이번 주 인공지능(AI) 생태계는 대폭 향상된 모델 성능과 새로운 개발 도구, 그리고 변화하는 규제 체계를 중심으로 움직였다. 제미나이 4 아르곤(제미나이 4 Argon)은 환각 현상을 대폭 낮추고 전례 없는 100만 토큰 출력 한도를 지원하며 지식 노동과 코딩 성능 평가에서 경쟁사들을 압박하고 있다. 이와 함께 클로드 코드는 사용자가 직접 정의하는 지속적 수정 기능과 클로드 Opus 5.5 기반의 터미널 기반 시각 애니메이션 도구를 선보였다. 디지털 인프라를 넘어 앤스로픽은 자사 모델의 생물학적 예측을 검증하기 위한 물리적 레벨 1/2 생물 실험실을 구축했으며, 안전 통제를 위한 글로벌 조약 제안도 함께 내놓았다. 오픈AI는 아스트라(Astra)의 비용 효율적 대안으로 GPT 6.1 솔(GPT 6.1 Sol)을 내세웠고, 개발자들은 토큰 비용을 조절하기 위해 여러 모델을 함께 쓰는 방식을 채택하고 있으며, 메타(Meta)는 컴퓨터 제어 기능을 더해 무스(Muse) 에이전트를 macOS로 확장했다. 영상 생성 분야에서는 4K 해상도와 10비트 HDR을 지원하는 링 4.0(Kling 4.0)이 새로운 기준을 세웠고, shadcn-lint 같은 디자인 거버넌스 도구는 AI 기반 작업 흐름에서 사용자 인터페이스(UI)의 일관성을 유지하도록 돕는다. 끝으로 미국 정부는 자국 내 자율성을 강조하기 위해 초지능이라는 용어를 공식 채택했고, 엔진(Engine)은 인프라 통제를 위해 직접 키를 가져오는 방식의 자체 호스팅 옵션을 도입했다.
01제미나이 4 Argon — 환각률 15% 달성과 100만 토큰 출력 지원
사용자는 이제 오류 걱정 없이 방대한 양의 텍스트를 생성할 수 있다. 매번 수동으로 사실 관계를 확인해야 했던 번거로움이 사라진다. 제미나이 4 Argon은 AI가 거짓 정보를 사실처럼 말하는 환각(hallucination) 현상을 억제해 신뢰성을 획기적으로 높였다. 비교 테스트 결과, 제미나이 4 Argon의 환각률은 15%에 불과했다. GPT-6 Astra의 45%, Fable의 70% 이상과 비교하면 압도적인 수치다. 수동 팩트체크의 부담이 크게 줄었다.
헤비 유저들의 고질적인 불만이었던 출력 길이 제한 문제도 해결했다. 입력 가능한 문맥 길이와는 별개로, 한 번에 출력할 수 있는 양을 100만 토큰까지 늘렸다. 이제 AI가 중간에 끊기지 않고 방대한 기술 문서나 대규모 소프트웨어 프로젝트, 장문의 원고를 한 번에 작성할 수 있다. 끊김 없는 생성의 시대다.
성능 면에서도 제미나이 4 Argon은 Text Arena를 비롯해 지식 작업, 자동화, 코딩 성능을 측정하는 Vibe Code Bench 등 주요 벤치마크에서 1위를 차지했다. Artificial Analysis 기준 점수는 53점으로 GPT-6 Astra와 동등한 수준이다. 하지만 가격 경쟁력은 더 높다. Astra의 입력 비용이 $3.26인 반면, 제미나이 4 Argon은 입력 $2, 출력 $10로 더 저렴하다. 성능은 같지만 가격은 가볍다.
02클로드 코드 — 터미널 내 영상 생성과 영구적 맞춤 설정
터미널에서 곧바로 복잡한 비디오 애니메이션과 그래픽을 제작할 수 있게 됐다. 프리미어(Premiere)나 베가스(Vegas) 같은 무거운 편집 도구로 화면을 전환할 필요가 없다. 클로드 Opus 5.5를 기반으로 구글 DeepMind의 AGI 논문 같은 외부 문서를 자율적으로 조사해, 시각적 결과물의 사실 관계를 바로잡고 사용자의 의도를 정교하게 구현한다. 작업 흐름이 단순해진다.
시각적 생성 기능을 넘어, 사용자가 정의한 기능인 '모드(mods)'로 AI의 동작 방식을 직접 설계할 수 있다. 기본적으로는 일회성으로 작동하지만, AI에게 명령해 이를 영구적인 플러그인 형태로 저장하면 다음 세션에서도 그대로 불러올 수 있다. 개발자가 자신만의 맞춤형 도구 모음을 점진적으로 쌓아 올리는 구조다. 나만의 AI 툴킷을 만드는 셈이다.
활용도를 높이기 위해 클로드를 이용해 기능을 분석하고 불필요한 복잡성을 걷어내며, 로컬 환경에 최적화된 형태로 함수를 변환할 수 있다. 이를 기존의 로컬 파일 경로 및 애플리케이션과 통합하면, 개별 환경에 정밀하게 맞춰진 전문 개발 인프라를 갖추게 된다. 환경 최적화의 자동화다.
03앤스로픽의 실제 실험실 구축, AI가 생물학 발견을 주도할 수 있을까?
앤스로픽이 AI 모델이 내놓은 이론적 결과물을 실제로 검증하기 위해 실제 실험실(wet lab)을 구축했다. AI의 생물학적 예측이 현실 세계에서도 작동하는지 확인하기 위한 조치다. 해당 시설은 레벨 1/2 생물학 실험실(Level 1/2 biolab)로 지정되어 인체에 위험한 물질은 다루지 않는다. 이론과 실제의 간극을 좁히려는 시도다.
최근 클로드는 과학자들의 일반적인 가이드에 따라 CRISPR과 유사한 특성을 가진 새로운 효소 시스템을 발견했다. 복잡한 유전체 데이터를 분석하는 모델의 능력이 입증된 사례다. Dario Amodei는 클로드가 실험 장비를 자율적으로 제어할 수 있을 때까지 이 능력을 발전시키는 것이 최종 목표라고 밝혔다. 결국 AI가 실험실의 주체가 되는 그림이다.
잠재적인 보안 리스크를 관리하기 위해 Dario Amodei는 세 가지 축으로 구성된 포괄적인 글로벌 거버넌스 체계를 제안했다. AI가 개발한 생물 무기 금지 조약, 경쟁 실험실 간의 글로벌 평가 및 검증 시스템, 그리고 통제 상실에 대비한 글로벌 테스트 표준 마련이 그 핵심이다. 기술의 속도만큼 안전장치도 시급하다는 판단이다.
04오픈AI GPT 6.1 Sol — Astra급 성능 유지하며 비용 부담 낮춰
오픈AI가 GPT 6.1 Sol 모델을 출시했다. 고도의 지능을 유지하면서 입력과 출력의 비용 효율성을 높이는 데 집중했다. 고성능 AI를 더 넓은 영역에 지속 가능하게 보급하겠다는 전략이다. 보급형 고성능 AI의 시작이다.
기본 성능 면에서 GPT 6.1 Sol은 Artificial Analysis 점수 52점을 기록했다. 이전 버전인 Astra보다 단 1점 낮은 수치다. 비용을 낮추면서도 추론 능력의 유의미한 손실은 막아냈다는 평가다. 성능 타협은 최소화했다.
다만 샌프란시스코행 항공권 예약 같은 실제 작업에 자율형 에이전트(autonomous agents)를 통합하는 과정에서는 여전히 응답 지연과 흐름의 매끄러움 문제가 드러났다. 벤치마크 점수가 곧바로 쾌적한 사용자 경험으로 이어지지는 않는다는 점을 시사한다. 숫자가 전부는 아니다.
05여러 모델을 함께 쓰는 조합, 업무 효율과 비용 절감 동시에 잡는다
효율을 극대화하는 방식은 하나의 공급업체나 도구에 의존하는 대신 서로 다른 시스템을 조합하는 구조로 바뀌고 있다. DeepSeek V 4.1 flash와 Jev를 묶거나 클로드 Opus 5.5와 GPT-6 Astra를 함께 쓰는 방식이 대표적이다. 이 접근법은 일반 언어 모델이 요구하는 토큰의 극히 일부만 쓰는 Jev 같은 최적화된 분류 모델을 함께 활용한다.
발행인의 코딩 에이전트 환경에서는 제미나이 3.8 Flash가 기본 모델로 쓰인다. 속도와 비용, 성능의 균형이 뛰어나 무거운 모델을 동원하지 않고도 일반적인 언어 모델 작업의 약 90%를 소화한다.
이러한 변화는 기업이 토큰 비용을 관리하는 방식을 바꾼다. 단순히 데이터 양을 늘리거나 비효율을 만드는 대신 실제 업무 성과를 높이는 방향으로 컴퓨팅 자원을 집중한다.
06메타 Muse: 데스크톱 제어권 확보와 서비스 생태계 확장
메타가 AI 에이전트 Muse의 무대를 모바일에서 macOS로 확장했다. 데스크톱 환경과 직접 상호작용하는 컴퓨터 제어 기능을 도입한 것이다. 여기에 실시간 아바타 기능을 추가해, AI가 영상 형태로 사용자와 소통하는 인터페이스까지 갖췄다.
실질적인 효용은 사용자 경험에서 드러난다. Muse가 개인 일정을 관리하거나 최신 버전의 메타 글래스에서 작동하는 사례가 대표적이다. 도구로서의 실용성을 확보한 셈이다. 일상 전반으로 활용 범위를 넓히기 위해 알렉산더 왕은 월마트, 세포라, Gap, Dick's, Box, Spotify 등 주요 유통 및 서비스 기업들과의 파트너십 체결을 발표했다.
07Kling 4.0 — 4K 해상도와 30초 분량으로 구현한 고화질 영상
곧 출시될 Kling 4.0 모델은 컴퓨터 생성 영상의 화질과 안정성, 정밀도를 획기적으로 높이기 위한 고사양 기술 규격을 도입한다. 영상의 완성도 자체가 달라진다.
업그레이드된 시스템은 4K 해상도와 10비트 HDR 출력을 지원하며, 스테레오 오디오 입모양 맞춤(lip-sync), 최대 15개의 참조 입력, 최대 10개의 키프레임을 제공한다. 덕분에 최대 30초 길이의 매끄러운 영상 제작이 가능하다.
이러한 정밀한 제어 기능과 고해상도 출력은 일반 제작자들이 고품질 콘텐츠를 만들 수 있는 환경이 빠르게 구축되고 있음을 보여준다. 이제 누구나 전문가 수준의 영상을 만든다.
08shadcn-lint — AI 작업 흐름의 디자인 일관성 확보
거대언어모델(LLM)로 페이지를 추가하거나 UI 구성 요소를 수정하다 보면 색상, 폰트, 간격 등이 제각각으로 변하는 일이 잦다. 이런 무작위 변형은 사이트의 디자인 시스템을 서서히 무너뜨리고, 결국 사용자에게 파편화된 인상을 준다. 디자인의 통일성이 깨지는 문제다.
개발자들은 shadcn 같은 표준 UI 컴포넌트 라이브러리를 쓰지만, LLM은 이를 무시하고 임의의 코드로 스타일을 덮어쓰는 경향이 있다. 이를 방지하기 위해 개발자들은 빌드 과정(build process)에 shadcn-lint를 도입해 디자인 규칙 위반 사례를 잡아내고, 사용자에게 배포되기 전 이를 명확한 오류로 변환한다. AI의 독단적인 수정을 시스템적으로 차단하는 방식이다.
이를 통해 개발자는 AI가 저지른 실수를 즉시 바로잡을 수 있다. 사람이 일일이 확인하며 놓칠 수 있는 스타일 오류를 제거함으로써, 사이트 전체에 일관된 정체성을 유지하는 것이 가능해진다. 관리 효율과 품질을 동시에 잡는 셈이다.
09Trump, 왜 AI 대신 '초지능'이라는 이름을 선택했나?
United States 정부가 공식 용어를 변경했다. Trump는 UN 연설에서 앞으로 '인공지능(AI)' 대신 '초지능(superintelligence)'이라는 용어를 사용하겠다고 발표했다. 단순한 이름 바꾸기가 아니다.
이번 명칭 변경은 국제적인 규제 움직임을 거부하겠다는 의지의 표현이다. Trump는 이 기술을 통제하려는 글로벌리스트의 계획을 United States가 완전히 거부한다고 밝혔다. 다자간의 감독보다는 국가적 자율성을 확보하는 것이 더 중요하다는 판단이다.
결국 이번 리브랜딩은 국내 통제권과 전략적 우위를 점하기 위한 포석이다. 기술의 발전 방향을 국제 사회의 통제가 아닌 United States의 국익에 맞게 결정하겠다는 계산이다. 주도권 싸움의 시작이다.
10최신 AI 모델의 시각적 소통 능력 — GPT-4를 압도하는 성능
AI의 창의적 시각 소통 능력이 과거의 업계 표준을 완전히 넘어섰다. 과거의 표준은 더 이상 경쟁력이 없다. 중세 시대의 특징을 정의하는 것과 같은 역사적 개념을 시각화하는 작업에서, 최신 도구들은 GPT-4를 활용한 이전의 결과물들을 무색하게 만든다.
이는 단순한 모방을 넘어, 특정 의미를 전달하기 위해 AI가 의도적인 선택을 내리는 정교한 시각적 창의성으로의 전환을 의미한다. 창작자에게는 시각적 요소가 정확한 서사적 목적을 수행하는 작업 흐름(workflow)이 열리는 셈이다.
추상적인 시간선을 설명하기 위해 시각적 은유를 성공적으로 활용하는 모습은 이전 버전들을 뛰어넘는 '의도성'을 증명한다. 결과물 자체에 즉각적인 감탄을 자아내는 힘이 실렸다.
11Engine, 자체 서버 운영 지원 — 클라우드 의존 낮추고 비용 통제권 확보
AI 인프라에 대한 통제권을 높이려는 기업들이 이제 Engine을 자체 서버에 설치해 운영할 수 있게 됐다. 클라우드 관리 서비스에만 의존하던 방식에서 벗어나, 소프트웨어를 내부적으로 직접 관리하는 자체 구축(self-hosted) 모델로 전환한 것이다. 통제권이 기업 내부로 돌아왔다.
이번 업데이트의 핵심은 '사용자 키 제공(bring your own key)' 방식의 도입이다. 1~2주 내 출시될 V17 버전부터 적용되며, 사용자가 이용하는 AI 모델의 API 키를 직접 입력해 사용할 수 있다. 이를 통해 서비스 제공자 계정과 비용 지출 내역을 기업이 직접 관리할 수 있게 된다. 불필요한 중간 비용을 걷어낸 구조다.
자체 구축 옵션과 Engine v2의 성능 개선 사항이 결합되면서, 기업은 실제 서비스 배포(production) 전 단계에서 더 낮은 비용과 적은 수동 작업 부담으로 신뢰도 높은 자율형(agentic) AI를 구축할 수 있다. 효율과 안정성을 동시에 잡은 셈이다.
