매일 한 편, AI 업계를 읽는 칼럼
엔지니어링·제품·전략 관점에서 기술 리더와 연구자들의 심층 인사이트를 큐레이션합니다.

Chrome 확장 프로그램의 Manifest V3 환경에서 Transformers.js를 활용해 로컬 AI를 실행하는 아키텍처를 다룬다. 백그라운드 서비스 워커에서 모델을 중앙 집중식으로 관리하여 메모리 효율과 응답성을 최적화한다. 메시지 통신과 상태

Cricket Australia가 경기 중 실시간 통찰을 제공하는 AI Insights 기능을 도입했다. GPT-5와 Azure를 결합해 1886년부터 축적된 방대한 경기 기록을 즉석에서 분석한다. 단순 점수판을 넘어 경기 맥락을 설명하는 스토리텔링형

OpenAI가 GPT-5.5를 공개하며 복잡한 실제 작업을 단일 모델로 처리한다. 모델은 작업 이해 속도가 빨라지고 사용자 지시 의존도가 낮아졌다. 출시 전 200곳의 얼리 액세스 파트너 피드백과 보안 평가를 완료했다.

OpenAI가 복합적인 업무 처리에 특화된 지능형 모델 GPT-5.5를 공개했다. 이 모델은 이전 버전과 동일한 속도를 유지하면서도 더 높은 지능을 제공한다. 코딩 및 에이전트 작업에서 효율성과 정확도를 대폭 개선했다.

Google이 자체 설계한 AI 전용 칩인 TPU의 최신 성능을 공개했다. 최신 세대 TPU는 121 엑사플롭스의 연산 처리 능력을 갖췄다. 이전 세대 대비 두 배 향상된 대역폭으로 대규모 AI 모델을 지원한다.

NVIDIA가 GeForce NOW 앱 내에 구독 서비스 연동 라벨을 도입했다. 사용자는 Xbox Game Pass와 Ubisoft+ 게임을 즉시 식별할 수 있다. 이번 업데이트로 클라우드 게임 라이브러리 접근성이 개선되었다.

깃허브에서 가장 인기 있는 에이전트 프로젝트 10개를 선정했다. OpenClaw는 개인 비서, OpenHands는 코딩 에이전트에 특화되어 있다. 각 저장소는 포크 후 로컬 실행과 수정이 가능하도록 설계되었다.

NVIDIA가 GPT-5.5 기반 Codex의 사내 도입 사례를 공개했다. 회사가 제시한 35배 비용 수치는 이전 세대 인프라와의 비교이며 API 판매 가격이 아니다. 직원용 VM과 운영 시스템의 읽기 전용 접근을 도입 조건으로 설명했다.

Codex가 여러 도구의 데이터를 통합해 업무 브리핑을 자동 생성한다. 캘린더와 메신저 정보를 분석해 주간 보고서 초안을 작성할 수 있다. 문서와 지표를 바탕으로 프레젠테이션 슬라이드 초안을 제작한다.

OpenMythos는 반복 연산을 통해 모델의 추론 깊이를 확장하는 아키텍처다. MLA 어텐션을 도입해 기존 GQA 방식보다 메모리 효율성을 대폭 개선했다. 추론 시 루프 횟수를 늘리는 것만으로 재학습 없이 성능 향상이 가능하다.

Codex가 플러그인으로 외부 도구와 정보를 연결함. Codex가 스킬로 팀의 작업 방식(플레이북)을 따르게 함. 스레드에서 $를 눌러 플러그인·스킬을 호출함.

Codex 자동화는 설정한 일정에 따라 반복 작업을 실행한다. 작업 내용과 결과 형식을 먼저 수동으로 확인한 뒤 자동화할 수 있다. 로컬 파일을 사용하는 작업은 컴퓨터와 앱의 실행 상태를 확인해야 한다.

Codex는 스레드와 프로젝트 단위로 작업을 구조화한다. 사용자는 프로젝트를 로컬 폴더와 연결해 파일 접근 권한을 제어한다. 작업 도중 Steer 기능을 통해 실시간으로 명령을 수정할 수 있다.

OpenAI가 Codex 설정 메뉴를 공개했다. 개인화, 절전 방지, 상세 수준, 외형 4가지 항목이 핵심이다. 아바타 기능으로 백그라운드 작업 추적이 가능해졌다.

Apple 연구팀이 비선형 RNN을 병렬로 학습하는 ParaRNN 프레임워크를 발표했다. 기존 순차적 방식 대비 학습 속도를 665배 개선하여 70억 파라미터 모델을 구현했다. 뉴턴의 방법을 활용해 비선형 구조를 선형 시스템으로 근사하여 병렬 연산을

다중 모달 생물학 파운데이션 모델이 파편화된 의료 데이터를 통합한다. 신약 개발과 임상 진단 과정에서 최대 90%의 시간 단축 효과를 낸다. AWS는 모델 학습부터 배포까지 지원하는 통합 인프라 환경을 제공한다.

Amazon Quick이 마케팅 도구 간 데이터를 통합하는 지능형 비서로 출시되었다. 사용자는 흩어진 데이터를 연결해 실시간 성과 분석과 자동화된 보고서를 생성한다. 반복적인 마케팅 업무 시간을 획기적으로 단축해 전략 수립에 집중하게 돕는다.

Google이 지리적으로 분산된 환경에서 AI를 학습시키는 Decoupled DiLoCo 기술을 공개했다. 이 방식은 기존 동기화 방식보다 학습 속도를 20배 이상 개선했다. 서로 다른 세대의 하드웨어를 혼합해 학습 자원으로 활용할 수 있다.

JWST가 2022년부터 초기 우주 관측 데이터를 대량으로 돌려줬다. 초기 은하가 한 번에 너무 많이 보여 분석이 ‘손작업’으로는 불가능해졌다. Robertson 연구팀은 대규모 계산 모델로 관측 한계를 풀었다.

대규모 언어 모델을 단순한 대화형 검색기 이상으로 활용할 수 있다. 논리 검증부터 복잡한 오류 분석까지 구체적인 역할 부여가 핵심이다. 사용자가 의도적으로 프롬프트를 설계하면 모델은 강력한 사고 파트너가 된다.

Google이 오스트리아 크론스토르프에 첫 데이터 센터를 건설한다. 이번 시설 구축으로 현지에서 100개의 직접 고용 일자리가 창출된다. 유럽 내 클라우드 인프라 확장을 통해 서비스 지연 시간을 단축한다.

CAMEL 프레임워크로 다중 에이전트 시스템을 설계했다. 계획, 연구, 작성, 비평, 재작성 5개 에이전트가 협업한다. Pydantic 스키마로 출력을 검증하고 자체 일관성 샘플링으로 신뢰도를 높였다.

NVIDIA가 25개 유럽 언어를 지원하는 Parakeet-TDT 모델을 공개했다. TDT 아키텍처로 침묵 구간을 건너뛰어 추론 속도를 획기적으로 높였다. AWS Batch와 스팟 인스턴스를 결합해 전사 비용을 최대 90% 절감했다.

Equinox가 JAX PyTree로 모델 파라미터를 다루는 방식을 보여줬다. filter_jit과 filter_grad로 배열 파트만 컴파일·미분하도록 했다. BatchNorm 상태 저장과 직렬화 검증, 학습 루프까지 진행했다.

Amazon Bedrock AgentCore가 관리형 에이전트 하네스 기능을 공개했다. 개발자는 복잡한 인프라 설정 없이 API 호출만으로 에이전트를 실행한다. CLI를 통해 로컬 개발부터 프로덕션 배포까지 단일 워크플로우를 지원한다.

Amazon SageMaker AI가 생성형 AI 모델의 배포 최적화 추천 기능을 제공한다. NVIDIA AIPerf를 통합하여 수주가 걸리던 벤치마킹 과정을 자동화했다. 비용, 지연 시간, 처리량 등 목표에 맞는 최적의 인프라 구성을 제안한다.

Alibaba가 Qwen3.6-27B 밀집 오픈웨이트를 공개했다. Qwen3.6-27B가 Qwen3.5-397B-A17B MoE를 일부 벤치에서 앞섰다. API에서 preserve_thinking으로 대화 전 구간 사고를 유지할 수 있다.

OpenAI가 팀 공유형 워크스페이스 에이전트를 연구 프리뷰로 출시했다. Codex 기반 클라우드에서 실행되며 보고서 작성부터 코드 실행까지 처리한다. 관리자는 권한과 승인 절차를 설정해 데이터 통제를 유지할 수 있다.

Apple이 ICLR 2026에서 대규모 RNN 훈련 프레임워크 ParaRNN을 공개했다. 기존 트랜스포머 대비 효율적인 SSM의 한계를 외부 도구 결합으로 해결했다. 이미지 이해와 생성을 동시에 수행하는 통합 모델 MANZANO를 선보였다.

Responses API가 WebSockets로 에이전트 루프를 40% 더 빠르게 했다. GPT-5·GPT-5.2는 65 TPS였고 GPT-5.3-Codex-Spark는 1,000 TPS를 노렸다. WebSocket 연결에서 이전 응답 상태를 캐시해