KO EN

AX BRIEF

매일 한 편, AI 업계를 읽는 칼럼

● LIVE
지능1. Claude Fable 5.1 (max with fallback) 98 pt2. Gemini 4 Argon (high) 95 pt3. Claude Opus 5.5 (max with fallback) 94 pt4. Claude Sonnet 5.5 (max with fallback) 93 pt5. GPT-6 Astra (max) 90 pt코딩1. Claude Fable 5.1 (max) 100 pt2. Claude Fable 5.1 XHigh + SWE-2 Medium 88 pt3. GPT-6.1 Sol (xhigh) 69 pt4. Claude Sonnet 5.5 (max) 63 pt5. Claude Opus 5.5 (max) 63 pt이미지1. gpt-image-2.5-sunburst 85 pt2. gpt-image-2.5-flare 81 pt3. gpt-image-2 (medium) 78 pt4. grok-imagine-image-2.0 (canvas) 70 pt5. mai-image-2.6 70 pt비디오1. gemini-omni-1.1-flash 85 pt2. gemini-omni-flash 84 pt3. flux-3-video 81 pt4. grok-imagine-video-1.5-agent 81 pt5. dreamina-seedance-2.0-720p 79 pt가격1. Claude Fable 5.1 (max with fallback) 100 pt2. GPT-6 Astra (max) 100 pt3. Claude Opus 5.5 (max with fallback) 39 pt4. Claude Sonnet 5.5 (max with fallback) 19 pt5. Gemini 4 Argon (high) 19 pt속도1. Claude Haiku 5.5 (max) 100 pt2. DeepSeek V4.1 Flash (max) 89 pt3. gpt-oss-120b (high) 74 pt4. Inkling (xhigh) 59 pt5. Muse Spark 1.3 (max) 58 pt

AI 뉴스

글로벌 AI 기업과 스타트업의 투자·제품·정책·핵심 동향을 매일 정리합니다.

Ouroboros, Claude Plan Mode 제치고 시뮬레이션 벤치마크 1위 기록

Ouroboros, Claude Plan Mode 제치고 시뮬레이션 벤치마크 1위 기록

한국 개발자가 만든 오픈소스 Ouroboros가 시뮬레이션 벤치마크 1위를 기록했다. Anthropic의 Claude Plan Mode보다 높은 성능을 보이며 모델링 능력을 입증했다. 문제 정의부터 복구까지 구조화된 워크플로우가 단순 지침 추가보다 효

Show GN, 로컬 LLM과 Gemini로 파일 번역 및 요약 통합

Show GN, 로컬 LLM과 Gemini로 파일 번역 및 요약 통합

Show GN이 로컬 LLM과 Gemini를 지원하는 데스크톱 번역 앱을 공개했다. LM Studio를 통한 로컬 서버 연결과 Google API 연동 기능을 제공한다. 긴 텍스트의 자동 청크 분할과 파일 번역 기능을 통해 작업 효율을 높였다.

LLM 앱 개발용 스캐폴딩 층이 사라진다, LlamaIndex CEO 진단

LLM 앱 개발용 스캐폴딩 층이 사라진다, LlamaIndex CEO 진단

LlamaIndex CEO가 LLM 앱 개발에 필요한 스캐폴딩 층이 붕괴 중이라고 진단했다. 모델이 스스로 추론·도구 사용·멀티스텝 계획을 처리하면서 프레임워크 수요가 줄었다. 생존 핵심은 맥락(context)이며, 파일 포맷 해석과 정확한 파싱이 차

xAI, Grok 4.3 출시와 음성 복제 도구 공개로 API 시장 공략

xAI, Grok 4.3 출시와 음성 복제 도구 공개로 API 시장 공략

xAI가 새로운 대규모 언어 모델인 Grok 4.3을 출시했다. 입력 토큰당 1.25달러로 이전 모델 대비 가격을 낮췄다. 사용자 음성을 복제하는 새로운 음성 생성 도구도 추가했다.

자연어로 퀀트 전략 짜는 Vibe-Trading, 7개 백테스트 엔진 지원

자연어로 퀀트 전략 짜는 Vibe-Trading, 7개 백테스트 엔진 지원

Vibe-Trading은 자연어 입력으로 트레이딩 전략을 생성하는 AI 플랫폼이다. 7개 백테스트 엔진과 29개 에이전트 팀 프리셋을 통해 복합적인 시장 분석을 지원한다. Docker와 파이썬 패키지를 통해 설치 가능하며 17개 MCP 도구와 연동된다

커밋 메시지 HERMES.md가 불러온 Claude Code 과금 오류

커밋 메시지 HERMES.md가 불러온 Claude Code 과금 오류

Git 커밋 메시지에 특정 문자열이 포함되면 Claude Code가 유료 크레딧을 강제로 소진하는 오류가 발생했다. Anti-abuse 시스템의 오작동으로 판명되어 현재는 수정되었으며 피해 사용자에게 환불과 크레딧이 지급된다. 개발자들은 이번 사태를

에러 로그 해독과 러버 덕킹까지 LLM 활용법 7가지

에러 로그 해독과 러버 덕킹까지 LLM 활용법 7가지

LLM을 단순 챗봇이 아닌 비전형적인 도구로 활용하는 7가지 방법을 제시했다. 에러 로그 해독과 법률 문서 검토 등 실무적인 적용 사례를 다뤘다. 페르소나 설정과 맞춤형 학습 로드맵 설계를 통해 효율을 높이는 방안을 설명했다.

GoModel, 11개 AI 모델을 단일 API로 통합하는 Go 기반 게이트웨이

GoModel, 11개 AI 모델을 단일 API로 통합하는 Go 기반 게이트웨이

Go로 작성된 AI 게이트웨이 GoModel이 공개되었다. 11개 AI 프로바이더를 단일 OpenAI API 규격으로 통합한다. 2계층 캐시와 관리 대시보드를 내장해 운영 효율을 높였다.

DataCenter.FM, AI 데이터센터 소음으로 구현한 버블의 청각화

DataCenter.FM, AI 데이터센터 소음으로 구현한 버블의 청각화

DataCenter.FM(데이터센터 소음을 제공하는 앱)이 공개되었다. AI 인프라의 물리적 소음을 배경음으로 제공해 버블 현상을 풍자한다. 거대 모델 운영에 필요한 물리적 비용과 환경적 영향을 환기한다.

AI 에이전트 37,000줄 코드의 함정과 ROI 20%의 현실

AI 에이전트 37,000줄 코드의 함정과 ROI 20%의 현실

경영진들이 AI 에이전트를 통한 가짜 생산성 착각에 빠져 있다. 실제 기업의 90%는 AI 도입 후 측정 가능한 생산성 향상이 없었다. 토큰 소비량만 늘리는 토큰맥싱 현상이 기업 내부에 확산 중이다.

Gen Z AI 희망 지수 18% 하락과 강제 도입의 역설

Gen Z AI 희망 지수 18% 하락과 강제 도입의 역설

Gen Z의 AI 희망 지수가 27%에서 18%로 하락했다. 74%가 AI를 사용하지만 80%는 학습 능력을 저해한다고 믿는다. 대학과 기업의 강제적 AI 도입이 젊은 층의 반발을 키우고 있다.

머스크의 xAI, OpenAI 모델로 Grok 학습시켰다 인정

머스크의 xAI, OpenAI 모델로 Grok 학습시켰다 인정

일론 머스크가 xAI의 Grok을 OpenAI 모델로 학습시켰다고 인정했다. 이는 거대 모델의 지식을 작은 모델에 옮기는 증류 기술을 사용한 것이다. 머스크는 현재 AI 업계에서 Anthropic을 가장 뛰어난 기업으로 꼽았다.

PyTorch Lightning 공급망 공격, 개발 환경 전방위 탈취

PyTorch Lightning 공급망 공격, 개발 환경 전방위 탈취

PyPI 패키지 lightning 버전 2.6.2와 2.6.3에서 악성 코드가 발견되었다. 해당 패키지는 설치 즉시 환경 변수와 클라우드 자격 증명을 탈취한다. 공격자는 Claude Code와 VS Code의 설정 파일을 악용해 지속성을 확보한다.

30억 파라미터로 구현한 Qwen3.6-35B-A3B의 코딩 효율

30억 파라미터로 구현한 Qwen3.6-35B-A3B의 코딩 효율

Qwen3.6-35B-A3B 모델이 30억 개의 활성 파라미터로 출시되었다. SWE-bench Verified에서 73.4점을 기록하며 코딩 능력을 입증했다. 저사양 GPU 환경에서도 고성능 코딩 에이전트 운용이 가능해졌다.

RunPod Flash 출시, 도커 없이 파이썬 코드로 GPU 서버리스 배포

RunPod Flash 출시, 도커 없이 파이썬 코드로 GPU 서버리스 배포

RunPod이 도커 컨테이너 없이 AI 모델을 배포하는 RunPod Flash를 공개했다. 개발자는 파이썬 코드 내에서 GPU 자원을 직접 호출하고 관리할 수 있다. Claude Code와 같은 AI 에이전트가 하드웨어를 자율적으로 제어하도록 돕는다.

Google Gemini, 차량용 인포테인먼트 시스템에 탑재 시작

Google Gemini, 차량용 인포테인먼트 시스템에 탑재 시작

Google이 차량용 인포테인먼트 시스템에 Gemini를 탑재한다. 기존 Google Assistant보다 자연스러운 대화형 제어가 가능하다. 소프트웨어 업데이트를 통해 기존 차량에서도 Gemini를 사용할 수 있다.

Stripe, AI 에이전트 전용 결제 지갑 Link로 가상카드 발행 지원

Stripe, AI 에이전트 전용 결제 지갑 Link로 가상카드 발행 지원

Stripe가 AI 에이전트 전용 디지털 지갑 Link를 출시했다. 사용자는 결제 정보를 직접 노출하지 않고 AI에게 결제 권한을 부여할 수 있다. 가상 카드와 공유 결제 토큰을 통해 실시간 승인과 지출 제어가 가능하다.

Writer, 프롬프트 없이 스스로 작동하는 이벤트 트리거 AI 에이전트 공개

Writer, 프롬프트 없이 스스로 작동하는 이벤트 트리거 AI 에이전트 공개

Writer가 외부 신호를 감지해 스스로 업무를 수행하는 이벤트 기반 트리거를 출시했다. Gmail과 슬랙 등 주요 협업 도구의 변화를 감지해 복잡한 워크플로우를 자동 실행한다. 경직된 논리 구조의 기존 자동화 도구와 달리 자연어 추론 엔진을 통해 자

LLM 미세조정 시 저작권 도서 내용이 그대로 출력되는 현상 확인

LLM 미세조정 시 저작권 도서 내용이 그대로 출력되는 현상 확인

거대언어모델 미세조정 과정에서 저작권 보호 도서의 내용이 복원되는 현상이 발견되었다. 연구팀은 미세조정이 모델의 기억을 활성화해 원문과 유사한 텍스트를 생성함을 입증했다. 공개된 저장소에서 데이터 전처리부터 기억력 평가까지 전 과정을 확인할 수 있다.

법률 문서 분석 도구 Mike, 오픈소스로 기업용 AI 대체

법률 문서 분석 도구 Mike, 오픈소스로 기업용 AI 대체

법률 문서 분석 도구인 Mike가 오픈소스로 공개되었다. 사용자는 Claude나 Gemini API 키를 직접 연결해 보안을 유지한다. 수백 개의 문서를 동시에 분석하고 근거를 정확히 제시한다.

Zig, AI 기여 전면 금지하며 코드보다 사람에 베팅한다

Zig, AI 기여 전면 금지하며 코드보다 사람에 베팅한다

Zig 프로젝트가 LLM을 이용한 모든 기여를 엄격히 금지했다. Bun은 AI로 컴파일 성능을 4배 높였으나 Zig에 반영하지 못했다. Zig는 코드 자체보다 기여자의 성장을 우선하는 전략을 택했다.

1조 파라미터 MiMo-V2.5-Pro, 420억 개 연산으로 효율 극대화

1조 파라미터 MiMo-V2.5-Pro, 420억 개 연산으로 효율 극대화

XiaomiMiMo가 1조 파라미터 규모의 MiMo-V2.5-Pro 모델을 공개했다. 실제 추론 시 420억 개의 파라미터만 활성화하여 연산 효율을 높였다. 100만 토큰의 컨텍스트를 지원하며 에이전트 작업 성능을 강화했다.

bkit과 Claude Code로 9일 만에 서비스 구축한 컨텍스트 엔지니어링 방식

bkit과 Claude Code로 9일 만에 서비스 구축한 컨텍스트 엔지니어링 방식

bkit이 Claude Code의 효율을 극대화하는 플러그인으로 공개됐다. 컨텍스트 엔지니어링을 통해 9일 만에 11개 마이크로서비스를 구축했다. 프롬프트 작성을 넘어 AI가 일하는 환경 자체를 설계하는 시스템을 구축했다.

Ramp Sheets AI, 수식 하나로 금융 데이터 유출 가능성 확인

Ramp Sheets AI, 수식 하나로 금융 데이터 유출 가능성 확인

Ramp의 Sheets AI에서 데이터 유출 취약점이 발견되었다. 외부 데이터의 프롬프트 주입으로 악성 수식이 자동 삽입되었다. Ramp는 해당 문제를 2026년 3월 16일에 해결했다고 밝혔다.

Zed 1.0 출시, GPU 기반 고속 편집기와 AI 에이전트 통합

Zed 1.0 출시, GPU 기반 고속 편집기와 AI 에이전트 통합

Zed가 자체 UI 프레임워크를 적용한 1.0 버전을 정식 출시했다. GPU 가속과 Rust 기반의 구조로 편집기 성능을 최적화했다. AI 에이전트와 실시간 협업을 위한 동기화 엔진을 탑재했다.

DeepGLM-5 코딩 에이전트 버그 수정으로 처리량 최대 132% 개선

GLM-5 코딩 에이전트 버그 수정으로 처리량 최대 132% 개선

Z.ai가 GLM-5 서비스 중 발생한 KV 캐시 버그 두 건을 해결했다. 이상 출력 비율을 0.1%에서 0.03% 미만으로 낮추는 성과를 거뒀다. 레이어 단위 분산 저장 기술로 처리량을 최대 132%까지 끌어올렸다.

Opus와 Haiku의 계층적 에이전트 설계로 LLM 비용 50% 절감하기

Opus와 Haiku의 계층적 에이전트 설계로 LLM 비용 50% 절감하기

Anthropic의 Opus와 Haiku 모델을 조합해 CI 로그 분석 비용을 최적화했다. 단순 중복 오류는 Haiku가 처리하고 복잡한 분석만 Opus가 수행하는 구조다. 에이전트가 직접 SQL로 로그를 조회하게 하여 토큰 비용과 문맥 오염을 줄였다

게임 테스트 자동화, AI 에이전트 기반 테스트 하네스 구축법

게임 테스트 자동화, AI 에이전트 기반 테스트 하네스 구축법

게임 플레이 테스트를 자동화하는 AI 에이전트 프레임워크가 공개되었다. 에이전트는 게임 내 상태를 인식하고 키보드 입력을 통해 캐릭터를 제어한다. 개발자는 이를 통해 반복적인 빌드 검증 과정을 효율적으로 단축할 수 있다.

AI 의존도가 높을수록 인간의 사고력은 퇴화한다

AI 의존도가 높을수록 인간의 사고력은 퇴화한다

AI를 쓰지 않으면 도태된다는 주장에 대한 반론이 제기되었다. AI에 과도하게 의존하면 생각하고 배우는 능력을 잃게 된다. 도구의 성능보다 인간 스스로 학습하는 능력이 더 중요하다.

AI 기업들은 왜 스스로 만든 기술을 위험하다고 경고할까

AI 기업들은 왜 스스로 만든 기술을 위험하다고 경고할까

Anthropic이 자사 모델 Claude Mythos의 위험성을 경고했다. AI 기업들은 기술의 파괴적 잠재력을 강조하며 공포 마케팅을 펼친다. 전문가들은 이것이 실질적인 사회적 피해를 가리기 위한 전략이라고 지적한다.