KO EN

AX BRIEF

매일 한 편, AI 업계를 읽는 칼럼

● LIVE
지능1. Claude Fable 5.1 (max with fallback) 98 pt2. Gemini 4 Argon (high) 95 pt3. Claude Opus 5.5 (max with fallback) 94 pt4. Claude Sonnet 5.5 (max with fallback) 93 pt5. GPT-6 Astra (max) 90 pt코딩1. Claude Fable 5.1 (max) 100 pt2. Claude Fable 5.1 XHigh + SWE-2 Medium 88 pt3. GPT-6.1 Sol (xhigh) 69 pt4. Claude Sonnet 5.5 (max) 63 pt5. Claude Opus 5.5 (max) 63 pt이미지1. gpt-image-2.5-sunburst 85 pt2. gpt-image-2.5-flare 81 pt3. gpt-image-2 (medium) 78 pt4. grok-imagine-image-2.0 (canvas) 70 pt5. mai-image-2.6 70 pt비디오1. gemini-omni-1.1-flash 85 pt2. gemini-omni-flash 84 pt3. flux-3-video 81 pt4. grok-imagine-video-1.5-agent 81 pt5. dreamina-seedance-2.0-720p 79 pt가격1. Claude Fable 5.1 (max with fallback) 100 pt2. GPT-6 Astra (max) 100 pt3. Claude Opus 5.5 (max with fallback) 39 pt4. Claude Sonnet 5.5 (max with fallback) 19 pt5. Gemini 4 Argon (high) 19 pt속도1. Claude Haiku 5.5 (max) 100 pt2. DeepSeek V4.1 Flash (max) 90 pt3. Muse Spark 1.3 (max) 84 pt4. gpt-oss-120b (high) 71 pt5. Nemotron 3 Ultra 51 pt

AI 뉴스

글로벌 AI 기업과 스타트업의 투자·제품·정책·핵심 동향을 매일 정리합니다.

엔비디아에 인재 뺏긴 Groq, 6.5억 달러 수혈하며 '네오클라우드'로 피벗

엔비디아에 인재 뺏긴 Groq, 6.5억 달러 수혈하며 '네오클라우드'로 피벗

엔비디아가 유망 스타트업의 인재와 기술만 흡수하는 '노트-어콰이어-하이어' 전략을 구사하고 있다. 핵심 경영진을 엔비디아에 뺏긴 Groq가 최근 6억 5,000만 달러의 신규 투자를 유치했다. 하드웨어 IP를 공유하게 된 Groq는 이제 LPU 기반의

추론 기록 믿지 마라 — Claude Code '확장 사고'의 실체는 요약본

추론 기록 믿지 마라 — Claude Code '확장 사고'의 실체는 요약본

AI 에이전트가 문제를 풀 때 거치는 사고 과정을 기록해 검토하는 기능이 주목받고 있다. Claude Code의 '확장 사고' 로그는 실제 추론 과정이 아닌 요약된 결과물임이 밝혀졌다. 원본 데이터 손실이 발생하는 구조여서 정밀한 감사 추적용으로는 부

센터 내부 물 사용을 0으로 줄인 엔비디아의 새로운 냉각 시스템

센터 내부 물 사용을 0으로 줄인 엔비디아의 새로운 냉각 시스템

AI 모델을 돌리는 데이터센터는 엄청난 양의 전력과 냉각수를 소비합니다. 엔비디아가 센터 내부 물 사용량을 거의 0으로 만드는 온수 냉각 기술을 공개했습니다. 하지만 전력 생산 과정의 물 소비까지 포함하면 전체 문제의 3분의 1만 해결한 셈입니다.

Sora·Seedance 무너진 틈타 세계 2위 올라선 알리바바 '해피호스'

Sora·Seedance 무너진 틈타 세계 2위 올라선 알리바바 '해피호스'

OpenAI의 소라처럼 화려한 AI 영상 모델들이 비용과 저작권 문제로 잇따라 중단되고 있습니다. 알리바바가 공개한 '해피호스 1.1'은 글로벌 랭킹 2위를 기록하며 기업용 시장의 대안으로 부상했습니다. 단일 모델로 영상과 음성을 동시에 처리하며 캐릭

6억 명 힌디어 시장 정조준한 아마존 알렉사+

6억 명 힌디어 시장 정조준한 아마존 알렉사+

스마트 스피커의 대명사 알렉사가 생성형 AI를 입고 진화하고 있다. 아마존이 6억 명 이상의 사용자를 보유한 인도 힌디어 시장에서 '알렉사+' 베타 테스트를 시작했다. 프라임 회원은 무료, 일반 유저는 월 구독료를 내는 수익 모델을 적용해 글로벌 확장

SpaceX의 GB300 칩 빌린 리플렉션 AI, 오픈소스의 반격

SpaceX의 GB300 칩 빌린 리플렉션 AI, 오픈소스의 반격

AI 모델 개발에는 막대한 양의 컴퓨팅 자원과 고성능 칩이 필수적입니다. 오픈소스 AI 스타트업 리플렉션 AI가 SpaceX와 최대 63억 달러 규모의 컴퓨팅 계약을 체결했습니다. 2026년 7월부터 월 1억 5천만 달러를 지불하며 엔비디아 GB300

클로드 접근 제한의 대안, 벤치마크 압도한 Sakana 'Fugu'

클로드 접근 제한의 대안, 벤치마크 압도한 Sakana 'Fugu'

특정 AI 기업의 모델 독점과 갑작스러운 접근 제한은 기업의 운영 리스크가 된다. Sakana AI가 여러 모델을 동적으로 조율하는 멀티에이전트 시스템 'Fugu'를 출시했다. Fugu Ultra는 코딩 및 추론 벤치마크에서 Claude Fable 5

agent-connector, MCP 서버 설정을 42개 에이전트 CLI에 일괄 배포하는 도구 공개

agent-connector, MCP 서버 설정을 42개 에이전트 CLI에 일괄 배포하는 도구 공개

MCP 서버와 훅 설정을 여러 에이전트 CLI에 한 번에 배포하는 도구인 agent-connector가 공개됐다. 42개 에이전트 CLI를 지원하며, 특정 사례에서 배포 코드를 20,322줄에서 76줄로 줄이는 수치를 기록했다. 개발자는 각 호스트의

상하이 AI 랩, 에이전트 운영 규칙 스스로 수정하는 'Self-Harness' 공개... 성능 최대 60% 향상

상하이 AI 랩, 에이전트 운영 규칙 스스로 수정하는 'Self-Harness' 공개... 성능 최대 60% 향상

상하이 AI 연구소가 LLM 에이전트가 자신의 운영 규칙을 스스로 최적화하는 'Self-Harness' 프레임워크를 공개했다. Terminal-Bench-2.0 테스트 결과 MiniMax M2.5, Qwen3.5, GLM-5 모델의 성능이 상대적으로

토큰 낭비 44% 줄인 Claude Code 분석 도구 Agent-Blackbox

토큰 낭비 44% 줄인 Claude Code 분석 도구 Agent-Blackbox

AI 에이전트에게 작업을 맡기면 정작 어디서 토큰이 낭비되는지 알기 어렵다. Agent-Blackbox는 Claude Code와 OpenCode의 실행 과정을 로컬에서 기록하고 세션 맵으로 보여준다. 반복된 파일 읽기와 낮은 캐시 활용도를 분석해 토큰

Recall, Claude Code용 로컬 프로젝트 메모리 도구 공개

Recall, Claude Code용 로컬 프로젝트 메모리 도구 공개

Claude Code의 세션 기억 상실 문제를 해결하는 로컬 메모리 도구 Recall이 공개됐다. TF-IDF와 TextRank 알고리즘을 통해 외부 API 호출 없이 로컬에서 세션 요약을 생성하며 numpy를 선택적 가속기로 사용한다. 개발자는 추가

Qwen 3:0.6B 파인튜닝으로 질문 분류 정확도 92% 달성

Qwen 3:0.6B 파인튜닝으로 질문 분류 정확도 92% 달성

초소형 LLM인 Qwen 3:0.6B를 활용해 RAG 검색 효율을 높이는 질문 분류기 구현 사례가 공개됐다. Unsloth와 QLora로 파인튜닝하고 카테고리를 불투명 ID로 매핑해 분류 정확도를 10%에서 92%로 높였다. 초소형 모델의 분류 성능을

ax-grep, 에이전트 웹 검색 토큰 사용량 3배 개선하는 리서치 툴 공개

ax-grep, 에이전트 웹 검색 토큰 사용량 3배 개선하는 리서치 툴 공개

에이전트 웹 리서치 툴 ax-grep이 공개됐다. 브라우저 없이 접근성 트리를 재현해 토큰 사용량을 3배 개선하고 메모리 사용량을 15배 줄였다. Codex, Claude Code, Antigravity를 지원한다.

AI 코딩 패러다임, 코드 생성에서 '비결정성 통제'와 '하네스 구축'으로 전환

AI 코딩 패러다임, 코드 생성에서 '비결정성 통제'와 '하네스 구축'으로 전환

AI가 코드 작성을 자동화하며 개발자의 역할이 직접 구현에서 설계와 검증 중심으로 이동하고 있다. 비결정적 AI 출력을 제어하기 위해 TDD 기반 산출물 분리와 결정적 검증 도구인 '하네스' 구축이 핵심으로 부상했다. 개발자는 프롬프트 작성을 넘어 A

벤치마크 80% 돌파한 AI 에이전트, 이제 '지능' 아닌 '권한'이 돈 된다

벤치마크 80% 돌파한 AI 에이전트, 이제 '지능' 아닌 '권한'이 돈 된다

AI 모델이 고도화되며 단순 기능 구현 서비스들이 '얇은 래퍼'로 전락해 흡수되는 추세다. 코딩 에이전트의 벤치마크 해결률이 13%에서 80%대로 급증하며 측정 가능한 지능은 공용재가 됐다. 결국 생존의 핵심은 모델이 훈련할 수 없는 사적 정답과 책임

레딧 댓글 13단어에 낚이는 ChatGPT와 구글 AI 검색

레딧 댓글 13단어에 낚이는 ChatGPT와 구글 AI 검색

AI 검색 엔진이 레딧이나 위키피디아 같은 사용자 생성 콘텐츠를 주요 정보원으로 활용한다. 단 11~15단어의 짧은 문구만으로도 AI의 추천 결과와 인용 자료를 특정 브랜드로 조작할 수 있다. LLM이 정확성보다 질의와의 어휘적 유사성을 우선시하는 구

myDoo, 클로드 코드 기본 탑재한 VS Code 기반 IDE 공개

myDoo, 클로드 코드 기본 탑재한 VS Code 기반 IDE 공개

클로드 코드를 기본 LLM으로 사용하는 IDE myDoo가 공개됐다. RAG 기반의 기억 공유와 웹 문서 게시, 반복 업무 자동화 기능을 제공한다. 개인 사용자는 무료로 이용 가능하다.

ponytail, AI 코딩 에이전트의 과잉 설계 방지 도구 공개

ponytail, AI 코딩 에이전트의 과잉 설계 방지 도구 공개

AI 코딩 에이전트가 불필요한 코드를 쓰지 않고 최소한의 코드만 남기게 하는 도구 ponytail이 공개됐다. 6단계 점검을 통해 과잉 설계를 막으며, 코드량 감소와 비용 절감 효과를 제공한다. Claude Code, Cursor 등 14개 에이전트와

스위스 AI 이니셔티브, 오픈 파운데이션 모델 'Apertus' 공개

스위스 AI 이니셔티브, 오픈 파운데이션 모델 'Apertus' 공개

스위스 AI 이니셔티브가 가중치와 데이터를 모두 공개한 파운데이션 모델 Apertus를 발표했다. 1,000개 이상의 언어를 지원하며 EU AI 법(EU AI Act) 기준을 준수한다.

앤스로픽, 클로드에 신원 확인 절차 도입... 오남용 방지 및 법적 준수 강화

앤스로픽, 클로드에 신원 확인 절차 도입... 오남용 방지 및 법적 준수 강화

앤스로픽이 클로드 사용자들을 대상으로 신원 확인(Identity Verification) 절차를 도입한다. 신원 확인 파트너사인 Persona를 통해 정부 발행 신분증과 셀카 사진을 제출받아 계정의 무결성을 검증한다. AI 서비스 이용 시 익명성 기반

엔비디아, 오픈소스 비밀 관리 도구 'OpenBao' 공식 도입

엔비디아, 오픈소스 비밀 관리 도구 'OpenBao' 공식 도입

엔비디아가 해시코프 볼트(HashiCorp Vault)의 오픈소스 포크 버전인 OpenBao를 공식 도입했다. 엔비디아는 서버리스 GPU 제어 평면인 NVCF의 쿠버네티스 포드에 비밀 정보를 주입하는 용도로 이를 사용한다. 기업은 벤더 종속성 탈피와

앤스로픽, 트럼프 행정부 수출 통제 명령으로 Fable 5·Mythos 5 서비스 중단

앤스로픽, 트럼프 행정부 수출 통제 명령으로 Fable 5·Mythos 5 서비스 중단

트럼프 행정부가 국가 안보 우려를 이유로 앤스로픽의 최신 AI 모델 두 종에 대해 서비스 중단을 명령했다. 수출 통제 명령에 따라 앤스로픽은 일반 공개 모델인 Fable 5와 기존 사용자용 Mythos 5를 오프라인으로 전환했다. AI 모델의 가드레일

애플, iOS 27에 '애플 인텔리전스' 기반 앱 내장형 AI 기능 공개

애플, iOS 27에 '애플 인텔리전스' 기반 앱 내장형 AI 기능 공개

애플이 iOS 27에서 시리(Siri) 외에 앱 전반에 걸쳐 작동하는 애플 인텔리전스 기능을 공개했다. 비용 분할, 에이전트 기반 비밀번호 업데이트, 온디바이스 기반 통화 컨텍스트 등 실무 중심 기능이 포함됐다. 사용자는 챗봇과의 대화가 아닌 기존 앱

4.5GB 메모리만으로 로컬 코딩 에이전트를 구현한 Gemma4-12B v2

4.5GB 메모리만으로 로컬 코딩 에이전트를 구현한 Gemma4-12B v2

개인용 컴퓨터에서 AI가 스스로 도구를 사용하는 에이전트 시대가 열리고 있다. Gemma4-12B v2는 4.5GB의 낮은 메모리 사양에서도 독립적인 코딩 보조가 가능하다. 추론 데이터 재구축을 통해 에이전트 성능을 기존 대비 3.5배 끌어올렸다.

OpenAI 모델 제약을 푼 Codex 로컬 프록시 opencodex

OpenAI 모델 제약을 푼 Codex 로컬 프록시 opencodex

Codex는 기본적으로 OpenAI 모델만 사용할 수 있는 폐쇄적인 구조다. opencodex는 로컬 프록시를 통해 Claude, Gemini 등 40개 이상의 외부 모델을 연결한다. 자체 프로토콜 번역과 세션 마이그레이션을 통해 네이티브 수준의 사용

바이엘, 검색에서 문서 작성까지 수행하는 에이전트 AI 'PRINCE' 구축

바이엘, 검색에서 문서 작성까지 수행하는 에이전트 AI 'PRINCE' 구축

제약 산업의 방대한 비정형 PDF 보고서 분석은 여전히 수동 작업에 의존한다. 바이엘과 Thoughtworks는 LangGraph 기반의 에이전트 RAG 시스템 'PRINCE'를 개발했다. 단순 검색을 넘어 복잡한 추론과 규제 문서 초안 작성까지 자동

노벨 화학상 수상자 존 점퍼, 구글 딥마인드 떠나 앤스로픽 합류

노벨 화학상 수상자 존 점퍼, 구글 딥마인드 떠나 앤스로픽 합류

AlphaFold 핵심 개발자인 존 점퍼가 구글 딥마인드를 떠나 앤스로픽에 합류한다. 약 9년간 단백질 구조 예측 연구를 주도하며 2024년 노벨 화학상을 수상했다.

"작동해도 거절한다" 코딩 에이전트가 만든 '리뷰 병목' 현상

"작동해도 거절한다" 코딩 에이전트가 만든 '리뷰 병목' 현상

ChatGPT 등 AI 코딩 도구의 보급으로 코드 구현 속도는 비약적으로 빨라졌다. 하지만 구현 속도보다 리뷰 속도가 따라가지 못하는 '인지 부하'가 새로운 병목으로 등장했다. CI 통과 여부와 상관없이 확장성과 유지보수성을 위해 인간의 설계 주도권이

형식만 완벽한 AI 인시던트 보고서의 함정

형식만 완벽한 AI 인시던트 보고서의 함정

장애 보고서 작성의 번거로움 때문에 AI 자동 생성 도구에 대한 수요가 높습니다. 하지만 LLM은 증거를 종합하는 사고 과정을 생략해 그럴듯한 가짜 결론을 낼 위험이 큽니다. 코딩과 달리 검증할 테스트 코드가 없어 잘못된 보고서가 그대로 조직의 지식으

AI 보조 도구 의존 시 전문 숙련도 하락 확인... 의료·코딩 분야 '디스킬링' 발생

AI 보조 도구 의존 시 전문 숙련도 하락 확인... 의료·코딩 분야 '디스킬링' 발생

AI 도구 의존이 의료 및 컴퓨터 과학 등 전문직의 실질적 역량을 약화시키는 '디스킬링(deskilling)' 현상이 연구를 통해 확인됐다. 폴란드 내시경 전문의의 선종 발견율이 28.4%에서 22.4%로 하락했고, Anthropic 실험의 AI 사용