KO EN

AX BRIEF

매일 한 편, AI 업계를 읽는 칼럼

● LIVE
지능1. Claude Fable 5.1 (max with fallback) 98 pt2. Gemini 4 Argon (high) 95 pt3. Claude Opus 5.5 (max with fallback) 94 pt4. Claude Sonnet 5.5 (max with fallback) 93 pt5. GPT-6 Astra (max) 90 pt코딩1. Claude Fable 5.1 (max) 100 pt2. Claude Fable 5.1 XHigh + SWE-2 Medium 88 pt3. GPT-6.1 Sol (xhigh) 69 pt4. Claude Sonnet 5.5 (max) 63 pt5. Claude Opus 5.5 (max) 63 pt이미지1. gpt-image-2.5-sunburst 85 pt2. gpt-image-2.5-flare 81 pt3. gpt-image-2 (medium) 78 pt4. grok-imagine-image-2.0 (canvas) 70 pt5. mai-image-2.6 70 pt비디오1. gemini-omni-1.1-flash 85 pt2. gemini-omni-flash 84 pt3. flux-3-video 81 pt4. grok-imagine-video-1.5-agent 81 pt5. dreamina-seedance-2.0-720p 79 pt가격1. Claude Fable 5.1 (max with fallback) 100 pt2. GPT-6 Astra (max) 100 pt3. Claude Opus 5.5 (max with fallback) 39 pt4. Claude Sonnet 5.5 (max with fallback) 19 pt5. Gemini 4 Argon (high) 19 pt속도1. Claude Haiku 5.5 (max) 100 pt2. DeepSeek V4.1 Flash (max) 90 pt3. Muse Spark 1.3 (max) 84 pt4. gpt-oss-120b (high) 71 pt5. Nemotron 3 Ultra 51 pt

AI 뉴스

글로벌 AI 기업과 스타트업의 투자·제품·정책·핵심 동향을 매일 정리합니다.

AI 에이전트 자율 개선 및 데이터 효율 최적화 연구 10편 공개

AI 에이전트 자율 개선 및 데이터 효율 최적화 연구 10편 공개

자율적 자가 개선과 데이터 효율성을 극대화한 AI 에이전트 및 인프라 관련 최신 연구 10편이 공개됐다. APEX는 프롬프트 최적화로 Gemini 2.5 Flash 성능을 11.2% 높였으며, Self-Harness는 모델별 통과율을 최대 21.4%p

AI 에이전트에게 '사원증' 부여하는 NewCore, 6,600만 달러 투자 유치

AI 에이전트에게 '사원증' 부여하는 NewCore, 6,600만 달러 투자 유치

AI 에이전트가 단순 도구를 넘어 기업의 디지털 직원으로 활용되는 추세다. NewCore가 AI 에이전트 전용 신원 인증 및 권한 관리 플랫폼을 공개했다. 6,600만 달러의 투자를 유치하며 AI 에이전트의 보안 거버넌스 시장에 진입했다.

Jane Street, AI 에이전트 코딩 검증 위해 형식 기법 전담 팀 신설

Jane Street, AI 에이전트 코딩 검증 위해 형식 기법 전담 팀 신설

Jane Street이 AI 에이전트가 생성한 코드의 신뢰성을 확보하기 위해 형식 기법 전담 팀을 구성했다. 과거 seL4 검증에 코드 한 줄당 23줄의 증명이 필요했던 고비용 구조를 AI 모델의 자동화로 해결하려는 시도다. 개발자는 단순 테스트의 한

1M 토큰 광고의 배신, LLM이 진짜 똑똑한 구간은 100k까지

1M 토큰 광고의 배신, LLM이 진짜 똑똑한 구간은 100k까지

LLM의 컨텍스트 창이 커지며 방대한 데이터를 한 번에 넣는 방식이 일반화되었다. 하지만 실제 지능이 유지되는 '스마트 구간'은 광고 수치와 무관하게 약 100k 토큰 주변에서 끝난다. 성능 저하를 막으려면 자동 요약 대신 사람이 직접 작성한 명세를

Ivanti, 섀도우 AI 거버넌스 공백과 에이전트 권한 오남용 실태 공개

Ivanti, 섀도우 AI 거버넌스 공백과 에이전트 권한 오남용 실태 공개

Ivanti가 3,900명의 임직원을 대상으로 AI 에이전트 관리 실태를 조사한 보고서를 발표했다. IT 전문가의 85%가 에이전트 소유자가 있다고 주장하나 실제 파악률은 42%에 불과하며, 일부 AI 앱은 입력 데이터를 모델 학습에 기본 활용한다.

마이크로소프트 사티아 나델라, '토큰 자본' 기반 AI 아키텍처와 산업 공동화 위험 경고

마이크로소프트 사티아 나델라, '토큰 자본' 기반 AI 아키텍처와 산업 공동화 위험 경고

사티아 나델라 MS CEO가 AI 모델의 독점으로 인한 산업 지식의 상품화와 공동화 위험을 경고하는 에세이를 발표했다. 기업이 모델 의존도를 낮추기 위해 평가, 강화학습, 검색으로 구성된 학습 루프를 구축하고 '토큰 자본'을 확보해야 한다고 주장했다.

"전력망 기다릴 시간 없다" — 유럽, 기존 슈퍼컴퓨터 연합으로 2028년 프런티어 AI 도전

"전력망 기다릴 시간 없다" — 유럽, 기존 슈퍼컴퓨터 연합으로 2028년 프런티어 AI 도전

AI 모델 학습을 위한 거대 데이터센터 구축과 전력 확보에는 수년의 시간이 소요된다. 유럽은 신규 센터 대신 EuroHPC 등 기존 공공 컴퓨팅 자원을 연합해 활용하는 방안을 제시했다. 이 방식 채택 시 프런티어급 모델 확보 시점을 2033년에서 20

8시간 만에 100쪽 보고서 뽑아내는 가상 CSO, 사카나 AI '말린' 출시

8시간 만에 100쪽 보고서 뽑아내는 가상 CSO, 사카나 AI '말린' 출시

챗봇의 즉각적인 답변에 익숙해진 시대다. 사카나 AI가 8시간 동안 스스로 추론해 100쪽 보고서를 쓰는 '말린'을 공개했다. 기업용 전략 수립을 위해 다중 모델을 오케스트레이션하는 딥 리서치 에이전트다.

검색 결과 대신 정답을 — 페이스북에 상륙한 'AI 모드'

검색 결과 대신 정답을 — 페이스북에 상륙한 'AI 모드'

페이스북에서 원하는 정보를 찾으려면 수많은 게시글과 그룹을 일일이 뒤져야 했습니다. 메타가 공개한 'AI 모드'는 공개 게시글과 릴스 내용을 분석해 질문에 대한 정답을 바로 요약해 줍니다. 사진 편집과 크리에이터 도구 강화는 물론, 월 3.99달러부터

끝났다 — 수작업 인프라 관리, OpenCode와 GitOps로 자동화

끝났다 — 수작업 인프라 관리, OpenCode와 GitOps로 자동화

많은 개발자가 홈랩이나 서버 관리를 위해 Docker Compose와 Git을 사용한다. OpenCode와 Arcane GitOps를 결합해 AI가 코드를 짜고 인간이 승인하는 워크플로우를 구축했다. 릴리스 노트 분석 시간을 수 시간에서 수 분으로 단

데이터 엔지니어링, '바이브 코딩'의 파편화 해결 위해 명세 기반 개발(SDD) 도입

데이터 엔지니어링, '바이브 코딩'의 파편화 해결 위해 명세 기반 개발(SDD) 도입

AI 코딩 에이전트가 프롬프트 기반의 '바이브 코딩'을 통해 데이터 파이프라인 생성 속도를 가속하고 있다. 파편화된 비즈니스 로직과 의존성 문제를 해결하기 위해 실행 가능하고 버전 관리가 가능한 명세 기반 개발(SDD) 방식이 제시됐다. 실무자는 일회

Luz, AI 없이 C++20으로 구현한 제로 디펜던시 패스 트레이서 공개

Luz, AI 없이 C++20으로 구현한 제로 디펜던시 패스 트레이서 공개

외부 라이브러리 의존성 없이 C++20으로만 구현된 패스 트레이서 'Luz'가 공개됐다. 몬테카를로 경로 추적, BVH 가속, NFOR 스타일 디노이징 및 블렌더 익스포터 기능을 갖췄다. AI 코딩 도구가 보편화된 환경에서 기초 구현 능력과 하드웨어

36억 달러에 '핀' 품은 세일즈포스, AI 고객 응대 시장 정조준

36억 달러에 '핀' 품은 세일즈포스, AI 고객 응대 시장 정조준

기업용 소프트웨어 강자 세일즈포스가 AI 고객 서비스 플랫폼 핀(Fin)을 인수합니다. 36억 달러 규모의 이번 인수로 옴니채널 AI 에이전트 기술을 확보합니다. 확보한 기술은 기존 AI 플랫폼 Agentforce에 통합되어 자동화 성능을 높입니다.

hera-agent-unity 공개, Unity 6 제어용 단일 바이너리 도구 제공

hera-agent-unity 공개, Unity 6 제어용 단일 바이너리 도구 제공

Unity 에디터를 CLI로 제어하는 hera-agent-unity가 MIT 라이선스로 공개됐다. Go 바이너리와 CUPM 패키지로 구성되며 31,581개의 Unity 6 스크립트 레퍼런스를 오프라인으로 지원한다. MCP 의존성 없이 HTTP 통신을

Google Gemma 3 탑재한 위성, 궤도서 스스로 물체 찾는 '온보드 AI' 실현

Google Gemma 3 탑재한 위성, 궤도서 스스로 물체 찾는 '온보드 AI' 실현

위성 데이터 분석은 보통 지상으로 전송 후 사람이 확인하는 방식이다. Loft Orbital의 Yam-9 위성이 Google Gemma 3를 탑재해 궤도 내 자율 탐색에 성공했다. 자연어 쿼리로 특정 지형을 분류하며 데이터 전송 병목 해결과 실시간 감

테크 기업 15만 명 감원과 AI 명분, 실질적 과잉 고용 해소 흐름

테크 기업 15만 명 감원과 AI 명분, 실질적 과잉 고용 해소 흐름

올해 테크 기업들이 AI 도입을 이유로 약 15만 명의 인력을 감원했다. TrueUp에 따르면 363개 기업이 참여했으며, 이는 전년 대비 44% 빠른 속도다. AI가 실제 대체 수단인지 혹은 팬데믹 시기 과잉 고용의 구실인지 판단하는 기준이 된다.

프롬프트 한 줄에 코드 삭제, AI 에이전트의 치명적 맹점

프롬프트 한 줄에 코드 삭제, AI 에이전트의 치명적 맹점

AI 코딩 에이전트가 개발 공정을 자동화하며 빠르게 보급되고 있다. 자바 테스트 도구 jqwik은 봇에게만 보이는 삭제 명령으로 AI의 맹점을 증명했다. 악성코드 역시 AI의 안전 가이드라인을 역이용해 탐지를 회피하는 수법을 쓴다.

최고의 모델은 없다, 기업의 생존을 결정할 '학습 루프'의 등장

최고의 모델은 없다, 기업의 생존을 결정할 '학습 루프'의 등장

많은 기업이 어떤 LLM 모델을 쓸지 고민하며 벤치마크 점수에 집중한다. 사티아 나델라는 모델 선택보다 인간의 전문성과 AI 역량이 복리로 쌓이는 '학습 루프' 구축이 핵심이라고 강조한다. Private RL과 맞춤형 평가 체계를 통해 기업 고유의 암

앤스로픽, Claude Code로 터미널 기반 에이전트 코딩 구현 및 깃허브 코드 4% 점유

앤스로픽, Claude Code로 터미널 기반 에이전트 코딩 구현 및 깃허브 코드 4% 점유

앤스로픽이 터미널 기반의 에이전트형 코딩 도구인 Claude Code를 통해 소프트웨어 개발 워크플로의 변화를 이끌고 있다. 출시 8개월 만에 깃허브 전체 코드의 약 4%를 담당했으며, Opus 4.7 모델을 통해 최대 20시간의 장시간 실행 능력을

Claude, 코딩 성능 높였더니 '논쟁광' 된 이유

Claude, 코딩 성능 높였더니 '논쟁광' 된 이유

AI와 대화하다 보면 내 말을 가르치려 들거나 불필요한 말꼬리를 잡는 답답한 순간이 있다. 최근 Claude의 최신 모델 Fable 등에서 이전 버전보다 훨씬 공격적이고 논쟁적으로 반응하는 현상이 나타났다. 이는 과도한 안전 가드레일 설정과 코딩 성능

AI 코딩 에이전트 작업 추적 도구 re_gent 공개

AI 코딩 에이전트 작업 추적 도구 re_gent 공개

AI 코딩 에이전트의 작업 내역과 프롬프트를 git 방식으로 추적하는 re_gent가 공개됐다. BLAKE3 해시와 SQLite 인덱스를 통해 에이전트의 변경 이력을 단계별로 감사할 수 있다.

규제 요청하던 앤스로픽, 정작 본인 모델 '수출 금지' 처분

규제 요청하던 앤스로픽, 정작 본인 모델 '수출 금지' 처분

미국 정부가 앤스로픽 최신 모델인 클로드 페이블과 미토스의 외국인 접근을 금지했습니다. 아마존의 제3자 평가에서 사이버 보안 위험이 확인되어 내려진 수출 통제 조치입니다. 정부의 배포 차단 권한을 주장해온 앤스로픽 CEO의 정책이 실제 규제로 돌아온

에이전트로 Git을 Rust로 다시 쓴 Grit, 테스트 99% 통과

에이전트로 Git을 Rust로 다시 쓴 Grit, 테스트 99% 통과

Git은 20년간 명령 조합 방식으로 확장되어 실행 시마다 오버헤드가 발생하는 구조적 한계가 있다. Grit은 이를 해결하기 위해 Rust로 코어를 재구현하여 42,000개 테스트 중 99.3%를 통과했다. AI 에이전트를 활용해 36만 라인의 코드를

미국 성인 70%는 AI 안 쓴다... '전방위적 채택' 내러티브의 균열

미국 성인 70%는 AI 안 쓴다... '전방위적 채택' 내러티브의 균열

미국 내 AI 이용률이 활성 사용자, 간헐적 사용자, 비사용자로 약 3등분 된 것으로 나타났다. 마이크로소프트 데이터 기준 미국 노동 가능 인구의 30%만이 월 90분 이상 AI를 사용하고 있다. AI 기업들은 보편적 확산이라는 환상에서 벗어나 사용자

트릴리언에어 탄생시킨 스페이스X IPO, AI 랩 상장 경쟁의 신호탄

트릴리언에어 탄생시킨 스페이스X IPO, AI 랩 상장 경쟁의 신호탄

일론 머스크의 스페이스X가 역대 최대 규모의 기업공개(IPO)를 단행했다. 이번 상장으로 시장의 자본 흐름이 기존 소비자 서비스에서 AI 랩과 딥테크로 이동 중이다. OpenAI와 앤스로픽(Anthropic) 역시 기밀리에 상장 신청을 완료하며 경쟁에

금요일 오후 5시 21분, 미국 정부가 중단시킨 Fable 5 접근권

금요일 오후 5시 21분, 미국 정부가 중단시킨 Fable 5 접근권

고성능 AI 모델을 API나 채팅으로 이용하는 것은 이제 실무자의 일상적인 개발 환경이 됐다. 미국 정부가 국가안보를 이유로 Anthropic의 Fable 5와 Mythos 5에 대한 외국인 접근을 전격 차단했다. 단순 취약점 이슈를 넘어 정부의 일방

아마존의 '취약점 제보' 한 번에 해외 사용 막힌 앤스로픽 AI

아마존의 '취약점 제보' 한 번에 해외 사용 막힌 앤스로픽 AI

AI 모델이 해킹 도구로 악용될 수 있다는 보안 우려는 업계의 오랜 숙제입니다. 아마존의 제보를 받은 트럼프 행정부가 앤스로픽 최상위 모델의 해외 접근을 전격 차단했습니다. 정치적 갈등과 보안 이슈가 겹치며 앤스로픽의 IPO 계획과 글로벌 연구 환경에

구글·야후, 대량 발송자 DMARC 구성 요구하며 이메일 인증을 AI 인프라로 전환

구글·야후, 대량 발송자 DMARC 구성 요구하며 이메일 인증을 AI 인프라로 전환

구글과 야후가 2024년 초부터 대량 이메일 발송자에게 DMARC 구성을 필수 요구했다. SPF, DKIM, DMARC 기반의 인증 체계는 AI 필터와 AI 보조 도구가 발신자 신뢰도를 판단하는 핵심 입력값이 된다. AI가 사용자를 대신해 메일을 처리

murrdb, AI 추론용 RocksDB 기반 캐시 'Murr' 공개

murrdb, AI 추론용 RocksDB 기반 캐시 'Murr' 공개

AI 추론 워크로드 최적화를 위한 RocksDB 기반 NVMe/S3 캐시 Murr가 공개됐다. Redis 대비 읽기 성능을 높이고 S3 기반 영속성과 비용 효율성을 확보했다. Apache 2.0 라이선스로 제공된다.

악성코드 개발자, AI 보안 스캐너 무력화 위해 핵·생물무기 문구 삽입

악성코드 개발자, AI 보안 스캐너 무력화 위해 핵·생물무기 문구 삽입

악성코드 개발자들이 AI 보안 스캐너의 분석을 피하기 위해 스파이웨어에 핵·생물무기 관련 문구를 삽입했다. LLM의 안전 거부 기능을 악용해 보안 분석 파이프라인을 무력화하려는 시도다.