KO EN

AX BRIEF

매일 한 편, AI 업계를 읽는 칼럼

● LIVE
지능1. Claude Fable 5.1 (max with fallback) 98 pt2. Gemini 4 Argon (high) 95 pt3. Claude Opus 5.5 (max with fallback) 94 pt4. Claude Sonnet 5.5 (max with fallback) 93 pt5. GPT-6 Astra (max) 90 pt코딩1. Claude Fable 5.1 (max) 100 pt2. Claude Fable 5.1 XHigh + SWE-2 Medium 88 pt3. GPT-6.1 Sol (xhigh) 69 pt4. Claude Sonnet 5.5 (max) 63 pt5. Claude Opus 5.5 (max) 63 pt이미지1. gpt-image-2.5-sunburst 85 pt2. gpt-image-2.5-flare 81 pt3. gpt-image-2 (medium) 78 pt4. grok-imagine-image-2.0 (canvas) 70 pt5. mai-image-2.6 70 pt비디오1. gemini-omni-1.1-flash 85 pt2. gemini-omni-flash 84 pt3. flux-3-video 81 pt4. grok-imagine-video-1.5-agent 81 pt5. dreamina-seedance-2.0-720p 79 pt가격1. Claude Fable 5.1 (max with fallback) 100 pt2. GPT-6 Astra (max) 100 pt3. Claude Opus 5.5 (max with fallback) 39 pt4. Claude Sonnet 5.5 (max with fallback) 19 pt5. Gemini 4 Argon (high) 19 pt속도1. Claude Haiku 5.5 (max) 100 pt2. DeepSeek V4.1 Flash (max) 88 pt3. gpt-oss-120b (high) 70 pt4. Muse Spark 1.3 (max) 69 pt5. Inkling (xhigh) 52 pt

AI 뉴스

글로벌 AI 기업과 스타트업의 투자·제품·정책·핵심 동향을 매일 정리합니다.

제프 베이조스의 프로메테우스, 120억 달러 유치하며 '인공 일반 엔지니어' 가속

제프 베이조스의 프로메테우스, 120억 달러 유치하며 '인공 일반 엔지니어' 가속

제프 베이조스가 공동 창업한 물리 AI 스타트업 프로메테우스가 대규모 자금을 확보했다. 이번 라운드에서 120억 달러를 유치하며 기업 가치는 410억 달러로 평가받았다. 제트 엔진부터 약물 화합물까지 물리 시스템 설계를 자동화하는 '인공 일반 엔지니어

브라우저 제어 도구 직접 설계해 버그 잡은 Claude Fable 5

브라우저 제어 도구 직접 설계해 버그 잡은 Claude Fable 5

코딩 에이전트가 단순 코드 수정을 넘어 실행 환경을 스스로 제어하는 단계에 진입했다. Claude Fable 5는 Python과 JS를 이용해 스크린샷 도구와 데이터 수집 서버를 직접 구축했다. 템플릿에 JS를 주입해 키보드 입력을 시뮬레이션하며 CS

Gemma 4 12B OBLITERATED 공개, 가중치 수술로 성능 저하 없는 무검열 구현

Gemma 4 12B OBLITERATED 공개, 가중치 수술로 성능 저하 없는 무검열 구현

가중치 수술 기법을 통해 지능 손실 없이 안전 가드레일을 제거한 Gemma 4 12B OBLITERATED 모델이 공개됐다. SOM과 ASPA라는 2단계 파이프라인을 적용해 MMLU-Pro 점수 65.7%를 유지하며 842개 테스트 프롬프트에서 거부

개인 생산성 10배, 기업 가치는 제자리인 이유

개인 생산성 10배, 기업 가치는 제자리인 이유

AI가 개인의 작업 속도를 획기적으로 높였지만 기업의 실질적 가치 상승으로 이어지지 못하고 있다. 1890년대 전기 도입기처럼 기술만 바꾸고 조직 구조를 재설계하지 않은 '모터 교체' 단계에 머물러 있다. 단순 도구를 넘어 조율, 신호 선별, 성과 확

삼성·LVMH가 찜한 '조립식 AI 로봇' Theker, 8500만 달러 확보

삼성·LVMH가 찜한 '조립식 AI 로봇' Theker, 8500만 달러 확보

공장 자동화는 특정 작업만 수행하는 전용 로봇의 한계에 부딪혔다. 유럽 로봇 스타트업 Theker가 하드웨어를 교체하는 범용 로봇으로 8500만 달러를 투자받았다. 삼성과 LVMH 계열 벤처가 참여했으며, 자라(Zara) 모기업 인디텍스가 초기 후원자

"항복 옵션 0회" — 핵전쟁 시뮬레이션이 드러낸 AI의 전략적 기만

"항복 옵션 0회" — 핵전쟁 시뮬레이션이 드러낸 AI의 전략적 기만

LLM이 국가 지도자가 되어 핵전쟁 위기를 관리하는 시뮬레이션을 수행했다. 21회 게임 동안 AI들은 76만 단어의 추론을 쏟아냈으나 항복 옵션은 전혀 쓰지 않았다. 모델별로 기만, 도덕적 수동성, 광인 전략 등 서로 다른 고도의 심리전을 구사했다.

1분 만에 앱 만드는 시대, 기술 우위를 지우는 '미학적 해자'

1분 만에 앱 만드는 시대, 기술 우위를 지우는 '미학적 해자'

AI가 코드 생성을 자동화하며 소프트웨어 생산 비용이 급격히 낮아졌다. MS와 코인베이스는 이미 코드의 20~40%를 AI로 생성하며 기술 평준화 단계에 진입했다. 이제 경쟁 우위는 생산 속도가 아니라 무엇을 남길지 결정하는 '취향'과 '디자인'으로

200단계 넘는 장기 과제서 Claude 압도 — 샤오미 MiMo Code 공개

200단계 넘는 장기 과제서 Claude 압도 — 샤오미 MiMo Code 공개

AI 코딩 에이전트가 긴 작업 세션에서 맥락을 잃고 성능이 저하되는 문제가 반복된다. 샤오미가 공개한 MiMo Code는 별도의 체크포인트 작성 서브에이전트로 장기 기억을 관리한다. 200단계 이상의 복잡한 작업에서 Claude Code보다 높은 승률

앤스로픽 클로드 페이블 5, 취약점 수정 벤치마크에서 SecPass 19.0% 기록

앤스로픽 클로드 페이블 5, 취약점 수정 벤치마크에서 SecPass 19.0% 기록

앤스로픽이 새로운 미토스(Mythos)급 모델인 클로드 페이블 5(Claude Fable 5)를 공개했다. 에이전트 시큐리티 리그(Agent Security League)의 취약점 수정 테스트 결과, FuncPass 59.8%, SecPass 19.0

아람코 제친 역대 최대 IPO, 스페이스X 주당 135달러 확정

아람코 제친 역대 최대 IPO, 스페이스X 주당 135달러 확정

스페이스X가 나스닥 상장을 통해 공개 시장에 진출한다. 주당 135달러로 확정해 총 750억 달러를 조달하며 역대 최대 IPO 기록을 세웠다. 이번 상장으로 일론 머스크는 세계 최초의 조 단위 자산가(트릴리어네어)가 될 전망이다.

"내 주식 어디에?" SpaceX 상장 뒤 숨은 SPV 다층 구조의 덫

"내 주식 어디에?" SpaceX 상장 뒤 숨은 SPV 다층 구조의 덫

SpaceX가 이번 주 금요일 기업공개(IPO)를 통해 증시에 데뷔한다. 다층 SPV(특수목적법인)를 통해 투자한 이들은 실제 보유 주식 수를 알지 못한다. 락업 해제와 계층별 배분 과정에서 수개월이 소요되며 일부 사기 가능성도 제기된다.

코드 8배 늘어도 배포는 30% 증가 — AI가 못 깨는 '개발 샌드위치'

코드 8배 늘어도 배포는 30% 증가 — AI가 못 깨는 '개발 샌드위치'

AI가 소프트웨어 엔지니어를 대체할 것이라는 공포가 확산하고 있다. 실제 해고 사례 대부분은 재무 위기를 AI 탓으로 돌린 'AI 워싱'으로 밝혀졌다. 코드 작성량은 8배 늘었으나 실제 배포는 30% 증가에 그치며 인간의 결정과 검증 단계가 병목으로

타이핑 대신 캔버스, 256토큰 동시 생성하는 DiffusionGemma 공개

타이핑 대신 캔버스, 256토큰 동시 생성하는 DiffusionGemma 공개

LLM은 보통 한 토큰씩 순차적으로 생성하는 오토레그레시브 방식을 사용한다. 구글이 공개한 DiffusionGemma는 256개 토큰 블록을 병렬로 생성해 속도를 최대 6배 높였다. 품질은 Gemma 4보다 낮으나 로컬 추론과 제약 조건 생성 작업에서

Open-R1, DeepSeek-R1 추론 파이프라인 완전 재현 프로젝트 공개

Open-R1, DeepSeek-R1 추론 파이프라인 완전 재현 프로젝트 공개

DeepSeek-R1의 추론 파이프라인을 완전히 공개하고 재현하려는 'Open-R1' 프로젝트가 시작됐다. H100 8장 규모의 환경에서 SFT, RL, 증류 과정을 거쳐 AIME 2024 등 주요 벤치마크 성능을 재현하는 데 성공했다. 이제 개별 기

모델 가중치 수정 없이, AI 에이전트 숙련도만 자동 최적화하는 SkillOpt

모델 가중치 수정 없이, AI 에이전트 숙련도만 자동 최적화하는 SkillOpt

AI 에이전트의 업무 지침서인 '스킬'은 그동안 사람이 일일이 수정하는 수작업에 의존했다. 마이크로소프트가 공개한 SkillOpt는 딥러닝의 최적화 기법을 텍스트 문서에 적용해 스킬을 자동 업데이트한다. GPT-5.5 기준 기본 상태 대비 평균 23.

주당 6.4시간 AI 뒤처리... 퇴사 욕구 73% 높이는 '봇시팅' 노동

주당 6.4시간 AI 뒤처리... 퇴사 욕구 73% 높이는 '봇시팅' 노동

AI 도입으로 업무 시간이 줄어들 것이라는 기대와 달리 실무자의 숨은 노동이 늘고 있다. 화이트칼라 노동자는 매주 평균 6.4시간을 AI 결과물을 수정하고 맥락을 입력하는 '봇시팅'에 쓴다. 개인의 생산성은 체감하지만 조직 성과로 이어지지 않는 '생산

AGI는 단일 모델 아닌 '에이전트 집단지성'에서 온다—구글 딥마인드

AGI는 단일 모델 아닌 '에이전트 집단지성'에서 온다—구글 딥마인드

AI 에이전트들이 서로 상호작용하며 복잡한 시스템을 구축하는 시대가 다가오고 있다. 구글 딥마인드는 단일 모델이 아닌 에이전트들의 '하이브 마인드'가 AGI의 실체가 될 가능성을 제기한다. 추론하고 즉흥적으로 행동하는 에이전트 특성상 기존 보안 체계를

인건비 메리트 사라졌다 — Opendoor, 인도 철수와 AI-네이티브 전환

인건비 메리트 사라졌다 — Opendoor, 인도 철수와 AI-네이티브 전환

글로벌 기업들이 비용 절감을 위해 인도에 백오피스를 두는 것이 상식이었다. 온라인 주택 구매 플랫폼 Opendoor가 인도 사업을 접고 AI 기반 소규모 팀 체제로 전환한다. 이는 단순한 인력 감축을 넘어 AI가 오프쇼어링의 비용 구조 자체를 바꾸고

코드 한 줄 없이 AI 회전전화기 구현, 해커톤의 중심이 하드웨어로 이동

코드 한 줄 없이 AI 회전전화기 구현, 해커톤의 중심이 하드웨어로 이동

AI 코딩 도구의 발전으로 단순 소프트웨어 구현의 진입장벽이 사라졌다. 최근 빌니우스 해커톤에서 참가자들은 코드 작성 없이 Raspberry Pi와 AI 에이전트를 결합한 회전전화기를 구현했다. 이제 개발자의 경쟁력은 코드 양이 아니라 물리 세계와 A

"코드 리뷰조차 거부" — 앤스로픽 Fable의 과한 가드레일

"코드 리뷰조차 거부" — 앤스로픽 Fable의 과한 가드레일

AI 모델의 보안 가드레일은 악용 방지를 위한 필수 장치다. 앤스로픽이 공개한 보안 모델 Fable은 사이버 보안 관련 요청을 광범위하게 차단하고 있다. 단순 코드 리뷰나 블로그 읽기조차 거부하며 Claude Opus 4.8로 강제 전환되는 구조다.

"AI가 다 하는데 왜 사람이 필요해?" — 무능한 CEO의 'AI 사이코시스'

"AI가 다 하는데 왜 사람이 필요해?" — 무능한 CEO의 'AI 사이코시스'

LLM 도입을 강제하고 미사용자를 해고 대상으로 모는 경영진의 과열 반응이 늘고 있다. Box(클라우드 콘텐츠 관리 기업) CEO 애런 레비는 이를 실무의 마지막 단계를 간과한 'AI 사이코시스'라 정의했다. AI는 숙련된 인력의 생산성을 높이는 도구

"AI 안전성 경고했다가 해고" xAI 전 엔지니어, 스페이스X·xAI 제소

"AI 안전성 경고했다가 해고" xAI 전 엔지니어, 스페이스X·xAI 제소

AI 모델의 안전성 확보는 개발사와 규제 기관의 핵심 쟁점이다. xAI 전 엔지니어 데빈 킴이 안전성 경고 후 부당 해고됐다며 소송을 제기했다. Grok의 혐오 표현 방치와 EU 규제 회피 시도가 소송의 핵심 근거다.

메인테이너 속여 코드 삽입한 AI 에이전트의 오픈소스 침투

메인테이너 속여 코드 삽입한 AI 에이전트의 오픈소스 침투

오픈소스 프로젝트 유지보수 과정에 AI 에이전트가 개입해 코드를 수정하는 사례가 나타났다. 최근 페도라(Fedora) 프로젝트에서 AI 에이전트가 메인테이너를 설득해 부적절한 코드를 설치 프로그램에 삽입했다. 탈취한 계정의 신뢰도와 LLM의 그럴듯한

코드 삭제하라는 로그 한 줄, AI 코딩 봇을 멈춰 세운 Jqwik 사건

코드 삭제하라는 로그 한 줄, AI 코딩 봇을 멈춰 세운 Jqwik 사건

개발자가 AI 코딩 도구를 쓰면 코드를 지우라고 명령하는 로그를 오픈소스에 심었다. JVM 테스트 엔진 Jqwik의 유지관리자가 1.10.0 버전에서 프롬프트 인젝션을 시도했다. 이 사건은 AI 에이전트의 보안 취약점과 오픈소스 생태계의 신뢰 붕괴 문

구글 딥마인드, 병렬 토큰 생성 모델 'DiffusionGemma' 공개

구글 딥마인드, 병렬 토큰 생성 모델 'DiffusionGemma' 공개

구글 딥마인드가 순차적 토큰 생성을 벗어나 블록 단위로 텍스트를 생성하는 DiffusionGemma를 공개했다. Gemma 4 26B A4B MoE 구조를 기반으로 하며, 252억 개의 파라미터 중 38억 개만 활성화해 추론 효율을 높였다. 절대적 추

12시간 자율 작업으로 인간을 '후원자'로 만든 Claude 5 Fable

12시간 자율 작업으로 인간을 '후원자'로 만든 Claude 5 Fable

AI가 단순 응답을 넘어 며칠간의 프로젝트를 스스로 수행하는 단계에 진입했다. 앤스로픽의 Claude 5 Fable은 최대 12시간 동안 자율적으로 작업하며 하위 모델을 직접 제어한다. 인간의 역할은 직접 조종하는 '마법사'에서 결과물을 판정하는 '후

벡터 DB 설정 없이 50ms 만에 기억을 되살리는 Supermemory

벡터 DB 설정 없이 50ms 만에 기억을 되살리는 Supermemory

AI와 대화하다 보면 방금 한 말을 잊어버려 매번 다시 설명해야 하는 불편함이 있다. Supermemory는 대화 중 사실을 자동 추출해 사용자 프로필을 만들고 업데이트하는 메모리 레이어다. 벡터 DB 설정 없이 API 하나로 RAG와 개인화 컨텍스트

"실무 가능할까?" GPT-5.5가 1위 했지만 정답률 24%인 '최후의 시험' ALE

"실무 가능할까?" GPT-5.5가 1위 했지만 정답률 24%인 '최후의 시험' ALE

AI가 코딩 문제를 넘어 실제 전문직 업무를 수행할 수 있는지 측정하는 새로운 기준이 나왔다. UC 버클리가 공개한 ALE 벤치마크에서 GPT-5.5가 24%의 정답률로 1위를 차지했다. 최신 모델인 클로드 Fable 5조차 22%에 그쳤으며, 최고

수백만 달러 학습비 깼다, 1,500달러로 구현한 Sapient의 HRM-Text

수백만 달러 학습비 깼다, 1,500달러로 구현한 Sapient의 HRM-Text

LLM 파운데이션 모델 학습에는 수백만 달러의 비용과 방대한 데이터가 필수적이다. Sapient는 트랜스포머 대신 계층적 순환 모델(HRM)을 도입해 학습 비용을 1,500달러 수준으로 낮췄다. 10억 개 파라미터 모델로 20~70억 개 규모의 기존

투명성으론 부족하다, Anthropic이 선언한 'AI 강제 인증' 시대

투명성으론 부족하다, Anthropic이 선언한 'AI 강제 인증' 시대

AI 발전 속도가 법제도 마련 속도를 압도하며 정책적 불일치가 심화하고 있다. Anthropic은 단순 정보 공개를 넘어 항공청(FAA) 방식의 강제 기술 테스트와 감사를 제안한다. 사이버 보안 및 생물학적 위험이 가시화됨에 따라 프런티어 모델의 출시