매일 한 편, AI 업계를 읽는 칼럼
엔지니어링·제품·전략 관점에서 기술 리더와 연구자들의 심층 인사이트를 큐레이션합니다.

TRL과 OpenEnv를 활용해 JS 코드로 수채화를 그리는 소형 모델 학습 파이프라인이 공개되었다. HPSv3와 Qwen3-VL-30B-A3B-Instruct를 조합한 보상 모델로 개인의 미적 취향을 학습시킨다. 소형 모델에 특정 도메인의 '취향'을

Amazon Bedrock AgentCore가 코드베이스를 분석해 아키텍처 다이어그램을 자동 생성하고 유지하는 파이프라인을 공개했다. 반복적 정제와 자가 수정 과정을 통해 단일 API 호출 대비 생성 신뢰도를 65%에서 95%로 끌어올렸다. CI/CD

Amazon Bedrock이 호주 리전에서 OpenAI GPT-5.6 Sol, Terra, Luna 모델 접근을 지원한다. 글로벌 교차 리전 추론과 100만 토큰 컨텍스트 창, 프롬프트 캐싱으로 성능과 비용을 최적화한다. 워크로드 성격에 맞는 모델 선

인프라 모니터링이 잡지 못하는 '침묵의 실패'를 잡는 대시보드 자동 검증 솔루션을 구축했다. Amazon Bedrock의 Claude 모델과 Rekognition을 활용해 탐지 시간을 72시간에서 1시간 미만으로 단축했다. BI 엔지니어는 LLM의 의

파편화된 운영 지식을 생성형 AI로 통합해 인력 증원 없이 지원 규모를 확장한다. 교육 영상의 SOP 자동화, RAG 기반 티켓 가이드, ML 리스크 예측을 2계층 구조로 구현한다. 운영 리더는 단순 티켓 수치보다 워크플로 가시성과 지식 추출 자동화

추론과 코딩 성능을 강화한 Gemini 3.8 Flash와 보안 특화 모델인 3.8 Flash Cyber가 공개됐다. 3.7 Flash의 비용과 속도를 유지하며 DeepSWE v1.1 등 주요 벤치마크에서 대형 모델 성능에 근접했다. 복잡한 작업 시

IBM이 Confluent와 협력해 실시간 시계열 파운데이션 모델(TSFM) 4종을 공개했다. Flink SQL 함수 호출만으로 별도 ML 스택 없이 실시간 예측과 이상 탐지를 구현한다. GPU 없이 CPU만으로 대규모 지표를 처리하려는 실무자는 모델

구글이 워크스페이스 앱 내에서 AI 이미지 생성과 편집이 가능한 Google Pics를 출시했다. Nano Banana 모델을 기반으로 Docs, Slides, Drive에 통합되어 탭 전환 없는 편집 환경을 제공한다. Google AI Pro 및 U

Gemini 3.7 Flash, 3.5 Transcribe, Omni 1.1 Flash 및 Tensor G6 기반 픽셀 11 시리즈를 출시했다. 3.7 Flash는 3.6 Flash 대비 토큰당 비용을 50% 절감하며 코딩 및 에이전트 성능을 강화했다

NVIDIA Nemotron 기반의 에이전틱 보안 시스템 SafeMind를 공개했다. 공격-방어 모델의 공진화 루프와 전용 하네스를 통해 보안 자동화를 구현했다. 비용 99% 절감과 27초의 공격 속도에 대응하려는 보안 실무자가 도입 조건을 확인해야

Gemini 3.7 및 3.6 Flash, 3.5 Flash-Lite 모델에 에이전틱 비디오 분석 기능이 추가되었다. 고정 프레임 방식 대신 동적 스캔 방식을 도입해 토큰 사용량은 최대 88%, 비용은 최대 66% 절감했다. 장편 영상 분석 비용과 정

Claude Fable 5.1이 Amazon Bedrock과 Claude Platform on AWS에 출시되었다. 추론 성능이 개선되었으나 'Covered Model'로 지정되어 기본 30일 데이터 보관과 인적 검토가 수행된다. EFS 대상 고객은

Atos가 AWS와 협력해 엔지니어 400명을 대상으로 3일간의 에이전틱 AI 실무 교육을 진행했다. 던전 탐색 에이전트를 구축하며 Bedrock AgentCore, Guardrails, SageMaker RLVR 등 AWS 스택을 활용해 성능과 효율

Astra가 자율적으로 보안 취약점을 찾고 공격 코드를 생성하는 'Critical' 수준의 사이버 보안 능력을 확보했다. ExploitBench 100% 달성 및 내부 테스트 중 2개의 제로데이 취약점을 직접 발견하며 GPT-5.6 Sol보다 높은 성

코딩과 지식 작업에 최적화된 Claude Fable 5.1과 Mythos 5.1이 공개됐다. 캐시 읽기 비용 절감으로 일반 작업 25%, 에이전트 작업 최대 45%의 비용을 낮췄다. Opus 5 수준의 성능을 더 낮은 비용으로 구현하려는 실무자는 비용

데카트론이 시계열 파운데이션 모델 Chronos-2를 도입해 공급망 예측 정확도를 15%p 개선했다. AutoGluon과 LoRA를 활용한 미세 조정으로 운영 복잡성을 줄이고 신규 지역 배포 기간을 절반으로 단축했다. 물류 및 재고 관리 실무자는 대규

Open ASR Leaderboard가 인도 영어(en-IN)와 힌디어(hi-IN)를 포함한 Monsoon 데이터셋을 추가했다. 4,888명의 화자와 9가지 변수를 통해 단순 평균 오차율(WER) 뒤에 숨은 인구통계학적 성능 격차를 측정한다. ASR

Amazon SageMaker Feature Store가 대량 데이터 처리를 위한 BatchWriteRecord와 데이터 가시성을 확보하는 ListRecords API를 출시했다. 기존 단일 레코드 방식의 연결 오버헤드를 줄이고, In-Memory 계

Salesforce는 SageMaker 추론 컴포넌트(IC)를 활용해 모델을 통합 배포하여 인프라 비용을 8배 절감했다. 새로 도입된 SchedulingConfig 파라미터를 통해 가용 영역(AZ) 간 모델 복제본을 균등하게 분산 배치했다. 멀티 AZ

LLM이 새로운 정보를 받아들여 확률적 믿음을 수정하는 방식이 통계학적 베이지안 업데이트와 일치하지 않음이 확인되었다. 연구진은 LLM의 정보 처리 편향을 측정하는 기법을 통해, 최적화된 베이지안 방식보다 학습된 휴리스틱이 오히려 성능이 높다는 점을

1B~14B 규모의 소형 언어 모델을 개인 PC에서 생산적으로 활용하는 로컬 AI 스택 구성법이다. Ollama를 기반으로 모델을 서빙하고 Cline이나 Aider 같은 에이전트 도구를 연결해 워크플로를 자동화한다. 개발자는 하드웨어 사양과 자동화 수

구글 클라우드 엔지니어들이 AI를 단순 보조가 아닌 비판적 대립자로 활용하는 10가지 프롬프트 기법을 공개했다. 코드 생성 전 요구사항 검증, 테스트 커버리지 감사, 엄격한 등급 평가 등 실무 관점을 강제하는 구조적 접근이 핵심이다. 개발자는 AI의

구글 검색의 AI 모드가 항공권 가격 추적과 마일리지 조회, 호텔 직접 예약 기능을 추가했다. 300개 이상의 항공사 데이터와 주요 호텔 체인의 리워드 정보를 검색 대화창에서 즉시 확인할 수 있다. 사용자는 항공권 가격 알림을 설정하고 구글 페이를 통

Amazon Quick과 fal을 MCP로 연결해 창작물의 일관성을 유지하는 에이전트 워크플로를 구축한다. 창작자가 정의한 단계별 검수와 참조 모델을 에이전트가 기억해 8단계 스토리보드 제작 시간을 단축한다. 반복적인 창작 업무를 수행하는 팀은 이 구

OpenAI가 브라질 상파울루에 상업 운영 거점을 마련하고 현지 기업 및 개발자 지원을 강화한다. 브라질은 ChatGPT의 세계 3대 시장 중 하나로, 일일 메시지 발송량 2억 1,500만 건을 기록하고 있다. 현지 개발자와 기업은 이번 거점 설립을

Google이 영상 생성 및 편집 제어 기능을 강화한 Gemini Omni 1.1 Flash를 공개했다. 최대 40초 장면 확장과 4K 출력, 360p 저해상도 초안 생성을 통한 비용 절감을 지원한다. 영상 편집 도구 개발자는 Google AI Stu

Amazon Bedrock이 인도 내 데이터 처리를 보장하는 GPT-5.6 모델을 출시했다. 뭄바이와 하이데라바드 리전 간 교차 리전 추론으로 데이터 국외 반출 없이 성능을 확보한다. 금융·의료 등 데이터 주권이 중요한 분야의 실무자는 인도 전용 추론

NVIDIA가 Gamescom 2026에서 클라우드 게이밍 서비스 GeForce NOW의 신규 기술과 플랫폼 확장을 발표했다. DLSS 4.5 제어 기능과 파이어폭스 브라우저 지원을 추가하고, GOG 계정 연동 간소화 및 신작 게임 5종의 출시 당일

NVIDIA MPS를 활용해 GPU 자원 활용도를 높여 추론 인프라를 16대에서 4대로 줄였다. CUDA 기본 시간 분할 방식의 비효율을 제거하고 동시 실행 환경을 구축해 인프라 비용을 75% 절감했다. ASR 서비스 운영자는 GPU 점유율과 지연 시

Amazon Bedrock AgentCore를 활용해 서로 다른 AWS 계정의 지식 기반에서 데이터를 안전하게 조회하는 두 가지 구현 방식을 공개한다. 코드 기반의 Strands 에이전트와 선언형 Harness 모델 중 팀의 오케스트레이션 제어 수준에