🔥 주요 소식
베일에 싸인 모델 Ox Alpha, OpenRouter 및 OpenCode에 기습 등장 : OpenRouter와 OpenCode에 코드명 ‘Ox Alpha’라는 의문의 스텔스 모델이 전격 출시되었습니다. 100만 Token의 컨텍스트를 제공하며 텍스트, 이미지, 비디오 입력을 네이티브로 지원합니다. 이 모델은 장기 Agent 프로그래밍, 복잡한 추론 및 실제 프로덕션 환경을 위해 설계되었으며, 일일 100조 Token의 무료 테스트 한도를 개방했습니다. 다수의 개발자 실측 결과 프로그래밍 및 추론 능력이 Fable 5와 GPT-5.6 Sol을 능가하는 것으로 나타났습니다. 인터넷 전체가 이 모델의 정체에 대해 열띤 추측을 벌이고 있으며, 현재 커뮤니티에서는 Zhipu GLM-5.4/5.5 또는 Xiaomi MiMo V3일 것으로 주로 추측하고 있습니다 (출처: OpenRouter, 36氪)
DeepSeek 공식, 멀티모달 비전 모델 V4-Flash-Vision-Exp 전격 출시 : DeepSeek 공식 API 플랫폼에 첫 네이티브 비전 이해 모델인 DeepSeek-V4-Flash-Vision-Exp가 전격 출시되었습니다. 이 모델은 V4-Flash의 강력한 텍스트 능력을 유지하는 동시에 멀티모달 Agent 성능을 크게 향상시켜 Opus 4.8에 근접했습니다. 이미지는 크기에 따라 Token으로 환산되며(단일 이미지 최대 384 tokens), 요금은 V4-Flash와 완전히 동일합니다(이미지 1,000장당 약 1위안에 불과). 또한 무료 Files API와 Harness 0.1.1 호환을 동시에 개방하여 비전 Agent의 개발 및 운영 비용을 획기적으로 낮췄습니다 (출처: DeepSeek, 机器之心)

Google, Gemini 3.7 Flash 출시 및 다수의 Agent 벤치마크 경신 : Google이 Gemini 3.7 Flash를 공식 출시했습니다. API 가격은 3.6 Flash 대비 50% 인하되었으며, 알고리즘 차원에서 대폭적인 지능 향상을 이루어냈습니다. Artificial Analysis의 AA-AnalystAgent 실제 데이터 분석 벤치마크에서 Gemini 3.7 Flash가 1위를 차지했으며, 과제 완료 속도는 경쟁사 대비 60%~90% 빠릅니다. 동시에 ARC-AGI 검증 평가에서 매우 저렴한 비용으로 ARC-AGI-2 84.6%라는 높은 점수를 기록하며 뛰어난 가성비와 비전 Agent 역량을 입증했습니다 (출처: demishassabis, Google Research Blog)

OpenAI, 재단 설립 및 AI Futures 프로젝트 출범 : OpenAI가 OpenAI Foundation 재단을 공식 설립하고 AI Futures 프로젝트를 출범했습니다. 이는 AGI 역량을 광범위한 사회적 공익으로 전환하는 것을 목표로 합니다. 재단은 생명 과학(단백질 설계 및 신약 개발 등)과 AI 사회적 복원력(생물학적/사이버 위협 방어)에 집중하고 있으며, 초기 5개월 동안 수억 달러를 투입했고 향후 수십억 달러를 투입할 계획입니다. 여기에는 조기 경보 시스템 구축을 위해 SecureBio에 1,720만 달러를 기부한 것이 포함됩니다. 이는 최정상 AI 연구소가 기술 오용과 사회적 위험을 방지하기 위한 공공 인프라 구축을 가속화하고 있음을 보여줍니다 (출처: OpenAI News, woj_zaremba)

🎯 동향
NVIDIA, AVO 에이전트 출시 및 ARC-AGI-3에서 100% 만점 기록 : NVIDIA AI 팀이 범용 프로그래밍 및 대화형 추론 에이전트 AVO를 공개했습니다. 명시적인 지시, 규칙 또는 사전 설정된 목표가 없는 상태에서, Claude Opus 5로 구동되는 AVO Harness는 ARC-AGI-3 대화형 추론 벤치마크의 전체 25개 환경 183개 스테이지를 완료하며 100% 만점을 달성했고, 동급 시스템 대비 작업 실행 효율이 12% 향상되었습니다 (출처: ClementDelangue)
Alibaba, Qwen-UI-Agent 에이전트 베이스 모델 오픈소스 공개 : Alibaba가 모바일, 데스크톱 및 웹 실행을 위한 GUI 에이전트 베이스 모델 Qwen-UI-Agent(27B / 35B-A3B / 4B 버전 제공)를 선보였습니다. 100대 이상의 실제 스마트폰 환경을 기반으로 학습되었으며, GUI 클릭과 CLI 명령줄 작업 공간을 통합하여 5개 핵심 GUI 벤치마크 테스트에서 GPT-5.6 Sol 및 Opus 4.8을 제쳤습니다 (출처: 36氪)
Xiaohongshu, 통합 음性 생성 및 편집 모델 FireRedTTS3 오픈소스 공개 : Xiaohongshu가 차세대 음성 모델 FireRedTTS3를 발표했습니다. 자체 개발한 RedAE 시맨틱 강화 연속 표현을 기반으로 단일 모델 내에서 24개 언어 및 21개 중국어 방언의 제로샷 클로닝, 자연어 사운드 디자인, 정밀한 부분 음성 편집을 통합했으며, Seed-TTS-Eval 등 4대 공개 벤치마크에서 1위를 싹쓸이했습니다 (출처: 机器之心)

Replit, GPT-5.6 Luna 기반 무료 모드 (Free Mode) 출시 : Replit이 OpenAI와 협력하여 GPT-5.6 Luna 기반의 Free Mode를 출시했습니다. 이를 통해 모든 사용자가 대화형 AI 프로그래밍 및 Agent 애플리케이션 개발을 무료로 체험할 수 있게 되었으며, 바닥부터 완전한 소프트웨어를 구축하는 진입 장벽을 대폭 낮췄습니다 (출처: amasad)

Meta, 네이티브 옴니모달 대형 모델 Muse Spark 1.2 출시 : Meta가 Muse Spark 1.2를 공식 발표했습니다. 강력한 비전 코드 생성, 로봇 계획 및 오디오/비디오 이해 능력을 갖추고 있습니다. Design Arena 평가에서 Video-to-Website 분야 1위 및 Image-to-HTML 순위 상위권을 차지하며 매우 강력한 옴니모달 실용 가치를 입증했습니다 (출처: alexandr_wang)

OpenAI, GPT-Image-2 투명 배경 네이티브 생성 기능 프리뷰 공개 : OpenAI가 GPT-Image-2 API에서 background=transparent 파라미터 프리뷰를 선보였습니다. 모델이 생성 단계에서 alpha 채널이 포함된 투명 PNG 레이어를 직접 출력할 수 있도록 지원하며, 유리 투명도나 가장자리 세사 등 복잡한 텍스처에서 기존의 후처리 배경 제거 방식보다 훨씬 뛰어난 효과를 보여줍니다 (출처: THE DECODER)
Adobe Firefly, Google Gemini Omni Flash 연동 및 AI 오디오 도구 출시 : Adobe가 자사의 Firefly 크리에이티브 플랫폼에 Google Gemini Omni Flash 멀티모달 비디오 모델을 연동한다고 발표했습니다. 이와 함께 상업적으로 안전한 AI 오디오 생성 도구인 Generate Music, Generate Speech, Generate Sound Effects 3종을 전면 출시했습니다 (출처: THE DECODER)
Google, 공간 인지 비전 언어 모델 TIPS 공개 : Google이 Hugging Face에 공간 인지 비전 언어 모델 TIPS(및 TIPSv2)를 오픈소스로 공개했습니다. 이 모델은 이미지 세그먼테이션, 깊이 추정 등 고밀도 비전 이해 작업을 위해 전용으로 설계되었습니다 (출처: gabriberton)

Runway, 16-bit HDR 비디오 향상 모델 Ruby 출시 : Runway가 비디오 모델 Ruby를 출시했습니다. SDR 비디오를 16-bit HDR ProRes/EXR 시퀀스로 변환하는 기능을 지원하여 생성된 비디오 및 업로드된 소스의 색상 깊이와 화질 표현을 대폭 향상시킵니다 (출처: c_valenzuelab)
NetEase HoneyBee, AI 인터랙티브 커뮤니티 및 차세대 UGC 공급 탐색 : NetEase HoneyBee가 오픈소스 및 자체 개발 모델 기반의 AI 역량을 젊은 층 중심의 관심사 커뮤니티에 깊이 융합시켰습니다. ‘Wannao Lobster’ 개인 비서와 AI 인터랙티브 게임/인터랙티브 그래픽 콘텐츠를 선보이며, 커뮤니티 콘텐츠 형태를 직접 플레이하고 2차 창작이 가능한 대화형 UGC로의 전환을 추진합니다 (출처: 36氪)

🧰 도구
MiniMax, 비디오 생성 및 제작 플랫폼 MiniMax Design 출시 : MiniMax가 상업용 비디오 제작을 위한 MiniMax Design 플랫폼을 선보였습니다. Agent를 핵심 엔트리 포인트로 삼아 대본, 콘티, 생성, 더빙, 편집을 단일 캔버스에 통합하고 재사용 가능한 Skill 메커니즘을 도입하여 Adobe 및 Canva의 상업용 비디오 파이프라인을 직접 겨냥했습니다 (출처: 36氪)

DP Technology, 데스크톱 AI 연구 협업 환경 ‘Bohr Science Space’ 출시 : DP Technology가 데스크톱 애플리케이션 ‘Bohr Science Space’를 출시했습니다. SciMaster, BioMaster, PharmMaster 등 분야별 AI 전문가를 내장하여 문헌 조사, 가설 추론, 데이터 계산 및 논문 작성의 전 과정을 연결함으로써 연구원들의 번거로운 연구 ‘육체 노동’을 대신 처리하도록 지원합니다 (출처: 量子位)

Lindy, 편지함 스마트 위탁 관리를 위한 Chrome 확장 프로그램 출시 : AI Agent 플랫폼 Lindy가 Gmail 수신함에 직접 삽입되는 Chrome 확장 프로그램을 출시했습니다. 개인 메모리 라이브러리를 활용하여 밤사이 수신된 이메일 요약을 자동 생성하고 답장을 작성하며 자동 태그 분류를 수행합니다 (출처: omarsar0)
ChatGPT / Codex, ExaAI 검색 플러グ인 연동 : OpenAI가 ChatGPT Work 및 Codex에 ExaAI 플러그인을 연동하여, AI Agent가 전 세계 1,000억 개 이상의 웹페이지, 학술 논문 및 기업 문서를 직접 검색할 수 있도록 했습니다 (출처: OpenAIDevs)
OpenHistory, Mac 네이티브 워크플로우 추적 앱 오픈소스 공개 : 개발자들이 OpenHistory 앱을 오픈소스로 공개했습니다. Mac 온디바이스 모델을 활용하여 작업 궤적을 자동으로 기록하고 요약을 생성하며, 안전한 MCP 프로토콜을 통해 로컬 Agent와 협업하는 기능을 지원합니다 (출처: zachtratar)
OpenBot, 크로스 Harness 기반 Grok Bot 대안 오픈소스 공개 : CopilotKit 팀이 OpenBot을 오픈소스로 공개했습니다. 어떤 Agent Harness와도 호환되는 Grok Bot 대안 제품을 제공하며 생성형 UI, 컴퓨터 제어, Agent-Human 협업 및 데이터 프라이빗 로컬 보관을 지원합니다 (출처: hwchase17)
📚 연구 및 학습
Pleias 연구진, 0.63M 파라미터의 초미니 검증기 (Verifier) 제안 : 연구진이 검증기 모델의 규모 하한선을 탐구했습니다. 단 1장의 H100에서 2분간의 사전 학습만 거친 63만 파라미터 규모의 초미니 모델이 특정 검증 작업에서 7B 대형 모델 수준의 성능을 달성했습니다 (출처: Dorialexander)

Spark-to-Paper, 엔드투엔드 오픈소스 논문 생성 시스템 : 연구진이 코딩 보조 도구 기반의 오픈소스 논문 생성 시스템 Spark-to-Paper를 공개했습니다. 조합 가능한 13개의 스킬을 포함하고 있어 연구 아이디어에서 출발하여 실험을 자동 실행하고, 벡터 그래픽을 그리며, 데이터를 교정하고, 컴파일 가능한 LaTeX 논문을 즉시 작성해 냅니다. 허위 결론 검출률은 92%에 달합니다 (출처: 机器之心)

Zhejiang University 및 Baidu, BEACON 장기 Agent 강화학습 프레임워크 제안 (ICML 2026) : Zhejiang University와 Baidu가 이정표 기반 정책 학습 프레임워크 BEACON을 제안했습니다. 이정표 경계에서 궤적을 분할하고 이중 스케일 이점 추정을 결합하여 장기 Agent 작업의 크레딧 오배분 문제를 해결했으며, ALFWorld 장기 작업 성공률을 GRPO의 53.5%에서 92.9%로 끌어올렸습니다 (출처: 机器之心)

AutoResearch 평가 보고书: Agent의 ‘메타인지 루프’ 부재로 연구 판단 오류 발생 : Stanford 및 Prentis AI 등 연구진이 800개의 Agent 연구 궤적을 진단한 결과, 실패의 92.1%가 엔지니어링 외적인 인지 및 논리적 오류에서 비롯되었으며, 궤적의 82.5%에서 ‘문제를 인지했음에도 수정하지 않는’ 메타인지 단절 현상이 나타났습니다. 이는 자동화된 연구가 단순 엔지니어링 실행을 넘어 깊이 있는 의사결정으로 진화하는 데 있어 핵심 병목이 존재함을 보여줍니다 (출처: 机器之心)

Patronus AI, FigmaTrace 디자인 Computer-use 데이터셋 오픈소스 공개 : Patronus AI가 UI/UX 디자인 분야 최초의 Computer-use 데이터셋 FigmaTrace를 오픈소스로 공개했습니다. 이 데이터셋에는 실제 디자이너가 Figma에서 수행한 200시간 이상, 3,400개 이상의 장기 복잡 작업 궤적이 수록되어 있습니다 (출처: rebeccatqian)
LangChain 창립자, Managed Deep Agents 시리즈 튜토리얼 발표 : Harrison Chase가 Managed Deep Agents 시리즈 비디오 및 튜토리얼을 발표했습니다. 프로덕션 환경에서 심층 Agent Harness 및 실행 환경을 구축, 배포, 관리하는 방법을 체계적으로 설명합니다 (출처: hwchase17)

Google, Pandora’s Router 지능형 모델 라우팅 이론 제안 : Google DeepMind 팀이 다중 모델 라우팅을 ‘판도라의 상자’ 탐색 문제로 정식화하여 평가 비용과 전문가 이득을 종합적으로 계산함으로써, 전체 탐색 품질을 유지하면서 고비용 추정기의 호출 횟수를 획기적으로 줄였습니다 (출처: dair_ai)

💼 비즈尼斯
GPT-5.6 Sol의 견인으로 OpenAI 3분기 기업용 지출 전분기 대비 82% 증가 : Ramp의 최신 데이터 및 분석에 따르면 GPT-5.6 Sol 모델의 강력한 성능에 힘입어 2026년 Q3 현재까지 OpenAI의 기업용 API 지출은 전분기 대비 82% 증가하며 Anthropic의 76%를 앞질렀고, 3분기 매출 35% 급증을 이끌었습니다 (출처: THE DECODER, GavinSBaker)

River AI, Cisco Investments 포함 1억 1,000만 달러 / 11억 달러 규모 투자 유치 : Cisco Investments가 탈중앙화 개인 AI 스타트업 River AI의 11억 달러 규모 투자 라운드에 전략적 투자를 발표하며, 사용자가 주도적으로 소유하는 AI 인프라 추진에 협력하기로 했습니다 (출처: ibab)
Hark, AT&T와 손잡고 AI 네이티브 소비자용 하드웨어 기기 출시 : AI 하드웨어 스타트업 Hark가 미국 통신 공룡 AT&T와 전략적 파트너십을 체결했습니다. AT&T는 Hark에 대한 투자와 함께 네트워크 및 기기 인증을 지원하며, 양사는 차세대 AI 네이티브 개인용 스마트 디바이스를 공동 출시할 예정입니다 (출처: adcock_brett)

🌟 커뮤니티
Pangram 분석: RLHF 사후 학습 가드레일이 ‘Mode Collapse’ 유발, AI 텍스트 탐지 더 용이해져 : AI 탐지 기관 Pangram은 미세 조정되지 않은 베이스 대형 모델이 원래 인간과 대등한 언어 다양성을 지니고 있었으나, RLHF와 안전 가드레일이 강제하는 행동 규칙으로 인해 모드 붕괴(Mode Collapse)가 발생했다고 지적했습니다. 이로 인해 모델이 고정된 표현 구문을 선호하게 되면서, 오히려 AI 생성 텍스트가 높은 정밀도로 감지되는 주요 특징이 되었습니다 (출처: THE DECODER)

💡 기타
JavaScript 런타임 Bun 1.4 정식 버전 출시 (Rust로 완벽 재작성) : Anthropic에 인수된 후 Bun이 Rust로 완전 재작성된 Bun 1.4 정식 버전을 공식 발표했습니다. 2,900개 이상의 Issue를 수정하고 메모리 누수를 해결했으며, 이미지 처리, 브라우저 자동화 및 HTTP/3 배포를 내장하여 월간 다운로드 수 2,000만 건을 돌파했습니다 (출처: 36氪)

RayNeo, 경량화된 RayNeo iO AI 글래스 출시 : RayNeo가 광학 구조와 프레임 형태를 재설계한 RayNeo iO AI 글래스를 출시했습니다. 무게를 34g으로 줄였으며 2일의 배터리 수명과 시력 교정 렌즈 장착을 지원합니다. 올데이 메모리 엔진과 DeepSeek V4 Pro / Qwen 3.7 Max 등 다중 모델 기반을 바탕으로 능동형 지식, 기억 및 실시간 번역 강화 기능을 제공합니다 (출처: 量子位)

미·중 AI 경쟁 심화 및 Pax Silica 동맹 구도 명확화 : 미국이 동맹국들에게 미·중 AI 경쟁에서 분명한 입장을 취할 것을 요구하는 문서를 작성했습니다. 중국 AI 협력 기구(WAICO)에 참여하는 국가는 Pax Silica 동맹에서 제외되며, 이는 글로벌 AI 인프라 및 공급망 분절화의 정치적 리스크를 부각시키고 있습니다 (출처: THE DECODER)