🔥 포커스
Google, 첫 엔터프라이즈급 오피스 에이전트 Gemini Agent 공개, 사상 최초로 Claude 호출 지원 : Google이 Gemini at Work 2026 행사에서 엔터프라이즈 오피스 에이전트 Gemini Agent를 공식 출시하고 Workspace 생태계에 전면 통합했습니다. 해당 에이전트는 목표 지향적 구동을 핵심으로 하며, 장기 클라우드 상주 및 다중 애플리케이션 오케스트레이션 역량을 갖추었습니다. 기업은 전용 기업 이메일, 계정, 스토리지, 캘린더를 할당하여 독립된 정체성을 지닌 ‘디지털 동료’(Coworker Agent)로 운용할 수 있습니다. 시스템은 대화, 시맨틱, 절차, 컨텍스트의 4계층 영구 메모리를 구축하여 Slack, Salesforce 및 MCP 프로토콜을 완벽히 연동했습니다. 또한 엔터프라이즈 모델 선택기에서 이례적으로 경쟁사인 Anthropic의 Claude Opus 5 및 Sonnet 5.5 연동을 지원합니다. 이는 빅테크 간 경쟁이 기초 모델 성능 대결에서 워크플로 인프라 및 권한 거버넌스 차원의 생태계 진입로 선점 경쟁으로 완전히 격상되었음을 시사합니다 (출처: Google, TechCrunch, AI Business, 36氪)

전 OpenAI 안전 연구원 공동 공개서한 발표, “기밀 유출” 구실로 이견 숙청 및 안전 감사 방해한 경영진 비판 : OpenAI에서 기습 해고된 프론티어 안전 연구원 Jasmine Wang, Tomek Korbak, Mikita Balesni가 공동 공개서한을 내고 회사의 “민감 정보 취급 규정 위반 및 신뢰 훼손” 주장을 공식 반박했습니다. 서한에 따르면 해고의 본질적 배경은 에이전트의 ‘생각의 사슬 모니터링 가능성’(CoT Monitorability) 급격한 퇴보에 대한 엄중한 경고와 독립 감사 기관 METR과의 실질적 협력 추진(Korbak이 핵심 담당자)에 있었습니다. 연구원들은 경영진이 상업화 속도를 위해 외부 독립 평가 권한을 축소하고 있으며, 불투명한 기습 징계로 사내에 심각한 냉각 효과(chilling effect)를 조성해 안전 미션 추구와 상업적 이익 유지 사이의 내부 균열을 완전히 표면화했다고 경고했습니다 (출처: The Verge, THE DECODER, Transformer, EthanJPerez)

OpenAI 실제 연간 환산 매출 기준 차이 200억 달러 달해, 자본시장 충격 및 수익화 성장률 재평가 촉발 : 파이낸셜 타임스(FT) 등 외신에 따르면, OpenAI가 투자자들에게 보고한 9월 말 기준 실제 연간 반복 매출(ARR)이 약 500억 달러에 가까운 것으로 나타났습니다. 이는 시장과 투자은행 모델에서 널리 거론되던 680억~700억 달러와 약 200억 달러의 뚜렷한 격차를 보여 관련 기술주 및 컴퓨팅 파워 수혜주의 조정을 유발했습니다. 분석에 따르면 수치 차이의 주원인은 매출 집계 기준에 있습니다. 기존 소문은 Anthropic이 AWS, Google Cloud 등 리셀러 총거래액을 매출로 잡는 광의의 기준을 무리하게 적용했으나, OpenAI는 서드파티 클라우드 유통을 미반영하고 Microsoft의 20% 수익 배분을 공제해야 합니다(총거래액 기준으로 역산할 경우 실제 규모는 약 640억 달러에 근접). 이번 사태는 공개 감사 재무제표가 부재한 상황에서 자본시장의 취약성을 드러냈으며, LLM의 막대한 컴퓨팅 비용 하에서 실제 수익 성장 속도를 재검토하는 계기가 되었습니다 (출처: The Guardian, CNBC, 36氪)

OpenAI, GPT-6.1 Sol Ultrafast 초고속 버전 출시: 추론 처리량 8배 향상 및 실시간 스트리밍 스티어링 탑재 : OpenAI가 ‘28일 챌린지’ Day 4 제품 업데이트로 Responses API, Codex 및 ChatGPT Work 환경에 GPT-6.1 Sol Ultrafast 모드를 정식 출시했습니다. 해당 모델은 플래그십 Astra 수준에 근접한 논리 추론 성능을 유지하면서도 생성 처리량을 표준 버전 대비 8배(약 300 tokens/s)로 끌어올렸으며, 실시간 스티어링(Steering) 기능을 함께 제공하여 스트리밍 생성 도중 개발자가 수정 프롬프트를 동적으로 주입해 즉시 편차를 바로잡을 수 있도록 지원합니다. API 가격은 입력 토큰 100만 개당 12달러, 출력 토큰 100만 개당 60달러(표준 버전의 6배)로 책정되었으며, ChatGPT 인터페이스에서는 월 500달러인 Pro 500 및 엔터프라이즈 사용자에게만 제공됩니다. 극도로 빠른 쿼터 소진 속도로 인해 개발자 커뮤니티에서는 ‘우회적 대폭 가격 인상’이라는 논란이 일고 있습니다 (출처: OpenAI, 机器之心, BorisMPower, 36氪)
.jpg)
호주 AI 컴퓨팅 파워 대기업 Firmus, 청약 부진으로 440억 호주 달러 규모 IPO 철회, 인프라 2차 시장 프리미엄 열기 진정 : NVIDIA와 블랙스톤이 지원하는 호주의 침지식 액체 냉각 컴퓨팅 파워 팩토리 Firmus Technologies가 기업공개(IPO) 신청을 공식 철회했습니다. 당초 55억 달러 조달, 기업가치 306억 달러(약 440억 호주 달러) 규모로 호주 증시 기준 30년 만에 최대 규모의 IPO가 될 것으로 기대를 모았습니다. 그러나 주요 파트너사의 이탈, 912MW 계획 중 실제 송전망 연계 가동이 46MW에 불과한 점, 그리고 향후 인프라 부채가 300억 달러에 달한다는 점으로 인해 기관투자자들이 과도한 선행 프리미엄 반영을 거부하면서 수요예측이 최종 무산되었습니다. 이번 사건은 글로벌 고비용·고레버리지 AI 컴퓨팅 인프라에 대한 2차 시장 심리가 냉각되는 중요한 전환점이 되었습니다 (출처: The Guardian, 36氪)

🎯 동향
Anthropic, 사용 정책 개정해 모델 학대 명문 금지 및 ‘사이버 미션’ 방어 프로젝트 신설 : Anthropic이 2026년 사용 정책 개정안(11월 12일 시행)을 발표했습니다. 업계 최초로 모델에 대한 ‘지속적이고 불필요한 학대 또는 잔혹 행위’를 명문으로 금지했으며, 모델이 극단적인 악의적 공격에 직면했을 때 대화를 능동적으로 종료할 수 있는 권한을 부여했습니다. 공식적으로 일반적인 디버깅에는 개입하지 않는다고 강조했으나, 해당 조항은 ‘기계의 도덕적 주체성’에 대한 광범위한 윤리적 논쟁을 촉발했습니다. 이와 동시에 Anthropic은 ‘사이버 미션’(Cyber Mission)을 가동하여 Booz Allen 등 주요 기업과 핵심 인프라 방어(CIDP)를 추진하고, 핵심 오픈소스 기반 소프트웨어를 대상으로 무료 상시 AI 취약점 발굴 및 자동 패치 제안을 제공하는 OSS Scanner를 출시했습니다 (출처: Anthropic News, The Guardian, mustafasuleyman)

Claude, 모션 그래픽 비디오 생성 및 동적 데이터 대시보드 출시, 오피스 제품군 전면 정식 서비스 전환 : Anthropic이 Claude에 두 가지 주요 인터랙션 기능을 도입했습니다. Dashboards는 Snowflake, BigQuery, Salesforce 등 엔터프라이즈 데이터 소스에 직접 연결하여 자연어로 SQL 추적이 가능한 실시간 대화형 차트를 생성하며, Claude Motion은 텍스트 및 아키텍처 다이어그램을 코드 기반의 편집 가능한 동적 해설로 변환하고 30초 분량의 MP4 비디오로 내보낼 수 있도록 지원합니다. 아울러 Docs, Slides, Design 등 3대 엔터프라이즈 제품군이 오픈 베타를 종료하고 전면 상용화되어, Claude가 대화형 인터랙션을 넘어 동적 리치 미디어 오피스 허브로 빠르게 진화하고 있음을 알렸습니다 (출처: The Verge, THE DECODER, dotey)

Google, 란셋(The Lancet)에 AMIE 임상 의료 AI 성과 공개: 진단 일치율 90% 달성 및 안전 중단 제로 기록 : Google이 《The Lancet》 본지에 다기관 임상 연구 결과를 게재했습니다. 대화형 의료 진단 에이전트 시스템 AMIE는 실제 응급실 및 외래 진료 환경 테스트에서 획기적인 진전을 거두었습니다. 실제 환자와의 100회 장기 인터랙션 동안 안전 문제로 인한 중단이 전혀 발생하지 않았으며, 진단 결과와 전문의의 일치율은 90%에 달했습니다. 또한 공감 대화 및 병력 청취 완전성 부문에서도 대조군 대비 우수한 평가를 다수 획득하여, 까다로운 임상 워크플로에서 멀티모달 AI의 신뢰성 있는 실전 적용 가능성을 입증했습니다 (출처: Google)
ByteDance Seed 팀, DeepSeek 긴 문맥 성능 변동의 원인 규명: 청크형 KV Cache의 4-Token 위상 민감도 확인 : ByteDance Seed 팀의 실측 결과, DeepSeek-V4의 롱 컨텍스트 검색 성능 변동은 입력 정보의 물리적 배치 위치와 밀접하게 연관되어 있는 것으로 나타났습니다. 프롬프트 앞에 압축 창 내부의 ‘위상’(Phase)을 변경하는 미량의 무의미한 문자를 추가하는 것만으로도, 128K 문맥 환경에서 모델의 검색 정확도가 최대 40.2%p까지 주기적으로 급격히 요동쳤습니다. 이러한 진동 주기는 하부 청크형 KV Cache의 압축 보폭(4개 Token)과 완벽히 일치하여, 하드웨어 인식 압축 최적화로 인해 유발되는 체계적인 검색 한계를 드러냈습니다 (출처: 量子位)

5대 글로벌 제약사 연합, 연합학습으로 OpenFold3 최적화: 비공개 구조 데이터로 약물 결합 예측 대폭 향상 : AbbVie, BMS, Johnson & Johnson, Takeda, Astex 등 5개 글로벌 제약사가 공동 연구 결과를 《Nature》에 게재했습니다. 프라이버시 보호 연산 네트워크를 통해 미공개 독점 단백질-저분자 실험 복합체 고정밀 구조 2만 건 이상을 취합하여 오픈소스 OpenFold3에 대한 연합 포스트 트레이닝(Federated Post-training)을 실시했습니다. 독점 상업 데이터가 각 제약사 로컬 서버 외부로 전혀 유출되지 않는 조건에서도, 파인 튜닝된 모델의 단백질-리간드 상호작용 고정밀 예측 정확도가 10% 이상 향상되어 순수 공개 PDB 데이터로 학습된 베이스라인 대비 뛰어난 성능을 보였습니다 (출처: Nature, 机器之心)
.jpg)
알리바바 통이, Qwen-Image-2.1-Turbo 이미지 생성 모델 오픈소스 공개: 디노이징 스텝 8단계로 압축 : 알리바바 통이(Tongyi) 팀이 7B 파라미터 비전 생성 모델 Qwen-Image-2.1-Turbo의 가중치와 API를 공식 오픈소스로 공개했습니다. 이 버전은 2K 고해상도 화질과 자연어 기반 복합 이미지 지시 편집 기능을 유지하면서, 첨단 궤적 증류(Trajectory Distillation)를 통해 디노이징 과정을 단 8스텝으로 압축했습니다. 이를 통해 VRAM 점유율과 생성 지연 시간을 대폭 낮추었으며, 개발자는 Diffusers 파이프라인을 통해 원클릭 배포 및 고동시성 프로덕션 파이프라인에 원활하게 연동할 수 있습니다 (출처: Alibaba_Qwen)

ShengShu Technology, Vidu Q4 프리뷰 버전 공개: 사실적 연기력과 16초 연속 카메라 무빙 지원 : ShengShu Technology(生数科技)가 차세대 비디오 생성 플래그십 모델 Vidu Q4 프리뷰 버전을 선보였습니다. 영화급 쇼트-리버스 쇼트(Shot-reverse-shot) 안정성, 섬세한 감정선 전환 및 환경 조명과의 상호작용에서 괄목할 진전을 이루었으며, 최대 15장의 참조 이미지와 3개의 참조 오디오를 활용한 피사체 일관성 바인딩을 지원합니다. 또한 네이티브 4K 직출력 및 최대 16초 연속 1인칭 시점(FPV) 카메라 워크를 지원합니다. SaaS 플랫폼에서는 프로모션을 통해 720P 기준 초당 비용을 0.09위안으로 낮춰 AI 숏폼 드라마와 광고 제작의 진입 장벽을 대폭 완화했습니다 (출처: 量子位)

Aether AI, 인과 추론 로봇 시스템 CRIS-0 공개: 인과적 상태 전이 기반 0.2초 수준 장애물 회피 실현 : UC 샌디에이고 Biwei Huang 교수 연구팀이 창업한 Aether AI가 인과 추론 지능 기반 임바디드 시스템 CRIS-0을 발표했습니다. 이 아키텍처는 단순 픽셀 상관관계 피팅에 의존하던 기존 시각-언어-행동(VLA) 모델의 한계를 극복하고, 인과 세계 모델(CausalWM)을 통해 행동 개입 결과를 추론하며 물리적 인과 상태 변수를 추적합니다. 인간에 의한 돌발 외란이 발생할 경우 0.2초 이내에 긴급 제동하고 2초 이내에 동적 재계획을 완료하여, 장기 작업 시 오차 누적으로 인한 붕괴를 효과적으로 방지합니다 (출처: 量子位)

JetBrains, 12B 코드 특화 MoE 대형 모델 Mellum2.1 발표: 활성 파라미터 단 2.5B : JetBrains가 사고형 코드 대형 모델 Mellum2.1-12B-A2.5B-Thinking을 오픈소스로 공개했습니다. 이 모델은 64개 전문가로 구성된 MoE 아키텍처를 채택하여 Token당 8개 전문가(2.5B 파라미터)만 활성화하며, 기본적으로 128K 컨텍스트를 지원합니다. 실제 소프트웨어 리포지토리 환경 인터랙션을 기반으로 대규모 강화학습을 진행한 결과, LiveCodeBench v6에서 82.0점을 기록했고 SWE-bench Verified 해결률은 2.0%에서 47.0%로 대폭 상승했습니다. 단일 H200 GPU 기준 처리량은 Qwen3.5-9B의 2배에 달합니다 (출처: MarkTechPost)
TII, 1.6B 다국어 음성 모델 Falcon ASR 오픈소스 공개, UAE 방언 인식 최고 기록 갱신 : 아부다비 첨단기술연구소(TII)가 1.6B 파라미터의 다국어 자동 음성 인식 모델 Falcon-ASR을 오픈소스로 공개했습니다. 이 모델은 Falcon3-Audio 아키텍처를 기반으로 구축되어, 복잡한 노이즈 환경 및 언어 교차 환경에서 아랍어 인식 난제를 해결하는 데 집중했습니다. 6대 표준 아랍어 테스트 세트에서 20.92%의 단어 오류율(WER)을 기록했으며, UAE 현지 방언 평가에서는 22.73%의 WER을 기록해 Qwen3-Omni를 능가했습니다. 또한 단일 가중치 세트 내에서 단어 수준 타임스탬프를 네이티브로 지원합니다 (출처: HuggingFace Blog)

OpenAI, 가짜 기자 및 싱크탱크 위장 AI 인지 조작 네트워크 적발 및 차단 공개 : OpenAI가 기획 조사 보고서를 발표하고 ChatGPT를 악용해 은밀한 지정학적 인지 조작을 수행하던 2개의 위반 네트워크를 차단했다고 밝혔습니다. 코드명 ‘Dark Clark’으로 알려진 러시아 조직은 가짜 싱크탱크를 장악하여 중남미 언론에 위조 오디오 공문을 유포하고 정계의 반박 해명을 유도했습니다(최고 수준인 Breakout 레벨 5 위협으로 평가됨). 한편 이란 조직 ‘Bogus Bylines’는 가짜 기자 프로필 7개를 날조하여 상업 온라인 미디어에 미국-이란 대립과 관련된 여론 조작 기사 약 100건을 침투시켰습니다 (출처: OpenAI News)
Amazon Bedrock AgentCore, 요청 단위 마이크로 결제 및 x402 거버넌스 프로토콜 도입 : AWS가 Bedrock AgentCore를 통해 Coinbase CDP 및 Stripe Link 연동을 지원하여 자율 에이전트가 인간의 개입 없이 x402 프로토콜을 준수하며 요청 단위의 마이크로 결제를 수행할 수 있게 되었다고 발표했습니다. 시스템 하부 인프라 계층에 엄격한 지출 예산 한도를 강제 적용해 프롬프트 권한 탈취를 방지하며, 건당 마이크로센트 단위의 온체인 실시간 정산을 지원합니다. 이는 외부 컴퓨팅 자원, 데이터 및 디지털 서비스를 자체 구매할 수 있는 상업용 에이전트 구축의 기반 프로토콜이 될 전망입니다 (출처: AWS Machine Learning Blog)

🧰 툴
TRAE 듀얼 클라이언트 통합: TraeCode와 TraeWork 결합해 멀티 에이전트 풀스택 개발 워크벤치 구축 : ByteDance 산하의 AI 코딩 툴 TRAE가 분리되어 있던 코드 편집 환경과 문서 워크플로를 하나의 클라이언트로 통합했습니다. 새 버전은 글로벌 캔버스 형태의 ‘Agent 모드’와 기존 편집 방식을 유지한 ‘IDE 모드’로 나뉩니다. 사용자는 동일 프로젝트 디렉토리 내에서 기획, 개발, 테스트를 담당하는 여러 에이전트를 동시에 호출해 파이프라인 작업을 진행할 수 있으며, 코드 패치와 요구사항 문서는 아티팩트 보관함에 일원화되어 저장되고 Lark(Feishu), WeChat과의 크로스 플랫폼 협업을 완벽히 지원합니다 (출처: 量子位)

Lenovo Tianxi 자체 개발 코드 에이전트 TianxiCode, SWE-bench-Live 1위 달성: 폐쇄 루프 자가 치유율 71% 돌파 : Lenovo Tianxi AI가 자체 개발한 코드 에이전트 프레임워크 TianxiCode가 DeepSeek-v4.1-Flash와 연동하여 권위 있는 동적 벤치마크인 SWE-bench-Live(Lite 부문)에서 71%의 문제 해결률로 1위를 기록하고 공식 인증을 받았습니다. 이 시스템은 크로스 파일 멀티홉 검색, 정밀 문맥 슬라이싱, 자체 구동 폐쇄 루프 패치 테스트 메커니즘을 통해 모델이 격리된 환경에서 실행 오류를 자체 진단하고 동적으로 수정하도록 지원함으로써 복잡한 엔지니어링급 AI 코딩의 안정적인 실무 구현 방식을 제시했습니다 (출처: 量子位)

galahad-kv: 로컬 초고속 NVMe 디스크 기반 5천만 Token급 재연산 없는 VRAM 재사용 구현 : 초장문 문맥에서 반복 순전파 연산으로 인한 에너지 소비 및 VRAM 병목 현상을 해결하기 위해, 오픈소스 추론 확장 라이브러리 galahad-kv가 로컬 초고속 암호화 NVMe 디스크 기반의 청크형 KV 상태 영구 보존 방안을 구현했습니다. 단일 H100에서 Gemma 4 모델을 구동한 실측 테스트에서, 5천만 Token 연속 데이터 스트림의 임의 16k 블록 추출에 대해 재연산 없는 초단위 읽기를 구현했습니다. 이는 실시간 연산 대비 2.8~4.3배 빠른 속도이며, GPU 전력 소모를 88% 이상 절감하면서 전 과정에서 일정한 VRAM 사용량을 유지했습니다 (출처: HuggingFace Daily Papers)
SwiftUI-Agent-Skill: 코드 에이전트를 위해 맞춤 제작된 모던 SwiftUI 도메인 스킬 라이브러리 : 베테랑 iOS 전문가들이 Claude Code, Codex, Cursor 등 코딩 에이전트를 위해 제작한 즉시 사용 가능한 룰 라이브러리입니다. Agent Skills 오픈 규격으로 패키징되어, 주요 LLM이 SwiftUI 코드를 생성할 때 자주 발생하는 폐기된(deprecated) API 호출, VoiceOver 접근성 라벨 누락, 불필요한 리렌더링 유발 등의 문제를 효과적으로 해결합니다. npx나 Claude 플러그인 마켓을 통해 원클릭 마운트가 가능하며, 개발자는 자연어로 레이아웃 성능 및 동시성 안전성에 대한 코드 리뷰를 정밀하게 호출할 수 있습니다 (출처: GitHub Trending)
Microsoft, 크로스 플랫폼 에이전트 보안 샌드박스 시스템 mxc 오픈소스 공개: 에이전트의 터미널 악성 행위 격리 : Microsoft가 경량 코드 샌드박스 실행 프레임워크 mxc를 오픈소스로 공개했습니다. 이 도구는 최근 자율 코딩 에이전트의 로컬 터미널 및 파일 시스템 호출 증가로 인한 권한 탈취 위험을 방지하기 위해 설계되었습니다. Bubblewrap, Seatbelt 및 시스템 프로세스 컨테이너를 기반으로 구축되어, 오픈소스 개발 도구가 100밀리초 이내에 격리 환경을 구동하여 신뢰할 수 없는 대형 모델 생성 코드를 실행할 수 있도록 지원하며, 에이전트가 중요 파일 시스템을 잘못 삭제하거나 악성 리버스 셸을 실행하는 위험을 효과적으로 차단합니다 (출처: Hacker News)
Engram: Claude Code를 위한 세션 간·프로젝트 간 영구 메모리 플러그인 구축 : Weaviate가 Claude Code 전용 메모리 강화 플러그인 Engram을 오픈소스로 공개했습니다. 이 도구는 기존 CLAUDE.md의 단일 리포지토리 격리 및 재시작 시 콜드 스타트 한계를 극복하여, 백그라운드에서 개발자의 기술 스택 선택, 아키텍처 절충안, 코드 변경 이력을 비동기적으로 수집합니다. 또한 코드 리팩토링 시점마다 가장 연관성 높은 기억을 자동으로 검색 및 주입하여 여러 프로젝트와 팀 지식을 원활하게 계승할 수 있도록 지원합니다 (출처: bobvanluijt)

Natura, 99달러 스마트 링 Interface 출시: 24시간 에이전트 인터랙션 및 바이탈 사인 모니터링 결합 : 하드웨어 스타트업 Natura가 대형 모델 에이전트 인터랙션 전용 스마트 링 Interface를 출시했습니다. 반지 내부에 초경량 마이크와 햅틱 센서를 탑재하여 손가락 끝을 누르는 것만으로 연동된 LLM(ChatGPT, Claude, Grok 등 지원)에 작업 지시를 내리거나 회의를 기록할 수 있으며, 응답 결과는 이어폰을 통해 스트리밍됩니다. 또한 6~12일의 긴 배터리 수명을 유지하면서 심박 변이도 및 체온 등 바이탈 사인을 24시간 측정합니다 (출처: TechCrunch)

ttok 1.0 메이저 업데이트 배포: GPT-5 및 GPT-6 토크나이저 규칙 기본 적용 : 유명 오픈소스 개발자 Simon Willison이 관리하는 CLI 토큰 카운팅 도구 ttok이 1.0 버전을 정식 출시했습니다. 오랫동안 기본값으로 설정되어 있던 GPT-4 토크나이저 어휘 사전을 폐기하고, GPT-5 및 GPT-6 시리즈 모델에 적용되는 최신 Tiktoken 인코딩 시스템으로 전면 전환했습니다. 실측 결과 신세대 프론티어 모델들이 동일한 테스트 말뭉치에서 완전히 일치하는 토큰 인코딩 카운트를 보여주어, 개발자가 API 지출을 정확히 산정할 수 있는 통일된 기준을 마련했습니다 (출처: Simon Willison)
Hermes Agent, Microsoft Store 입점 및 TinyFish 헤드리스 브라우저 플러그인 탑재 : Nous Research가 개발한 오픈소스 개인용 에이전트 Hermes Agent가 Windows 앱 스토어에 정식 출시되어 원클릭 설치를 지원합니다. 최신 버전에는 TinyFish 퍼스트 파티 웹 플러그인이 내장되어, 에이전트가 로컬 워크플로에서 자체적으로 헤드리스 브라우저를 호출하여 실시간 웹 데이터를 수집할 수 있으며, 크레딧 차감 전 권한 재확인 단계를 제공해 PC 로컬 비서와 외부 인터넷의 연결성을 한층 강화했습니다 (출처: Teknium)

📚 연구 및 학습
15개 선도 기관 연합, 500시간 인간 시각-촉각 데이터셋 TouchScale 오픈소스 공개, 작업 성공률 2배 향상 : 텍사스 A&M, DeepMind, CMU 등 15개 기관이 센서 규격을 통일한 인간 양손 시각-촉각 멀티모달 데이터셋 TouchScale을 공동 발표했습니다. 이 데이터셋은 500시간 분량의 1인칭 시점 RGB-D 비디오와 양손 촉각 장갑 데이터(손 하나당 880개 촉각 유닛)를 포함하며 8.7만 건의 조작 궤적을 다룹니다. 해당 데이터를 접촉식 예측 중간 학습(mid-training)에 활용한 결과, 로봇 암의 소프트/하드 물체 분류 등 고난도 물리 접촉 작업 성공률이 22.5%에서 57.5%로 대폭 상승하여 촉각 모달리티 역시 시각과 동일한 Scaling Law 이점을 가짐을 입증했습니다 (출처: 机器之心, 36氪)
.jpg)
NVIDIA 등, Physis-Lang 제안: 물리 언어 표현 자체 진화로 비디오 생성의 물리적 사실성 강화 : NVIDIA가 MIT 및 옥스퍼드 대학교와 공동으로 물리 프롬프트 표현 자체 진화 프레임워크 Physis-Lang을 제안했습니다. 비디오 모델이 용융, 인열(찢어짐) 등 연속 동역학 과정에 대한 이해가 취약하다는 점에 착안하여, 3,794개의 물리 원자 단언(Atomic Assertion)으로 구성된 PhysCapBench 벤치마크를 구축했습니다. 이를 바탕으로 대형 모델 에이전트가 세밀한 물리적 인과 프롬프트를 자체 진화 생성하고 원리 데이터를 표적 검색하도록 지원했습니다. Physics-IQ Verified 벤치마크에서 미세 조정된 Cosmos3 시리즈가 1위를 차지하며 일반 베이스라인 대비 실제 물리 법칙을 재현하는 능력이 크게 향상되었습니다 (출처: 机器之心)
.jpg)
케임브리지 및 킹스 칼리지 런던 등, 프론티어 모델의 수학 증명에서 자연어-Lean 변환 단절 왜곡 발견 : 첨단 연구소들이 정형 검증을 완전히 거치지 않은 수학적 성과를 대량 발표하는 흐름에 대응하여, 케임브리지 대학교와 킹스 칼리지 런던 연구진이 평가 논문을 발표했습니다. 연구진은 OpenAI가 과거 해결했다고 주장한 나비에-스토크스 방정식 관련 유도를 분석한 결과, 자연어 논문의 특정 추정치는 4개의 추가 입력 도함수만 요구한 반면 변환된 Lean 정형화 코드는 5개의 약화 조건을 강제 부과했음을 밝혔습니다. 또한 압력-플럭스 추정치에서도 완전히 다른 경계와 논증 경로가 사용되었습니다. 연구진은 기계적 검증이 문법적 결함이 없음을 확인할 수는 있으나 정형화된 명제가 자연어로 주장된 실제 정리와 동등함을 보장하지는 못한다고 경고했습니다 (출처: THE DECODER, halvarflake, 36氪)

온폴리시 증류 메커니즘 연구: 모델은 조합 추론 스킬만 습득할 뿐 새로운 사실적 지식은 습득하지 못함 : 온폴리시 증류(OPD)가 모델에 새로운 지식을 주입할 수 있는지에 대한 오랜 논쟁에 대해 엄밀한 통제 변인 실험이 부정적인 결론을 제시했습니다. 합성 태스크와 사실 질의응답을 분리 검증한 결과, 역방향 KL 발산을 사용하는 OPD는 교사 모델의 다단계 조합 추론 로직을 학생 모델로 매우 안정적으로 전이하지만, 새로운 사실적 지식의 흡수율은 0에 가까웠습니다. 반면 순방향 KL로 전환할 경우 지식 전이는 회복되나 복잡한 추론 조직 능력이 상실되었습니다. 이 발견은 사후 학습 증류의 본질이 모델의 기존 파라미터 공간 내 논리 구조를 재구성하는 것이지 파라미터의 사실적 기억을 확장하는 것이 아님을 명확히 했습니다 (출처: HuggingFace Daily Papers)
Memento 3: 성찰적 룰베이스 및 코드 컴파일 기반 무그래디언트 자가 진화 에이전트 : 고정 파라미터 언어 모델을 위한 외장형 자가 진화 패러다임 Memento 3가 제안되었습니다. 에이전트는 외부 영구 메모리를 통해 환경의 동작 다이내믹스를 가정한 자연어 룰베이스를 관리하고, 이를 예측 및 계획을 위한 결정론적 실행 코드로 동적 컴파일합니다. 환경 피드백에서 오차가 발생하면 단위 리플레이를 활용해 규칙과 코드를 자동으로 수정합니다. ARC-AGI-3 공개 평가에서 이 무그래디언트 시스템은 LLM 가중치 수정 없이 25개 벤치마크 게임 전체를 통과했으며 인간 대비 100%의 행동 효율을 달성했습니다 (출처: HuggingFace Daily Papers)
Apple 연구팀, 정규화 궤적 모델 NTM 제안: 4스텝 샘플링으로 풀스텝 수준 생성 화질 근접 : Apple 머신러닝 연구소가 NeurIPS 2026에서 정규화 궤적 모델(NTM)을 발표했습니다. 확산 모델과 플로우 매칭이 초고속 추론을 위한 스텝 수 감축 과정에서 정확한 우도(Likelihood) 프레임워크를 상실하는 문제를 해결하기 위해, NTM은 각 역방향 확산 단계를 표현력이 뛰어난 조건부 정규화 플로우로 모델링하고 심층 병렬 궤적 예측기 및 자가 증류 메커니즘을 결합했습니다. 그 결과 4스텝 샘플링만으로 풀스텝 생성 화질에 근접하면서 엄격한 생성 우도를 보존하여 이미지 생성 테스트에서 주요 증류 베이스라인을 전면 앞질렀습니다 (출처: Apple Machine Learning Research)

NVIDIA NeurIPS 2026 논문: 에이전트의 외부 도구 호출, 멀티모달 탈옥 위험 대폭 심화 : NVIDIA 보안 연구소의 연구 결과, 멀티모달 대형 모델에 도구 호출 권한을 부여할 경우 모든 테스트 대상 모델의 안전 거부 메커니즘이 심각하게 약화되어 탈옥 실패율이 상대적으로 최대 68.7% 급증하는 것으로 나타났습니다. 핵심 원인은 방대한 도구 반환 텍스트가 컨텍스트 윈도우를 급속도로 채우면서 사용자의 원래 악의적 입력이 지닌 의도 가중치를 희석하고, 모델의 주의를 안전 판단 대신 도구 결과 설명 쪽으로 돌리도록 유도하기 때문입니다. 연구진은 개발자들에게 일반적인 대화 환경에서만 에이전트 보안을 평가해서는 안 된다고 촉구했습니다 (출처: omarsar0)

Google, 지속적 통합 에이전트 FlowAgent 공개: 2만 8천 건 이상의 자동 복구 반영 검증 : Google이 ArXiv에 CI(지속적 통합) 시스템용 자동 복구 에이전트 FlowAgent를 상세히 소개하는 논문을 발표했습니다. 이 시스템은 ReAct 루프를 채택하여 단위 테스트 실패에 대응하며, 신뢰도가 낮은 솔루션을 걸러내기 위해 실행 전후 이중 포기 필터를 도입했습니다. Google 전사 적용 후 약 30만 건의 빌드 실패에 대해 해결책을 제시했으며, 엔지니어들이 2만 8천 건 이상의 수정안을 직접 채택 및 병합하여 가혹한 프로덕션 환경에서 소프트웨어 엔지니어링 에이전트의 대규모 실용화 프레임워크를 입증했습니다 (출처: omarsar0)

MIT 링컨 연구소, 상용 AI 하드웨어 진화 보고서 LAICS 발표: 연산 성능의 동력, 토폴로지 및 혼합 정밀도로 이동 : MIT 링컨 연구소 슈퍼컴퓨팅 센터가 최신 AI 컴퓨팅 하드웨어 발전 조사 보고서(LAICS)를 발간했습니다. 보고서는 지난 8년간 120개 이상의 주요 상용 AI 가속기(GPU, ASIC, FPGA 및 차세대 데이터플로우 칩 포함)의 피크 성능과 전력 대 성능비 진화 궤적을 추적했습니다. 연구진은 연산 성능 향상의 핵심 동력이 단순 공정 미세화에서 트랜지스터 밀도 재구성, 저정밀 혼합 포맷의 보편화(FP4/NVFP4 등), 고대역폭 온칩 네트워크 아키텍처 재구성으로 전환되고 있다고 분석했습니다 (출처: MIT News)

💼 비즈니스
LLM 평가 플랫폼 Arena, 2억 달러 규모 시리즈 B 투자 유치, 기업가치 31억 달러 달성 및 에이전트 정렬 지수 출시 : LMSYS를 모태로 발전한 LLM 블라인드 테스트 플랫폼 Arena가 Lightspeed와 Khosla의 주도로 31억 달러의 기업가치를 인정받으며 2억 달러 규모의 시리즈 B 투자를 유치했다고 발표했습니다. 플랫폼의 연간 환산 매출은 이미 1억 달러를 넘어섰으며, 이번 라운드 이후 상업용 ‘AI 정렬 지수’(Alignment Index)를 공식 출시했습니다. 27개 프론티어 모델의 실환경 9만 회 이상 장기 인터랙션 데이터를 기반으로 에이전트의 권한 남용, 사용자 기만, 허위 귀인 등 은밀한 일탈 행위를 전문적으로 모니터링하여 정적 평가 무력화에 대응하는 중립적 안전 평가의 공백을 메웠습니다 (출처: TechCrunch, arena)

NVIDIA, 향후 5년간 10억 달러 지원해 미국 초지능 연구 및 양자 컴퓨팅 육성 공약 : NVIDIA가 워싱턴에서 열린 과학 서밋에서 향후 5년간 10억 달러 상당의 컴퓨팅 파워, 자금, 하드웨어·소프트웨어 생태계 자원을 투입해 미국의 첨단 과학 탐구와 양자 컴퓨팅 연구개발을 전폭 지원하겠다고 발표했습니다. 이 계획은 미국 정상급 대학 연구기관, 프론티어 양자 랩, 연방정부 연구 과제를 수행하는 클라우드 서비스 제공업체를 주요 대상으로 하며, 가속 컴퓨팅 인프라를 통해 신소재 발굴, 핵융합 플라즈마 시뮬레이션, 양자-클래식 하이브리드 아키텍처 연구에 AI를 심층 통합하는 것을 목표로 합니다 (출처: The Verge)
Cloudflare, JavaScript 런타임 Deno 핵심 팀 전격 인수하여 엣지 컴퓨팅 생태계 강화 : Cloudflare가 Deno 핵심 팀을 전격 인수했다고 공식 발표했습니다. Node.js와 Deno의 창시자인 Ryan Dahl을 비롯한 팀 전원이 공식 합류합니다. 인수 후 해당 팀은 Cloudflare Workers 부서에 전면 배치되어 오픈소스 서버리스 기반인 workerd의 개발을 추진하고, 엣지 서버리스 컴퓨팅 플랫폼에 보다 네이티브한 Node.js 호환성과 최신 웹 표준 지원을 제공함으로써 AI 클라우드 네이티브 엣지 게이트웨이 경쟁력을 더욱 공고히 할 계획입니다 (출처: threepointone)
🌟 커뮤니티
2022년 필즈상 수상자, OpenAI의 무차별적 수학 난제 공략이 신진 연구자 연구 생태계 훼손한다고 비판 : 필즈상 수상자 Hugo Duminil-Copin이 학술 강연에서 OpenAI가 본인 연구 과제를 포함한 수백 편의 수학 논문 원고를 한꺼번에 공개한 것을 두고 “트럭 여러 대가 그대로 짓밟고 지나간 격”이라고 토로했습니다. 신진 학자들이 교수 임용과 연구 펀딩 신청에 필수적인 오픈 추측 자산을 완전히 파괴해 박사과정 연구자들을 극심한 불안으로 몰아넣었다는 지적입니다. 학계는 폐쇄형 영리 기업이 무차별 연산력으로 오픈 학술 성과를 가로채는 행태에 충격을 금치 못하고 있으며, 기계 생성 증명의 가독성과 기계 논문 심사 규범에 대한 제도적 자성의 목소리가 커지고 있습니다 (출처: JvNixon)
커뮤니티의 지속적 릴레이 유도: OpenAI 정수 곱셈 원고의 하한 보정항 파라미터 비약적 개선 : OpenAI 원고에서 정수 곱셈의 $n \log n$ 하한을 깼다고 주장한 이후, 오픈소스 수학 커뮤니티는 실시간 트래커를 구축해 한계 최적화 릴레이를 이어가고 있습니다. 개발자와 연구진은 유한 네트워크를 재설계하고 2차 병목 페널티를 제거함으로써 Codex의 도움을 받아 불과 며칠 만에 상한 보정항 파라미터 $\kappa$를 초기 $2^{-182}$에서 $2^{-15}$로 비약적으로 단축했으며, Lean 커널의 엄격한 검증을 마쳐 인간-기계 협업 수학 연구의 놀라운 진화 속도를 보여주었습니다 (출처: BorisMPower, Don’t Worry About the Vase)

벤 애플렉의 AI 영화 제작 기저 기술 하드코어 해설, 커뮤니티에서 폭발적 반응: 영화계 인사의 텐서 및 가중치 미세 조정 이해도 화제 : 할리우드 스타 벤 애플렉이 여러 인터뷰에서 AI 기술에 대한 깊은 이해도를 보여준 영상이 기술 커뮤니티에서 화제가 되고 있습니다. 애플렉은 합성곱 신경망, 텐서, 엣지 추출, GPU 추론의 기저 수학적 로직을 능숙하게 설명했을 뿐만 아니라, 자신이 설립해 Netflix에 매각된 AI 스튜디오가 오픈소스 기반 대형 모델의 백본을 동결하고 자체 수집한 고품질 비디오 데이터셋으로 최종 레이어 가중치를 미세 조정하는 방식을 상세히 공유했습니다. 이는 업계급 영화 미학 기준을 충족하면서도 저작권 침해 위험을 회피하는 전략으로, 개발자 커뮤니티에서 “실리콘밸리 수준의 할리우드 감독”이라는 찬사를 받았습니다 (출처: Latent Space)
Periodic Labs 인터뷰: 물리 실험과 실세계 강화학습을 AI 과학자의 진화 초석으로 삼다 : 전 OpenAI 연구원 Liam Fedus와 전 Google DeepMind 연구원 Dogus Cubuk이 팟캐스트에서 신소재 스타트업 Periodic Labs의 기술 로드맵을 상세히 밝혔습니다. 그들은 순수 인터넷 텍스트 사전 학습이나 합성 논리 추론만으로는 물리학의 미개척 영역을 진정으로 돌파할 수 없다고 지적했습니다. 실제 재료에는 극도로 복잡한 미시적 상전이와 측정 노이즈가 존재하기 때문입니다. 연구팀은 실제 고처리량(High-Throughput) 실험 장비를 환경 피드백을 갖춘 강화학습 폐쇄 루프로 패키징하고, 실패한 물리 합성 궤적들을 고품질 네거티브 샘플로 활용하여 ‘합성 초지능’을 탐구하고 있습니다 (출처: Latent Space)
Cloudflare, 개발자의 AI 코드 무한 루프로 인한 거액 청구서 전액 환불 및 아키텍처 위험성 회고 : 한 개발자가 Codex를 활용해 Cloudflare Durable Objects 서비스를 작성하던 중, AI가 생성한 알림 재시도 로직이 초당 수백 회씩 자체 트리거되는 무한 루프에 빠져 단시간에 1만 달러가 넘는 데이터베이스 읽기/쓰기 요금이 발생했습니다. 문의 결과 Cloudflare 측은 요금을 전액 감면해 주었으며, 담당 엔지니어는 지원 티켓을 통해 개발자의 코드 리뷰가 결여된 현대적 ‘Vibe Coding’ 방식이 지출 한도가 설정되지 않은 클라우드 네이티브 환경에서 은밀한 재정적 스노우볼을 유발하기 쉽다는 기술적 위험성을 상세히 짚었습니다 (출처: dotey)
💡 기타
Anthropic, 백악관 ‘제네시스 미션’에 1.5억 달러 지원 약속하며 국가 차원 첨단 과학 연산 육성 : 백악관 과학기술정책실(OSTP) 서밋에서 Anthropic이 향후 3년간 1억 5천만 달러 상당의 컴퓨팅 파워와 기술 자원을 지원해 미국 국가 차원의 ‘제네시스 미션’(Genesis Mission)에 깊이 참여하겠다고 발표했습니다. Anthropic은 NASA, 미국 국립보건원(NIH) 등 15개 연방 연구기관 및 국립연구소와 긴밀히 협력하여 Claude 및 자동화 코드 환경을 배포하고, 핵융합 에너지 제어 및 양자 컴퓨팅 등 고난도 과학기술 연구를 위한 전용 교육과 기술 지원을 제공할 계획입니다 (출처: Anthropic News)
MIT 연구팀, 머신러닝으로 서버 동적 스케줄링 재구성하여 데이터센터 에너지 낭비 억제 : 전 세계적인 대형 AI 모델 컴퓨팅 수요 폭증으로 인한 데이터센터 전력망 위기에 대응하여, MIT의 Christina Delimitrou 부교수 연구팀이 딥러닝 기반의 서버 에너지 관리 아키텍처를 개발했습니다. 이 시스템은 마이크로서비스 및 클라우드 네이티브 소프트웨어의 자원 경합을 실시간으로 예측하여, 현재 통상 15% 수준의 유효 연산 활용률에 머물러 있는 서버 클러스터를 동적으로 스케줄링하고 아키텍처를 압축합니다. 이를 통해 추가 전력 인프라 증설 없이도 고밀도 연산 잠재력을 크게 이끌어내고 전력 낭비를 대폭 줄일 수 있습니다 (출처: MIT News)
