🔥 포커스
OpenAI, 미공개 모델 수학 논문 초고 722편 집중 공개… 준 리만 가설 등 세기의 난제 경계 허물어 : OpenAI가 공식 GitHub 오픈소스 저장소 openai/math에 미공개 내부 프런티어 모델로 생성한 372개 결과군, 총 722편의 수학 논문 초고를 전격 공개했습니다. 핵심 성과로는 준 리만 가설(모든 디리클레 L-함수가 실수부 7/8 초과 영역에서 영점을 갖지 않으며 지겔 영점을 제거했다고 주장), 아벨 다양체 호지 추측 증명, 4차원 카케야 추측, 유리수체 위의 힐베르트 10번 문제, 고유 게임 추측에서 벗어난 Basic-SDP의 일반 NP-난해 임계값 확립 등이 포함되며, 그중 약 160편에는 Lean 형식화 증명이 첨부되어 있습니다. OpenAI는 단일 성과당 평균 약 3시간의 ChatGPT Pro 추론 연산 자원이 소요되었다고 밝혔습니다. 기계의 자율적 과학 발견을 보여주는 이정표로 평가받는 한편, 필즈상 수상자 3인이 포함된 프린스턴 고등연구소 자문 패널은 성명을 내고 공개가 곧 학계의 인정을 의미하는 것은 아니라고 강조하며, 기계가 대량 생성하는 증명이 인간 학자들의 검토 및 검증 체계에 심각한 충격을 주고 있다고 경고했습니다 (출처: 机器之心, The Verge, Latent Space, Abhishek Saha, openai)

미 에너지부 및 NIH, DeepMind 등 빅테크와 손잡고 ‘가상 생물학 이니셔티브’ 출범 : 미국 에너지부(DOE)와 미국 국립보건원(NIH)은 Google DeepMind, Meta, Isomorphic Labs, NVIDIA 등과 국가 차원의 전략적 협력을 체결하고 ‘가상 생물학 이니셔티브(Virtual Biology Initiative)’를 출범한다고 발표했습니다. 해당 프로젝트는 전 스케일 세포 생물학 지도를 체계적으로 구축하고 표준화된 벤치마크 데이터를 생성하며, 멀티모달 AI를 결합해 세포의 생명 활동을 엔드투엔드로 예측할 수 있는 세계 최초의 범용 디지털 모델을 구축하여 제1원리로부터 신약 개발과 질병 메커니즘 규명을 재정의하는 것을 목표로 합니다 (출처: Alex Rives)
Google DeepMind, 온디바이스 옴니모달 임베딩 모델 EmbeddingGemma 2 오픈소스 공개 : Google DeepMind가 Gemma 4 아키텍처 기반의 첫 멀티모달 임베딩 모델인 EmbeddingGemma 2를 Apache 2.0 라이선스로 공식 오픈소스 공개했습니다. 모델 파라미터 수는 740M으로, 텍스트, 코드, 이미지, 오디오, 비디오의 벡터 표현 공간을 네이티브하게 통합하며 8K 컨텍스트를 지원합니다. 모듈형 설계를 통해 텍스트 단일 모달의 경우 270M 파라미터로 구동 가능하며, 양자화 시 모바일 기기에서 약 191MB의 메모리만 차지합니다. 또한 Matryoshka 표현 학습을 통해 차원을 768차원 이하로 동적 트렁케이션할 수 있으며, Qdrant 실측 결과 1-bit 양자화와 결합 시 VRAM 점유율을 77배 절감하면서도 94.5%의 검색 정확도를 유지하여 경량 온디바이스 옴니모달 RAG 및 오프라인 시맨틱 검색 인프라의 공백을 메웠습니다 (출처: Google DeepMind Blog, THE DECODER, GoogleDeepMind)

OpenAI, ‘28일 챌린지’ Day 2 업데이트 발표: Auto-review 전면 무료화 및 Decisions API 공개 테스트 : ‘28일 매일 실용적 개선 제공’ 챌린지의 둘째 날, OpenAI는 Agent 도입 과정의 마찰을 줄이기 위한 핵심 업데이트를 집중 공개했습니다. 장기 작업 자동 리스크 통제 및 감사 기능인 Auto-review가 전체 ChatGPT 로그인 사용자에게 무료로 개방되며 할당량에 차감되지 않습니다. API 요금제 티어는 기존 5단계에서 Build, Launch, Grow의 3단계로 간소화되었고 최고 티어 기준은 500달러로 인하되었습니다. 이산 라우팅 및 툴 디스패치를 위한 Decisions API가 공식 퍼블릭 베타를 시작했으며, 이 인터페이스는 GPT-6 Luna 기반으로 서버 사이드 응답 속도가 100ms 미만이고 입력 토큰 100만 개당 0.10달러에 불과하며 출력 및 캐시 비용은 면제됩니다. 또한 macOS 클라이언트에는 Meetings 회의 워크스페이스 플러그인이 동시 그레이스케일 배포되었습니다 (출처: 机器之心, OpenAI Developers, )

Meta 및 Sierra, 주요 빅테크와 함께 개인 에이전트 프로토콜 PAP 발표… 사람-기업 Agent 인터랙션 규격 정립 : 소비자용 AI Agent가 상업 웹사이트의 봇 방지 기능에 차단되는 문제를 해결하기 위해, Meta와 AI 고객 서비스 플랫폼 Sierra는 Stripe, Shopify, Walmart 등 여러 기업과 연합하여 오픈 산업 표준인 ‘개인 에이전트 프로토콜(Personal Agent Protocol, PAP)’을 공동 발족했습니다. 해당 프로토콜은 A2A 및 OAuth 아키텍처를 기반으로 하며, 개인 AI 어시스턴트가 사용자를 대신해 전자상거래 주문, 티켓 조회, 양식 작성을 수행할 때 기업 시스템과 통신하는 인증 및 리스크 제어 경계를 명확히 규정합니다. Decagon 또한 에이전트의 크로스 바운더리 호출 신뢰 마찰을 완화하기 위해 부속 PACT 신뢰 프로토콜을 오픈소스로 동시 공개했습니다 (출처: The Verge, TechCrunch, saranormous)

🎯 동향
Google DeepMind, 이미지 생성 및 편집 모델 Nano Banana 2.1 출시 : Google이 Gemini 3.6 Flash 기반의 생성형 이미지 모델 Nano Banana 2.1(API 식별자: gemini-nano-banana-2.1)을 출시하고 Gemini API, AI Studio, Google Ads에 동시 공개했습니다. 새 모델은 복잡한 타이포그래피 디자인, 정밀한 마스크 기반 인페인팅, 최대 14장의 참조 이미지를 통한 캐릭터 일관성 통합을 네이티브로 지원하며, 최대 4K 해상도 렌더링을 지원합니다. 단일 이미지 생성 비용은 0.034달러(약 50% 인하)로 낮아졌으며, 상업적 비주얼 디자인에서 다회차 턴 간 일관성을 유지하는 난제를 집중 해결했습니다 (출처: 机器之心, GoogleAIStudio, THE DECODER)

Claude, 확률론 난제 해결… 연속 스며들기 상전이 추측 Lean 형식화 증명 : Anthropic의 미공개 내부 프런티어 Claude 모델이 수학계에서 약 70년간 미해결 상태였던 연속 상전이 추측(임계 확률 $p_c$에서 무한 연결 확률이 0이라는 가설)을 해결하는 데 성공했습니다. 해당 모델은 학계가 2024년에 구축한 부등식 프레임워크를 기반으로 Lean 증명 보조기를 통해 수천 줄에 달하는 형식화 추론을 완료하여, 3차원에서 10차원에 이르는 핵심 물리 차원의 장기적 정체를 깼습니다. AI가 필즈상 수준의 추측을 형식화 증명해낸 성과는 학계에 깊은 충격을 안겨주고 있습니다 (출처: 36氪)

Anthropic, 사이버 보안 검증 프로그램 확장 및 3단계 접근 권한 체계 구축 : Anthropic이 사이버 보안 검증 프로그램(CVP)을 3단계 상시 접근 아키텍처(방어 티어, 레드팀 티어, 전용 티어)로 개편하고, 검증된 기관과 화이트해커 전문가에게 안전 필터가 완화된 Claude Opus 5.5, Sonnet 5.5 및 Mythos 5.1에 대한 접근을 개방한다고 발표했습니다. 새로운 체계는 모의 침투 테스트와 레드/블루팀 공방 훈련을 위한 인가된 공격적 호출 기능을 최초로 규정에 맞추어 지원하며, “방어자가 취약점을 패치하기 위해 강력한 툴이 필요함에도 일반 안전 정책에 가로막혀 거부당하는” 모순을 해소하는 것을 목표로 합니다 (출처: Anthropic News, AnthropicAI, THE DECODER)
DeepMind, 전장 유전체 변이 영향 해독하는 AlphaGenome Atlas 출시 : Google DeepMind가 유전체 딥러닝 모델 AlphaGenome과 사전 계산 데이터베이스 AlphaGenome Atlas를 공개했습니다. 모델은 단일 염기쌍 해상도와 100만 염기쌍의 긴 컨텍스트를 지원하며, Atlas 맵은 인간 유전체의 전체 90억 개 단일 염기 다형성 가능 변이에 대한 분자 표현형 영향을 사전 계산했습니다. 이는 AlphaFold 데이터베이스의 30배에 달하는 데이터 규모로, 희귀 돌연변이 및 복합 질환의 감수성 메커니즘을 체계적으로 규명하는 것을 목표로 합니다 (출처: )
vLLM v0.31.0, CRIU 스냅샷 메커니즘 도입으로 콜드 스타트를 밀리초 단위 프로세스 복구로 전환 : vLLM이 v0.31.0 버전을 출시하며 상주 데몬인 vllm snapshot과 vllm preload를 도입했습니다. 해당 메커니즘은 Linux CRIU 기술을 기반으로 추론 엔진 런타임의 빠른 체크포인트 저장과 이미지 복원을 구현하여, 인스턴스 핫스왑이나 스케일아웃 시 오랜 시간이 걸리던 모델 가중치 로드 및 초기화 과정을 건너뜀으로써 대규모 추론 클러스터 탄력 스케줄링 시 콜드 스타트 지연 시간을 획기적으로 낮췄습니다 (출처: vLLM)
하얼빈공대 및 싱가포르국립대, 비디오 월드 모델용 2-bit KV Cache 압축 솔루션 QuantWM 오픈소스 공개 : 오토리그레시브 비디오 월드 모델이 VRAM을 과도하게 소모하고 기존 양자화 방식이 심각한 화면 깜빡임 현상을 유발하는 문제를 해결하기 위해, 하얼빈공대 심천 캠퍼스와 NUS 연구팀이 학습 불필요 양자화 솔루션인 QuantWM을 제안했습니다. 연구진은 양자화된 Key로 인한 시공간 어텐션 오정렬이 시간적 떨림의 근본 원인임을 밝혀냈으며, 민감도 인식 클러스터링과 주 부분공간 오차 보상을 통해 생성 비디오의 시계열 안정성을 유지하면서도 KV Cache VRAM을 최대 6.2배 압축하는 데 성공했습니다 (출처: 机器之心)
.jpg)
Perplexity, 업그레이드된 오픈소스 의사결정 모델 pplx-decider-v1.1-27b 출시 : Perplexity가 업그레이드된 멀티모달 의사결정 모델 pplx-decider-v1.1-27b를 오픈소스로 공개했습니다. 이 가중치는 최신 Hugging Face Decision Index 0.3 벤치마크에서 1위를 차지했으며, 시각 및 논리적 의사결정 정확도를 유지하면서 추론 효율성을 대폭 개선했습니다. 연계된 Decision API 서비스 단가 역시 입력 토큰 100만 개당 0.02달러로 인하되었습니다 (출처: AravSrinivas)

Meta, 프로덕션 레벨 할당 의사결정 솔버 Rebalancer 오픈소스 공개 : Meta가 사내에서 9년 이상 운영되며 하루 평균 약 4,000만 건의 리소스 스케줄링을 처리해 온 C++ 코어 솔버 Rebalancer를 공식 오픈소스(Python 인터페이스 제공, Apache 2.0 라이선스)로 공개했습니다. 본 도구는 샤딩 스케줄링, 트래픽 밸런싱 등 NP-hard 문제를 통합 유향 비순환 그래프로 추상화하여, 수백만 단위의 대규모 엔티티에 대해 효율적인 로컬 탐색과 혼합 정수 계획법 풀이를 제공합니다 (출처: MarkTechPost)
TII, 아랍에미리트 방언 거대언어모델 Falcon-Emirati-7B 발표 : 아랍에미리트 기술혁신연구소(TII)가 UAE 방언에 특화된 모델 Falcon-Emirati-7B를 출시했습니다. 연구팀은 구어체 웹 데이터, 현지 문화적 배경 및 통제된 합성 코퍼스로 구성된 데이터 파이프라인을 구축했으며, 현지 평가 벤치마크인 Alyah에서 84.83%의 객관식 정확도를 기록하고 자유 대화에서 문화적 은유 이해도와 에티켓 부합도를 대폭 향상시켰습니다 (출처: HuggingFace Blog)

Figma 제품 디자인 AI Agent 전면 GA 상용화 돌입 : Figma가 UI/UX 제품 디자인을 위한 내장 AI Agent를 모든 사용자에게 정식 출시(GA)한다고 발표했습니다. 새 버전에는 팀 디자인 시스템 가이드라인 바인딩 메커니즘과 멀티플레이어 협업 모드에서의 크로스 팀 Agent 액션 시각화 기능이 추가되어, 에이전트가 컴포넌트 라이브러리를 기반으로 고충실도 인터페이스와 다중 상태 인터랙티브 프로토타입을 직접 자동 구축할 수 있습니다 (출처: The Verge)

Cohere, 70여 개 소수 언어 지원하는 다국어 소형 모델 패밀리 Tiny Aya 오픈소스 공개 : Cohere Labs가 COLM 2026 컨퍼런스에서 경량 다국어 모델 패밀리 Tiny Aya를 오픈소스 공개했습니다. 해당 시리즈는 범용 다국어 베이스와 지역 특화 변형을 결합하여 전 세계 70여 개 언어(다수의 저자원 소수 언어 포함)를 지원하며, 온디바이스 다국어 배포 장벽을 낮추고 소형 모델의 교차 문화 의미 생성을 개선하는 것을 목표로 합니다 (출처: sarahookr)

NeurIPS 2026 | SAGE 프레임워크, 위상 구조 신호 활용해 거대언어모델 장기 추론 오차 보정 : 버지니아 공대 연구팀 등은 LLM 장기 체인 추론에서 발생하는 “중간 단계에서 경로를 이탈했음에도 최종 리워드 지연으로 인해 오류를 수정하지 못하는” 고질적 문제를 해결하기 위해, 구조적 수용성 유도 탐색 기법인 SAGE를 제안했습니다. 이 방식은 대수적 희소화를 통해 탐색 편향을 압축하고 쌍곡 공간 거리를 활용해 스텝별 피드백을 제공함으로써, 여러 기호 및 형식 수학 벤치마크에서 정확도를 크게 끌어올렸으며 Lean 검증 통과율을 수배 향상시켰습니다 (출처: 机器之心)
.jpg)
Google, 실험적 노코드 게임 생성 플랫폼 Playground 출시 : Google이 AI 게임 실험 플랫폼 playground.google을 공개했습니다. 사용자는 자연어 대화만으로 브라우저 내에서 커스텀 물리 규칙, 캐릭터 상호작용 및 씬 스타일이 포함된 경량 게임을 제작할 수 있으며, 멀티 디바이스 플레이 및 커뮤니티 공유를 지원합니다. 향후 더 전문적인 3D 엔진 지원을 위해 Unity Spark와의 연동도 계획하고 있습니다 (출처: Google AI Blog)
Replit, 프로젝트 간 글로벌 컨텍스트 및 백그라운드 비동기 코드 Agent 출시 : Replit이 개발 환경의 대대적인 업그레이드를 단행하며 프로젝트 간 워크스페이스 글로벌 컨텍스트를 공식 도입했습니다. 에이전트는 사용자 계정 내 모든 이전 프로젝트와 디자인 시스템을 색인화하여, 참조 프로젝트에서 색상과 컴포넌트 로직을 추출해 새 프로젝트로 마이그레이션할 수 있으며, 백그라운드 비동기 생성 편집 작업 및 원클릭 검토·머지를 지원합니다 (출처: amasad)
🧰 툴
Hark Pro: 독립 샌드박스 브라우저를 탑재한 온디바이스 프라이버시 개인 에이전트 : Figure AI 창립자 Brett Adcock 팀이 데스크톱 및 모바일 애플리케이션 Hark Pro를 출시했습니다. 시스템에는 Handoff 컴퓨터 유즈 에이전트와 전직 Apple 팀이 제작한 인터페이스가 탑재되어 격리된 샌드박스 내에서 사용자 자격 증명을 안전하게 호출하고 자율적으로 웹서핑을 하며 비자 발급, 티켓 예매, 크로스 시스템 양식 작성 등을 수행합니다. 모든 작업 궤적이 사용자에게 투명하게 공개되어 자율 대행과 온디바이스 프라이버시 보안 사이의 균형을 유지합니다 (출처: TechCrunch, TheRundownAI)
Monid.ai, 770만 달러 투자 유치… Agent용 동적 도구 결제 게이트웨이 구축 : 에이전트 개발 서비스 제공업체 Monid.ai가 ‘Agent를 위한 OpenRouter’로 불리는 집계 API 게이트웨이를 선보이며 770만 달러 규모의 투자를 유치했습니다. 개발자는 단일 인터페이스만으로 마케팅, SEO, 검색, 전자상거래, 멀티모달 생성 등 2,500개의 상용 API를 런타임에 동적으로 탐색하고 호출 건당 과금으로 결제할 수 있어, 기존의 월간 기업형 SaaS 구독 번들을 대체할 수 있습니다 (출처: yoheinakajima)
AgentID 출시: AI Agent를 위해 특별 설계된 독립 신원 자격 증명 솔루션 : AgentMail이 AgentID 서비스를 출시했습니다. 이 솔루션은 자율 구동되는 각 에이전트마다 실제 소유자에게 연결된 독립 공인 이메일과 신원 자격 증명을 부여하여, 서드파티 SaaS 플랫폼이 감사 추적성을 유지하고 계정 위험을 방지하면서 외부 Agent의 로그인 및 크로스 플랫폼 인가 작업을 안전하게 허용할 수 있도록 지원합니다 (출처: omarsar0)
Spotify Portal AI Plugins: 엔터프라이즈 개발 플랫폼을 주요 코드 에이전트에 도입 : Spotify가 사내 개발자 플랫폼 Spotify Portal을 Claude Code, Codex, Cursor에 직접 연동하는 공식 오픈소스 플러그인 모음을 공개했습니다. 에이전트는 CLI를 통해 마이크로서비스 카탈로그를 직접 검색하고, 서비스 진단을 호출하며, 헬스 상태를 조회할 수 있을 뿐만 아니라, shunt 플러그인을 통해 I/O 집약적 작업을 경량 모델로 분류하여 토큰 비용을 절감할 수 있습니다 (출처: GitHub Trending)
T3 Code, 스레드 내 실시간 UI 렌더링 및 인터랙티브 프리뷰 지원 : 코딩 툴 T3 Code가 앱 내 UI 시각화 기능을 선보였습니다. 에이전트가 프론트엔드 리팩토링이나 PR 코드 리뷰를 수행할 때, 대화 스레드 내에서 인터랙티브 HTML/React 컴포넌트 결과물과 비주얼 프로토타입을 인라인으로 직접 렌더링하여 개발자가 핫 리로딩 디버깅을 위해 IDE를 수시로 오가며 겪는 컨텍스트 손실을 줄여줍니다 (출처: theo)

Overmind 오픈소스 공개: 에이전트 실행 궤적을 활용한 수직형 소형 모델 자동 증류 : 일상 코딩 에이전트나 비즈니스 Agent의 도구 호출 로그 및 실행 궤적으로부터 가치 높은 파인튜닝 데이터셋과 평가셋을 추출·구축할 수 있는 오픈소스 도구 Overmind가 공개되었습니다. 실측 테스트 결과, 이를 통해 파인튜닝된 버티컬 소형 모델은 긴 계약서 조항 추출 시나리오에서 인용문 허위 생성률을 거대 모델의 3.36%에서 0.12%로 대폭 낮췄습니다 (출처: kimmonismus)

Mitchell Hashimoto, 범용 터미널 프로그램 상태 규격 OSC 7501 발표 : 저명한 개발자 Mitchell Hashimoto가 새로운 OSC 7501 터미널 제어 규격을 발표했습니다. 이 규격은 커맨드라인 프로그램이 터미널에 유휴, 실행, 블록 대기, 완료, 실패 등의 세분화된 상태를 정밀하게 보고할 수 있도록 지원하며, 현재 수백 개의 에이전트 오케스트레이터가 의존하고 있는 휴리스틱 정규표현식 판단을 대체하여 멀티 Agent 상태 통신의 표준 프로토콜을 정립하는 것을 목표로 합니다 (출처: mitchellh)
Scale AI, 고충실도 에이전트 강화학습 환경 프레임워크 AgentEnv 오픈소스 공개 : Scale AI가 Modal과 공동으로 AgentEnv 환경 구축 툴킷을 오픈소스로 공개했습니다. 이 프레임워크는 복잡한 장기 실행 에이전트의 강화학습 사후 훈련을 위해 설계되었으며 동적 트리거, 가상 시계 및 멀티 샌드박스 환경 스케줄링을 제공하여 대규모 동시성 롤아웃과 환경 대조 훈련을 지원하기 위해 주요 클라우드 샌드박스 클러스터와 원활하게 연동됩니다 (출처: Scale AI)
DAIR.AI, Agent를 위한 톱 컨퍼런스 논문 탐색 MCP 툴킷 출시 : 저명한 오픈소스 AI 조직 DAIR.AI가 Claude Code, Codex, Grok Bot 등 에이전트에 원클릭 연동이 가능한 전용 MCP 플러그인을 선보였습니다. 에이전트는 장기간 엄선된 AI 논문 데이터베이스를 자율적으로 호출하여 최신 연구 동향 정리, 자동 문헌 검토 작성, 방법론 아키텍처 시각화 비교 등을 수행할 수 있습니다 (출처: DAIR.AI)
ruNNtime, 브라우저 WebGPU 환경에서 EmbeddingGemma 2 완전 구동 구현 : WebGPU 추론 라이브러리 ruNNtime이 EmbeddingGemma 2의 텍스트 및 비전 타워를 순수 프론트엔드 환경으로 성공적으로 이식했습니다. 사용자는 백엔드 서버의 개입 없이 로컬 브라우저 GPU를 사용해 갤러리 멀티모달 시맨틱 검색을 직접 수행할 수 있어, 온디바이스 경량 멀티모달 검색 아키텍처의 프라이버시 보호 및 오프라인 환경 잠재력을 입증했습니다 (출처: Reddit r/LocalLLaMA)

Anthropic, Claude for Google Workspace 플러그인 공개 베타 출시 : Anthropic이 유료 구독 사용자를 대상으로 Google Workspace 공식 사이드바 플러그인을 출시하여 Docs, Slides, Sheets 내에서 직접 Claude를 호출해 다회차 편집, 구조 최적화, 자동 포맷팅을 수행할 수 있게 했으며 크로스 문서 컨텍스트의 직접 읽기를 지원합니다 (출처: The Verge)
📚 연구
얀 르쿤 팀, 계층적 월드 모델 H-JEPA 제안… 장기 시각 계획 성공률 4배 증가 : 시각 기반 엔드투엔드 계획에서 국소 디테일이 손실되기 쉬운 문제를 해결하기 위해, 얀 르쿤 팀이 하향식 계층 표현을 적용한 H-JEPA 아키텍처를 제안했습니다. 각 계층은 독립적인 잠재 공간 표현과 의미론적 추상화 스케일을 가지며, 복잡한 Visual AntMaze 미로 장기 계획 테스트에서 3계층 스택 구조를 통해 태스크 성공률을 18%에서 73%로 대폭 끌어올렸습니다 (출처: ylecun)

Meta 및 MIT, 하드웨어-딥러닝 모델 동시 설계 Agent 플랫폼 Coco 발표 : Meta와 MIT가 하드웨어 설계를 위한 멀티 에이전트 시스템 Coco를 제안했습니다. Agent는 수백 GB에 달하는 미확인 시뮬레이션 스캔 데이터를 마주했을 때 관계형 데이터베이스를 조회하는 SQL을 자율 작성하고, 분석 도구를 오케스트레이션하며, UI 내비게이션 상태를 읽어내어 TPU 아키텍트가 시뮬레이션 환경 구축 및 성능 병목 분석에 쏟는 작업 시간을 절반으로 단축했습니다 (출처: dair_ai)

AgentCore 및 OpenClaw 기반 영구 메모리 지원 스마트 어시스턴트 구축 가이드 : AWS 팀이 Serverless 런타임 환경에서 OpenClaw 기반 구조와 Bedrock AgentCore 영구 메모리 컴포넌트를 결합하는 방법을 다룬 상세 아키텍처 튜토리얼을 공개했습니다. 이 글은 단기 이벤트 캡처와 비동기 장기 팩트 추출의 2단계 메모리 구조를 상세히 분석하고 프롬프트 캐싱 기술을 통해 메모리를 동반한 다회차 인터랙션의 추론 비용을 90% 가까이 절감하는 방법을 소개합니다 (출처: AWS Machine Learning Blog)

스탠퍼드, LLM의 독창적 과학 가설 제시 역량 정량화하는 Priced Guidance 프레임워크 제안 : 퍼시 량 팀이 정보 이론에 기반한 ‘유료 가이드(Priced Guidance)’ 평가 패러다임을 제안했습니다. ‘스무고개’ 게임 메커니즘을 설계하여 모델이 사전 학습 컷오프 시점 이후에 새로 발표된 논문의 핵심 개념을 복원하는 데 필요한 정보 비트 수를 정밀 측정함으로써, 압축 관점에서 모델의 과학적 직관과 첨단 일반화 능력을 정량화하는 벤치마크를 수립했습니다 (출처: percyliang)

다중 교사 온폴리시 증류(MOPD) 메커니즘 분석: 교차 도메인 RL 역량 충돌 해소 : 연구진이 다중 교사 온폴리시 증류(MOPD) 기법을 분석했습니다. 추론, 코딩, 대화 등 다양한 도메인을 단일 RL 미세조정으로 통합할 때 발생하는 보상 충돌과 연산 부하 문제를 해결하기 위해, 도메인별 전문 교사 모델을 개별 학습시킨 후 역방향 KL 발산을 통해 토큰 단위로 학생 모델에 밀집 감독을 제공함으로써 범용 모델을 통합하면서도 샘플 효율성을 보존합니다 (출처: cwolferesearch)

HAD 프레임워크: 환경 인식 증류를 통한 소형 언어 모델 에이전트 실행력 강화 : 논문에서는 하네스 기반 배포 환경을 위한 소형 모델 에이전트 증류 기법인 HAD를 제안했습니다. 외부 상태 정보의 유무에 따른 교사 모델의 행동 차이를 비교하여 소형 모델이 프레임워크 정보를 활용하는 의도를 집중 훈련함으로써, ALFWorld 벤치마크에서 소형 모델의 작업 성공률을 63.4%로 끌어올리고 정체 상태에 빠진 시나리오의 약 60%를 성공적으로 해결했습니다 (출처: omarsar0)

Amazon AGI, 적응형 순환 확산 언어 모델 ALoDLM 오픈소스 공개 : Amazon 연구팀이 8B 파라미터 규모의 ALoDLM 아키텍처 및 학습 방식을 오픈소스로 공개했습니다. 확산 언어 모델 내부에 적응형 순환 추론과 점진적 오류 수정 메커니즘을 도입하여 난도 높은 샘플에 컴퓨팅 자원을 동적으로 할당함으로써, 다양한 종합 언어 이해 및 생성 벤치마크에서 동급 규모의 오토리그레시브 베이스라인을 전면 능가했습니다 (출처: arankomatsuzaki)

Jay Alammar, ‘AI 에이전트 일러스트 가이드’ 핵심 시스템 아키텍처 다이어그램 공유 : 저명한 테크 저술가 Jay Alammar가 에이전트 시스템의 가장 핵심적인 폐루프 아키텍처 다이어그램을 공유했습니다. LLM이 에이전트 환경에서 사용자 목표 수신, 상태 유지, 메모리 검색, 환경 액션 실행으로 이어지는 재귀적 폐루프 메커니즘을 상세히 분석하여, 현대 자율 Agent 시스템의 핵심 엔지니어링 토대를 개발자들에게 정리해 제공합니다 (출처: Jay Alammar)

💼 비즈니스
AMD, 페이페이 리 교수의 공간 지능 스타트업 World Labs를 82억 달러 전액 주식 교환으로 인수 추진 : AMD가 페이페이 리가 공동 창업한 월드 모델 유니콘 기업 World Labs를 약 82억 달러 규모의 전액 주식 거래로 최종 인수하기로 합의했다고 발표했습니다. 업계에서는 Atlas 모델이 희소 시점 기반의 실시간 4D 재구성 가능성을 입증함에 따라 임바디드 및 월드 모델이 산업적 스케일업의 전환점을 맞이하고 있다고 분석하며, AMD의 이번 행보는 NVIDIA에 대항하고 4D 컴퓨팅 칩 아키텍처 및 시뮬레이션 생태계에서 탄탄한 방벽을 구축하려는 전략으로 풀이됩니다 (출처: 36氪)

Kuaishou 산하 Kling AI, CICC 및 Goldman Sachs 주관사 선정해 홍콩 IPO 준비… 10억 달러 이상 조달 계획 : Kuaishou 산하의 비디오 생성 모델 서비스 Kling AI가 CICC, Goldman Sachs, UBS를 주관사단으로 확정하고 홍콩 분할 상장 절차를 추진하여 최소 10억 달러를 조달할 계획이며, 이르면 2027년에 상장될 전망입니다. Kling은 2026년 2분기 매출이 이미 8.5억 위안을 넘어섰으며, 독립 상장을 통해 고비용 컴퓨팅 클러스터 연구개발을 위한 독자적인 자금 조달 창구를 넓히려는 목적이며 Kuaishou가 절대적 지배력을 유지할 예정입니다 (출처: 36氪)

AI 컴퓨팅 클라우드 서비스 기업 Lambda, IPO 앞두고 145억 달러 기업가치로 40억 달러 투자 유치 추진 : 월스트리트저널에 따르면 GPU 클라우드 인프라 제공업체 Lambda가 Coatue와 Blackstone의 주도로 투자 전 기업가치 145억 달러 기준 최대 40억 달러 규모의 자금 조달을 추진 중입니다. Anthropic 등 대형 고객사들의 막대한 컴퓨팅 계약에 힘입어 수주 잔고가 500억 달러로 급증했으며, 이번 지분 투자는 IPO 이전에 차세대 컴퓨팅 센터 구축 자금을 선제 확보하기 위해 사용될 예정입니다 (출처: TechCrunch)
🌟 커뮤니티
기업의 Agent 도입, ‘협업세’ 직면: 티켓 해결 1시간당 내부 소통 3시간 소요 : 고객 서비스 관리 플랫폼 Front가 기업 관리자 700명을 대상으로 진행한 설문조사가 큰 화제를 모았습니다. 조사 결과에 따르면 기업들이 Agent를 도입한 후 인건비가 즉각적으로 절감되지 않고, 오히려 에이전트가 문제를 완결 짓지 못해 발생하는 다중 인수인계와 티켓 에스컬레이션으로 인해 막대한 미측정 ‘협업세’가 발생하는 것으로 나타났습니다. 시스템 간 인수인계 및 맥락 확인에 소요되는 시간이 실제 해결 시간의 3배에 달해, 엔드투엔드 가시성 결여라는 거버넌스 난점을 드러냈습니다 (출처: )
ChatGPT 세션 제목 끝에 도박 광고 삽입되는 원인 심층 분석: 토크나이저 오염과 조기 중단 실패 : 개발자들이 ChatGPT 세션 제목에 불법 스팸 광고가 간헐적으로 노출되는 기술적 원인을 심층 분석했습니다. o200k 토크나이저 사전 훈련 코퍼스에 불법 웹사이트의 고빈도 장문 토큰이 다량 혼입된 상태에서, 경량 제목 추론 모델이 말미에 EOS 제어 토큰을 출력할 때 확률 표류가 발생하여 모델이 거의 본 적 없는 비인기 토큰 ‘쓰레기통’에서 높은 확률의 광고 텍스트 조각을 잘못 샘플링하여 출력한 것으로 밝혀졌습니다 (출처: 36氪)
클라우드 네이티브 Harness 아키텍처 부상: K8s 창립 멤버들, Agent 중앙 집중식 거버넌스 방안 모색 : Kubernetes 초기 핵심 팀이 창업한 Stacklok이 클라우드 네이티브 Agent Harness 프로젝트인 Mecatl을 오픈소스화했습니다. 커뮤니티에서는 에이전트가 ‘로컬 터미널 스크립트’에서 ‘엔터프라이즈 중앙 관리 플랫폼’으로 진화하는 경로를 심도 있게 논의하며, 에이전트 상태, MCP 도구 게이트웨이 및 민감한 샌드박스 실행 환경을 완전히 디커플링하여 기업 핵심 자산과 권한이 단일 머신 환경에 종속되는 위험을 방지해야 한다고 촉구했습니다 (출처: Latent Space)
Meta Muse, 400만 사용자 소셜 프로필 실시간 구축 사실 알려지며 프라이버시 우려 확산 : 커뮤니티를 통해 Meta 산하 에이전트 Muse가 매시간 사용자의 채팅 및 통신 기록을 기반으로 소셜 관계망, 대인 관계 갈등, 취향 등을 포함한 상세 프로필을 자동 업데이트한다는 사실이 알려졌습니다. Meta 측은 사용자 VM이 독립된 샌드박스라고 밝혔으나, 인스턴스 간 ‘학습 경험 공유’ 메커니즘으로 인해 보이지 않는 데이터 수집과 타깃 광고 악용에 대한 사용자들의 강한 경계심이 일고 있습니다 (출처: Reddit r/artificial)

개발자들, ‘AI가 사람 말을 안 쓰는’ 현상 주목: CoT 압축부터 코퍼스 피팅 불균형까지 : 최근 개발자 커뮤니티에서는 최신 코딩 모델들이 작업 보고 시 “15/15 올그린, 단일 레그 불발”과 같은 어색하고 딱딱한 은어를 빈번하게 쏟아내는 현상에 대한 불만이 이어지고 있습니다. 토론에서는 토큰 소모를 낮추기 위해 제조사들이 잠재 사고 사슬(CoT)을 난해한 축약어로 과도하게 압축한 것이 한 원인으로 지목되었으며, 일부 엔지니어들은 이를 계기로 밀도 높은 고대 한문이나 문언문 코딩이 토큰 극한 압축에서 갖는 본질적인 엔지니어링상 이점을 논의하기도 했습니다 (출처: 量子位)

Prompt 암호화 우회 취약점 노출: 에이전트의 자체 복호화가 보안 취약점으로 작용 : 보안 연구에 따르면 공격자가 암호화된 악성 명령을 사용해 Copilot 등의 외부 보안 필터를 우회할 수 있으며, 에이전트가 입력을 처리하는 과정에서 스스로 복호화를 수행하고 로컬 기밀을 검색해 외부 네트워크로 전송하는 문제가 발견되었습니다. 테스트 결과 자동 모델 라우팅 메커니즘으로 인해 보안 방어가 극도로 불안정해지는 것으로 나타나, 모델의 자체 규율에 의존하는 보안 방어선에 구조적인 허점이 존재함을 입증했습니다 (출처: Reddit r/artificial)

초소형화의 한계 돌파: 개발자, 파라미터 2만 개에 불과한 스토리텔링 모델 MacroStories 학습 성공 : 독립 개발자가 용량 81KB(파라미터 19,969개)에 불과한 초소형 언어 모델 MacroStories를 오픈소스로 공개했습니다. 이 모델은 단일 디코더를 4회 순환하는 추론 아키텍처를 채택하여 일반 CPU나 마이크로컨트롤러 캐시에서도 초고속으로 실행되며, 제한된 어휘 목록 내에서도 명확한 서사 구조를 유지함으로써 언어 일관성을 유지하는 데 필요한 최소한의 컴퓨팅 경계를 탐색했습니다 (출처: Reddit r/LocalLLaMA)

💡 기타
전력망 확장 및 변압기 공급망 부족, AI 확장에 있어 연산 칩보다 먼저 ‘급제동 요인’ 될 수 있어 : 에너지 정책 분석에 따르면 미국 전역의 AI 데이터센터 전력 부하가 2030년까지 50GW로 치솟을 것으로 예상되지만, 초고압 변압기 등 중전기기 설비의 납기가 통상 5년을 초과하고 있으며 제조업체들은 과거 설비 과잉 트라우마로 인해 섣부른 증설을 꺼리고 있습니다. 물리적 전력망과 송배전 인프라의 경직된 수급 불균형이 연산 능력의 무분별한 확장을 제약하는 가장 냉혹한 물리적 병목으로 부상하고 있습니다 (출처: Transformer)
Adobe 디자인 도구 전체 오픈소스로 역공학 복제: 코드 대형 모델, 지식재산권 해자 재정의 : 오픈소스 프로젝트 Artcraft가 Opus 5.5 등 첨단 코드 모델을 활용해 전통 디자인 스위트의 로직을 디컴파일하고 Rust 규격으로 재구축함으로써, Photoshop급 디자인 소프트웨어 전체의 클린룸 오픈소스 대체 버전을 구현했습니다. 커뮤니티에서는 레거시 소프트웨어를 초고속으로 리버스 엔지니어링하는 코드 Agent의 능력이 전통 독점 소프트웨어의 견고한 비즈니스 해자를 근본적으로 허물고 있다는 평가가 나오고 있습니다 (출처: dotey, amasad)

맥도날드, AI 가격 책정 툴을 통한 가맹점 가격 담합 혐의로 반독점 소송 피소 : 소비자들이 시카고 연방법원에 맥도날드를 상대로 반독점 집단소송을 제기하며, 독립 가맹점들에 도입을 요구한 동적 가격 책정 AI 도구가 실제로는 비공개 판매 데이터의 수평적 교환 및 알고리즘 기반 가격 조작에 해당하여 소비자 권익을 침해하고 시장 경쟁 질서를 어지럽혔다고 주장했습니다 (출처: The Guardian)
