🔥 주목
OpenAI 차세대 초대형 사전 학습 모델 ‘Doug’ 공개, 파운데이션 Scaling 노선으로 복귀: 업계 분석 기관과 내부 고발자에 따르면, OpenAI는 코드명 ‘Doug’인 새로운 초대형 사전 학습 모델을 추진 중이며, 늦어도 11월에 출시할 예정인 것으로 알려졌다. 이는 지난 2년 가까이 사후 학습(post-training)과 강화 학습에 주로 의존하여 성능 향상을 도모해 온 OpenAI가, Google Gemini 3 등 경쟁 제품의 직접적인 경쟁 압력에 대응하기 위해 파운데이션 자체의 대규모 Scaling을 다시 시작했음을 보여준다.(출처: 机器之心)
.jpg)
Google AI 조직 개편 내막 확산: 하사비스, Jeff Dean과 같은 시기에 사직하려 했던 것으로 밝혀져: 업계 소식통에 따르면, DeepMind 창립자 하사비스는 원래 Jeff Dean과 같은 시기에 Google을 떠날 계획이었으나, Google 경영진이 주가 폭락을 우려해 강제로 만류한 것으로 알려졌다. 그의 이사회 의장 및 Alphabet 수석 과학자 승진은 임시 방편에 불과하다는 지적이다. 현재 Google은 AI 연구개발 및 의사결정 센터를 실리콘밸리 본사로 전면 회수했으며, 공동 창립자 세르게이 브린이 직접 Gemini 개발을 감독하고 있어 DeepMind의 독립 연구 기관으로서의 색채는 점차 옅어지고 있다.(출처: 量子位)

학술 및 응용 분야의 이중 돌파구: GPT-5.6과 Fable 5, 25년간 미해결 상태였던 MIMO 탐지 수학 난제 공동 해결: Microsoft 연구소의 학자 Dimitris Papailiopoulos는 GPT-5.6과 Fable 5의 도움을 받아 무선 통신에서 MIMO 탐지가 최대 우도 임계값(maximum likelihood threshold)에 정확히 도달할 수 있도록 하는 다항식 시간 알고리즘을 성공적으로 증명했다고 발표했다. 이 발견은 지난 25년간 통계적 ‘복구 가능성’과 빠른 알고리즘의 ‘복구 가능성’ 사이에 존재하던 간극을 메웠으며, 복잡한 수학 이론의 도출 및 검증에서 AI가 가진 거대한 잠재력을 보여주었다.(출처: 量子位)

AI 컴퓨팅 파워 에너지 위기 심화: Amazon 텍사스 7.65GW 천연가스 발전소 및 NVIDIA 30억 달러 투자 공개: AI 데이터 센터의 방대한 전력 수요를 충족하기 위해, Amazon은 텍사스주에 35대의 터빈을 갖추고 7.65GW의 전력을 생산하는 민간 천연가스 발전소 건설을 지원할 것이라고 확인했다. 이는 미국 최대의 단일 온실가스 배출원이 될 가능성이 있다. 동시에 NVIDIA는 텍사스 전력 인프라 개발업체인 Lancium에 최대 30억 달러를 투자할 계획인 것으로 알려져, 컴퓨팅 파워 확장과 기후 목표 간의 심각한 갈등을 부각시켰다.(출처: THE DECODER)

🎯 동향
대형 모델 사후 학습의 새로운 돌파구: 난징대학교 및 여러 대학, 연속 확산 언어 모델 AURORA-LM 공동 제안: 연구팀은 연속적인 의미 공간에서 언어를 모델링하는 새로운 방안을 제시했다. 오토인코더를 통해 텍스트에 대한 고용량 연속 벡터 시퀀스를 구축하고, 블록 인과 확산 모델(chunked causal diffusion model)을 사용하여 생성 분포를 학습한다. 이 모델은 Ascend NPU에서 모든 실험을 완료하고 10억 매개변수 규모로 확장되었으며, 자유 생성 및 조건부 요약 작업 모두에서 우수한 성적을 거두어 중국 국산 AI 컴퓨팅 플랫폼의 타당성을 검증했다.(출처: 机器之心)
.jpg)
Google DeepMind, DiffusionGemma 기술 보고서 발표, 처음부터 학습하지 않는 텍스트 확산 모델 공개: 보고서는 기존 Gemma-4-26B 모델을 텍스트 확산 모델로 변환하는 방법을 상세히 소개했다. 지도 미세 조정(SFT)과 ‘샘플러 증류 + 강화 학습’(SD-RL)의 2단계 학습을 통해 DiffusionGemma는 H100에서 초당 1500개 token의 병렬 생성 속도를 달성했으며, 양방향 추론 및 자가 오류 수정 능력을 갖추어 스도쿠 풀이 등 구조화된 작업에서 우수한 성능을 보였다.(출처: THE DECODER)

빅테크 AI 프로그래밍 및 비용 관리 최신 동향: Claude Code ‘자동 모드’ 기본 활성화, Amazon은 Sonnet 호출로 예산 860% 초과 지출: Anthropic은 자동 모드를 Claude Code의 기본 권한으로 설정한다고 발표했다. 테스트 결과 자동 분류기는 위험한 작업의 89%를 포착하여 인간의 수동 검토(14%)를 크게 앞질렀다. 이와 동시에 Amazon은 Claude Sonnet을 사용해 저자 정보를 채우는 과정에서 Agent의 반복적인 재시도로 인해 청구 비용이 180만 달러로 치솟아 예산을 860% 초과한 것으로 밝혀져, 기업급 Agent의 비용 통제 불능 위험을 부각시켰다.(출처: 机器之心)
.jpg)
대형 모델 ‘지속 가능한 학습’ 노선 분화: 학계와 산업계, 모델의 ‘사용하며 학습하는’ 메커니즘 적극 탐색: 대형 모델의 고질적 문제인 ‘파괴적 망각(catastrophic forgetting)’에 대응하여, 업계는 외부 메모리(예: Letta), 컨텍스트 엔지니어링(예: ACE), 지속적인 사후 학습(예: Tinker), 자율적 자가 수정(예: SEAL, Hope) 등의 노선으로 분화하고 있다. Karpathy 등 전문가들은 미래의 지속 가능한 학습이 ‘인지 코어 + 외부 메모리’의 계층적 협업으로 나아갈 것이며, AI가 학습 내용과 전략을 스스로 결정하게 될 것이라고 지적했다.(출처: 机器之心)
.jpg)
빅테크 AI 프로그래밍 도구에 세션 간 통신 도입, 에이전트 협업이 다중 Agent 신패러다임으로 진화: Anthropic은 Claude Code에 세션 간 메시지 전송 기능을 도입하여, 동일한 기기 또는 원격 연결에서 실행되는 서로 다른 AI 세션 간에 자율적인 통신 및 진행 상황 동기화가 가능하도록 했다. 이번 업데이트는 코드 에이전트가 단독으로 작동하던 한계를 깨고, 터미널 간 복사 및 붙여넣기로 인한 컨텍스트 손실을 제거하여 복잡한 다중 작업 병렬 개발에 새로운 지원을 제공한다.(출처: 机器之心)
.jpg)
저장대학교, Agentic 공간 인지 평가 프레임워크 ProVisE 제안, 생성형 모델이 공간 지능을 ‘그려내도록’ 주장: 모델에 추상적인 좌표 출력을 강제하는 기존 공간 인지 평가의 단점을 해결하기 위해, OmniAI 팀은 ProVisE 프레임워크와 SpatialGen-Bench 벤치마크를 제안했다. 이 프레임워크는 시각적 프로토콜을 통해 생성형 모델이 이미지 위에 직접 정답을 표시하도록 유도하고, 파서(parser)를 통해 이를 구조화된 예측으로 복원한다. 테스트 결과 이미지 생성 모델이 직접적인 공간 직관에서 독특한 우위를 보이는 것으로 나타났다.(출처: 机器之心)
.jpg)
온디바이스 AI 및 초장기 컨텍스트 최신 동향: LFM 2.6B 및 Pokee-Isaac 28B 잇달아 출시: Liquid AI가 출시한 온디바이스 모델 LFM 2.6B는 RTX 3090에서 260T/s의 생성 속도를 달성하며 초고속 로컬 추론을 내세웠다. 반면 Pokee AI가 발표한 Pokee-Isaac 28B는 10M-token의 초장기 컨텍스트를 지원하며, 단일 GPU에서 완전히 로컬화된 안전한 배포를 지원하여 규제 대상 산업에 데이터 외부 유출이 없는 에이전트 실행 솔루션을 제공한다.(출처: MarkTechPost)
🧰 도구
Shepherd: 에이전트 실행 상태 분기, 재생 및 롤백을 지원하는 오픈 소스 Python 런타임 기반: 노스이스턴 대학교와 스탠퍼드 대학교 팀이 개발한 이 도구는 에이전트의 각 환경 상호작용을 Git 방식의 typed event로 기록한다. 에이전트가 장기 작업 중 오류를 발생시키면 개발자나 메타 에이전트는 클릭 한 번으로 지정된 단계로 롤백하여 재실행할 수 있어, 재실행에 따른 컴퓨팅 자원 낭비를 방지하고 95% 이상의 프롬프트 캐시 재사용률을 달성했다.(출처: MarkTechPost)
Code-Graph-RAG: 지식 그래프 기반 다국어 모노레포 코드 분석 및 편집 RAG 시스템: 이 오픈 소스 프로젝트는 Tree-sitter를 사용하여 다국어 코드베이스를 파싱하고 Memgraph에 통합된 구조적 지식 그래프를 구축한다. 최신 버전에는 Ruby 언어 지원, ast-grep 기반의 구조화된 검색 및 대체 도구, 그리고 크로스 언어 데이터 흐름 추적 기능이 도입되어 사용자가 자연어를 통해 복잡한 모노레포를 쿼리하고 편집할 수 있도록 지원한다.(출처: GitHub)

Agent DevTools: 에이전트 메모리 및 검색 디버깅을 위한 로컬 개발자 도구: 이 프로젝트는 에이전트 개발자에게 LangChain 프레임워크를 지원하는 시각적 로컬 디버거를 제공한다. 개발자는 이 도구를 통해 에이전트의 프롬프트, 메모리 상태, 검색 로직 및 도구 호출 과정을 실시간으로 inspect(검사)할 수 있으며, 서로 다른 실행 버전 간의 차이점을 비교하여 에이전트 의사결정 편향의 근본 원인을 신속하게 찾아낼 수 있다.(출처: GitHub)

LiteParse: LlamaIndex 오픈 소스 고속 PDF 구조화 데이터 추출 도구: 이 도구는 비싸고 느린 시각 멀티모달 대형 모델을 호출할 필요 없이 밀리초 단위 내에 디지털 PDF에서 양식 필드 값, 체크박스 상태, 주석, 임베디드 이미지 및 벡터 그래픽 등의 구조화된 데이터를 직접 추출한다. 또한 추출 결과를 LlamaParse 등 대형 모델 솔루션으로 원활하게 라우팅할 수 있도록 지원하여 문서 파싱의 Token 비용을 크게 절감한다.(출처: GitHub)
Overeasy: S3 불변 로그 기반의 영구 파일 시스템 오버레이: 이 도구는 AI Agent에게 분기, 복구 및 롤백이 가능한 가상 파일 시스템을 제공한다. 파일 시스템 작업을 S3의 불변 로그로 기록함으로써, Overeasy는 에이전트가 서로 다른 기기 간에 실행 상태를 원활하게 복구할 수 있도록 하며, 코드 생성 또는 시스템 설정 오류 발생 시 임의의 기록 상태로 안전하게 롤백할 수 있도록 지원한다.(출처: GitHub)
📚 학습
‘실제 세계의 에이전트’(Agents in the Wild) 튜토리얼 논문 발표: Microsoft, Bloomberg 등의 기관이 공동 집필한 이 논문은 AI 에이전트가 통제된 벤치마크를 벗어나 실제 세계에 배포될 때 직면하는 핵심 과제들을 상세히 정리했다. 내용은 실험실 수준을 넘어서는 추론 및 계획, 다중 에이전트 협업, 동적 검증 파이프라인 구축, 성능 저하 시 폴백(fallback) 메커니즘, 인간 참여형(HITL) 감독 모드 등을 다루며, 의료 및 금융 분야의 실무 사례를 제공한다.(출처: X)
‘대형 모델 사후 학습에서의 분포적 시각 망각’ 연구 발표: 서북공업대학교, 홍콩과기대학교, 저장대학교 공동 연구팀은 자기회귀 멀티모달 대형 모델이 긴 체인 추론 과정에서 ‘분포적 시각 망각(distributional visual forgetting)’을 겪기 쉽다고 지적했다. 연구팀은 Remember-R1 프레임워크를 제안하여, GRPO 학습 과정에 시각 어휘, 시각 메모리 및 핵심 영역의 3단계 프로세스 보상(process reward)을 도입함으로써 모델이 전체 추론 체인에서 시각적 증거를 지속적이고 정확하게 호출하도록 규제했다. 이를 통해 7B 모델의 여러 벤치마크 성능을 크게 향상시켰다.(출처: X)
.jpg)
‘머신러닝 기초’(Machine Learning: The Basics) 요약 복습 가이드 발표: 학자 Alexander Jung이 집필한 요약 튜토리얼로, ‘데이터-모델-손실’의 통합 프레임워크를 통해 머신러닝의 핵심 개념을 체계적으로 정리했다. 가설 공간, 모델 선택, 경험적 위험 최소화 및 정규화, 확률 모델 및 군집화, 연합 학습, 그리고 개인정보 보호 및 설명 가능성을 다루고 있어 빠른 복습 자료로 적합하다.(출처: X)
💼 비즈니스
Weilian Intelligent, 수천만 위안 규모의 엔젤 라운드 투자 유치 완료, Li Zexiang 및 Lu Qi 공동 투자: Weilian Intelligent는 Li Zexiang의 Qingshuiwan Fund, Lu Qi의 MiraclePlus 등이 공동 투자한 엔젤 라운드 투자를 유치했다고 발표했다. 저장대학교 박사 Ning Dongdong이 설립한 이 회사는 이커머스 시나리오를 겨냥한 ‘기술 사후 서비스(AS) 고객 상담’ 대화형 챗봇 개발에 집중하고 있다. 멀티모달 비디오/이미지 이해 능력과 자율적인 논리 추론 문제 해결을 강점으로 내세워, 복잡한 하드웨어 AS 비용이 많이 드는 문제를 해결하는 것을 목표로 한다.(출처: 36氪)
Zhongke Huisi 설립 및 로봇 핸드 제품 3종 출시, ‘하드웨어(본체) × 데이터’ 이중 플라이휠 탐색: Zhongke Huisi는 Zhongke Huiling, Lens Technology, Huaxia Group이 공동 설립했으며, L1 경량 버전, D1 고자유도 5지 핸드, M1 모듈형 시나리오 핸드 등 3종의 제품을 발표했다. 회사는 로봇 핸드를 진입점으로 삼아 말단 작동장치(end effector)가 단순한 하드웨어에서 소프트웨어와 하드웨어가 결합된 조작 기술 플랫폼으로 진화하도록 추진하는 데 전념하고 있으며, 전문적인 로봇 핸드 기술 훈련장 건설을 선언했다.(출처: 36氪)
OpenAI, 프레젠테이션 생성 스타트업 NextSlide 인수, 시각적 프레젠테이션 기능 통합 가속화: 프레젠테이션 생성 스타트업 NextSlide는 OpenAI에 인수되었으며 해당 팀이 ChatGPT 부서에 합류했다고 발표했다. NextSlide의 기술은 프롬프트, 메모 또는 문서를 클릭 한 번으로 아름답고 편집 가능한 프레젠테이션으로 변환하는 것을 강점으로 한다. 이번 인수는 ChatGPT의 시각적 커뮤니케이션 및 콘텐츠 제작 능력을 강화하기 위한 것이며, 구체적인 거래 조건은 공개되지 않았다.(출처: TechCrunch)
🌟 커뮤니티
학계와 산업계, ‘AI 학술 부정 적발’ 열띤 논쟁: ICML 2026 Oral 논문 재현율 10% 미만으로 신뢰 위기 초래: 독립 연구 기관 SAI가 ICML 2026의 Oral 논문 105편에 대해 완전한 실험 재현을 진행한 결과, 재현 점수가 80%를 넘는 논문은 8편에 불과했으며 중간값은 28%에 그쳤다고 밝혔다. 또한 다수의 논문에서 코드 누락, 데이터 미공개, 실험 결과와 설명 불일치 등의 문제가 발견되었다고 지적했다. OpenAI 연구원 Keller Jordan 등은 최고 권위 학회 논문에서 재현 방해 및 과장 광고가 빈번하게 발생하여, 최첨단 연구소들은 이제 학회 논문을 거의 읽지 않고 신뢰하지 않는 수준에 이르렀다고 지적했다.(출처: X)
대형 모델 Harness 및 Inference 생태계 대토론: Codex 등 로컬 프레임워크, ‘클라우드 네이티브’ 전환 직면: OpenAI 임원 Thibault Sottiaux는 장시간 추론 및 고자율성 모델이 등장함에 따라 단일 기기 Harness(예: Cursor, Claude Code 등 로컬 실행 환경)가 컴퓨팅 파워, 메모리 및 동시성 샌드박스의 병목 현상에 직면해 있다고 지적했다. 향후 2~3개월 내에 에이전트 워크플로우가 ‘로컬 가벼운 지시, 클라우드 무거운 실행’ 방식의 클라우드 네이티브 마이크로 샌드박스 인프라로 빠르게 전환될 것이라고 덧붙였다.(출처: 机器之心)
.jpg)
‘AI 탈옥 및 샌드박스 탈출’ 논란 재점화: 커뮤니티, Kimi K3 보안 테스트 논쟁으로 들썩: 소셜 미디어에서 화제가 된 ‘Kimi K3가 사이버 보안 테스트 중 샌드박스를 탈출하고 네트워크에 연결되었다’는 소문에 대해, UK AISI 및 보안 연구원들은 해당 사건이 모델의 자발적인 탈옥이 아니라 테스트 인력이 평가 도구인 Inspect를 구성할 때 네트워크 격리를 제대로 하지 않아 발생한 것이라고 해명했다. 커뮤니티에서는 일부 연구소가 이러한 ‘AI 통제 불능’ 내러티브를 과도한 마케팅에 활용하여 폐쇄형 독점에 유리한 규제 정책을 추진하려는 것이 아닌가 하는 우려와 함께 격렬한 토론이 벌어졌다.(출처: X)
AI 시대 1인 개발자 생존 가이드: Token 예산 관리 및 진정성 있는 브랜드 구축: 커뮤니티의 유명 1인 개발자 Tw93 등은 AI 시대의 개발에 대한 생각을 공유했다. 이들은 AI가 코드 장벽을 낮춤에 따라 개발자의 핵심 역량이 코드 작성이 아닌 ‘프로덕트 엔지니어’(사용자 연구 + 제품 + 운영 + 비즈니스의 종합체)로 전환되었다고 지적했다. 개발 과정에서 Token을 투자로 간주하고 꼭 필요한 곳에 사용해야 하며, 빠른 반복 작업, 진정성 있는 소통, 글로벌 시야를 통해 장기적인 개인 신뢰 브랜드를 구축해야 한다고 조언했다.(출처: X)
💡 기타
AI 생성 단편 소설, 블라인드 테스트에서 인간 작품 평점 추월: 2,500명 이상의 참가자를 대상으로 한 연구에 따르면, 독자들은 인간 작가가 쓴 단편 소설과 ChatGPT-4가 생성한 단편 소설을 정확히 구별하지 못했다. 블라인드 테스트에서 AI 소설은 인지된 품질과 몰입도 면에서 인간의 작품보다 훨씬 높은 점수를 받았는데, 이는 AI 텍스트가 일반적으로 더 매끄럽고 읽기 쉽기 때문이다. 그러나 소설이 AI에 의해 생성되었다는 사실을 알게 되면 독자들의 평점은 심리적 편견으로 인해 눈에 띄게 하락했다.(출처: THE DECODER)

영국 노동법원, AI 생성 소장 남발로 심각한 사건 적체 직면: 영국 법원장 Barry Clarke 등이 발표한 각서에 따르면, ChatGPT 및 Grok 등의 도구가 법률 장벽을 낮추면서 일반 근로자들이 수백 페이지에 달하는 복잡한 소장을 무료로 생성할 수 있게 되었다. 이로 인해 법원의 임시 구제 신청 및 사건 적체량이 전년 대비 55% 급증했으며, 미결 사건은 64,000건에 달했다. 이러한 ‘공유지의 비극’은 실제로 소송이 필요한 근로자들의 대기 시간을 더욱 늘리고 있다.(출처: THE DECODER)
Stack Overflow 활성도 10년 만에 99% 폭락, AI 시대 지식 원천에 대한 우려 제기: 통계 데이터에 따르면, 세계 최대 개발자 Q&A 커뮤니티 Stack Overflow의 월간 질문 수는 2014년 3월의 최고치인 20만 7천 건에서 2026년 7월 1천 4백 건으로 99% 폭락했다. 커뮤니티 사용자들은 SO의 고질적인 폐쇄주의와 독성 분위기가 신규 사용자의 유입을 막았고, 대형 모델의 대중화가 트래픽을 완전히 분산시켰다고 지적했다. 커뮤니티는 인류가 공개 플랫폼에 새로운 지식을 기여하는 것을 중단한다면 향후 AI 학습 데이터가 고갈될 것이라고 우려하기 시작했다.(출처: Reddit)
