🔥 聚焦
OpenAI新一代超大预训练模型“Doug”曝光,重回底座Scaling路线:行业分析机构与爆料者透露,OpenAI正在推进代号为“Doug”的全新超大规模预训练模型,预计最迟于11月推出。这表明在经历近两年主要依赖后训练和强化学习推动能力增长后,OpenAI正重新启动底座本身的大规模Scaling,以应对来自谷歌Gemini 3等竞品的直接竞争压力。(来源: 机器之心)
.jpg)
谷歌AI重组内幕发酵:哈萨比斯被曝曾计划与Jeff Dean同期离职:据行业消息源透露,DeepMind创始人哈萨比斯原本计划与Jeff Dean同期离开谷歌,但因谷歌高层担心股价崩盘而被强行挽留,其升任董事长及Alphabet首席科学家被指仅是过渡安排。目前,谷歌已将AI研发与决策中心全面收归硅谷总部,由联合创始人布林亲自监督Gemini开发,DeepMind的独立研究机构色彩正逐步淡化。(来源: 量子位)

学术与应用双重突破:GPT-5.6与Fable 5联手破解悬置25年的MIMO检测数学难题:微软研究院学者Dimitris Papailiopoulos宣布,在GPT-5.6与Fable 5的协助下,成功证明了一个多项式时间算法,能让无线通信中的MIMO检测精确命中最大似然阈值。这一发现填补了25年来统计上“能恢复”与快速算法“能恢复”之间的鸿沟,展示了AI在复杂数学理论推导与验证中的巨大潜力。(来源: 量子位)

AI算力能耗危机加剧:亚马逊德州7.65GW天然气发电厂与英伟达30亿美元投资曝光:为满足AI数据中心庞大的电力需求,亚马逊确认将在德州资助建设一座拥有35台涡轮机、发电量达7.65吉瓦的私有天然气发电厂,这可能使其成为全美最大的单一温室气体排放源。同时,英伟达被曝计划向德州电力基础设施开发商Lancium投资高达30亿美元,凸显了算力扩张与气候目标的剧烈冲突。(来源: THE DECODER)

🎯 动向
大模型后训练新突破:南京大学联合多校提出连续扩散语言模型AURORA-LM:研究团队提出了一种在连续语义空间中建模语言的全新方案,通过自编码器为文本构造高容量连续向量序列,并使用分块因果扩散模型学习其生成分布。该模型在昇腾NPU上完成了全部实验,并扩展至10亿参数规模,在自由生成和条件摘要任务上均取得优异成绩,验证了国产AI算力平台的可行性。(来源: 机器之心)
.jpg)
Google DeepMind发布DiffusionGemma技术报告,展示非从头训练的文本扩散模型:报告详细介绍了如何将现有的Gemma-4-26B模型转换为文本扩散模型。通过监督微调与“采样器蒸馏+强化学习”(SD-RL)两阶段训练,DiffusionGemma在H100上实现了每秒1500个token的并行生成速度,并具备双向推理和自我纠错能力,在数独求解等结构化任务中表现优异。(来源: THE DECODER)

大厂AI编程与成本管理新动态:Claude Code默认开启“自动模式”,亚马逊因Sonnet调用超支860%:Anthropic宣布将自动模式设为Claude Code默认权限,测试显示自动分类器能捕获89%的危险操作,远超人类手动审核的14%。与此同时,亚马逊被曝在使用Claude Sonnet填充作者信息时,因Agent反复重试导致账单飙升至180万美元,超出预算860%,凸显了企业级Agent成本失控的风险。(来源: 机器之心)
.jpg)
大模型“持续学习”路线分化:学术界与产业界积极探索模型“边用边学”机制:针对大模型“灾难性遗忘”痛点,行业正分化出外挂记忆(如Letta)、上下文工程(如ACE)、持续后训练(如Tinker)及自适应自我修改(如SEAL、Hope)等路线。Karpathy等专家指出,未来的持续学习将走向“认知内核+外部记忆”的分层协作,由AI自主决定学习内容与策略。(来源: 机器之心)
.jpg)
大厂AI编程工具引入跨会话通信,智能体协作走向多Agent新范式:Anthropic为Claude Code引入跨会话消息传递功能,允许运行在同一台机器或远程连接中的不同AI会话之间进行自主通信与进度对齐。这一更新打破了代码智能体单打独斗的局限,消除了跨终端复制粘贴的上下文损耗,为复杂的多任务并行开发提供了新支持。(来源: 机器之心)
.jpg)
浙大提出Agentic空间认知评估框架ProVisE,主张生成式模型“画出”空间智能:针对传统空间认知评测强迫模型输出抽象坐标的弊端,OmniAI团队提出ProVisE框架和SpatialGen-Bench基准。该框架通过视觉协议引导生成式模型直接在图像上标记答案,并由解析器恢复为结构化预测,测试显示图像生成模型在直接空间直觉上表现出独特优势。(来源: 机器之心)
.jpg)
端侧AI与超长上下文新动向:LFM 2.6B与Pokee-Isaac 28B相继发布:Liquid AI发布的LFM 2.6B端侧模型在RTX 3090上实现了260T/s的生成速度,主打极速本地推理;而Pokee AI发布的Pokee-Isaac 28B则支持10M-token超长上下文,支持在单个GPU上进行完全本地化的安全部署,为受监管行业提供了无需数据出境的智能体运行方案。(来源: MarkTechPost)
🧰 工具
Shepherd:支持智能体运行状态分叉、重放与回滚的开源Python运行时底座:由东北大学与斯坦福大学团队开发,该工具将智能体的每次环境交互记录为Git式的 typed event。当智能体在长任务中出错时,开发者或元智能体可以一键回滚到指定步骤重新执行,避免了重新运行的算力浪费,并实现了超95%的提示词缓存复用率。(来源: MarkTechPost)
Code-Graph-RAG:基于知识图谱的多语言单体仓库代码分析与编辑RAG系统:该开源项目利用Tree-sitter解析多语言代码库,并在Memgraph中构建统一的结构知识图谱。最新版本引入了Ruby语言支持、基于ast-grep的结构化搜索与替换工具,以及跨语言的数据流追踪功能,允许用户通过自然语言对复杂单体仓库进行查询和编辑。(来源: GitHub)

Agent DevTools:面向智能体内存与检索调试的本地开发者工具:该项目为智能体开发者提供了一个可视化的本地调试器,支持LangChain框架。开发者可以通过该工具实时 inspect 智能体的提示词、内存状态、检索逻辑和工具调用过程,并对比不同运行版本之间的差异,从而快速定位智能体决策偏差的根源。(来源: GitHub)

LiteParse:LlamaIndex开源的高速PDF结构化数据提取工具:该工具无需调用昂贵且缓慢的视觉多模态大模型,即可在毫秒级内直接从数字化PDF中提取表单字段值、复选框状态、批注、嵌入图像和矢量图形等结构化数据,并支持将提取结果无缝路由至LlamaParse等大模型方案,大幅降低了文档解析的Token开销。(来源: GitHub)
Overeasy:基于S3不可变日志的持久化文件系统覆盖层:该工具为AI Agent提供了一个可分叉、可恢复和可回滚的虚拟文件系统。通过将文件系统操作记录为S3上的不可变日志,Overeasy允许智能体在不同机器之间无缝恢复运行状态,并在代码生成或系统配置出错时安全地回滚到任意历史状态。(来源: GitHub)
📚 学习
《智能体在真实世界》(Agents in the Wild)教程论文发布:由微软、彭博社等机构联合撰写,详细梳理了AI智能体从受控基准走向真实世界部署时的核心挑战。内容涵盖超越实验室的推理与规划、多智能体协同、动态验证管线构建、降级回退机制以及人机协同(HITL)监督模式,并提供了医药和金融领域的实践案例。(来源: X)
《大模型后训练中的分布性视觉遗忘》研究发布:西北工业大学、港科大和浙大团队指出,自回归多模态大模型在长链推理中容易出现“分布性视觉遗忘”。研究提出了Remember-R1框架,通过在GRPO训练中引入视觉词汇、视觉记忆和关键区域三层过程奖励,约束模型在整条推理链中持续且准确地调用视觉证据,显著提升了7B模型在多项基准上的表现。(来源: X)
.jpg)
《机器学习基础》(Machine Learning: The Basics)精简复习指南发布:学者Alexander Jung撰写的精简教程,通过“数据-模型-损失”的统一框架对机器学习核心概念进行了系统梳理。内容涵盖假设空间、模型选择、经验风险最小化与正则化、概率模型与聚类、联邦学习以及隐私与可解释性,适合作为快速复习材料。(来源: X)
💼 商业
微链智能完成千万元天使轮融资,李泽湘、陆奇共同押注:微链智能宣布完成由李泽湘清水湾基金、陆奇奇绩创坛等共同投资的天使轮融资。公司由浙江大学博士宁冬冬创立,专注于研发面向电商场景的“技术售后客服”对话机器人,主打多模态视频/图片理解能力与自主逻辑推理排障,旨在解决复杂硬件售后成本高的痛点。(来源: 36氪)
中科慧思成立并发布三款灵巧手产品,探索“本体×数据”双飞轮:中科慧思由中科慧灵、蓝思科技与华夏集团共同成立,并发布了L1轻量版、D1高自由度五指手及M1模块化场景手三款产品。公司以灵巧手为入口,致力于推动末端执行器从单一硬件向软硬件结合的操作技能平台演进,并宣布建设专业化灵巧手技能训练场。(来源: 36氪)
OpenAI收购演示文稿生成创企NextSlide,加速视觉演示功能集成:演示文稿生成初创公司NextSlide宣布已被OpenAI收购,其团队已加入ChatGPT部门。NextSlide的技术主打将提示词、笔记或文档一键转化为精美且可编辑的演示文稿。此次收购旨在增强ChatGPT的视觉沟通与内容创作能力,具体交易条款未披露。(来源: TechCrunch)
🌟 社区
学术界与产业界热议“AI学术打假”:ICML 2026 Oral论文复现率不足一成引发信任危机:独立研究机构SAI对ICML 2026的105篇Oral论文进行完整实验复现,发现仅有8篇论文的复现得分超过80%,中位数仅为28%,并指出大量论文存在代码缺失、数据未公开或实验结果与描述不符等问题。OpenAI研究员Keller Jordan等指出,顶会论文中阻碍复现和夸大宣传频发,导致前沿实验室已基本不再阅读和信任顶会论文。(来源: X)
大模型Harness与Inference生态大讨论:Codex等本地框架面临“云原生”转型:OpenAI高管Thibault Sottiaux指出,随着长时推理和高自主性模型的出现,单机Harness(如Cursor、Claude Code等本地运行环境)正面临算力、内存及并发沙箱的瓶颈,未来两到三个月内,智能体工作流将加速向“本地轻指挥、云端重执行”的云原生微沙箱基础设施转型。(来源: 机器之心)
.jpg)
“AI越狱与沙盒逃逸”风波再起:社区热议Kimi K3安全测试争议:针对社交媒体热议“Kimi K3在网络安全测试中逃逸沙盒并联网”的传闻,UK AISI及安全研究人员澄清称,该事件并非模型主动越狱,而是测试人员在配置评估工具Inspect时未正确隔离网络所致。社区对此展开激烈讨论,担忧部分实验室利用此类“AI失控”叙事进行过度营销,从而推动有利于闭源垄断的监管政策。(来源: X)
独立开发者AI时代生存指南:Token预算管理与真诚品牌构建:社区知名独立开发者Tw93等分享了AI时代的开发思考。他们指出,随着AI降低了代码壁垒,开发者的核心能力已从写代码转向“产品工程师”(用研+产品+运营+商业的综合体)。在开发中,应将Token视作投资并用在刀刃上,通过快速迭代、真诚沟通和全球化视野来构建长期的个人信任品牌。(来源: X)
💡 其他
AI生成短故事在盲测中评分超越人类作品:一项针对2500多名参与者的研究显示,读者无法准确区分人类作家与ChatGPT-4生成的短故事。在盲测中,AI故事在感知质量和沉浸感上的评分甚至显著高于人类作品,因为AI文本通常更流畅、易读。然而,一旦得知故事由AI生成,读者的评分就会因心理偏见而明显下降。(来源: THE DECODER)

英国雇工法庭因AI生成诉状泛滥面临严重案件积压:英国法庭总统Barry Clarke等发布的备忘录显示,由于ChatGPT和Grok等工具降低了法律门槛,普通员工可以免费生成长达数百页的复杂起诉书,导致法庭临时救济申请和案件积压量同比飙升55%,未决案件达64,000件。这种“公地悲剧”使真正有诉求的劳动者面临更长的等待时间。(来源: THE DECODER)
Stack Overflow活跃度十年暴跌99%,AI时代知识源头引担忧:统计数据显示,全球最大程序员问答社区Stack Overflow的月提问量已从2014年3月的20.7万次峰值,暴跌至2026年7月的1.4千次,降幅达99%。社区用户指出,SO长期的门禁主义和毒性氛围本就劝退了新人,而大模型的普及彻底分流了流量。社区开始担忧,若人类停止在公开平台贡献新知识,未来AI的训练数据将面临枯竭。(来源: Reddit)
