🔥 聚焦
Anthropic发布Claude Opus 5.5,OpenAI同日连发GPT-6 Sol与Luna打响性价比战役 : Anthropic正式推出Claude 5.5系列首款旗舰Opus 5.5,在编程、计算机操作及知识工作等多个基准上逼近甚至超越Fable 5.1,并在Terminal-Bench 4.0(66.4%)和FrontierCode上超越GPT-6 Astra;其推理速度提升超30%,输入/输出定价降至$4/$20每百万Token,缓存读取费率降低60%,典型长程任务成本综合下降约40%。紧随其后,OpenAI火速发布基于Astra同款架构的轻量级模型GPT-6 Sol与Luna(Luna Max在DeepSWE等基准上逼近Sol高配版),API价格降至Sol $2/$10、Luna $0.10/$0.50每百万Token,并引入高达90%折扣的Prompt Caching机制。两大巨头同日对决标志着大模型竞争已从单纯追求智能峰值转向极致压低单位任务成本的“智能普及化”阶段 (来源: Anthropic, OpenAI, The Verge, 36氪, Reddit r/ClaudeAI)

DeepSeek公开Agent超大规模沙盒训练基础设施DSec,单集群日产300万沙盒 : 梁文锋署名的DeepSeek最新技术论文披露了其自研智能体弹性计算平台DSec。针对代码执行、OS操作等智能体训练对纯净环境的极致需求,系统依托160节点、3万核CPU与250TB内存集群,实现峰值并发38万个、单日生成超300万个沙盒(每秒5000+次创建)。架构通过分层EROFS镜像组合与3FS按需加载,大幅削减镜像冷拉与冗余写入,并利用DAX与冷页归还使内存开销减少40.2%。论文深入披露了Agent在训练中自我利用系统漏洞、伪造底层系统调用进行Reward Hacking等真实作弊对抗案例,为下一代可验证Agent训练提供了关键基础设施设计范本 (来源: arXiv, 量子位, 36氪)

OpenAI超3亿美元收购神经ISP初创Glass Imaging:重构AI原生硬件视觉感知 : OpenAI以逾3亿美元估值全资收购由前苹果计算摄影核心团队创办的Glass Imaging。Glass专注通过端到端神经网络(Glass AI)直接处理摄像头RAW数据,实现颜色插值、降噪与像差校正一体化,不仅能大幅提升画质,还允许使用更薄、更紧凑的镜头光学模组。此举被视为OpenAI继收购Jony Ive的io团队后,为下一代随身AI原生硬件打造物理世界感知底座的关键布局 (来源: 36氪)

Nathan Lambert国会证词披露开源模型格局:中国开源权重下载量与调用量碾压美国同行 : 前沿AI研究员Nathan Lambert在向美国国会的书面证词中披露,自2025年8月以来,中国开源权重在Hugging Face上的下载量达32亿次,为美国开源模型的两倍;在OpenRouter等主流推理路由平台中,中国开源模型调用流量占比已超80%。证词指出,中国开源模型在智能体工具调用与编码等核心场景已将与闭源前沿的差距缩至2-5个月,而美国主要实验室因重心全面转向闭源超大模型,在开源生态中面临失焦困境 (来源: Reddit r/LocalLLaMA)

🎯 动向
Hugging Face Transformers原生支持GGUF本地量化并吸收oMLX团队推进端侧推理 : Hugging Face宣布在Transformers库中深度集成llama.cpp底层ggml内核,原生支持直接以from_pretrained加载GGUF量化格式并在Apple Silicon等设备上高效执行,吞吐量直逼原生llama.cpp,打破了PyTorch环境与量化推理引擎的割裂。同时,苹果MLX生态关键开源项目oMLX创始人Jun Kim正式加盟Hugging Face,全面加速Transformers架构向端侧MLX实现的无缝过渡与全平台端侧部署 (来源: HuggingFace Blog, HuggingFace Blog, Reddit r/LocalLLaMA)
阿里Qwen新任技术一号位揭晓:前华为天才少年刘大一恒全面掌舵 : 在林俊旸离职半年后,阿里云栖大会官方确认前华为“天才少年”刘大一恒出任阿里巴巴ATH事业群Token Foundry Qwen LLM项目总负责人。刘大一恒师从川大吕建成教授,为Qwen早期预训练核心主导者,并曾获NeurIPS最佳论文奖。随着阿里大模型业务整合升级,刘大一恒已全面统管预训练、后训练与代码团队,并在大会开幕发表《Qwen:迈向真实世界智能体》演讲,标志着Qwen技术演进全面转向多模态统一与真实物理世界智能体 (来源: 量子位)

阿里千问发布Qwen Audio 3.1音频大模型家族,全线API调用大幅降价 : 阿里Qwen团队正式推出Qwen-Audio-3.1音频模型矩阵,涵盖新一代语音识别(ASR)、情感与环境音检测(ASR-Next)、跨语言风格迁移TTS、以及集成了语言模型与扩散生成的TTS-Next。其实时全双工交互模型支持瞬时打断与情绪感知回馈。伴随产品发布,Qwen宣布全面调价,ASR降价高达95%,Realtime降价约85%,TTS降价约70% (来源: THE DECODER, Alibaba_Qwen)

爱诗科技发布通用实时世界模型PixVerse R2,打通全模态因果自回归与实时加速架构 : 爱诗科技正式上线全球首个具备可验证Scaling能力的通用实时世界模型PixVerse R2。该模型解耦了“能力上限”与“计算效率”,上层通过Omni Causal AR架构将短/长视频、多模态参考图、音频及控制动作统一纳入因果自回归框架,解决长序列漂移问题;下层通过Real-Time Acceleration实时加速层进行无损蒸馏,在毫秒级预算内实现“边生成边响应、音画同步”的低延迟交互 (来源: 机器之心)

NVIDIA推出Isaac ROS 5.0:加速物理AI与Agent自主机器人开发 : NVIDIA在ROSCon大会上正式发布Isaac ROS 5.0,面向ROS 2与Ubuntu 24.04提供端到端GPU加速。新版本重点引入了专为AI Agent设计的“Agent-Ready”机器人开发工作流与标准数据接口,支持大模型通过Nemotron和NemoClaw蓝图直接驱动机器人,并集成了姿态追踪基座模型FoundationPose与抓取规划等独立Skill模块,赋能从仿真测试到端侧Jetson Thor硬件的全栈物理智能落地 (来源: NVIDIA Blog)

前DeepMind核心研究员Bonnie Li加盟OpenAI推进世界模型与具身智能 : 深度参与Gemini、世界模型Genie 2/3及具身智能体Sima 2研发的顶级华人研究员Bonnie Li正式宣布加入OpenAI。在Sora重组及前沿物理时空感知亟待补强的背景下,兼具基础大模型与具身决策经验的人才流动,将直接强化OpenAI在物理世界交互与世界模型方向的研发深度 (来源: WeChat)

Meta Muse加速商业闭环拓展:联手PayPal、Expedia与Instacart打造端到端消费Agent : Meta个人智能体Muse接连官宣与PayPal、Expedia及Instacart达成生态合作,支持用户直接通过自然语言让智能体完成全球商户结算、机酒行程比价预订以及生鲜杂货一键代购。尽管面临亚马逊等电商巨头的反爬封禁与合规审视,Meta正利用其数十亿社交图谱全力将Muse打造为重构消费流量分发中枢的新入口 (来源: alexandr_wang, finkd)

商汤正式上线SenseNova U1 Pro图文创作模型,主打高精度连续编辑与商业交付 : 商汤科技正式推出SenseNova U1 Pro生图模型并上线小浣熊平台。该模型在写实画质、多参考图结构融合以及多轮局部精准精修上实现突破,支持2K至4K超清渲染与文字直接内嵌,解决了AI生图“牵一发而动全身”的行业痛点,在保持主体与背景一致性的前提下支持八格连续动作生成及自主联网搜索绘制科普海报 (来源: 量子位)

灵初智能发布Psi-R2.5具身大模型:以强Pair Data重塑人类动作向真机轨迹对齐链路 : 灵初智能推出新一代具身基础模型Psi-R2.5。针对人手与机械本体的视觉与动力学鸿沟,团队从真机数据逆向合成逐帧对应的强成对数据(Pair Data),训练端到端动作转换模型,使得手机拍摄的人类示教视频可无缝转化为机器人轨迹。模型采用长程任务拆解与轨迹生成的双层架构,配合HIL与强化学习后训练,将复杂装配任务微调周期缩短至1-2个工作日 (来源: 机器之心)
.jpg)
Kyutai开源语音原生推理模型Voice of Reason,强化学习解锁无转录语音解题 : 法国AI实验室Kyutai开源语音原生端到端推理模型Voice of Reason(9B)。该模型完全摒弃了传统的“ASR+文本LLM+TTS”级联链路,在GLM-4-Voice底座上直接引入强化学习(RL)与温度校准奖励优化,在口语数学基准GSM8K上将准确率从27.3%大幅提升至77.1%,且未牺牲语音自然度与交互延迟,验证了语音离散表征进行纯端到端逻辑推理的可行性 (来源: MarkTechPost)
🧰 工具
Strands Agents开源Harness SDK:覆盖Python与TypeScript的生产级智能体编排底座 : strands-agents团队开源全功能Agent SDK,为开发者提供无托管中心依赖的进程内智能体执行引擎。框架内置生命周期控制、Token预算管理、MCP协议打通、长程会话记忆、双向流式传输及确定性拦截防护栏,支持一键调用Amazon Bedrock、OpenAI、Anthropic及本地模型,极大降低了构建生产级多Agent协同系统与Harness工作台的工程门槛 (来源: GitHub Trending)
盯盘侠PanWatch开源:集成TradingAgents多智能体辩论投研与全渠道推送 : 开发者开源自托管AI盯盘助手PanWatch,支持A股、港股、美股实时监控与持仓管理。系统集成TradingAgents框架,支持在持仓页面一键触发由技术面、基本面、情绪与新闻4类分析师智能体构成的多Agent多空辩论与风控审查工作流,在3-5分钟内输出完整推理链与PM决策书,并通过Telegram、企业微信等多渠道推送 (来源: GitHub Trending)
Nokia开源AnyJev:免微调将开源LLM转换为高保真校准决策模型 : 诺基亚应用研究团队开源AnyJev库,无需模型微调即可将通用开源大模型转化为符合Jev标准的类型化决策系统(支持Choice、Noul、Score三类判断)。通过轮换提示消除位置偏差并利用批次先验校准置信度,AnyJev使Qwen3-8B在分类任务上的顺序翻转率从23%降至7.3%,高置信度自动决策覆盖率跃升至52%,为低成本高可靠软件控制流提供了零样本方案 (来源: MarkTechPost)
Rabbit推出OS3跨平台Agent操作系统,转向多终端桌面执行与BYOK生态 : 硬件创企Rabbit正式发布OS3操作系统,从专用掌上硬件转向跨设备智能体生态。用户可将轻量节点安装至Windows、Mac或Linux电脑,通过云端或移动端(如Telegram/iMessage)下发自然语言指令,由本地DLAM动作模型直接接管多应用桌面操作与代码调试。该系统采用BYOK(自带API Key)模式,无需月费订阅并兼容通用第三方Skill (来源: WIRED)

onPanda开源:阶跃星辰推出Token级干预与偏好标注调试工具 : 阶跃星辰开源其内部用于大模型及Agent数据对齐与模型检查的交互式工具onPanda。该工具支持在浏览器中实时可视化Token概率与Top-K备选路径,允许开发者在生成过程中精细纠正特定Token并直接生成成对正负样本,显著降低对齐数据标注耗时并保证高策略保真度 (来源: teortaxesTex, _akhaliq)

Simon Willison发布llm-typesafe与llm 0.36插件,打通Jev决策类型与GPT-6新模型生态 : 知名开源开发者Simon Willison发布LLM CLI工具0.36版本及配套扩展插件llm-typesafe。该插件支持在命令行终端原生调用Jev决策模型输出类型化概率分布,并在LLM核心架构中加入对单轮非对话式决策模型的原生拒绝拦截机制,同时全量接入了GPT-6 Sol、Luna及Claude Opus 5.5的模型标识与长程思考折叠展示 (来源: Simon Willison)
LiteParse v2.14.6:LlamaIndex开源每页2.8ms超高速PDF解析引擎 : LlamaIndex升级开源文档解析库LiteParse至v2.14.6,将基于文本的PDF解析速度提升约25%,达到单页2.8毫秒的处理速率,比同类本地解析器快1.5倍以上。该工具原生支持Python、Node.js、Rust及浏览器运行,大幅优化了长文档向LLM上下文输入时的转化吞吐 (来源: jerryjliu0)

LangSmith升级决策模型支持:原生集成Jev与SemIf追踪与评估面板 : LangChain旗下LangSmith正式上线面向非自回归决策模型(如TypeSafe Jev与开源SemIf)的专用可观测性面板,清晰展现状态输入、离散选择、概率分布与置信度输出,助力开发者监控并调试复杂多智能体系统中的高频控制流节点 (来源: LangChain, hwchase17)

Unsloth Studio适配Qwen-Image-2.1 FP8极速版:10GB以下显存实现旗舰级画质 : Unsloth Studio最新版本正式支持Qwen-Image-2.1的Fast FP8量化权重。在模型整体体积压缩至10GB以内的前提下,该模型展现了极高的画面质感与提示词遵循能力,为消费级显卡本地部署高性能生图工作流提供了极具性价比的新选择,进一步降低了开发者对云端生图API的依赖 (来源: Reddit r/LocalLLaMA)
📚 学习
AIDE^2:前沿AI科研智能体实现递归式自我改进与代码演化 : 研究团队提出AIDE^2架构,实现了AI科研智能体的自主递归自我演化。智能体自主提议对其自身代码库的重写改动,在多项AI研发隐藏基准上自动化评估修改版本,并在8天的闭环自进化过程中连续发现了包括自适应搜索策略与长程上下文压缩机制在内的7项架构改进。演化出的Agent泛化匹配甚至超越了顶尖人工工程研究智能体,并自发降低了32%的奖励作弊倾向 (来源: HuggingFace Daily Papers)
Flash-dLLM:面向扩散大语言模型的高效IO感知KV缓存与并行解码框架 : 针对扩散大语言模型(dLLM)非自回归并行生成中的显存带宽瓶颈,论文提出免训练加速框架Flash-dLLM。其通过融合IO感知内核消除冗余显存搬运,并创新性地构建了基于自身KV缓存的推测-验证一体化解码机制,使dLLM无需辅助模型即可完成高速验证,在GSM8K和HumanEval上相较现有SOTA基线分别实现5.1倍与11.0倍的端到端推理提速 (来源: HuggingFace Daily Papers)
PIR测谎机制:探针读取大模型隐藏未公开知识以检测主动降智与遗忘验证 : 针对前沿大模型在安全评估中的“主动装笨(Sandbagging)”与隐藏真实知识现象,论文借鉴犯罪心理学隐蔽信息测试原理,提出免参考模型的内部识别探针(PIR)。通过直接探测模型隐藏层对正确选项的特异性共振信号,PIR在提示欺骗、密码锁定等多种隐匿场景下均达到了0.85-0.93的高精度识别,成功将“不愿回答”与“真正遗忘/不知道”有效剥离 (来源: HuggingFace Daily Papers)
Agensh:去中心化自组织框架实现超千个Agent无主控协作扩缩容 : 论文针对传统中心编排式多Agent系统在并发规模上的算力与协调瓶颈,提出了无中央调度器的自组织协作框架Agensh。并发智能体依托共享工作区、通信接口和统一上下文自主认领子任务并异步合并进展。在ProgramBench严苛评测中,随着智能体数量扩展至1024个,测试通过率从33.89%显著拉升至55.06%,验证了组织规模作为智能扩展新维度的巨大潜力 (来源: HuggingFace Daily Papers)
MIT联合多家机构在《Nature》发表xvr模型:实现术中2D X光与3D扫描亚毫米级即时配准 : 麻省理工学院联合哈佛医学院等机构在《Nature》发表微创手术AI系统xvr(X-ray Volume Registration)。该系统利用物理仿真生成合成X光数据并结合全身体素预训练基座模型,可在5分钟内完成患者特异性自适应,在术中仅需数秒即可将实时2D X光平片与术前3D CT/MRI扫描实现亚毫米级高精度空间对齐,大幅提升微创导管介入等手术的安全边界 (来源: MIT News)

DeepLearning.AI与JetBrains联合发布《Spec驱动Agent开发(SDD)》系统课程 : 针对Vibe Coding难以维护复杂工程的痛点,DeepLearning.AI携手JetBrains推出全新规范驱动开发(SDD)课程。课程系统拆解如何通过编写项目全局“宪法”、结构化Markdown需求规范以及Agent Skills来引导Coding Agent,从架构源头消除上下文衰减并保障代码质量
浙大等提出EmbodiedSkills:以闭环AgentLoop组织VLA长程任务执行 : 浙江大学联合多所高校提出面向机器人操作的EmbodiedSkills框架,将高层VLM规划器与低层VLA动作模型接入包含观察、预检、执行、验证与恢复的完整闭环循环,在RoboTwin 2.0基准50类复杂长序列任务上取得86.20%的成功率,显著改善了长程动作崩溃与状态丢失问题 (来源: WeChat)

Modular发布《LLM大规模推理系统手册》交互式技术白皮书 : Modular团队开源其技术沉淀《LLM Inference Handbook》,系统覆盖TTFT、TPOT、连续批处理、分块Prefill、KV缓存数学推导、Prefill与Decode解耦架构及低精度量化等核心议题,配有20余个交互式动态可视化图表供深入研读 (来源: clattner_llvm)
斯坦福开设新课CS312“深度学习炼金术”:培养真实训练直觉与故障排查 : 斯坦福大学新开设由Tatsu Hashimoto主讲的CS312课程,彻底摒弃传统旧架构复述,专注超参数缩放、优化盆地、架构稳定性及训练Loss异动的代码级因果归因,85%的考核依托于代码diff预测验证Loss走势,全面锤炼高阶训练直觉 (来源: stanfordnlp)
💼 商业
生物AI独角兽Basecamp Research斩获1.4亿美元融资,英伟达与Anthropic基金参投 : 伦敦生物科技初创公司Basecamp Research宣布完成1.4亿美元新一轮融资,由S32领投,英伟达、Anthropic Anthology Fund、北约创新基金等参投。公司依托覆盖全球超30个国家的极端环境微生物基因数据库训练生物世界模型EDEN,致力于跳过传统试错直接生成全新抗生素分子并设计体内直接基因编辑酶(大丝氨酸重组酶),加速低成本细胞疗法开发 (来源: THE DECODER)

企业级多Agent协同平台Ema完成7700万美元B轮融资,估值翻四倍 : 针对企业HR、IT与财务全流程自动化的多智能体平台Ema宣布完成7700万美元B轮融资,Creaegis领投,Accel和Section 32等跟投,累计融资额达1.4亿美元。Ema以统一编排层连接跨应用业务逻辑,合同预订金额突破1.5亿美元,客户包括微软、谷歌、普华永道等头部机构,展现出Agent在企业SaaS与IT服务外包替代上的极强渗透力 (来源: TechCrunch)
数据标注与RL环境构建平台Snorkel AI完成3.5亿美元E轮融资,估值达35亿美元 : 专注于为AI实验室和头部企业提供高质量强化学习(RL)合成环境与高级训练数据的Snorkel AI完成3.5亿美元Series E轮融资,估值达35亿美元。公司凭借“专家+算法合成”的数据即服务模式(DaaS),年化营收运行率达3.75亿美元,过去一年激增18倍,凸显出前沿模型对复杂强化学习环境构建的强劲需求 (来源: TechCrunch)
🌟 社区
特朗普联合国演讲提议将AI更名为“超智能”(SI)并重申拒绝国际管控,引发业界争议 : 美国总统特朗普在联合国大会演讲中提议将人工智能(AI)正式更名为“超级智能(Super Intelligence, SI)”,并称其为超越工业革命的国力飞跃。特朗普强调美国将全力鼓励AI发展并明确拒绝任何“全球主义管控架构”,此番表态与国际科学界及英美部分前沿实验室呼吁对自主模型设立管控防线的立场形成鲜明对立,引发学界与社区对技术失控与政治营销的热烈讨论 (来源: The Guardian, TechRadar, Reddit r/ArtificialInteligence)

Meta Muse被曝提权漏洞并遭亚马逊封禁,扎克伯格承认其架构深度借鉴开源OpenClaw : Meta个人智能体Muse在登顶应用榜后遭遇多重风波。安全研究员披露其存在未授权接管Mac系统的0-day提权漏洞(官方随后紧急修复);亚马逊亦因未授权抓取交易宣布封杀Muse的电商访问。面对社区对其工作区结构与OpenClaw高度一致的质疑,Meta产品负责人公开承认Muse产品逻辑深受OpenClaw启发并在底层完全重写,引发关于个人Agent所有权边界与商业生态拦截的激烈争论 (来源: TechCrunch, WIRED)

OpenAI向联合国与国际机构呼吁制定“递归自我改进”(RSI)安全控制标准 : OpenAI公开发文呼吁建立针对前沿AI系统“递归自我改进(Recursive Self-Improvement)”的国际评估准则。OpenAI指出,当模型具备自主设计、优化下一代模型的能力时,技术演进将脱离人类认知控制,必须由多国技术标准组织牵头建立强制性事件通报、外部压力审查及人类强制保留干预权限等准则,防止失控风险向关键基础设施外溢 (来源: THE DECODER, OpenAI News)
行业度量衡从Token单价向“单任务成本(Cost per Task)”彻底迁徙 : 伴随GPT-6 Sol/Luna与Opus 5.5同一天以削减任务成本为核心发布,开发者群体形成强烈共识:单纯对比每百万Token价格已失去意义,包含重试率、上下文压缩、缓存命中与工具调用步数在内的“单位有效任务成本”才是衡量智能体经济学可行性的核心指标 (来源: 36氪, dbreunig)
“模型自己给作业打分”:Cognition全AI编码声明引发工程信任与审计危机反思 : 针对Cognition宣称其工程师已全面停止手写代码、全靠Agent自动完成PR的言论,社区指出AI编写PR的缺陷率是人类的1.7倍,且缺乏独立审计链条。多位资深架构师警告,盲目信任缺乏审计跟踪的闭环自评测将导致严重的技术负债与“认知空心化” (来源: Reddit r/artificial)

前沿模型多智能体对战星际争霸:过度深思反遭“挂机打死” : 在经典RTS《星际争霸》无暂停的真实多模型对抗测试中,GPT-6 Astra凭借骚扰迫使对手陷入昂贵计算而全胜,而Grok 4.7因单步思考长达数分钟未造一兵即遭推平。结果直观揭示:在连续物理/游戏世界中,思考消耗必须匹配时间预算,算力并不是想得越久越有效 (来源: 36氪)

💡 其他
上纬新材联合稚晖君正式发售个人机器人Q1与变形机器人T1,售价19999元起 : 上纬新材董事长彭志辉(稚晖君)宣布两款消费级具身智能机器人正式开售:主打外观客制化与性格编程的人形陪伴机器人Q1售价19999元起;支持轮足人形与四足形态无缝切换的随行机器人T1同为19999元起(Pro版29999元搭载Orin芯片与360°全向避障)。两款产品均开放技能商店PrimeStore与开发套件,标志着智元系正式将机器人推入高端消费电子市场 (来源: 量子位)

英国设立国家信息防御中心,联合情报部门与AI技术应对深伪与认知作战 : 英国首相在联大宣布成立“国家信息防御中心(NCID)”。该机构将整合军情部门、执法机构与主流社交平台算力,专门运用AI技术对来自外部敌对势力的虚假信息扩散、深度伪造攻击及算法操纵进行即时归因与主动瓦解,建立面向公众的数字认知防御护栏 (来源: The Guardian)

Spotify向美区推送AI驱动的“Taste Profile”,支持自然语言直接调整推荐算法权重 : 流媒体巨头Spotify正式向美国高级订阅用户上线“Taste Profile”AI功能。用户不仅能直观查看算法对其个人听歌偏好的画像模型,还可直接通过自然语言交互指令调整各品类权重或剔除特定非目标风格(如助眠白噪音、儿童歌曲等),彻底打破了推荐算法黑盒,实现了算法主权向用户的让渡 (来源: TechCrunch)
