Anthropic推出模型硬件标准MHS开启物理AI交互|AI日报 2026-08-29

🔥 聚焦

Anthropic推出模型硬件标准MHS开启物理AI交互 : Anthropic正式发布面向物理设备的开放驱动规范“模型硬件标准”(Model Hardware Standard,MHS)研究预览版。该标准被视为“物理世界的MCP”,通过提供统一的设备描述文件与标准驱动接口,使Claude等AI Agent能够像调用软件API一样,跨网络直接发现并协同操纵显微镜、机械臂、移液器及量子激光器等精密仪器。实测中Claude借助MHS将精密激光校准时间从数周压缩至数小时并实现99.3%的稳定率。目前已联合HHMI Janelia、基因泰克、杜山机器人及AWS展开测试,标志着具身智能与科研自动化正从数字代码操作跨入真实物理实验的标准化自主闭环。(来源: Anthropic News)

Anthropic发布MHS

美联邦法官裁定五角大楼将Anthropic列入黑名单违宪并撤销制裁 : 美国加州北区联邦地区法院裁定,国防部此前将Anthropic列为“供应链国家安全风险”并禁止联邦采购的决定属于非法报复行为,违反了美国宪法第一修正案与第五修正案的正当程序条款。法官指出,军方以国家安全为由惩罚公开批评政府AI政策的企业缺乏事实依据,且与五角大楼持续寻求采购其前沿安全模型的技术现实相矛盾。该判决立即生效并撤销针对该公司的行政禁令,为前沿AI实验室在政府合规及军事安全红线博弈中树立了关键司法判例。(来源: The Guardian)

美联邦法官判决

全球百余家科技巨头联合签署倡议:以AI自主防御应对新型网络攻击 : OpenAI、Anthropic、谷歌、微软、AWS、Oracle、CrowdStrike与Hugging Face等116家科技企业与安全机构联合发布公开信,呼吁公私部门协同构建全球性AI网络防御纵深。签署方警告,由高阶AI驱动的自动化网络攻击将在数月内呈爆发式增长,关键基础设施正面临前所未有的AI渗透风险;业界必须改变传统静态防护思路,直接资助并部署具备自主推断与实时修复能力的防御型AI系统,建立跨机构的安全事件共享机制。(来源: OpenAI, THE DECODER)

OpenAI联合发起网络防御倡议

Google发布Gemini Omni 1.1 Flash强化长视频可控生成 : Google DeepMind正式上线新一代多模态音视频生成与编辑模型Gemini Omni 1.1 Flash,同步开放Gemini API、Google AI Studio与企业Agent平台。新模型重点增强多镜头制作的连贯性,支持最长读取10秒前序视频并将场景无缝延展至40秒,提供首尾关键帧补全与3秒动作参考视频输入能力;同时推出系统吞吐提升60%且成本降低三分之二的360p草稿模式,并支持4K超清交付,分别斩获评测竞技场Text-to-Video第一与Image-to-Video第二。(来源: Google DeepMind Blog, Google DeepMind)

Gemini Omni 1.1 Flash

🎯 动向

腾讯混元开源770B旗舰大模型Hy4 preview : 腾讯混元正式开源新一代MoE大模型Hy4 preview,总参数量770B、激活参数49B,支持1M长上下文并遵循Apache 2.0协议。架构采用Gated DSA稀疏注意力、iHC跨层残差与10B多Token预测(MTP)机制,在203项复杂工程与数学任务盲测中跻身开源第一梯队,首日获vLLM与英伟达Blackwell硬件平台深度适配支持。(来源: Hugging Face, 机器之心)

腾讯混元Hy4 preview

OpenAI内部测试Codex“持久模式”赋予智能体自主行动力 : 外媒审查Codex CLI开源代码库发现,OpenAI正在内部灰度测试Persistent Mode。该模式打破当前数分钟或单轮会话上限,设定为“持续工作直到被强制休眠”,允许模型在休眠前跨会话自主生成后续待办、主动探测上下文并向用户推送通知,展现出OpenAI向24小时常驻自主数字员工演进的明确路线。(来源: WIRED)

Codex Persistent Mode

Google DeepMind试点首个双盲机密AI评估框架 : Google DeepMind联合新加坡AI安全研究所与MLCommons等机构,基于Google Cloud机密计算空间(Confidential Space)构建了全球首套双盲模型评测流水线。该机制通过硬件级加密隔离,确保评估机构无法窃取专有模型权重,模型方也无法预见测试题,从密码学底层消除前沿模型评估中的基准污染问题。(来源: THE DECODER)

双盲AI评估框架

NVIDIA扩展NVLink Fusion并推出NVHBM定制内存标准 : 英伟达宣布将NVLink Fusion机架互联生态延伸至定制高带宽内存技术NVHBM。该架构将内存控制器直接内嵌至3D HBM基础裸片,为算力芯片释放出最高25%的计算核心面积,提升30%内存带宽并降低15%功耗,AWS Annapurna Labs已确认将在下一代Trainium芯片中率先适配。(来源: NVIDIA Blog)

清华等团队提出FormaTheoria:AI构建百万行代码核验数学大定理 : 在丘成桐先生倡导下,清华大学求真书院与华威大学等团队提出FormaTheoria工作流,利用AI自主从非结构化文献中提取依赖并转化为Lean严格证明。系统已成功形式化有限单群分类(CFSG)中的四大定理,生成超99.4万行代码与依赖图,7个月内完成了传统数学界需15位专家耗时6年的形式化体量。(来源: arXiv)

FormaTheoria形式化数学验证

Cartesia正式GA发布实时语音大模型Sonic-3.6 : 语音AI创企Cartesia宣布Sonic-3.6语音合成模型正式进入通用可用阶段。该模型重构底层网络架构,在保持超低延迟的同时显著增强了自然度与沉浸感。在权威评测榜单Voice Arena上,Sonic-3.6以1085 Elo积分与Gemini 3.1 Flash TTS并列第一。(来源: Cartesia)

Cartesia发布Sonic-3.6

高德发布万帧级流式3D重建模型ABot-Recon : 阿里巴巴旗下高德发布单目RGB流式三维重建模型ABot-Recon,采用“12帧局部位姿预测+残差优化”架构,彻底摒弃长程记忆锚点。该设计将显存峰值压降至6.71GB,在单张消费级显卡上实现万帧级场景24.45FPS的实时全局无漂移建图,大幅降低具身智能的空间感知门槛。(来源: 量子位)

ABot-Recon

阿里全新升级Qoder智能体工作台推动编程能力普及 : 阿里巴巴正式发布全新Qoder,将其从单一编码工具拓展为面向全员的通用智能体工作平台。平台新增常驻桌面宠物助手与实时语音交互,支持专业编码与非技术通用双模式,内置Auto智能调度引擎并打通70多款插件,将复杂开发能力封装为普通业务人员可调用的数字生产力。(来源: 智东西)

阿里全新Qoder上线

苹果推出多模态高斯单图3D生成表征Luce : 苹果机器学习研究团队提出Luce,将三维几何网格与反照率、粗糙度等物理渲染(PBR)材质参数统一嵌入体素化高斯点云潜空间。通过整流流Transformer与多层特征对齐,Luce在单图生成3D模型时实现高保真度重光照与文本细节保留,FID指标改善达28%。(来源: Apple Machine Learning Research)

Luce 3D生成

Midjourney开启V8.2图像编辑与局部重绘模型公测 : Midjourney开启V8.2图像编辑模型公测。新版本全面支持自然语言指令精准改图、多图融合参考生成、基于画笔的交互式局部重绘(Inpainting)与外绘扩展(Outpainting),并能无缝继承个性化参数与灵感看板设置,显著提升了商用图像设计的可控度。(来源: DavidSHolz)

Midjourney V8.2测试

🧰 工具

Tailcat:基于WireGuard数据平面的无服务端点对点隧道 : Tailscale开源轻量级网络工具Tailcat,提取核心magicsock与用户态TCP/IP协议栈,无需接入集中式控制平面即可通过短期Token完成NAT穿透与WireGuard端到端加密通信,为分布式智能体间搭建私密、无权限依赖的数据流通管道。(来源: GitHub Trending)

Tailcat

LlamaParse推出原生表格与复杂表单结构化提取模式 : LlamaIndex为其解析平台推出专为电子表格和密集表单设计的Agentic提取引擎。该工具直接读取单元格公式、合并区域、隐藏行和跨表逻辑,支持基于Schema的精准映射与自动标注检测,大幅降低了下游RAG和财务分析Agent的解析错误率。(来源: LlamaIndex)

LlamaParse表格解析

Cohere发布2.3B端到端文档解析模型Parse 5 : Cohere正式上线轻量级视觉语言解析模型Parse(parse-v5.0)。该模型在8K上下文内直接将复杂扫描件、PPT与表格转译为带HTML结构与边界框的Markdown,省去独立OCR模块,在吞吐性价比与多语言结构化解析上表现出众。(来源: MarkTechPost)

Nous Research发布Hermes桌面HUD实时标注与浏览器托管 : 开源团队Nous Research为Hermes Agent推出HUD视觉分析模式与浏览器代理插件。HUD模式可直接在用户屏幕图表上叠加绘制阻力位与支撑线等分析层,而新版浏览器环境则支持通过隔离克隆的Chrome Profile复用登录凭证,使Agent能在保障主账号安全的前提下代办复杂网页流程。(来源: Teknium)

Hermes RSS与桌面插件

Perplexity开发者平台推出统一连接器简化企业数据集成 : Perplexity宣布在其Agent API中引入一键连接器功能,企业管理员仅需一次性配置即可使Agent无缝访问GitHub、Slack、Google Drive及Datadog,无需在每次请求中重复传递鉴权Token,大幅简化了企业级智能体的工作流编排门槛。(来源: AravSrinivas)

screenshot-to-code升级多模态前端生成体验 : 流行开源工具screenshot-to-code全面升级模型矩阵与视觉校验链路,支持直接输入交互录像或设计截图生成React、Vue及Tailwind代码,新增无头浏览器渲染即时校验回路以减少视觉幻觉。(来源: GitHub Trending)

screenshot-to-code

Open WebUI发布Quick Actions套件实现40余种上下文一键操作 : 社区开发者为Open WebUI构建了Quick Actions(v3.0.0)扩展插件。该功能在模型回复下方嵌入自适应轻量菜单,能根据当前输出是代码、文档还是数据,动态提供改写、事实核查、安全审计、格式转换等40多项免提示词操作。(来源: GitHub)

📚 学习

李飞飞团队提出TrAct:以视觉轨迹作为策略与世界模型的中间语言 : 斯坦福大学李飞飞、吴佳俊团队提出以二维“视觉轨迹”作为跨模态统一接口,让策略网络联合预测动作与像素点运动,再由扩散世界模型生成预演视频并打分决策,有效解决了底层动作指令与本体强绑定且难以指导视觉预测的痛点,在分布外与跨本体任务中显著超越基线。(来源: arXiv)

TrAct视觉轨迹世界模型

Science Robotics:伯克利与斯坦福联合提出BeyondMimic人形机器人动作框架 : 联合团队提出强化学习运动跟踪框架BeyondMimic。该方案先利用统一跟踪奖励从人类示范中学习空翻、转身踢等数百种高动态技能,再通过潜在状态-动作扩散模型进行技能插值与目标引导,成功使机器人在真实室外地形中稳定完成动作切换与实时避障。(来源: Science Robotics)

BeyondMimic动作合成框架

Harness Continual Learning:持续学习向智能体脚手架演进 : 南京大学与伍伦贡大学团队联合提出HCL新范式,指出在冻结模型权重的前提下,智能体可通过更新任务接口、经验记忆、能力图谱与路由策略实现系统级持续学习。论文同时形式化定义了Harness层的灾难性遗忘,并提出守护演化机制以平衡可塑性与稳定性。(来源: 机器之心)

HCL框架

Code-as-World:以可执行代码重建物理演化机制 : MirroS团队提出Code-as-World框架,主张通过逆向推演将视觉观测转化为包含实体属性、动力学规则与渲染条件的可执行代码,使AI从单纯拟合像素表象转向发现底层物理因果机制,为物理世界推理与连续交互提供坚实表征底座。(来源: 机器之心)

Code-as-World

ICML 2026录用论文GRACE:量化感知训练与知识蒸馏联合优化 : ETH Zurich学者提出GRACE框架,批判了先全精度蒸馏再训练后量化的割裂路线。通过置信度门控输出蒸馏与视觉特征关系对齐,让学生模型在4-bit低比特约束下直接向教师学习关键表示,使2B视觉语言模型在实测推理中逼近并反超7B教师水平。(来源: arXiv)

GRACE量化蒸馏框架

MIT提出SceneSmith以多Agent协作生成物理仿真空间 : MIT CSAIL与丰田研究院合作开发SceneSmith,利用设计、批评与编排三类VLM Agent的对话闭环,全自动构建高密度、具备真实物理属性(质量、摩擦、铰接机构)的3D室内场景,大幅加速具身智能真机策略的低成本仿真训练。(来源: aihub.org)

SceneSmith

北大与可灵提出MAVIN实现多镜头音视频联合定制生成 : 针对现有视频模型在复杂时间线上对白错位与角色漂移的痛点,北大等团队提出双塔架构模型MAVIN(ECCV 2026 Oral),通过边界感知注意力与身份感知传播,使生成系统能精确按照分镜剧本调度视听元素与角色一致性。(来源: 机器之心)

MAVIN

TTPO:利用错误样本不对称性实现无监督测试期策略优化 : 论文提出测试期策略优化算法TTPO,发现多轮推理中偏离多数投票的轨迹大概率属于绝对错误。通过对一致轨迹进行自蒸馏、对分歧错误进行分组惩罚,在完全无需真实标签的情况下大幅刷新数学与逻辑推理极限。(来源: arXiv)

Self-OPD:Flow Matching模型的无教师在线策略蒸馏 : 论文提出Self-OPD框架,通过在单步生成轨迹上分支多路随机SDE并以自身ODE预测为基线评估优势,完全摆脱对外部复杂教师模型的依赖,有效缓解了扩散与流匹配模型在后训练对齐中的分布偏移累积误差。(来源: arXiv)

斯坦福学者访谈:深入探讨大模型可解释性与内部推理机制 : 斯坦福计算机学者Aryaman Arora在专访中深度解析了AI可解释性研究的前沿分支。他对比了稀疏自编码器(SAE)与因果抽象两种流派的优缺点,指出模型内部确实存在未被吐露的内部推理步骤,并强调理解内部机制不仅关乎安全审计,更是指导架构迭代的理论基石。(来源: 硅谷101)

大模型可解释性对谈

💼 商业

亚马逊宣布将于9月关停运营21年的Mechanical Turk众包平台 : 亚马逊确认旗下先驱级众包数据标注平台Mechanical Turk(MTurk)将于2026年9月30日彻底停止运营。MTurk曾汇聚全球50万零工并支撑了ImageNet等深度学习基石数据集的构建,但在多模态大模型普及以及高阶模型转向专业领域专家标注后,传统简单众包标注市场已加速萎缩并走向历史终点。(来源: CNBC)

MTurk停止服务

字节跳动与美国电影协会就AI影视达成全球版权保护框架 : 字节跳动与代表好莱坞巨头的美国电影协会(MPA)签署谅解备忘录,就生成式AI模型的知识产权保护与正版授权建立全球合作框架。该合作标志着影视工业巨头从前期的法律对抗转向接纳AI视频技术并建立常态化IP授权与分账通道,为专业级AI长片与衍生内容创作扫清商业化障碍。(来源: 雷科技)

好莱坞与字节达成版权合作

首款AI辅助设计mRNA癌症疫苗III期临床过关引高定价热议 : 莫德纳与默沙东联合开发的黑色素瘤个性化疫苗Intismeran公布III期阳性数据,AI贯穿全流程抗原筛选与定制排产。投行预估其“一人一制备”治疗费用或达47.5万美元,引发业界对突破性生物AI疗法商业可及性的激烈讨论。(来源: 量子位)

mRNA癌症疫苗

🌟 社区

《时代》周刊发布2026 AI百人榜引发评选标准与代表性热议 : 《时代》杂志公布2026年度全球AI百大最具影响力人物榜单,智元机器人邓泰华与多位华人领袖登榜。榜单在技术社区引发广泛讨论,部分学者与开发者批评该榜单过度偏向公众知名度与商业热度,而忽略了多位奠定底层理论架构的基础科学家,折射出大众媒体与专业圈在AI价值评估上的认知割裂。(来源: TIME, 量子位)

时代周刊AI百人榜

开发者热议“软件开发零成本”后的分发与注意力困境 : 随着Claude Code与Codex让应用构建门槛无限降低,开发者社区普遍感叹软件生产成本已近乎归零,但真正稀缺的资源已迅速转向“用户注意力与信任分发”。许多个人打造的优秀轻量应用因缺乏分发渠道而无人问津,促使开发者反思未来产品的护城河正从写代码的效率转向工作流沉淀与可扩展架构设计。(来源: Reddit r/ClaudeAI)

沃顿商学院实测揭示AI购物Agent决策极易受偏见颠覆 : 沃顿商学院最新研究指出,当前多模态购物Agent决策鲁棒性较差。哪怕注入一条微弱的评测提及或用户过往记忆片段,模型对客观最优产品的推荐偏好便会发生高达90个百分点的剧烈逆转,表明完全自主代理消费在工业落地前仍需更严格的确定性约束。(来源: THE DECODER)

AI购物Agent评测

DJ平台Beatport全面封禁纯AI生成音乐 : 电子音乐平台Beatport宣布部署检测算法全面拦截纯AI生成曲目。官方调研显示近八成专业DJ排斥在演出中使用纯AI音乐,平台强调AI应作为辅助人类灵感的工具,而非抹杀创作主体性的替代品。(来源: THE DECODER)

Beatport公告

前Meta高管谈AI智能体颠覆组织架构与初级岗位 : 原Meta与Salesforce AI高管Clara Shih在访谈中指出,Agent流水线正在迅速吞噬初级开发、设计与分析职能。企业正加速向“少数资深专家+智能体群”结构转型,传统白领中转角色面临洗牌,组织需重新思考初级人才培养与人类核心价值。(来源: Platformer)

企业级Agent采纳加速与“浅层繁荣”矛盾引共鸣 : 调研显示大中型企业AI采纳率虽超八成,但近七成仍停留在单点探索阶段,仅不到一成进入体系化业务优化。社区指出企业AI落地瓶颈并非模型智商,而是复杂的权限控制、数据隔离与ROI量化指标,倒逼企业将精力转向构建统一的控制平面与治理体系。(来源: 艾瑞咨询)

企业AI智能体成熟度分析

💡 其他

美光披露HBM晶圆面积达DDR5三倍,半导体产能挤压加剧 : 美光在Hot Chips技术峰会上披露,同等容量下HBM4晶圆占用面积约为标准DDR5的三倍,且因极高的制造复杂度与TSV通孔技术导致良率更低。上游存储厂商向HBM倾斜产能的过程中,客观上削减了全球常规DRAM的有效供给,导致算力中心与消费级内存供应偏紧。(来源: Reddit r/LocalLLaMA)

HBM晶圆面积分析

反AI爬虫创作者与前黑客联手开源防抓取指纹工具Lantern : 在艺术家平台Cara遭大规模爬取后,平台创办人与涉事抓取者达成和解并共同开发开源工具Lantern,通过生成单向图像特征指纹定期扫描公开AI训练集,为创作者维权取证提供技术手段。(来源: WIRED)

Cara艺术保护

AWS与Heidi利用CUDA MPS降低75%语音识别算力开支 : AWS与临床AI平台Heidi Health实践披露,通过在EC2 GPU实例上部署CUDA多进程服务(MPS)与Triton服务器,消除了ASR小模型推理时的硬件空转,在保障亚秒级延迟的同时将所需GPU集群规模从16卡精简至4卡。(来源: AWS Machine Learning Blog)

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注