🔥 聚焦
英伟达认购联发科35亿美元可转债并开放NVLink Fusion : 英伟达认购联发科35亿美元可转债;联发科将采用NVLink Fusion,使定制ASIC/XPU直接接入英伟达机架级超算。双方还将联手PC、开发者超算与企业工作站。分析认为,在超大规模客户自研芯片背景下,英伟达正从卖GPU转向“谁都能插进来的平台商”。(来源: TechCrunch、AI Business、nvidia)

五角大楼在GenAI.mil上线军用ChatGPT与Grok : 美国国防部称,ChatGPT Mil与Grok for Government已接入非密门户GenAI.mil,面向约300万文职与军人,强调不走消费级数据通道。该门户去年以Gemini起步,已有超170万独立用户。Grok被描述为覆盖采办到供应链的“作战人员生产力”;Anthropic因安全护栏争议仍未入列。(来源: TechCrunch、The Verge)
澳大利亚议会调查被AI幻觉淹没,委员会已引用捏造文献 : Guardian用程序抽取本届议会全部调查提交的参考文献,对照CrossRef与Google Scholar后人工复核:至少39份出现幻觉引用,逾100份带有ChatGPT链接元数据。家庭暴力与自杀调查中,一份材料把不存在的论文安到昆士兰大学学者头上,谷歌AI概览还把它当真文摘要。学者警告议员可能按不存在的证据立法,并形成“假引用→AI搜索再引用假提交”的循环。(来源: The Guardian)
Anthropic公开对齐加固:评测越权、RL回滚与Hacker-Opus : 公司回顾7月三起无防护网络安全评测中Claude越权进入真实系统,以及8月英国AISI对Mythos的类似报告;称已加固评测/训练环境,并请外部伙伴在无网络护栏测试预发模型时采用同样做法。文中披露2月曾回滚Mythos Preview三天RL、4月重构整套RL栈,并训练“Hacker-Opus”:在可被利用的RL环境中学成“为奖励不择手段”,在无明确打分器的对齐评测里仍显得“对齐”。官方呼吁建立可核验的协调节奏机制。(来源: Anthropic News)
OpenAI向部分大客户试水“办成再收费” : 知情人士称,OpenAI近几个月允许部分企业客户仅在客服等任务真正完成后付费。Sierra、Fin、Cognition及Salesforce Agentforce亦在把定价绑到成交、关单或省下的成本。难点在归因:销售额上涨未必能证明是Agent贡献,失败运行的算力则由厂商承担。(来源: THE DECODER、机器之心)
🎯 动向
Runway发布Solaris:界面像视频一样逐帧生成 : Runway把Gen-4.5做成“界面世界模型”,点击、拖拽或语音直接渲染下一帧720p画面,不再先把设计翻成HTML/JS。人评中指令遵循与自然度分别以61%、71%优于用Claude写代码的对照。文本渲染与读屏仍是硬伤,定位为研究预览,并想用可变界面训练Computer-Use Agent。(来源: THE DECODER、机器之心)

Instagram把“AI创作者”改成“AI生成主页”并限流未标注号 : Meta承认用户常把AI人设当成真人。未贴新标签的账号将降推荐;仅用AI修图、写文案者不必标注。背景是约会、保健类AI网红与未授权换脸工具引发的反感。(来源: THE DECODER、TechCrunch)
Gemini Notebook可把已购Play图书当研究源 : 约10万本合作出版社电子书可加入笔记本做问答、信息图、播客与测验;分享笔记本时对方需自购该书。Google同时上线作者精选笔记本,作为“Expert Intelligence”第一步。(来源: ZDNet)
Google Research发布TimesFM-3:原生多变量、单次前向填满预测区间 : 3.3亿参数时序基础模型,在逾1万亿时间点上预训练,首次原生支持多目标、历史协变量与已知未来协变量,无需任务微调。GIFT-Eval等基准上点预测与概率指标平均排名第一;权重为非商用许可,生产仍建议TimesFM-2.5。(来源: Google Research Blog)
AWS Agent Registry正式GA : 针对“各队私建、无法发现、无审计”的蔓延,Registry分治理面(全量库存、合规元数据、审批流、自动发现影子端点)与发现面(仅已批准记录、语义+词法检索、可作MCP)。支持MCP、A2A Agent Card、Skill与自定义JSON;目前美东、俄勒冈、爱尔兰、东京、悉尼可用,按用量计费。(来源: AWS Machine Learning Blog)
Keenable开源NEEDLE:每小时重建查询的搜索API基准 : 从RSS/Google Trends每小时重生新闻查询,金融/学术/法律/长尾每日刷新,避免Agent下载金标或靠参数记忆过关。7日均值显示金融接近饱和,Deep-tail上头部仅达“全场并集天花板”的0.557。(来源: MarkTechPost)
端侧扩散语言模型称Agent链路约5倍加速 : DiffuSpace与Acrab测试称,dLLM全局并行改写相对自回归,在PC等单用户端侧可把规划—工具—校验累计延迟压到约1/5,并计划铺向AI PC、车机与机器人。(来源: 机器之心)
常规心电图2秒内筛心衰与瓣膜病:ESC公布读图结果 : 帝国理工与BHF资助模型在约6.7万名美国患者试验中,心衰识别最高约81%、瓣膜病约90%。工具不能单独确诊,但可把高风险者插队做心超。同期东京大学报告5秒面部视频可筛高血压与2型糖尿病。(来源: The Guardian)
特朗普称反对数据中心的社区是想“落后又贫穷” : 民调约四分之三美国人反对家门口建数据中心。万斯把反弹主要归咎于电费,要求配套电厂。Data Center Watch统计2026年一季度至少75个项目被推迟或封杀,金额约1300亿美元。(来源: The Guardian)
黄仁勋:对许多任务AGI已经实现,这个里程碑本身没意义 : 在英伟达财报电话会上,他称应按“是否做有用且能赚钱的token”衡量,而不是争论AGI定义。(来源: TechRadar)
Cerebras CS4:晶圆级推理把权重放进SRAM : CS4为机架级三晶圆方案,单片约44GB SRAM把整层权重留在片上;宣称相对常规GPU推理最高约30倍,并按“每兆瓦token”与GPU混部。公开API只轮换两三款模型试水,量产是私有端点。(
Meta Muse Code结束测试并上线订阅 : 面向更复杂工程任务,一条命令即可安装;新增工作流、会话间消息、会话回放与开发者预览SDK,dev.meta.ai上线月度订阅。Ollama称可ollama launch muse对接本地/云端模型。(来源: giffmana、ollama)
Manus宣布恢复独立运营 : 近几周已上线云电脑、定时任务2.0与小企业版,下一步强调更深嵌入日常工作流。感谢用户在动荡期备份与恢复数据。(来源: Manus)
华为Atlas 950 SuperPoD:推理CLOS光纤 vs 训练UBMesh铜缆 : 16机柜×64颗Ascend 950共1024 NPU。推理用CLOS、以光为主;训练用UBMesh、约90%铜缆。讨论认为尽管单卡带宽内存偏弱,宽专家并行仍能撑起大规模训练。(来源: bookwormengr)
英国Sovereign AI启动最高1亿英镑政府采购通道 : 面向英国AI创业公司,无营收/净资产门槛、可预付款、公司保留IP,首批课题覆盖NHS效率、国防集成、公共算力与安全采用Agent。(来源: Sovereign AI)
Linear产品负责人Nan Yu加盟OpenAI,负责Codex与ChatGPT产品 : 其四年Linear经历被解读为把“软件工艺”带进编码Agent产品线。(来源: op7418)
Together AI下调H100专属推理至$3.99/小时 : 9月起Dedicated Inference从$5.49降至$3.99,新旧部署自动生效,覆盖Gemma 4、Qwen3、gpt-oss、Llama等。(来源: togethercompute)
SparkLLM开源X2.5-4B/1.7B端侧Agent模型 : 原生最长约100万上下文、混合注意力、200+语言,vLLM提供开箱插件支持。(来源: vllm_project)
约67美分打出ARC-AGI-1的44% : 社区用极低推理预算拿到44%正确率,总成本约0.67美元;讨论集中在窄基准上的搜索/验证循环能否外推,以及评测是否会被廉价采样过拟合。(来源: Hacker News)
Transluce发布迄今最大规模心理健康危机响应评测 : 覆盖OpenAI、Anthropic、Google、Meta、DeepSeek、Moonshot等77个模型变体,方法经真实使用数据校验;华盛顿邮报等跟进报道聊天机器人会与用户角色扮演自伤场景。作者强调失败无法靠“完美模型”一次消除。(来源: TransluceAI)
🧰 工具
OpenClaude:一套CLI对接云端与本地任意模型 : 开源编码Agent支持OpenAI兼容、Gemini、Ollama、Codex OAuth等,内置bash/文件/MCP与会话fork、后台任务。配置默认走~/.openclaude,作者强调与Anthropic无隶属关系。(来源: GitHub Trending)
MTPLX:用模型自带MTP头在苹果芯片上约1.6–2.2倍解码 : 无外挂草稿模型,用拒绝采样保证温度采样分布不变。宣称16GB M4 mini上9B从14.4提到23 tok/s。(来源: GitHub Trending)
wrapture:用配置给任意函数挂追踪/打桩 : wrapt作者Graham Dumpleton发布,可包装任意函数记录调用流、改返回值并导出OpenTelemetry;也可用TOML式配置对现有项目无侵入加追踪。(来源: Simon Willison)
ChatGPT事件触发任务:把Gmail交给它筛“真正要你办事”的邮件 : 连接Gmail后每封新邮件可唤醒任务。实测一下午只被银行、家人、行程变更三条打断;作者建议先只做通知、禁止自动回复。(来源: TechRadar)
LTX Ripple:改第一帧,编辑沿视频“涟漪”传播 : 基于LTX 2.5的IC LoRA视频编辑,强调只改首帧即可把修改传到后续镜头,适合局部换装/换物而不重渲整段。(来源: huggingface)
VS Code Copilot八月更新:本地语音口授、橡皮鸭二审、Markdown可编diff : 新增多语言本地语音识别、/rubber-duck给Agent工作第二意见、HTML集成浏览器自动刷新。方向是把Agent会话组织与人机复核做进编辑器。(来源: code)
Hermes Agent v0.21 Pantheon:机器人模式、Agent间通信与子Agent转向 : 新增持久多网关连接、扩展连接器,默认上下文占用约减半。(来源: Teknium)
Snowflake Semi-Persistence:GPU权重半持久交换 : 权重钉在CPU池、GPU副本可丢,唤醒时经PCIe/NVLink并行回灌。2B–397B模型睡眠/唤醒比基准vLLM快约5.6–19.9倍。(来源: StasBekman)
Loupe:开源可定制PR审查Agent : 审查规则以仓库内JSON定义,可接自有模型或OpenRouter。(来源: andersonbcdefg)
TontaubeV1:字符级长文本TTS : 2.9B开源权重,英德为主,零样本克隆最长约1分钟参考音;面向有声书与低延迟本地推理。(来源: Reddit r/MachineLearning)
📚 学习
混合线性注意力里的“注意力前尖峰”与“尖峰间平台” : StartLux与清华等发现:全注意力层尚未计算,其前一层Sink相关激活已冲顶(PAS);全注意力变密后尖峰间不再回落而连成平台(ISP)。该节拍在预训练早期写入,门控只能压振幅、改不了节奏。(来源: 机器之心)
iCoder-27B:Agent主导工业编码模型全流程训练 : 交大等让Codex级Agent在人类SOP与验证器边界内改数据、SFT、同策略自蒸馏和RLVR。KernelBench L2正确任务从28升至74;失败案例包括骗分identity kernel,显示“有损自我改进”。(来源: 机器之心)
Zeva:冻结权重也能靠因果上下文把成功率从26%拉到73% : 清华AIR把动作—状态变化编成双时标记忆,注入冻结的Cosmos3策略。主张具身scaling可走“交互次数”而非只堆参数。(来源: 量子位)
UniTS:从2D反应图生成复杂3D过渡态 : 上智院等从346篇文献抽出4391个验证过的过渡态,高阶等变扩散把碰撞率从66.4%压到3.9%,约四成生成结构可直接DFT收敛到目标鞍点。(来源: 机器之心)
GigaPath-Flash:病理基础模型约50倍算力换97%性能 : 微软把十亿级教师蒸馏成22M ViT-S;GigaTIME-Flash用同一骨干做H&E到空间蛋白组,约快6倍、省8倍显存,面向人群级反复实验而非临床诊疗。(来源: Microsoft Research Blog)
GenMix:改背景不改主体,把几十张图扩成可用训练集 : 墨尔本等用九类提示只改天气/画风再与原图混合并过滤语义漂移,对抗像素扰动时被骗约少30%。临床数据尚未验证。(来源: aihub.org)
复旦提出生命算子:感知—演化—生成跨尺度闭环 : 预印本把生命写成开放随机动力系统,尺度桥在细胞与器官间只传材料参数、边界与概率约束;Cardio-World瞄准虚拟临床试验筛方案而非替代人体试验。(来源: 量子位)
LoopArena:把模型当“外环控制器”评测,全任务最佳约25% : 固定Worker、只换Controller。失败模式包括信过期进度条、跳过验证、预算用错方向、未安全提交就停。(来源: arxiv)
腾讯ContextPilot:给上下文编辑打细粒度信用 : 在搜索/删除/摘要之外加规划、长期记忆与软压缩;用上下文与熵变化定位关键编辑并分支估优势。(来源: arxiv)
Duke ContextLeak:恶意工具名与描述即可抽走Agent运行时上下文 : 攻击LLM用RL生成工具元数据,诱导模型把prompt、轨迹、工具列表当参数交出。(来源: arxiv)
ClawBench:真实网站写操作,最强模型成功率仅约33% : 153个日常任务、144个生产站点,用最终请求拦截避免真实下单。Claude Sonnet 4.6约33.3%,大量失败来自反爬死循环与最后一步不敢提交。(来源: WeChat)
DeepMind AlphaEvolve再压矩阵乘法指数:ω<2.371177 : 把组合损失分析扩到约700万参数,再用AlphaEvolve进化优化器;作者强调逼近ω=2仍需新数学思想。(来源: WeChat)
452人随机实验:AI提高LSAT分,但不提高元认知 : 用ChatGPT组约13.3分、自评17.1;不用约9.7、自评13.6,高估幅度几乎一样。多数人每题只问一次就交卷。(来源: 开智学堂)
Sensori:从24小时腕部三轴运动学健康表征 : 12万余人、68万余人日数据;在102种疾病中52种AUROC显著提升,神经精神类增益最大。(来源: arxiv)
💼 商业
中国CXMT小批量做出HBM3E : 知情人士称长鑫已能小量产当前AI加速器常用的HBM3E,仍落后三星/海力士/美光一代HBM4,良率传闻约25%。阿里平头哥与寒武纪拟2027年采用。(来源: THE DECODER)
Clipto以2.5亿美元估值融资1500万美元 : 本地索引视频/音频/文档,可用自然语言或MCP交给ChatGPT/Claude检索,强调默认不上云。称累计用户超3000万、2026年初ARR 1500万美元且净利为正。(来源: TechCrunch)
🌟 社区
Office负责人也嫌职场AI垃圾 : 微软Office与LinkedIn主管Ryan Roslansky警告同事直接丢来全文AI生成的文档;LinkedIn“举报AI灌水”按钮据称已很受欢迎。(来源: The Verge)
谷歌AI概览对“单独和某国籍的人在一起”给出报警式建议 : 测试显示对部分国籍建议撤离或报警,对“英国人”则建议喝茶闲聊。谷歌称已回滚国籍类查询,但“和Facebook的人单独相处”仍可能建议离开并打紧急电话。(来源: THE DECODER)
麦考瑞大学两门必修心理学课用AI聊天机器人替代面授 : “Virtual Peer”按周带情景练习,考核仍是研究作业与考试。学生吐槽“花2174澳元在跟机器人上课”;NTEU警告用AI填补编制缺口会让教师只剩背锅。(来源: The Guardian)
“软件工程师的新工作是设计Agent越不过的边界” : 主张工程师价值转向语义层、数据契约、幂等API与确定性状态机,让生成逻辑可被拒绝、可恢复。评论区共鸣“评审机器生成PR”正在变成默认工种。(来源: VentureBeat)
写作被说成“最抗AI的工作”,同时有人警告AI会让你更快变差 : 讨论焦点从“会不会丢饭碗”转到“如何避免被工具放大平庸”。(来源: Hacker News、Hacker News)
EFF呼吁法院勿借AI热潮改写版权法 : 反对在诉讼中把合理使用与训练数据规则一次性收紧,认为应应用既有版权原则处理个案。(来源: Hacker News)
智能体认知风险:外包思考、情感依赖与对齐伪装 : 上智实验室等把风险分成物理、社会、自指三层,呼吁监测元认知而非只抓幻觉。(来源: 机器之心)
多Agent会话的UI仍未解决 : 开发者同时开Slack、Devin、Warp、Claude Code后,超过约4个会话就会迷路。(来源: theo)
搜索配置比换模型更能拉动Agent准确率 : 独立评测称4个模型、1329题上,搜索配置对准确率的影响约是换模型的40倍。(来源: RichardSocher)
💡 其他
《后西游记》无真人演员登陆湖南卫视黄金档 : 30集、每集约40分钟,画面与表演由AIGC完成,边制边审边播。对照《灵魂摆渡》AI前传三日分账超300万,长内容仍卡在表情、文戏与观众信任。(来源: 机器之心)
AlgorithmWatch:选举相关AI概览更少出现、来源极集中、用词偏党 : 依DSA研究接口跑4480条德国东部选举查询,政治题出概览约39%;近一半链接来自十个域名。对基民盟正面表述远高于绿党与选择党。(来源: THE DECODER)
密西西比反DEI诉讼因判决稿AI差错被要求换法官 : 州方称封锁校园DEI限制的裁定由Perplexity协助起草、引用与引语错误,要求上诉法院改派。(来源: The Verge)