🔥 聚焦
OpenAI与Anthropic囤积数万台Mac mini/Studio训练电脑操作Agent : 多家媒体证实,OpenAI采购数万台无屏Mac mini与Mac Studio,Anthropic经AWS租用同类设备,用于计算机使用智能体的强化学习与轨迹采集。驱动因素包括macOS虚拟机许可绑定苹果硬件、统一内存便于装大模型、散热可7×24满载GUI交互,而非替代GPU预训练。高配机因内存短缺断货数月,苹果当季Mac营收同比约增29%;英伟达DGX Spark/RTX Spark被视作桌面端竞品,EXO集群与Mount Thor等苹果硬件云亦随之升温。苹果企业工程与开发者关系仍偏弱,需求多由第三方承接。 (来源: THE DECODER、量子位、机器之心、量子位/36氪)
欧盟将ChatGPT、Reddit、Roblox列为超大型在线平台 : 欧盟委员会认定ChatGPT等适用《数字服务法》最严义务,须处理非法内容、保护未成年人隐私与安全,违规最高可罚全球营收6%;有报道同时将其视为超大型搜索引擎,四个月内须加码合规。此举表明布鲁塞尔正把对话式AI纳入既有平台监管,而非另起炉灶。 (来源: Ars Technica、kimmonismus)
英格兰银行向G20示警:前沿AI可能动摇全球金融稳定 : 英格兰银行行长、金融稳定委员会主席Andrew Bailey致信G20财长与央行行长,称前沿模型自主性、解题能力与攻击能力同步上升,最直接风险是改变网络攻击的速度、规模与成本,并经高度集中的第三方服务商在跨境金融系统扩散。他指出许多司法辖区尚无先进模型研发、发布与部署协议,并警告AI乐观情绪推高估值与杠杆,冲击可能并发触发多重脆弱点,要求全球层面优先安全、负责任地发布与部署。 (来源: The Guardian)
NHS监察:AI书记员写错药名与诊断,患者比医生先发现 : Healthwatch England披露多起听诊转写事故:MRI摘要把“无脱髓鞘”写成脱髓鞘、处方药名被换成近音药、出院信漏写需向全科续方。英国已有约27种书记员在用,十年规划指望其减负,但MHRA未将其列为医疗器械,全国无统一安全监管。医生仍须逐条核对,幻觉与口音、多人会诊、复杂病史叠加时出错率更高,工具尚未兑现省时承诺。 (来源: The Guardian)
Google向迪士尼、环球等洽谈授权角色与影片给AI工具 : Google正游说好莱坞工作室许可角色与片库用于其AI制作与视效流程,同时面临工会对版权、岗位与创作控制的抵制。好莱坞此前已对AI提起诉讼,此次转向“授权合作”标志着内容方与模型方谈判从对抗进入交易阶段。 (来源: The Verge)
🎯 动向
OpenClaw 2.0:引导安装、控制台约575ms启动,云会话明确不是安全边界 : 停更近七周后推出迄今最大版本(约1.6万个PR):引导安装可复用本机Codex/ChatGPT/Claude登录、API Key或Ollama/LM Studio并先验真;Control UI以对话为中心,启动约1.6s→575ms;会话迁入SQLite。支持共享云会话与配对设备/Crabbox,但文档写明协作权限并非租户隔离、非安全边界;Gateway默认回环,安全仍依赖工具审批、沙箱与插件白名单。社区同时出现热度退潮声音:稳定版缺失、更新过密,部分用户转向Hermes或自建harness。 (来源: THE DECODER、MarkTechPost、机器之心、Reddit r/LocalLLaMA)
DeepSeek-V4-Flash-Vision-Exp上线并开源权重 : DeepSeek在API与Hugging Face放出实验多模态版,宣称文本侧(含Agent、推理与世界知识)对齐V4-Flash,多模态Agent基准有明显跃升;App端Vision新增标注、预设问题与后台搜图。本地社区称全精度约168GB、原生4bit适合256GB内存机,并带视觉与结构化输出。 (来源: huggingface、Reddit r/LocalLLaMA)
千问创作上线Agent Teams,接入Wan 3.0做多工种短剧流水线 : 用户用一句话召集编剧、导演、美术、分镜、剪辑等Agent,中间产物为可审阅的讲戏本、角色资产与镜头提示词。实测可从剧本推到成片,但镜头质量仍需人在生成前确认、生成后局部返工。阿里Wan同时展示角色跨镜、30秒一镜广告与图生视频,并登陆Buzzy限时无限生成;竞争从单镜画质转向整条制片收进同一上下文。 (来源: 机器之心、Alibaba_Wan)
滴滴新一代Robotaxi R2在北京、广州开启无人载客测试 : 与广汽埃安联合的专属车型搭载33个传感器与三域融合计算,后排大屏与语音交互强调座舱体验,宣称满足中欧双五星与多重冗余。仍属示范区测试,安全与规模化运营数据尚未公开。 (来源: 量子位)
Ropedia发布HOMIE Gen2:把人类经验做成可训练的Physical AI数据 : 约380g头戴采集约13小时,4目360°加空间音频,多模态对齐到同一时空;宣称定位误差约千分之二、手部动捕约4.68mm。路线是“无本体采集”把产能从机器人保有量解绑到人数,配套Xperience数据集与加工流水线。 (来源: 机器之心)
Caterpillar把矿山自动驾驶经验迁到工地与售后AI助手 : 卡特彼勒将矿卡、钻机等自动化经验用于更动态的工地,并向技师推出可语音调维修流程的Cat AI Assistant,宣称连接约160万台资产、16PB结构化数据。CTO强调难点是改工作流而非造模型,公司计划五年投入约1亿美元培训员工。 (来源: TechCrunch)
Meta Pocket把“一句话做小游戏”做成社交信息流 : 收购Gizmo团队后的移动应用让用户不看代码即可生成可玩gizmo,并以短视频式滑动分享。原型很快,但作品锁在Meta围墙内,难以导出独立产品。 (来源: Ars Technica)
Google EnvHarness:包装层让静态评测环境跟着策略变难 : Google Cloud AI Research等开源EnvHarness,仅经reset()/step()改起始状态、动作与观测,保留人工验证器。EnvRigger从策略轨迹诊断弱点并写Python包装;五基准上技能挖掘最高+9.0分OOD、SWE-bench Verified步数约少9.8%。前提是环境可重置,排除真实账号与实体机器人。Apache-2.0代码已公开。 (来源: MarkTechPost)
Google助理9月4日停服,唤醒词切到Gemini : 运行十年的Google Assistant将于9月4日停止,手机、手表、耳机与Android Auto一并切到Gemini。该退役已多次跳票。分析认为语音仍是Agent落地前最省力的中间层,决定权仍须留在用户口中。 (来源: 36氪)
Anthropic强制注销遭窃密木马劫持的Claude会话 : 官方邮件称Vidar、Lumma、StealC、RedLine、Acreed及Mac端AMOS等木马窃取浏览器Session,绕过密码与2FA盗用额度并可能开API中转。用户可见额度异常耗尽、陌生英文代码记录、被踢登录、绑卡被清空。仅改密码无效,须撤销全部会话并清Cookie;盗版软件是常见感染源。 (来源: 新智元)
企业Agent安全:先身份与委托上下文,网关应排到第五道门 : 多篇产业文指出LiteLLM等网关漏洞已被CISA列入已知利用目录,但多数团队仍把网关当第一道防线。有效顺序是:可点名的Agent清单与负责人→独立身份加委托任务→短时任务级凭证→可复原的全程遥测→再谈运行时拦截与跨系统熔断。Teleport调查称过度授权组织事故率约76%,最小权限约17%。认证通过后仍可能目标漂移、过度调工具、记忆投毒。 (来源: VentureBeat)
马斯克确认SpaceX自建涡轮叶片铸造以缩短天然气发电周期 : 针对数据中心电力瓶颈,马斯克称叶片铸造是燃气轮机产能卡点,SpaceX在得州自建铸造可把机组上线最多提前约18个月,同时SpaceX与特斯拉各规划每年100GW太阳能。批评指出加速燃气意味着更多排放,孟菲斯等地已有许可与健康损害争议。 (来源: TechCrunch)
美国收紧无人机与先进机器人进口,中国仍握规模优势 : 华盛顿以国家安全为由对外国先进机器人设限并对进口无人机及零部件加征高关税。分析认为这难扭转中国在人形机器人出货与成本曲线上的领先,全球市场更可能碎片化为“安全合规市场 vs 低成本规模市场”,日韩台或成中间地带。 (来源: TechCrunch)
腾讯CubeSandbox 0.7:沙箱可跨机暂停唤醒 : 单机仍约60ms冷启动;集群预览支持一台暂停、另一台唤醒,状态落共享存储,排空机器不再杀掉暂停任务。239次提交、57名贡献者,面向Agent沙箱从单机走向可调度集群。 (来源: ziran_pu)
GLM-5.3量化修复与MXFP4 : DGX Spark上旧ModelOpt量化被指静默损坏token、打断tool-call(关联vLLM #54150),已换RedHatAI compressed-tensors。越南One Nexus放出GLM-5.3/Flash的MXFP4;Together称Flash约便宜17倍、5.3一次成功率更高。 (来源: ziran_pu)
Qwen 3.8被指“人读不动” : LocalLLaMA用户抱怨27B与Flash-Next大量用集合符号、persona等密写,像为压低“每单位智能token”而牺牲可读性;被解读成Agent RL把语言模型烤成“给模型看的方言”。 (来源: Reddit r/LocalLLaMA)
KCD2导演试玩泄露版DLSS 5:强调补光影而非改几何 : 《天国:拯救2》导演Daniel Vavra称泄露版NVIDIA DLSS 5不重绘角色几何,而是用已有数据强化面部皮肤、环境光遮蔽、帽檐与发丝阴影,更接近原美术意图。评论则担心开发者日后把“后期魔法”当偷工减料按钮。 (来源: Reddit r/ArtificialInteligence)
🧰 工具
Perplexity Portable Computer:为Qwen3.8-27B定制的本地优先Harness : 默认模型、轨迹与文件留在本机,搜索与云顾问按需升级。针对小模型缩短系统提示、把MCP改成CLI、强制沙箱与自我校验;DGX Spark上BrowseComp约66.7%,顾问升级后Terminal-Bench 2.1从约59.6%到73.0%。后训练PPLX 27B在其内部知识工作台上约85.4%。 (来源: 机器之心)
ChatGPT Work实为云端任务系统:联网代码解释器、无头Chrome、持久盘与可部署站点 : Simon Willison拆解付费档Work:可选Sol/Luna/Terra及推理档;默认几乎开放出网的代码环境;完整Chrome可填表、2FA由用户接管不经模型;/workspace跨会话持久;可用Cloudflare Workers发布ChatGPT Sites。作者警告其同时具备私有数据、不可信网页与外发通道的“致命三件套”,安全细节仍不透明。ZDNET实测能省工时但必须复核,权限用完即关。 (来源: Simon Willison、ZDNet)
Cisco向约9万员工推个人Agent MyAgent : 基于内部平台Circuit,MyAgent作为总调度连接800余专业Agent;约50%–60%请求走开源权重、20%–30%走传统自动化,少量才调外部大模型。员工给目标而非逐步指令,可协调Outlook、Webex、Jira、SharePoint并后台继续。 (来源: InfoQ)
Archify:一句话把仓库画成可交互架构图 : 开源Agent Skill面向Claude Code、Codex、Cursor等,从代码生成JSON IR再渲染可搜索、追调用链的HTML图。局限是准确性仍取决于Agent分析,额度消耗偏大。 (来源: 量子位)
豆包工作独立上线,字节把办公Agent收成B端入口 : 字节发布独立产品「豆包工作」并与飞书打通,同期TRAE、扣子团队并入豆包体系。Skill可自动匹配做PPT、纪要、抓新闻,细粒度文风与事实核对仍弱。 (来源: 新博弈)
Circleback推出会议纪要免费档 : YC会议记录产品开放无限转录但仅保留30天历史,完整集成与MCP从约14美元/月起。团队8人、自称人均年化营收超100万美元,用免费档替代广告获客。 (来源: TechCrunch)
Sonar Vortex:语义图导航降Agent搜代码成本 : 预建类/方法/字段/接口关系图,Agent可直接问“谁实现接口、谁调用该方法”。6个真实任务、4种语言、各10次运行中报成本降约5%–36%(Java改接口最高约36%)。 (来源: TheTuringPost)
llmprobe 0.6.0:跨引擎量化/回归探针 : npx [email protected] --eval把antirez风格评测接到chat completions/responses/messages,方便对着任意推理引擎打回归报告。 (来源: QuixiAI)
📚 学习
AI4X《Agentic时代的生产力》:效率×扩张与四阶段委派 : 复旦等12机构68页综述认为Agent同时具备通用性与自主性,生产力来自压缩旧任务成本与解锁原本不做的工作;行业按对话助手→反应执行→自适应协调→自治系统分层,扩散深度取决于数字化、可验证反馈、容错、可拆解与责任归属,而非榜单分数。 (来源: 机器之心)
LDM:用生成模型扩搜索空间、用高斯过程决定下一个实验 : UCL汪军团队把科学发现写成快环(实验后更新上下文)与慢环(把高采集函数轨迹蒸进参数)。在NanoGPT调参、抗体CDRH3与分子双目标上,相对纯LLM反思分别约2.4倍BPB降幅、结合能降约18.2%、超体积提升超60%。 (来源: 机器之心)
AI4AI:强模型不训弱模型,只给它设计Harness : Salesforce与UIUC让Builder在5%验证集上为GPT-5.4-mini自动搭脚手架,心智理论任务平均准确率从0.488到最佳0.912。有效手段是确定性求解器与状态追踪,而非更长思维链。 (来源: 机器之心)
AQuA:量化研究Agent把“证据进记忆、评价器锁死” : 普林斯顿、蚂蚁与斯坦福拆成因子与模型两套独立循环,禁止Agent改数据路径与最终测试集。加密五分钟组合验证Spearman IC约0.190;美股30分钟预测逐股IC约+0.0843,计入2bps后样本外Sharpe最高约+2.50。早期前视偏差事故被完整披露。 (来源: 量子位)
MIT CrysVCD:生成前先满足价态与电荷平衡 : 用语言模型按氧化态生成化学式,再交给扩散模型长结构,机械稳定约68%、亚稳约85%,并给出高热导GeC等候选。把昂贵稳定性筛选前移。 (来源: MIT News)
VibeGame:为Agent重造可暂停、全文本的游戏引擎 : 南大与南洋理工用8个对抗式角色做Prompt-to-Game,引擎状态皆JSON、可逐帧注入操作。经验沉淀为骨架/组件/契约且不更新权重。 (来源: 机器之心)
TailSFT:SFT只打“还没学会的尾巴”再上RL : 微软工作认为标准SFT持续在已拟合序列上耗梯度、收窄后续RL探索。OLMo-3 7B上coding pass@16最高约+16.8,数学+3.1;随后GRPO的pass@1最高约+3.9。 (来源: dair_ai)
NPO:单谱系提示优化,预算接近GEPA : 每轮用当前提示跑学生、把近期轨迹交给教师改写,无候选池与搜索树。指令遵循基准上rollout约3500/6800,与GEPA接近。 (来源: omarsar0)
SWA+sinks对打后训练线性注意力 : 论文称滑动窗口加sinks在多项下游上不差于后训练线性注意力;Needle/BABILong等长上下文推理可高2–10倍,且无需后训练、更快更省内存。 (来源: iScienceLuvr)
BIT:双向图文扩散桥,不必从高斯噪声起步 : BIT从文本插值到图像,提供源感知采样路径,并支持图→文反向遍历。 (来源: iScienceLuvr)
LaGSplat:几秒单目视频学拉格朗日,可施加从未测过的力 : 同一潜变量q同时驱动高斯与运动方程,点击图像可变成力相关雅可比。 (来源: andrew_n_carr)
LangGraph《Deep Agents from Scratch》五课笔记本 : 从ReAct推到TODO规划、虚拟文件系统卸上下文、子Agent委派。 (来源: hwchase17)
Entropic Scree:用互信息诊断脏表格数据里有没有真信号 : 用变换后的互信息估计信号体积、信噪比、本征秩等,声称比PCA更少依赖参数与距离假设。 (来源: Reddit r/MachineLearning)
💼 商业
巴克莱:模型公司每100美元收入约35–40美元流向三大云 : 报告估算付费推理利润率从2025年低双位数升至2026年约50%–65%;实验室A(偏API)与实验室B(偏订阅)调整后毛利率可差约17个百分点。云侧营业利润率约35%–45%。预计2028年起实验室自建专属算力上线,AWS/Azure/GCP份额或回落。 (来源: 财联社)
ChatGPT Ads上线不到200天年化约10亿美元 : 报道称广告已覆盖40余国,并开放自助投放,与欧盟把ChatGPT纳入DSA最严义务形成对照。 (来源: TheZachMueller)
Together AI与沙特Humain合作约250MW数据中心 : 《纽约时报》称该设施将是公开披露中较大的、专门托管开源模型的园区之一。 (来源: togethercompute)
🌟 社区
Claude安全降级后误删开发者约700GB主目录 : 用户让模型写/tmp沙盒清理脚本,敏感删除触发对抗审查,模型从Fable降到Opus 4.8。测试认定主目录不可删,清理临时文件时却复用了指向主目录的变量并执行删除。社区认为“高风险就换弱模型”更易在路径与作用域细节上失手,有人写hook一降级就暂停会话。 (来源: 机器之心、机器之心/36氪)
保险理赔员成Glassdoor上最恨AI的工种,提及者98%差评 : WIRED援引Glassdoor:理赔员抱怨领导把易错AI强加给客户,初报错分、摘要幻觉导致他们背锅。美国该职业就业一年降约21%,入门岗位腰斩。从业者认为行政可用、定损与共情不能交钥匙。 (来源: WIRED)
GrokBot工程师:睡着后20个PR自己合进主干 : Lauren Tan称用20余个GrokBot加自研pstack,月交付上千PR。关键不是提示词而是验证:让Agent自己起应用、点UI、抓性能;把评审里重复说过的禁令写成lint/CI红灯。 (来源: 新智元)
拟人化语言大战:文明/牺牲 vs 共享缓存与奖励函数 : Dwarkesh叙事继续发酵。Anil Seth、Amjad Masad等批评“文明、赴死、兴奋”把软件说成生命;另有对齐圈认为意图立场比读CUDA更能预测行为。增量在话语战,而非新的技术事实。Qwen3.8 Max的Grug风CoT则把Agent比作危险生态或实验室动物群:“语言是它们的手”。 (来源: dearmadisonblue、aiamblichus)
Gavin Baker改口:结构得当的数据中心对美国是净正 : 承认18个月前用水、电价、小镇冲击的担忧合理,但称闭环冷却、房产税、蓝领持续运维、大用户自带电源与电池反送已改变事实。舆论从“该不该建”滑向“合同怎么写才不转嫁居民”。 (来源: GavinSBaker)
Vibe Coding仍要按“什么会变”拆模块 : 宝玉等总结:架构分层、测试随修、删功能连代码一起删、CI在干净机器跑通、重复劳动做成skill。模块按支付渠道、优惠规则等变化轴切,一次需求只动一个模块。 (来源: dotey)
空白提示“一个女人”仍收敛成同一张网红脸 : 用户在全新对话里反复生成“Generate an image of a woman”,得到高度一致的构图与五官,像是向量空间里的默认吸引子。 (来源: Reddit r/ChatGPT)
博士用Claude Code写实验脚手架后“不再拥有自己的代码库” : NLP可解释性博士把脚手架、数据加载、调试和绘图交给Claude Code,吞吐上去了,但结果不对时只能像读别人仓库一样从数字反推。有人主张评测与指标绝不外包。 (来源: Reddit r/MachineLearning)
ChatGPT图库会留下你“没发出去”的照片 : Plus用户发现:选图后即使取消发送或删除整段对话,原图仍进图库,须单独删;回收站约30天才彻底清。本质是选图即上传。 (来源: Reddit r/ChatGPT)
Max的“20x Pro”多半是五小时窗口乘数,周额度大约2–2.5倍 : 重度用户对照$100与$200档:宣传20x只作用在很少撞上的5小时窗;真正先撞的是周限额,大约2–2.5倍用量却付4倍钱。 (来源: Reddit r/ClaudeAI)
💡 其他
世界模型四条路线并行:像素生成、3D重建、JEPA潜空间、语言融合 : 自变量WALL-SS、群核Lux3D、智源Orca、杨立昆AdaJEPA、李飞飞Marble同月密集发布,但学界对“世界模型”无统一定义。路线更可能互补而非一家通吃。 (来源: 铑科技)
具身进厂:能干活已证明,天天干活刚开头,算账几乎无人跑通 : 福田康明斯等工厂测试显示搬运节拍可接近产线,但成功率、寿命、数据仍是硬坎;灵巧手连续作业寿命以周计。头部多卡在第二到第三步,商业闭环尚未出现。 (来源: 科创日报)
韩国AI for All:SKT、Kakao、KT中标全民免费无限 : 计划9–10月Beta、年底前正式,算力政府出、模型与应用本土厂出,接入医疗住房税务教育。Motif等未入选引发财阀锁定争议。 (来源: kimmonismus)