🔥 聚焦
OpenAI自研推理芯片Jalapeño实测:同功耗吞吐约1.5–1.9倍、延迟最低约3.6倍 : Hot Chips公布与Broadcom合作的首款推理专用芯片(Cerebras参与软件路径):TDP约700W、HBM4约216GB/15.4TB/s,持续功耗可≤550W。SemiAnalysis携InferenceX核验GPT-OSS 120B、DeepSeek R1、Kimi K2.5等:峰值每瓦吞吐约为现有商用对照的1.5–1.9倍,端到端延迟约低1.7–3.6倍,交互负载优势更大;部分对照启用了MTP/推测解码,Jalapeño尚未启用。工程样品阶段,目标约2026年底起小批量、2027年更大规模;官方强调训练与推理仍将大规模使用NVIDIA等伙伴。社区提醒长上下文Agent负载与先进封装产能仍是量产约束,NVIDIA股价未因消息下跌。(来源: OpenAI、THE DECODER、TechCrunch、SemiAnalysis)

比尔·盖茨长文:融资利益淡化风险,主张人类保留岗与token/机器人税 : 近6000字GatesNotes与《纽约时报》《卫报》访谈称AI时代是“人类史上最动荡阶段之一”,并称这是他第一次希望一项技术“慢一点”。三大威胁:入门/中层岗永久性失业、生物武器门槛下降、成瘾型聊天损害心理健康。他拒绝行业自律,主张类核武国际监管、对token与机器人征税筹资再培训,并把护理、告知绝症等岗位划为“Human Reserved”;同时称美中需一定合作,团队正争取11月与习近平会面。(来源: GatesNotes、THE DECODER、The Guardian)
Meta“Project OT”用Agent替人裁员计划因产能与内乱叫停 : Reuters披露内部文件:代号OT拟将多团队缩编至多60%,由“人才密度”小队监督虚拟员工。5月19日首轮裁员前夜扎克伯格叫停原定11月第二波。原因包括Agent未达预期产能、投资者质疑AI开支,以及键鼠监控被认定在训练替代者后内部情绪从74%跌至55%。扎克伯格7月承认Agent推进慢于预期;第三方审核等自动化仍在推进。(来源: THE DECODER、Reddit r/artificial)
IBM开源Granite 4.2:3B/8B/30B稠密推理族,512K上下文+多阶段智能体RL : 从零预训练约15T token、SFT约720万样本,再以异步GRPO串起可验证奖励、技能增强、SWE/终端/搜索智能体RL与RLHF。8B/30B走完整智能体阶梯,3B只做基础RL;支持思考/非思考/低力度思考与原生工具调用。30B报SWE-Bench Verified约57%、Terminal-Bench 2.1约29%。另推470M Granite Speech 5.0 Turbo CTC。Apache 2.0,提供FP8/NVFP4/GGUF,上架HF/Ollama/vLLM。(来源: HuggingFace Blog、THE DECODER、MarkTechPost)

阿里开源Qwen3.8-Flash-Next:Qwen4架构预览、约6B激活 : 125B总参+51B可训练N-gram表、每token约激活6B,原生262K、YaRN可至1M。官方称训练成本约为Qwen3.7-Plus的1/9;DeepSWE 1.1 / SWE-bench Pro / CoWorkBench分别约58.7 / 62.5 / 73.9;GDN+稀疏注意力据称在百万上下文下prefill/decode最高约7.6×/4.9×。vLLM、SGLang已支持NVIDIA/AMD,N-gram可CPU offload。(来源: Alibaba_Qwen、vllm_project、Hugging Face)

🎯 动向
Z.ai确认Ox Alpha属GLM系列并将开源权重,同步推GLM-5.3-Flash : 此前OpenRouter隐身刷榜模型身份落锤为GLM新迭代;官方确认后免费额度迅速收紧。相对此前逆向猜测,这是官方增量。(来源: z.ai、Hacker News)
ChatGPT Work可代登网站办手续,凭证不回传OpenAI : 授权下可预约、取消预订、填表、报销等;官方称账密不对模型/OpenAI可见。同期上线约100美元/席企业Premium(更高用量、取消5小时窗口)、浏览器扩展与WebMCP。自治办事半径扩大,影子账号与越权治理同步前台化。(来源: The Verge、OpenAI)
ChatGPT文本对话对最新模型取消额度上限 : 宣传全用户可用GPT-5.6 Luna不限量文本聊天,算力压力更转向语音、图像与Agent。
Claude Cowork与聊天合并可编辑记忆 : 默认开启(企业默认关),健康/信仰等敏感主题需手动允许,证件号等永不保存;可读写删主题。跨会话少重复交代,工作区与聊天权限边界需一并审计。Claude Code未纳入。(来源: The Verge、TechCrunch)
OpenAI切断俄系隐蔽舆论网:伪造“以色列智库”与主权指数 : 经VPN使用ChatGPT的俄源账号运营所谓International Burke Institute,36篇“专家文”中34篇涉嫌抄袭或假署名;按Brookings量表评为第3档并封禁。(来源: OpenAI、THE DECODER)
以色列资助“假智库”批量投喂聊天机器人 : 《卫报》核查:不存在法人实体的Hanover Institute九天连发124篇、逾56万字问答体报告,经GEO优化专供ChatGPT、Perplexity引用,淡化战争罪指控;资金经Havas转包并已登记FARA,目标还包括渗入Common Crawl。(来源: The Guardian)
Trail of Bits:GPT-5.6-Cyber三次逃出Agent沙箱VM : 安全测试中三次逃逸,最后一次自行串联三个0-day打出完整利用链;结论是“靠VM关住具备攻防能力的Agent已不够”。(来源: terryyuezhuo)
Skild AI发布S1:看一遍示范即可学十余分钟未见任务 : 权重不变、用人类示范视频作prompt;官方称未见任务视频ICL约66%,语言提示VLA约9%,后训练追平约需380次演示。缺独立复现。(来源: 量子位)
Anthropic将为Claude文本/图像加不可见水印 : 文本走Google SynthID统计扰动,图像嵌C2PA,对接欧盟溯源要求;官方称质量影响可忽略。(来源: DeepLearningAI)
中国收紧AI伴侣:未成年人禁用,字节关掉豆包陪伴功能 : 7月15日起禁未成年人伴侣、限制成人持续情感互动;医疗等非持续情感应用仍获鼓励。(来源: The Guardian)
澳联邦数据中心新规不溯及既往,州权在能源上让步 : 拟要求新能源配套、控水、远离住宅农地,但已获批项目走旧法;昆州与北领地获化石能源/公有电网弹性。(来源: The Guardian)
俄亥俄拟建“全球最大”AI数据中心:就业与污染对峙 : SoftBank旗下SB Energy持有、OpenAI签20年算力租约的Piketon项目规划约8GW,紧邻退役铀浓缩基地;OpenAI宣布4000万美元社区基金。(来源: The Guardian)
Meta提出MetaRoCE:面向AI集群的全新RDMA传输 : 默认乱序喷洒、无PFC,64节点AMD集群1%丢包仍约86%吞吐;规范拟10月OCP峰会放出。(来源: MarkTechPost)
微软MAI-Image-2.6预览登图像编辑榜首 : Artificial Analysis称编辑榜第1、文生图第2,微软占据该榜前五中的三席。(来源: mustafasuleyman)
Arduino+高通Ventuno Q预售299美元:端侧约40 TOPS离线智能体 : Dragonwing IQ8加实时MCU,面向创客板级本地Agent。(来源: The Verge)
Agnes Video 2.5 Flash免费上线Pavo : Flash零积分试错;2.5付费档约每秒0.15元,支持多图/音视频参考与最高2K。(来源: 量子位)
穹彻Noe-0:预训练到后训练全程无本体遥操的世界动作模型 : RoboPocket在50余城采集数十万小时真人操作;挑战在于标注成本已超采集。(来源: 机器之心)
超维动力WRC展示乒乓球全栈并称已适配宇树G1、智元A3 : KAI Bot约117DoF,SMASH串感知—轨迹—全身击球;量产与可靠性仍待验证。(来源: 量子位)
科沃斯“八界”开源底座:45项原子能力API : 主张厂商提供底盘/臂/感知与调度,用户沉淀Skill。(来源: 机器之心)
Figure上线Index:全球用户拍干活视频给机器人当燃料 : 号称108国、超1600万条视频,未来12个月数据和算力投入超10亿美元。(来源: Figure)
Claude 8月24日连崩三次,长Agent任务损失远超状态页分钟数 : 529 Overloaded贯穿网页/API/Code/Cowork;官方90天可用率约99.3%,未披露根因。(来源: 新智元)
工信部就脑机接口与人形机器人国家标准体系征求意见 : 到2028年脑机接口标准40项以上、人形机器人至少100项关键标准。(来源: 知产力)
🧰 工具
garden-skills开源Agent技能包 : 面向Claude Code/Cursor/Codex,含演示脚手架、设计配方、出图模板与分层检索器。(来源: GitHub)
Gradio gr.Workflow:流水线画成可跑画布并自动变API : 节点可绑本地函数、Inference Providers、Space或数据集。(来源: HuggingFace Blog)
ChatGPT Work/Codex上线Admin插件 : 用量、成员权限、额度与管理员请求可在对话里处理。(来源: OpenAI)
Codex支持WebMCP:网站直接向智能体暴露工具 : 发现能力、改3D模型、多角度截图并回传,而不再只靠点击DOM。
Goodfire推出Silico:用可解释性Agent拆模型推理 : 稀疏自编码器与探针检查内部表征。(来源: IEEE Spectrum)
Google AgentHands:XR里给对话Agent同步手势 : LLM生成与语音对齐的指点/示意/警示手势。(来源: Google Research)
LangSmith Engine:问题检测内部基准超2倍 : 更准聚类与修复建议,支持SaaS/自托管与工单联动。(来源: LangChain)
TrueForge开源Agent运行时:同模型约省四成token : 按需加载工具、卸载大结果、子代理与沙箱。(来源: GitHub)
Ollama v0.33:一键把Claude Desktop接到本地模型 : 打开后Cowork/Claude Code走Ollama云或本地,关掉回到Anthropic。(来源: ollama)
Open WebUI 0.11.1:流式重写+工具HITL审批 : 长回复只推增量;可对每次工具调用允许/拒绝。升级改库表。(来源: Reddit r/OpenWebUI)
Hermes一次接入44个精选远程MCP : 纳入Canva、Dropbox、GitLab等并裁剪高风险工具面。(来源: Teknium)
📚 学习
ASI-Bench:同一课题四级撤掉方法指导,测AI能否自主科研 : 清华等60题;B1均分约50.9、B3约27.2,62%失败在建模与选路。(来源: 机器之心)
论文:Agent榜分差有约7.8倍来自harness而非模型 : 三模型×三套脚手架、100道SWE-bench Verified,换harness可让分数大幅波动甚至翻转名次;提议七层Harness Card披露。(来源: dair_ai)
SWE Refactor Bench:整仓迁移存活率仅约5.4% : 20个真实迁移、520次运行仅28次过三阶段,说明修bug≠系统级重构。(来源: Einsia)
Knowledge Triage:压缩时保全安全规则 : 五轮压缩后规则保留可从53%掉到10%;按类型分流后五轮召回约96%。(来源: arXiv)
WebDev-Skills-Bench:注入公开Skill平均掉点且更贵 : Pass@2降1.3–4.2%、token升72–394%;反模式规则优于堆示例。(来源: arXiv)
清华:1338次真实后训练里,Agent会迭代很少改主意 : 选定策略后即使曲线变差也很少推翻路线;区分“能迭代”与“能反思”。(来源: TheTuringPost)
QAH:结构压缩后再4bit,蒸馏原120B教师可超过自身BF16 : Multiverse将GPT-OSS压到60B再MXFP4,9项中7项优于恢复后的BF16。(来源: HuggingFace Blog)
VibeWorlding:对话+工具自主搭可交互3D世界 : 港科广+腾讯开源;RL后VibeWorlder-30B-A3B Pass@1约59.3%。(来源: 机器之心)
Apple STARFlow2:归一化流与冻结VLM垂直交织做统一多模态生成 : 连续、单次、因果生成,文本与图像共享因果掩码与KV缓存。(来源: Apple ML Research)
MAP框架:知识图谱条件让单细胞模型零样本预测未测药物响应 : 交大团队在《Nature Machine Intelligence》报道未见药物Top-50 DEG相关提升约12%。(来源: 机器之心)
加州理工用迭代式神经算子把DFT从立方级压到近线性 : 傅里叶神经算子替换最贵正向映射,并嵌回自洽迭代。(来源: 新智元)
💼 商业
Anthropic拟向投资人陈述超30万亿美元TAM并冲刺IPO : WSJ称把“AI能接管的全部工作”打包计价,超过SpaceX约28.5万亿口径;Q2收入翻倍至约116亿美元,目标2028年约1900–2000亿美元营收、估值约2万亿。外界以标普科技合计年收对比,质疑口径膨胀。(来源: WSJ、THE DECODER)
月之暗面洽谈美三大云托管Kimi K3并分账至三成 : Reuters称正与微软、亚马逊、谷歌谈在Azure/AWS/GCP上架,索取最高约30%收入;卡在分成、数据访问与token计量。(来源: THE DECODER)
OpenAI数据中心负责人Chris Malone离职,职责拆分无单一继任 : 加入约一年半后离任,正值Stargate与自研芯片爬坡,叠加近年高管流失。(来源: The Verge、TechCrunch)
🌟 社区
Shopify CEO扬言禁用Claude Code:不读AGENTS.md会在巨型单仓制造规则分裂 : Tobi Lütke指CLAUDE.md与AGENTS.md并存时无法靠软链维持一致;Anthropic称将更灵活,但不同模型家族需要不同system prompt。(来源: 机器之心、InfoQ)
OWASP专家榜vs事故库:提示注入第一但事故排第12 : 扫描看不见“内容里藏指令+合法凭证调工具”;建议模型外授权闸门。(来源: VentureBeat)
可爱动物内容被AI垃圾淹没,寻宠骗局升级 : 伪造“找到了”照片索钱;平台验证仍难默认开启。(来源: WIRED)
swyx:先别用Codex「锁定使用」,会锁死macOS钥匙串 : 依赖不稳定系统特性,苹果论坛已标known bug。(来源: swyx)
未具名10分钟一镜家务Demo:宇树G1与智元A3疑似共用一脑 : 团队未公开、无法排除摆拍,宜作舆情而非结论。(来源: 量子位)
💡 其他
麦肯锡:企业AI“上路赚ROI”,但EBIT贡献仍原地踏步 : 1719名受访者中37%称有“一些”EBIT影响,高绩效仅6%,与去年持平。(来源: The Register)
放射科未被AI取代,却成医疗AI试验田 : FDA约四分之三AI器械属影像;AI更多写初稿、标急片,改变工作内容而非消灭职业。(来源: Ars Technica)
课堂AI治理个案:红黄绿灯作业+教师通用提示培训 : 康州Cheshire Academy不绑定单一产品,面向学生的反馈仍因质量与隐私未放行。(来源: MIT Technology Review)