🔥 聚焦
xAI发布Grok 4.6并推出Grok Bot智能体 : xAI正式发布Grok 4.6模型,支持500K上下文与多模态输入。该模型在AA智能指数上取得61分,追平GPT-5.6 Sol,在真实工作评测GDPVal-AA v2上以1753 Elo居次席。其API定价为每百万输入2美元、输出6美元,比竞品便宜60%以上。同步推出的Grok Bot支持多智能体协作与云端独立运行,可自动登录第三方应用并学习用户工作流。(来源:xAI)

DeepSeek V4 Pro正式版上线并开源Harness框架 : DeepSeek发布V4 Pro正式版(0813),采用1.6T参数MoE架构,支持1M上下文及图像输入。其Agent能力大幅跃升,在DeepSWE基准上从预览版的12.8分暴涨至62.7分。同时,官方开源了基于Cordis微内核的DeepSeek Harness v0.1智能体框架,支持将模型、工具和沙箱以插件形式灵活组装。(来源:DeepSeek)
.jpg)
阿里开源2.4万亿参数大模型Qwen3.8-Max : 阿里千问团队开源了Qwen3.8-2.4T-A95B(Qwen3.8-Max)的模型权重,其激活参数达95B,原生支持262K上下文。该模型在PaperBench中取得93分,在OSWorld等智能体任务上表现优异。Unsloth利用1-bit量化技术将其体积压缩91%至397GB,使本地部署成为可能。(来源:Hugging Face)
Google DeepMind推出手语转文字模型SL2T : Google DeepMind发布手语转文字模型SL2T,并在Pixel 11的Gboard和Live Transcribe中上线。该模型在FLEURS-ASL翻译基准上取得70 BLEURT的零样本高分。为保护隐私,系统采用MediaPipe Holistic在本地提取人体姿态坐标,仅将几何数据发送至云端完成ASL到英文的实时翻译。(来源:Google DeepMind)
Ilya旗下SSI首个基于TTT的推理模型曝光 : 社区爆料称,Ilya Sutskever创办的SSI正在开发一款基于测试时训练(TTT)的小型推理引擎。该模型在推理时可通过梯度下降实时更新部分权重以适应分布外数据,从而摆脱静态上下文窗口的限制,实现样本高效的持续学习,其性能可与规模大得多的模型竞争。(来源:X)

🎯 动向
Dyna Robotics发布基于百万小时 egocentric 视频预训练的Dyna-2模型 : Dyna Robotics发布了用于机器人操作的世界动作模型Dyna-2。该模型在超100万小时的人类第一视角视频上进行预训练,首次在未见过的机器人数据上验证了Scaling Law的跨身体泛化能力。实验表明,联合视频预测与动作去噪的协同训练是实现泛化的关键。(来源:Dyna Robotics)
小红书与上交大开源连续自回归语音合成模型dots.tts : 该模型拥有20亿参数,直接在连续隐空间中以自回归方式逐块建模,避免了离散声学Token带来的信息丢失。在Seed-TTS-Eval基准上,其平均说话人相似度与内容准确度均达到SOTA,并支持流式输出和双流交互模式。(来源:机器之心)
.jpg)
微软发布MAI-Code-1.1-Flash并大幅降价 : 微软更新其代码模型并发布MAI-Code-1.1-Flash,优化了CLI and 智能体任务的Token消耗。同时,微软将GitHub上的API价格下调75%(输入0.2美元/百万,输出1.2美元/百万),旨在Anthropic主导的编程市场中保持竞争力。(来源:AI Business)

阿里安全团队发布多模态安全基座模型Yuvion VL : 阿里安全团队推出Yuvion VL系列模型,聚焦AI与内容安全。该模型引入混淆对立微调(C2FT)对比学习框架,动态挖掘易混淆的困难负样本。评测显示,其8B版本在多项安全任务上超越了参数量大其50倍的GPT-5.4等商业大模型。(来源:arXiv)
牛津与新加坡国立大学提出“心智世界模型”MWM框架 : 联合研究团队提出心智世界建模(MWM)框架,主张将智能体的信念、目标和情绪等心智变量纳入全局世界状态中。参考系统MENTIS的测试表明,相较于纯物理世界模型,显式建模心智状态能使人类决策预测的F1分数大幅提升。(来源:arXiv)
.jpg)
北大等团队提出基于AF3接触概率的基因编辑器优化框架ContactSeek : 联合研究团队在《Nature》发表论文,提出利用AlphaFold3预测的接触概率(CP)来优化基因编辑器特异性的AI框架ContactSeek。该框架成功识别了Cas蛋白与DNA/RNA相互作用的关键接触残基,设计出高保真的碱基编辑器变体。(来源:Nature)
.jpg)
LiteLLM遭遇大规模供应链攻击导致数太字节凭证泄露 : 安全机构披露,开源AI开发工具LiteLLM在3月份遭遇供应链攻击,黑客通过官方PyPI源的恶意版本,在40分钟内窃取了包括微软、亚马逊、Salesforce等2500家企业的云密钥、API Token及SSH私钥,泄露数据达195TB。(来源:Ars Technica)
苹果洽谈向新闻出版商付费以改善Siri的AI新闻服务 : 据报道,苹果公司正在与多家主要新闻出版商进行谈判,提议在Siri使用出版商的新闻内容来回答用户问题或生成摘要时向其付费。此举旨在获取合规的实时高质量数据,以提升Siri的智能助理体验。(来源:The Wall Street Journal)
谷歌发布Pixel 11系列并全面升级Gemini AI功能 : 谷歌在Made by Google ‘26活动上发布Pixel 11系列手机。新机搭载Tensor G6处理器,并深度集成Gemini。新功能包括支持ASL手语实时转文字、能理解口语化表达的Rambler语音输入,以及与Pixel Watch 5的健康数据联动。(来源:TechCrunch)

科大讯飞发布覆盖七大核心场景的企业服务智能体矩阵 : 科大讯飞推出覆盖智能管理、流程IT、供应链交易等七大场景的智能体矩阵,推动企业AI从“完成单点动作”走向“交付业务结果”。产品包括支持采购监管的合规审核智能体,以及超拟人交互的SparkOS智能体。(来源:量子位)

前字节机器人负责人孔涛加盟小米,出任具身智能与应用部负责人 : 原字节跳动机器人团队负责人孔涛已于近期加盟小米,担任新设立的“具身智能与应用部”负责人。小米在智能汽车制造等“人车家全生态”中的真实物理场景,被认为是吸引这位清华计算机博士加盟的关键因素。(来源:36氪)
Canva因AI算力成本高昂削减三分之一营收增长预测 : 设计软件独角兽Canva将预期营收增长率下调至20%。CEO Melanie Perkins透露,用户对AI功能的需求远超预期,导致算力成本激增。公司决定放缓部分AI功能的推广,重新构建底层架构以降低单次任务的Token成本。(来源:Reddit)

🧰 工具
LlamaIndex发布ExtractBench与LlamaExtract Agentic Plus : LlamaIndex推出企业文档信息提取评测集ExtractBench。针对前沿VLM在长文档提取中召回率崩溃的问题,他们推出了LlamaExtract Agentic Plus,通过分段迭代处理长文档,在长列表提取任务中实现了96.1%的F1分数。(来源:LlamaIndex)
OpenAI推出ChatGPT Work企业工作台与Sites网页生成工具 : 该工具可将企业在Google Drive中的文档、NetSuite中的财务实绩以及Slack中的团队讨论无缝整合。用户可通过自然语言指令自动完成复杂的季度财务审计、预测数据分析,并一键生成交互式的Sites数据看板。(来源:OpenAI)

Automattic关系管理工具Mesh登陆Android平台 : 个人关系管理与CRM工具Mesh(原名Clay)推出Android版本。应用支持分屏与弹窗视图,可与Beeper等多平台消息软件联动。其内置的Nexus AI允许用户通过自然语言查询人脉网络中的行业专家或特定城市联系人。(来源:TechCrunch)

📚 学习
DeepLearning.AI联合JetBrains推出《AI编码工作流:从云端到本地》短课程 : 该课程由JetBrains开发者倡导者Paul Everitt主讲,指导学员在云端、混合及完全本地的环境中构建Python应用。课程涵盖了如何使用子智能体分解任务、如何通过模型路由降低成本,以及如何在本地配置开源编码智能体。(来源:DeepLearning.AI)
IIT Bombay与Adobe Research提出逆向提取LLM提示词的PTP方法 : 联合研究团队发表论文,介绍了一种名为前Token预测(PTP)的逆向提取方法。该方法通过在目标LLM的合成输出上训练逆向模型,能够以极高的保真度还原出大模型的系统提示词和用户隐私数据,且无需访问模型权重。(来源:arXiv)

OpenMOSS团队开源用于具身RL控制的WCM世界批评家模型 : 联合研究团队开源了WCM框架。针对机器人控制中的部分可观测性问题,WCM在估计状态价值的同时预测执行动作后的下一时刻潜在状态。实验表明,引入未来状态预测能显著提升VLA模型在真机强化学习中的效率。(来源:arXiv)
.jpg)
开源数据集OpenWALDO致力于提供安全透明的AI训练数据源 : 针对开源模型训练数据不透明的问题,CentOS创始人Gregory Kurtzer发起了OpenWALDO项目。该项目旨在建立一个完全公开、可审计的AI训练数据集,目前已包含1673亿个源自公有领域文献和学术论文的参考Token。(来源:The Register)
💼 商业
无代码软件开发平台Lovable完成4亿美元C轮融资 : 瑞典“可视化编程”创企Lovable宣布完成4亿美元C轮融资,由Menlo Ventures领投,腾讯等参投,估值在7个月内翻倍至133亿美元。公司ARR已达6亿美元,用户可直接在平台上完成从应用构想到上线运营的全流程。(来源:TechCrunch)

Thrive Holdings融资20亿美元,推动OpenAI模型在传统行业落地 : 专注于AI落地的私募股权公司Thrive Holdings宣布获得20亿美元新资金,估值达120亿美元。该公司通过收购会计和IT等传统企业,并直接嵌入OpenAI模型来优化工作流。新资金将用于开拓物理资产监管等新业务。(来源:TechCrunch)
IBM与Together AI达成2.4亿美元Nvidia Blackwell集群租赁协议 : IBM与Together AI签署了价值2.4亿美元的多年期合作协议。Together AI将在IBM Cloud上部署包含2000颗Nvidia B300(Blackwell)芯片的AI算力集群,为DeepSeek、Kimi等开源大模型提供高效的云端推理服务。(来源:IBM)

🌟 社区
社区热议Fable 5商业采用率低迷与企业AI支出天花板 : 财务服务商Ramp的数据显示,Fable 5在发布首月仅占企业在Anthropic模型总支出的11.4%。分析指出,每百万输出50美元的高昂定价已触及企业AI支出的天花板,在无法量化ROI的情况下,企业正转向更具性价比的开源或中轻量模型。(来源:Ramp)

开发者热议AI编程工具中“脚手架”(Harness)与模型能力的边界 : 在Opus 5通过自主编写269个程序通关ARC-AGI-3后,开发者们讨论认为,随着模型推理能力增强,过度设计的提示词和复杂的外部Agent框架(Harness)反而成为限制模型发挥的“绳子”,未来极简的环境接口才是趋势。(来源:36氪)
皇家统计学会AI工作组呼吁将统计学原则引入AI监管 : 皇家统计学会发表报告指出,由于AI模型在部署后会随环境动态演化,传统的静态合规审查无法有效防范风险。工作组呼吁监管机构建立统计学评估能力,对AI Agent在真实业务场景中的行为进行持续审计。(来源:RSS)

AI幻觉导致农业损失引发对自动化决策边界的讨论 : 社区热议一起因听信AI建议而导致25英亩作物被毁的事件。AI应用错误地推荐了一种会同时杀死杂草和作物的化学制剂。网友指出,在涉及物理世界的决策中,盲目信任AI的自动化建议而缺少人工核验会带来严重后果。(来源:X)
💡 其他
Kellanova利用西门子数字孪生技术优化薯片生产线 : 休闲食品巨头Kellanova投入500万美元,在波兰工厂部署了马铃薯泥的实时数字孪生系统。传感器每毫秒采集200个数据点并输入机器学习模型,以自动微调配方,使生产线废料减少了13%,能耗降低了7%。(来源:X)
宇树科技IPO获近千万户申购,创下科创板中签率历史新低 : 宇树科技A股IPO网上申购户数超978万,中签率仅为0.018%,创科创板历史新低。发行市值达610亿元。此外,人工智能公司DeepSeek已确认作为战略投资者参与配售,双方将围绕具身智能与大模型展开联合研发。(来源:36氪)
Suno联合BMG达成合作,但数字水印引发创作者担忧 : 音乐生成平台Suno宣布与BMG达成全球合作,以将人类创作者置于AI音乐生态的中心。然而,Suno在音轨中强制添加的不可逆数字水印引发了社区反弹,创作者担心这会成为唱片公司和平台进行版权监控与内容下架的工具。(来源:Suno)