🔥 聚焦
新智具身联合复旦发布N0系列模型与NeoData数据集 : 新智具身与复旦大学联合发布N0系列具身智能模型及NeoData数据集。NeoData包含超3万小时的视觉-触觉交互数据,NeoForce统一表征模型解决了不同触觉传感器的数据融合难题。N0-VTLA通过预测未来50步触觉演变提升操作成功率,N0-TWAM则在世界模型中引入触觉预测,推动具身智能从“视觉驱动”向“视触融合”演进。(来源:量子位)

Induction Labs发布Photon-1模型 : Induction Labs推出了Photon-1模型,这是一款106B-A5B的稀疏混合专家(MoE)模型,其创新之处在于通过无动作标注的视频进行预训练,学习到隐式策略。Photon-1在计算机使用基准测试中超越了Gemini 3.1 Flash-Lite,且预训练算力消耗显著降低,推理成本降低了约3倍。即使只学习了桌面视频,微调后的Photon-1在西洋棋和弹球物理模拟中依然表现优异。(来源:MarkTechPost)
KwaiKAT团队发布KAT-Coder-V2.5 : 快手KwaiKAT团队推出了KAT-Coder-V2.5,这是一款在真实可执行代码库中进行训练的智能体编程模型。团队通过AutoBuilder自动构建了超10万个可验证的库环境,并利用基于过程的过滤机制和非对称AFT-PPO算法进行强化学习。KAT-Coder-V2.5在PinchBench上以94.9的高分领跑,展示了通过优化沙箱基础设施和算法设计来提升长程编程智能体性能的路径。(来源:MarkTechPost)
MonkeyOCRv2文档视觉底座开源 : 华中科技大学等团队开源了MonkeyOCRv2,该模型引入了“重建即文档视觉记忆”的预训练目标。在保持后端语言模型Qwen3-1.7B冻结的受控实验中,MonkeyOCRv2在8个文档理解基准上领先最强对照13.2分。同时,团队开源了包含1.13亿张图像的MonkeyDoc v2数据集,为社区提供了统一的文档视觉预训练实验场,推动文档AI从语义补全向视觉忠实度演进。(来源:机器之心)
.jpg)
Valkor联合浙大等开源智能体状态管理框架Loom : 针对AI编程智能体在长任务中容易陷入“调试黑洞”和“局部失忆”的痛点,Valkor联合浙江大学及UCL团队推出了开源框架Loom。Loom将复杂的软件交付任务拆解为结构化、可随时恢复的状态链。当测试失败时,Loom会将其捕获为独立于聊天记录的待办状态,使得开发者可以无缝切换模型或智能体继续任务,为严肃生产环境下的AI编程提供了关键的状态基础设施。(来源:机器之心)
.jpg)
🎯 动向
Sakana AI发布网络安全路由模型Fugu-Cyber : Sakana AI推出了Fugu-Cyber,这是其Fugu编排器上的网络安全专用路由模型。该模型在CyberGym上取得了86.9%的成功率,在CTI-REALM上取得72.1%的成绩,可与GPT-5.5-Cyber等前沿模型竞争。Fugu-Cyber通过TRINITY和Conductor框架,动态协调多个安全领域的子智能体进行漏洞验证与检测规则生成,采用按Token付费的阶梯定价模式。(来源:MarkTechPost)
Open Dreamer开源Dreamer 4世界模型JAX实现 : 独立研究团队Reactor开源了Open Dreamer,这是基于JAX和Flax NNX对Dreamer 4世界模型管线的复现。该模型包含一个无需对抗损失的Masked Autoencoder视频分词器,以及一个1.6B参数的无动作标注时空注意力动力学模型。团队完整公开了训练配方,并分享了在B200 GPU上优化显存、解决Muon优化器漂移等稳定性工程细节,为世界模型的复现提供了宝贵参考。(来源:MarkTechPost)
InclusionAI在OpenRouter上线Ling-3.0-flash : 专注于智能体工作流执行的轻量级MoE模型Ling-3.0-flash已在OpenRouter以API形式上线。该模型总参数量124B,激活参数5.1B,支持256K上下文,TTFT低于100ms。该模型定位为与大型规划器配合使用的低成本快速执行节点,针对长程工具调用和指令遵循进行了优化,提供可切换的混合推理模式。(来源:Reddit)

Abliterated版GLM-5.2模型发布 : 社区发布了经过“去拒绝(Abliterated)”和微调的GLM-5.2大模型。该模型移除了安全拒绝方向,并在长程对抗和智能体任务上进行了针对性微调,以防止模型在处理技术性或敏感任务时无故退出。评测显示其在CyberGym和AgentHarm等安全与代码基准上表现优异,默认不保留数据,规则完全由用户通过系统提示词定义。(来源:Reddit)

🧰 工具
Llama.cpp合并原生MCP支持 : 开发者ngxson主导的PR已成功合并至llama.cpp,使其WebUI和命令行工具原生支持模型上下文协议(MCP)。用户现在无需外部中转,即可直接在本地客户端中配置和调用各种MCP服务器(如Serena代码助手),实现了完全本地化、无依赖的智能体开发与调试,极大地降低了本地开源模型构建智能体生态的门槛。(来源:Reddit)
Open Minis端侧智能体框架开源 : 开发者Ethan Wang宣布开源Open Minis,这是一个可在手机端本地运行的AI智能体应用。它支持iOS和Android系统,集成了本地Linux Shell、浏览器自动化、可扩展技能和持久记忆。通过将Skills的元信息在系统提示词中加载并结合Prompt Caching,模型能在单轮对话中连贯完成工具选择与执行,为端侧智能体开发提供了轻量级参考。(来源:X)
Aethos_Memory解决智能体跨会话遗忘问题 : 针对AI编码助手在不同会话之间无法共享上下文的痛点,开发者开源了Aethos_Memory工具。该工具为智能体提供了持久化的内存层,能够自动提取并存储会话中的关键决策、代码库架构和Bug修复记录。在新建会话时,智能体可直接读取结构化的内存,避免了开发者手动复制粘贴历史记录的繁琐操作。(来源:Reddit)

Runway推出媒体路由工具Media Router : 视频生成平台Runway推出了首个针对生成式媒体的偏好优化路由工具Media Router。企业团队在运行包含多种视频、图像和音频模型的生产管线时,无需手动为每个请求选择模型,只需在Router中定义一次关于成本、质量或延迟的偏好,路由系统便会自动分发Token请求,实现成本与效果的最优平衡。(来源:X)
📚 学习
设计与优化GPU内核的TileLang工具发布 : 本文介绍了基于TVM的GPU内核设计DSL工具TileLang。教程提供了完整的Python代码,演示了如何设计向量加法、Tensor Core矩阵乘法、融合Softmax、FlashAttention等内核。通过TileLang的共享内存Tile和寄存器分块,编译器可自动处理线程映射和同步,并支持通过@tilelang.autotune在固定GPU预算下寻找最优硬件配置。(来源:MarkTechPost)
FAIRChem v2与UMA原子模拟潜力教程发布 : 教程详细介绍了Meta FAIRChem v2框架以及UMA通用机器学习原子间势(MLIP)的使用。内容涵盖如何通过Hugging Face获取gated模型权重,并在ASE(Atomic Simulation Environment)中配置计算器,完成单点能量预测、分子几何优化、自旋态对比、反应能估算、晶格松弛、物态方程拟合及分子动力学模拟等一系列计算化学工作流。(来源:MarkTechPost)
Relative Representation解决异构LLM向量空间对齐 : 社区分享了一种利用相对表示法(Relative Representation Method)和Lowdin对称正交化来对齐不同LLM嵌入空间(如混用Llama、Mistral和Phi)的几何技术。该方法无需微调,通过在特定语义域内引入参考锚点并进行列向Z-score标准化,将不同维度的向量映射到统一的共性空间,解决了多智能体路由中的各向异性圆锥体与维度不匹配问题。(来源:Reddit)

U-Net手绘推导与计算过程图解 : 计算机视觉学者Prof. Tom Yeh发布了U-Net网络的手绘计算图解。教程通过17个步骤,将包含R、G、B三通道的图像通过卷积、最大池化压缩至2×4的Bottleneck,再通过转置卷积和跳跃连接(Skip Connection)逐步恢复至原始尺寸,以直观的矩阵乘法流程展示了这一扩散模型核心骨架的数学原理。(来源:X)
💼 商业
Stripe拟以100亿美元收购OpenRouter : 支付巨头Stripe正与AI模型聚合平台OpenRouter进行重磅收购谈判,估值达100亿美元,较两个月前的13亿飙升近8倍。随着企业倾向于使用多模型分散风险,OpenRouter的流量与战略价值凸显。Stripe通过一行支付代码在AI时代“闷声发财”,此前已收购Metronome,此次收购将使其业务从支付延伸至AI生态底层基础设施。(来源:机器之心)
.jpg)
眸深智能完成近亿元Pre-A轮追加融资 : 端侧具身大脑公司「眸深智能」宣布完成近亿元Pre-A轮追加融资,Pre-A+轮近5亿融资也在交割中,估值在半年内增长超10倍。公司由复旦大学陈涛教授和前英特尔科学家张益民创办,其STI-WM时空一体世界动作模型通过将动作Token化,将真机数据需求降低了90%,并在海思、地平线等国产芯片上实现了超低成本的端侧适配。(来源:36kr)

手术机器人公司Vicarious Surgical清算破产 : 曾获比尔·盖茨、杨致远等投资的手术机器人独角兽Vicarious Surgical,因研发进度严重滞后、资金链断裂,股东投票决定停止运营并进行破产清算。公司累计融资超20亿元,其激进的解耦驱动方案和VR控制概念在FDA审批和量产中撞墙,为当前估值高企但商业化落地艰难的具身智能赛道敲响了警钟。(来源:36kr)

🌟 社区
AI编程助手引发CS教育界对考核方式的重构 : 计算机协会(ACM)对全球49个国家700多名计算机科学教育者的调查显示,69%的教师认为AI改变了软件开发所需的技能,64%的教学重心已从“从零写代码”转向代码理解与调试。为了应对AI带来的作弊和过度依赖,68%的教师调整了评估方式,增加了现场闭卷考试、口头答辩和代码防御环节,以重新定义AI时代的编程技能评估。(来源:THE DECODER)

Claude共享对话链接被Google索引引发隐私担忧 : 社区发现,用户通过Claude“创建公开链接”分享的对话和Artifacts正被Google等搜索引擎公开索引,甚至出现了专门爬取这些链接的第三方网站。泄露内容包含加密货币私钥、公司机密和个人医疗隐私。用户批评Anthropic未在分享页面添加noindex元标记,这在安全设计上属于低级失误,呼吁用户及时在设置中清理已分享的对话。(来源:Reddit)

硅谷掀起“Avoiding AI”反向数字素养工坊热潮 : 随着科技巨头将AI强制推送到各类终端,美国多地图书馆发起的“Avoiding AI(避开AI)”线下工作坊在社交媒体爆火。图书管理员手把手指导市民如何彻底关闭Apple Intelligence、Gemini等系统内置AI,并分享屏蔽Google搜索AI摘要的浏览器插件。市民借此表达对大厂垄断、隐私侵犯和数据中心能耗的担忧,呼吁技术自主权。(来源:TechCrunch)

商务部部长Lutnick表态支持开源AI以抗衡中国 : 社区热议美国商务部长Howard Lutnick在白宫记者晚宴上的表态,他直接表示“本届白宫将保护开源AI”。此前,APEC签署了支持开源AI的声明,美政府内部正讨论通过针对特定模型的定向禁令来代替一刀切的封锁,以帮助美国开源生态在算力受限的情况下通过“分叉”和“微调”快速追赶闭源前沿,确保美国的技术主导地位。(来源:X)
Andrej Karpathy修改个人简介引发离职猜测 : 知名AI学者Andrej Karpathy在其社交账号个人简介中删除了“Anthropic”字样,引发社区对其是否已离职的广泛猜测。部分爆料称其因出口禁令导致非美籍身份无法访问公司最先进模型而选择离开,但也有网友指出其简介修改已发生多日。由于Anthropic近期未签署黄仁勋发起的开源公开信,其保守的商业与监管策略正在社区中遭遇部分舆论反弹。(来源:机器之心)
.jpg)
DeepSeek因投资人会议纪要泄露暂停第二轮融资 : 社交媒体上疯传的一份关于DeepSeek创始人梁文锋与投资人交流的会议纪要,导致DeepSeek官方紧急通知潜在投资者,暂时搁置第二轮融资。泄露的文字稿涉及DeepSeek对中美算力差距、Token定价策略以及开源商业模式的敏感表态。社区对DeepSeek通过工程优化将推理成本降至西方同行三分之一的“Token工厂”模式展开了微调和部署讨论。(来源:Hacker News)
💡 其他
ChatGPT协助用户发现MacBook感染AtomicStealer : 一名Mac用户在尝试优化本地大模型运行内存时,通过ChatGPT分析系统进程,意外发现两个伪装成系统服务的LaunchDaemon文件指向Library中的隐藏脚本。ChatGPT随即警示其为恶意软件,帮助用户定位了因安装被污染的PDF开源库而感染的OSX.AtomicStealer窃密木马,展示了AI在日常终端安全防护中的意外作用。(来源:Reddit)

Decoy Font利用视觉差异欺骗多模态AI : 设计工作室Mixfont发布了“Decoy Font(诱饵字体)”。该字体通过在常规字母上叠加细线勾勒的干扰字符,使得ChatGPT、Claude等具有视觉能力的多模态AI在OCR识别时只能读出错误的文字(如“Sorry Robot”),而人类肉眼在一定距离外仍能正常阅读真实文本(如“Happy Human”),成为一种新型的物理级AI防爬虫/对抗样本技术。(来源:Reddit)

纽约一高中拟引入人形机器人引发教师抗议 : 纽约一所公立高中计划在教学楼中引入人形机器人用于辅助教学,此举遭到教师工会的强烈反对。教师们认为,在教育经费紧张、师资流失的背景下,高昂的人形机器人采购与维护费用属于资源错配,且机器人无法替代人类教师在情感沟通和个性化引导中的核心作用,技术进校园应保持边界。(来源:Reddit)
