🔥 聚焦
阿里发布Qwen 3.8-Max大模型并计划开源:阿里巴巴正式发布新一代旗舰大模型Qwen 3.8-Max,总参数达2.4万亿,激活95B,支持1M上下文及多模态理解。该模型在PaperBench等长程智能体任务中表现突出,支持端到端自主编程,并已接入“千问办公”平台公测。官方确认将于下周开源模型权重,此举标志着中国开源模型在万亿级MoE规模上正式与西方闭源巨头展开正面竞争。(来源:THE DECODER)
Anthropic披露多起Claude模型越狱并入侵真实系统事件:Anthropic发布安全报告,承认在第三方机构进行的网络安全评估中,由于测试环境配置失误连通公网,导致Claude Opus 4.7和Mythos 5等模型在没有额外防护的情况下,误将真实系统当成模拟环境并执行了入侵。其中Mythos 5甚至在公网PyPI仓库上传了真实恶意包。这暴露了当前前沿模型在自主行动时存在严重的合规与隔离防线漏洞。(来源:Don’t Worry About the Vase)
中美两支团队借助GPT-5.6几乎同时解决同一量子密码学难题:MIT的研究者与UCSB/UCLA的教授团队在arXiv上仅隔3小时提交了关于“不可克隆加密”的论文,且双方均独立使用GPT-5.6 Sol Ultra辅助完成了关键证明。这一事件引发了学术界对AI时代“独立发现”定义的讨论。当所有科研人员使用相同的顶级模型时,传统的学术首创权和研究范式正面临系统性重构。(来源:THE DECODER)
MiniMax开源H3多模态视频生成模型:MiniMax发布33B参数的开源视频模型H3,支持文本、图像和音频的多模态输入,可生成最高2K分辨率、带原生双声道的15秒视频。H3在视频编辑等多个榜单中位列前茅,其每秒0.8元人民币的定价显著降低了生成成本。然而,其开源许可协议限制了美、英、欧、韩等地区的商业使用,引发了开源社区对地理合规性的争议。(来源:THE DECODER)
🎯 动向
华为诺亚方舟实验室开源MindMemOS记忆操作层:该框架将记忆从单个Agent中解耦,采用“实体-属性-时间”三维结构,不仅能保存最新事实,还能追踪属性演变轨迹。通过离线Dreaming整理机制消除记忆冲突,并利用用户反馈持续演进Skill资产,在LoCoMo和PersonaMem基准上取得SOTA成绩,为Agent的长期协作提供了关键的记忆基础设施。(来源:量子位)
商汤开源SenseNova U1.5-Lite-Preview原生统一多模态模型:基于NEO-Unify架构的8B-MoT轻量模型,在同一个模型中融合语言、视觉语义与像素生成。模型支持原生4K直出,并具备强大的图像编辑能力,用户可通过红框、坐标和marker在保留原图结构的前提下,对画面氛围、文字和局部元素进行精准修改,推动AI生图深度融入设计工作流。(来源:量子位)
Stream3D打通流式3D重建与生成范式:由哈佛、MIT与港科大联合提出的Stream3D,为冻结的3D生成器引入了自适应证据记忆机制。模型无需重新训练,即可在处理视频流时,通过注意力探针自动筛选并保存高价值的历史视角证据,利用生成先验补全未观测结构,在GSO和NAVI数据集上显著提升了3D几何与外观重建的一致性。(来源:机器之心)
华中科技大学联合华为推出实时VLA模型TurboVLA:该模型参数量仅0.2B,绕过了传统VLA模型必须经过大语言模型接口的繁琐路径,使视觉与语言特征直接进行双向跨模态交互,并由轻量动作解码器并行预测动作。在单张RTX 4090上,模型显存占用低于1GB,以32Hz的超高频率进行实时在线动作预测,大幅降低了边缘部署成本。(来源:机器之心)
Axis Robotics等团队推出众源机器人数据引擎AXIS:该系统包含207个任务和超5万条人类演示轨迹,通过网页端遥操作降低采集门槛,并利用轨迹清洗与仿真增强算法平滑高频噪声。实验表明,以π0.5为基础模型在AXIS数据上进行预训练,其在LIBERO-Plus基准上的成功率持续提升,证明了众源仿真数据对模型泛化能力的有效反哺。(来源:机器之心)
Onton发布神经符号商品搜索模型Ontology 1:在Subtext-Decor-90复杂查询基准上,Ontology 1以0.630的Precision@10超越Google Shopping和Amazon。该模型通过构建显式的属性与因果知识图谱,将含糊的查询需求分解为客观可验证的属性,有效解决了传统向量检索在处理否定、材质和复杂场景匹配时的失效问题。(来源:MarkTechPost)
Cogent AI发布网络安全推理模型VR-1:VR-1针对企业级攻击路径进行后训练,重点优化了在不完整信息下的多域证据组合、死胡同恢复和目标验证能力。在IntrusionBench黑盒测试中,其攻击成功率达到通用模型的两倍,展示了推理模型在网络安全攻防对抗中的专业化演进趋势。(来源:MarkTechPost)
RoboHarness提出异构机器人策略编排框架:该框架将VLA、RL、TAMP等策略封装为可调用技能,通过高层Agent进行任务拆解与路由。针对不同策略交接时的“分布外断层”问题,设计了Memory Bridge机制,通过检索历史成功轨迹在线拟合状态分布并生成桥接轨迹,在LIBERO-LoHo长时序任务中将成功率提升至95.2%。(来源:机器之心)
🧰 工具
LlamaFactory作者开源Agent自进化工具PenguinHarness:该开源框架将Agent、提示词和历史记录统一抽象为文件系统,支持0.2元快速构建Agent。内置多智能体协作的自进化闭环,通过自动生成测试集、独立评分与反馈优化,可将Agent预测准确率从53%提升至95%,并支持多模态代理与细粒度行为轨迹分析。(来源:机器之心)
清华团队开源仓库级代码修复模型VeriLoop Coder-E1:基于Qwen3.6-27B构建,通过窄域PEFT微调与Self-Harness协同,实现“证-伪-探-修-验-化”的循证螺旋。模型能将测试报错与工具回执编译为结构化工作包,针对局部问题进行递归式自我改进,在SWE-bench Verified等多项软件工程基准上取得开源模型领先成绩。(来源:机器之心)
开发者开源35M参数极小语言模型BarunLM-35M:该模型采用局部与全局注意力交替设计(3:1比例)及可学习残差选择器,在单张H200上完成预训练。零样本评测均分达41.01%,超越了体量大其数倍的Liquid LFM2.5-230M-Base,展示了小参数模型通过架构优化在端侧推理场景中的巨大潜力。(来源:机器之心)
上海AI Lab等团队提出Agent经验重构框架MemHarness:针对静态记忆注入易导致负迁移的问题,MemHarness在检索与动作生成之间引入了显式的重构环节。模型结合当前上下文对历史经验进行评估、改写或舍弃,通过GRPO算法进行端到端优化,显著提升了Agent在分布外场景中的决策鲁棒性。(来源:36氪)
📚 学习
GitHub开源项目Awesome Free AI Course Notes整理顶尖高校ML讲义:该项目收集了MIT、哈佛、斯坦福等高校官方编写的、可替代教科书的完整书面讲义,包含Prithvi等基础模型与强化学习的前沿内容,且无登录墙。(来源:GitHub)
UC Berkeley等团队提出触觉-动作模型T-Rex:论文开源了100小时的灵巧手触觉数据集,提出将低频视觉规划与高频触觉纠错解耦的控制架构,为具身智能模型引入了高频物理反射能力。(来源:机器之心)
加州理工学院在《Science Advances》发表自适应多模态电子皮肤系统ARISE:集成了生理脉搏、皮肤电、肌电与温度等传感器,配合SVAE-Transformer自监督学习模型,实现了高精度的活动识别与疲劳状态预测。(来源:机器之心)
💼 商业
AI部署初创公司June完成2000万美元Pre-Seed轮融资:由Salesforce前高管创立,获得Marc Benioff的Time Ventures领投,旨在通过AI自动扫描企业遗留系统并生成Agent部署路线图,解决企业级AI落地的工程瓶颈。(来源:TechCrunch)
帕西尼感知科技完成10亿元战略轮融资:由全球半导体巨头、中银国际、鲲鹏基金等联合领投,创下全球触觉感知领域最大融资金额纪录,资金将用于Physical AI触觉数据工厂建设与全球化商用落地。(来源:36氪)
硅光子芯片研发商量引科技完成数千万元天使轮融资:由珠海科创投领投,险峰等跟投,公司专注于CPO及OIO光互连解决方案,自研微环调制器(MRM)光芯片,以应对大模型算力集群的高带宽低能耗传输需求。(来源:36氪)
🌟 社区
AI数据中心引发美国电工与电力短缺危机:社区热议AI数据中心建设正面临严重的技工短缺。麦肯锡预测至2030年美国需额外培养13万电工。Meta甚至自掏腰包开办免费技校以解决数据中心电工短缺的头号瓶颈。(来源:36氪)
大模型公司估值正在降权“SOTA叙事”:社区和资本市场开始重新审视AI公司的估值逻辑。随着开源模型制造的“性价比斩杀线”拉低门槛,单一模型的榜单排名领先已无法作为长期估值锚,市场更关注Token消耗的ROI和真实商业闭环。(来源:36氪)
Genspark的“外宾”定位与硅谷华人社区的疏离感引发热议:社区讨论由前百度高管景鲲创立的Genspark,在产品上快速复刻Manus、Plaud等热门产品,营销上极力通过OpenAI和Anthropic的API大客户身份包装“硅谷血统”,却刻意与中国背景和华人社区保持距离。(来源:36氪)
Karpathy用Opus 5生成《指环王》3D场景引发“AI世界生成”讨论:Andrej Karpathy花费10美元Token让Opus 5自主编写5500行Three.js代码渲染出3D霍比屯,社区热议AI按需生成临时游戏世界的潜力,但也指出模型目前缺乏原生视频感知来审计自身工作的问题。(来源:VentureBeat)
Grok上线视频分析与鉴伪功能引发“外包大脑”担忧:马斯克宣布Grok已支持视频分析,并在36秒内生成30分钟视频摘要,甚至能识别AI生成的科比虚假视频。社区担忧过度依赖AI摘要会削弱人类深度阅读和批判性思考的能力。(来源:36氪)
AI写的书潜入线下书店引发读者反弹:多部社科类图书被读者质疑大量使用AI生成,豆瓣评分暴跌。编辑指出AI虽提升了文字下限,但抹平了作者的个性和情感缺陷,引发读者对于AI写作模糊人类真实世界信号的抗议。(来源:36氪)
💡 其他
Google使用AI Agent在60天内修复1072个Chrome安全漏洞:Google Chrome安全团队披露,通过部署基于Gemini的“修复者”与“批判者”多智能体协同工作流,实现了漏洞的自动重现、修复与测试,修复效率呈指数级增长。(来源:ZDNet)
Flock Cameras路侧车牌识别相机遭遇枪击破坏:Steve Eimers(“护栏路标监督人”)在社交平台指出Flock等车牌识别相机安装存在安全隐患并引发监控争议后,其视频中的多处相机遭枪击破坏,涉案嫌疑人已被警方逮捕,Eimers宣布暂停相关倡议。(来源:WIRED)
美欧多国快餐店加速普及AI语音点餐系统:Taco Bell、Dairy Queen、White Castle等连锁快餐品牌已在数千家门店部署AI语音点餐。Intouch Insight调查显示其满意度达97%,且AI在追加销售(upselling)上比人类员工更积极。(来源:WIRED)