OpenAI集中公开722篇未发布模型数学手稿,撕开准黎曼猜想等世纪难题边界|AI日报 2026-10-08

🔥 聚焦

OpenAI集中公开722篇未发布模型数学手稿,撕开准黎曼猜想等世纪难题边界 : OpenAI正式在GitHub开源仓库openai/math集中公布了由未发布内部前沿模型生成的372组结果、共计722篇数学论文手稿。核心成果涵盖准黎曼猜想(声称证明所有狄利克雷L-函数在实部大于7/8区域无零点并消除西格尔零点)、阿贝尔簇霍奇猜想证明、四维挂谷猜想、有理数域希尔伯特第十问题及脱离唯一游戏猜想确立Basic-SDP的普通NP-困难阈值;其中约160篇附带Lean形式化证明。OpenAI披露单项成果平均耗费约3小时ChatGPT Pro推理算力。尽管被视为机器自主科学发现的里程碑,但包含三位菲尔兹奖得主的普林斯顿高等研究院顾问小组发表声明,强调公开不等于学界认可,警示机器批量生成证明正在严重冲击人类学者的消化与验证机制 (来源: 机器之心、The Verge、Latent Space、Abhishek Saha、openai)

OpenAI一次放出722篇数学成果

美能源部与NIH联合DeepMind等巨头启动“虚拟生物学倡议” : 美国能源部(DOE)与美国国立卫生研究院(NIH)宣布达成国家级战略合作,联合Google DeepMind、Meta、Isomorphic Labs及英伟达等机构创立“虚拟生物学倡议”(Virtual Biology Initiative)。该计划旨在系统绘制全尺度细胞生物学图谱并生成标准化基准数据,集合多模态AI构建世界首个可端到端预测细胞生命活动的通用数字模型,从第一性原理重塑新药研发与疾病机理探索 (来源: Alex Rives)

Google DeepMind开源端侧全模态嵌入模型EmbeddingGemma 2 : Google DeepMind正式开源首款基于Gemma 4架构的多模态嵌入模型EmbeddingGemma 2,采用Apache 2.0协议。该模型参数量为740M,原生统一了文本、代码、图像、音频与视频的向量表征空间,支持8K上下文;其模块化设计允许文本单模态以270M参数运行,量化后在移动端仅需约191MB内存,并借助Matryoshka表示学习支持维度动态截断至768维以内,Qdrant实测结合1-bit量化可将显存占用骤降77倍并保持94.5%检索精度,填补了轻量端侧全模态RAG与离线语义检索的基建空白 (来源: Google DeepMind Blog、THE DECODER、GoogleDeepMind)

EmbeddingGemma 2

OpenAI兑现“28天对赌”Day 2更新:Auto-review全面免费并公测Decisions API : 在“28天每日交付实用改进”挑战的第二天,OpenAI集中针对Agent落地摩擦推出多项核心更新:长任务自动风控审计功能Auto-review面向全体ChatGPT登录用户免费开放且不计入配额;API付费等级由五档简化为Build、Launch、Grow三档,最高档门槛降至500美元;面向离散路由与工具分流的Decisions API正式开启公共测试,该接口由GPT-6 Luna驱动,服务器端响应低于100毫秒,每百万输入Token仅售0.10美元且免收输出与缓存费用;此外macOS端同步灰度Meetings会议工作区插件

Meta与Sierra联合巨头发布个人智能体协议PAP,确立人企Agent交互规范 : 针对消费级AI Agent在商业网站频遭防爬拦截的困境,Meta与AI客服平台Sierra联合Stripe、Shopify、Walmart等多家企业,共同发起开放行业标准“个人智能体协议”(Personal Agent Protocol, PAP)。该协议基于A2A与OAuth架构,明确规范了个人AI助手在代表用户执行电商下单、票务查询与表单填写时与企业系统通信的鉴权与风控边界;Decagon亦同步开源配套的PACT信任协议,加速消除智能体跨边界调用的信任摩擦 (来源: The Verge、TechCrunch、saranormous)

Personal Agent Protocol

🎯 动向

Google DeepMind发布图像生成与编辑模型Nano Banana 2.1 : 谷歌上线基于Gemini 3.6 Flash的生成式图像模型Nano Banana 2.1(API标识为gemini-nano-banana-2.1),并在Gemini API、AI Studio与Google Ads同步推出。新模型原生支持复杂排版设计、精确蒙版局部重绘以及多达14张参考图的角色一致性融合,支持最高4K画质渲染,单张出图成本降至0.034美元(降价约50%),重点攻克商业视觉设计中的连续跨轮一致性难题 (来源: 机器之心、GoogleAIStudio、THE DECODER)

Nano Banana 2.1

Claude攻克概率论难题,Lean形式化证明渗流连续相变猜想 : Anthropic未公开的内部前沿Claude模型成功攻克困扰数学界近70年的连续相变猜想($p_c$临界概率处无限连通概率为0)。模型在学界2024年搭建的不等式框架基础上,通过Lean证明助手完成数千行形式化推导,打破了3到10维关键物理维度的长期停滞,AI完成菲尔兹奖级别猜想形式化证明的进展引发学界深层震动 (来源: 36氪)

Claude攻破概率论难题

Anthropic扩展网络安全验证计划并设立三级准入机制 : Anthropic宣布将其网络安全验证计划(CVP)升级为常态化三级访问架构(防御级、红队级、专用级),向经核验的机构与白帽专家开放放宽安全过滤器的Claude Opus 5.5、Sonnet 5.5及Mythos 5.1。新体系首次合规开放针对渗透测试与红蓝对抗的授权进攻性调用能力,旨在化解“防御者需要强力工具修补漏洞却遭通用安全策略拒答”的矛盾 (来源: Anthropic News、AnthropicAI、THE DECODER)

Expanding the Cyber Verification Program

DeepMind推出AlphaGenome Atlas解码全基因组变异影响 : Google DeepMind公布基因组深度学习模型AlphaGenome及其预计算数据库AlphaGenome Atlas。模型具备单碱基对分辨率与100万碱基对长上下文,其Atlas图谱预计算了人类基因组全部90亿个单核苷酸可能变异的分子表型影响,数据规模达AlphaFold数据库的30倍,旨在系统解析罕见突变与复杂疾病的易感机制

vLLM v0.31.0引入CRIU快照机制将冷启动转化为毫秒级进程恢复 : vLLM发布v0.31.0版本,引入vllm snapshot与vllm preload常驻守护进程。该机制基于Linux CRIU技术实现推理引擎运行时的快速检查点保存与镜像还原,在实例热切或扩容时跳过耗时漫长的模型权重载入与初始化过程,显著降低大规模推理集群弹性调度时的冷启动延迟 (来源: vLLM)

哈工大与新国大开源视频世界模型2-bit KV Cache压缩方案QuantWM : 针对自回归视频世界模型极度消耗显存且传统量化引发严重画面闪烁的问题,哈工大深圳与NUS团队联合提出免训练量化方案QuantWM。研究揭示量化Key引起的时空注意力错位是时序抖动的根源,通过敏感性感知聚类与主子空间误差补偿,在保持生成画面时序稳定的同时实现最高6.2倍的KV Cache显存压缩 (来源: 机器之心)

QuantWM框架

Perplexity推出升级版开源决策模型pplx-decider-v1.1-27b : Perplexity开源升级版多模态决策模型pplx-decider-v1.1-27b。该权重在最新Hugging Face Decision Index 0.3评测中登顶,在保持视觉与逻辑决策精度的同时大幅优化了推理效率,配套Decision API服务单价同步下调至每百万输入Token 0.02美元 (来源: AravSrinivas)

pplx-decider-v1.1-27b

Meta开源生产级分配决策求解器Rebalancer : Meta正式开源内部运行超9年、日均处理约4000万次资源调度的C++核心求解器Rebalancer(提供Python接口与Apache 2.0协议)。该工具将分片调度、流量平衡等NP-hard问题抽象为统一定向无环图,针对百万级超大规模实体提供高效局部搜索与混合整数规划求解 (来源: MarkTechPost)

TII发布阿联酋方言大模型Falcon-Emirati-7B : 阿联酋技术创新研究院(TII)推出专精阿联酋方言的模型Falcon-Emirati-7B。团队构建了包含口语网络数据、本土文化背景与受控合成语料的数据管线,在本土评测基准Alyah上取得84.83%的多选题准确率,并在自由对话中显著提升了文化隐喻理解与礼仪匹配度 (来源: HuggingFace Blog)

Falcon-Emirati

Figma产品设计AI Agent全面进入GA商用 : Figma宣布其面向UI/UX产品设计的内置AI智能体正式向全体用户开放。新版本新增了团队设计规范参考指南绑定机制,以及多人协作模式下跨团队Agent动作协同可视能力,允许智能体直接基于组件库自动搭建高保真界面与多状态交互原型 (来源: The Verge)

Figma AI agent GA

Cohere开源多语言小模型家族Tiny Aya,覆盖70余种小众语言 : Cohere Labs在COLM 2026大会开源轻量化多语言模型家族Tiny Aya。该系列将通用多语言基座与区域特化变体相结合,覆盖全球70多种语言(包含大量低资源小语种),旨在降低端侧多语言部署门槛并改善小模型的跨文化语义生成 (来源: sarahookr)

Tiny Aya

NeurIPS 2026 | SAGE框架利用拓扑结构信号纠偏大模型长程推理 : 弗吉尼亚理工大学等团队针对LLM长链条推理“中途走偏却因终点奖励滞后无法纠错”的痼疾,提出结构可采纳性引导探索方法SAGE。该方法通过代数稀疏化压缩探索偏差,并借助双曲空间距离提供逐步反馈,在多项符号化与形式化数学基准中显著提升准确率,Lean验证通过率提升数倍 (来源: 机器之心)

SAGE长推理纠偏

Google推出实验性免代码游戏生成平台Playground : 谷歌上线AI游戏实验平台playground.google,用户仅需通过自然语言对话即可在浏览器中设计包含自定义物理规则、角色交互和场景风格的轻量级游戏,并支持多端游玩与社区分享,后续计划整合Unity Spark以引入更专业的3D引擎支持 (来源: Google AI Blog)

Replit上线跨项目全局上下文与后台异步代码Agent : Replit对开发环境进行重大升级,正式引入跨工程工作区全局上下文。智能体可索引用户账户下的所有历史项目与设计规范,实现从参考项目提取色彩与组件逻辑并迁移至新项目,支持后台异步生成编辑任务及一键审核合并 (来源: amasad)

🧰 工具

Hark Pro:搭载独立沙箱浏览器的端侧隐私个人智能体 : Figure AI创始人Brett Adcock团队上线桌面与移动端应用Hark Pro。系统搭载Handoff计算机使用智能体与前苹果团队打造的交互界面,可在隔离沙箱中安全调度用户凭证、自主浏览网页并执行办签证、购票与跨系统表单操作,操作轨迹全程对用户透传,平衡了自主代理与端侧隐私安全 (来源: TechCrunch、TheRundownAI)

Monid.ai获770万美元融资打造Agent动态工具结算网关 : 智能体开发服务商Monid.ai推出被称为“面向Agent的OpenRouter”的聚合API网关并获770万美元融资。开发者仅需单一接口即可让智能体在运行时动态发现并按调用计费结算涵盖营销、SEO、搜索、电商及多模态生成的2500个商业API,替代传统的按月企业SaaS订阅捆绑 (来源: yoheinakajima)

AgentID上线:专为AI Agent打造的独立身份凭据方案 : AgentMail推出AgentID服务。该方案为每个自主运行的智能体分配一个绑定至人类所有者的独立认证邮箱与身份凭据,使第三方SaaS平台能够在保留审计溯源、规避账户风控的前提下,安全放行外部Agent进行登录与跨平台授权操作 (来源: omarsar0)

Spotify Portal AI Plugins:将企业级开发平台引入主流代码智能体 : Spotify发布官方开源插件集,将内部开发者平台Spotify Portal直连接入Claude Code、Codex与Cursor。智能体可直接通过CLI检索微服务目录、调用服务诊断、查询健康状态,并支持通过shunt插件将I/O密集型任务分流至轻量模型以降低Token开销 (来源: GitHub Trending)

T3 Code上线线程内实时UI渲染与交互预览 : 代码工具T3 Code推出应用内UI可视化功能。智能体在执行前端重构或PR代码审查时,可直接在对话线程内内联渲染交互式HTML/React组件产物与视觉原型,减少了开发者频繁切出IDE进行热更新调试的上下文损耗 (来源: theo)

T3 Code UI Preview

Overmind开源:利用智能体执行轨迹自动化蒸馏垂直小模型 : 开源工具Overmind发布,支持从日常编码智能体或业务Agent的工具调用日志与执行轨迹中提炼构建高价值微调数据集与评测集。实测显示,其微调出的垂直小模型在长合同条款提取场景中,将引文虚构率由大模型的3.36%降至0.12% (来源: kimmonismus)

Overmind

Mitchell Hashimoto发布OSC 7501通用终端程序状态规范 : 著名开发者Mitchell Hashimoto发布全新的OSC 7501终端控制规范,允许命令行程序向终端精确上报空闲、运行、阻塞等待、完成及失败等细粒度状态,旨在替代目前数百款智能体编排器所依赖的启发式正则判断,确立多Agent状态通信的标准协议 (来源: mitchellh)

Scale AI开源高保真智能体强化学习环境框架AgentEnv : Scale AI联合Modal开源AgentEnv环境构建套件。该框架专为复杂长程Agent的强化学习后训练打造,提供动态触发器、虚拟时钟与多沙箱环境调度,可无缝对接主流云端沙箱集群以支持海量并发Rollout与环境对抗训练 (来源: Scale AI)

DAIR.AI推出面向Agent的顶会文献探索MCP套件 : 知名开源AI组织DAIR.AI推出专属MCP插件,支持一键接入Claude Code、Codex与Grok Bot等智能体。智能体可自主调取长期精选的AI论文数据库,完成最新研究脉络梳理、自动文献综述撰写以及方法架构可视化对比 (来源: DAIR.AI)

ruNNtime实现EmbeddingGemma 2完全在浏览器端WebGPU运行 : WebGPU推理库ruNNtime成功将EmbeddingGemma 2的文本和视觉塔移植至纯前端环境,用户可在无需后端服务参与的情况下,直接利用本地浏览器GPU对图库进行多模态语义搜索,验证了端侧轻量多模态检索架构在隐私保护与离线场景下的潜力 (来源: Reddit r/LocalLLaMA)

ruNNtime

Anthropic推出Claude for Google Workspace插件公测 : Anthropic面向付费订阅用户推出Google Workspace官方侧边栏插件,允许用户在Docs、Slides和Sheets内直接调用Claude进行多轮编辑、结构优化与自动格式排版,并支持直接读取跨文档上下文 (来源: The Verge)

📚 学习

杨立昆团队提出分层世界模型H-JEPA,长程视觉规划成功率翻两番 : 针对视觉端到端规划容易丢失局部细节的困境,杨立昆团队提出自顶向下分层表征的H-JEPA架构。各层具有独立的潜空间表征与语义抽象尺度,在复杂的Visual AntMaze迷宫长程规划测试中,三层堆叠结构将任务成功率由18%跃升至73% (来源: ylecun)

H-JEPA

Meta与MIT发布Coco:硬件与深度学习模型协同设计Agent平台 : Meta与MIT提出硬件设计多智能体系统Coco。面对数百GB未见模拟扫描数据,Agent能自主编写SQL查询关系型数据库、编排分析工具并读取UI导航状态,将TPU架构师在仿真配置建立与性能瓶颈归因上耗费的工时缩减一半 (来源: dair_ai)

Coco Copilot

基于AgentCore与OpenClaw构建带持久记忆的智能助手指南 : AWS团队发表长篇架构教程,展示如何在Serverless运行时上结合OpenClaw底座与Bedrock AgentCore持久记忆组件。文章详细拆解了短期事件捕获与异步长期事实抽取的双层记忆架构,并通过提示词缓存技术将多轮带记忆交互的推理成本削减近90% (来源: AWS Machine Learning Blog)

AgentCore Memory Architecture

斯坦福提出Priced Guidance框架,量化LLM提出原创科研假说能力 : 梁伟峻团队提出基于信息论的有价指引(Priced Guidance)评估范式。通过设计“二十个问题”博弈机制,精确计量模型从预训练截断点恢复未来新发表论文核心概念所需的信息比特,从压缩视角建立了量化模型科研直觉与前沿泛化能力的基准 (来源: percyliang)

Priced Guidance

多教师在策略蒸馏(MOPD)机制解析:破除跨领域RL能力冲突 : 研究拆解了多教师在策略蒸馏(MOPD)方法。针对推理、编程与对话等多领域在统一RL微调中存在的奖励冲突与算力过载,该方法分别训练领域专精教师模型,再通过反向KL散度在Token粒度为学生模型提供密集监督,在合并全能模型的同时兼顾样本效率 (来源: cwolferesearch)

MOPD

HAD框架:利用环境感知蒸馏提升小语言模型智能体执行力 : 论文提出面向带Harness部署的小模型智能体蒸馏方法HAD。通过在有无外部状态信息下对比教师模型的动作差异,专门训练小模型对框架信息的利用意图,在ALFWorld基准上将小模型任务成功率提升至63.4%,并在近六成的卡死场景中成功脱困 (来源: omarsar0)

HAD Distillation

亚马逊AGI开源自适应循环扩散语言模型ALoDLM : 亚马逊研究团队开源8B参数的ALoDLM架构与训练方案。通过在扩散语言模型内部引入自适应循环推理与渐进纠错机制,动态调配难度样本的计算资源,在多项综合语言理解与生成基准上全面超越同等规模的自回归基线 (来源: arankomatsuzaki)

ALoDLM

Jay Alammar分享《AI智能体图解指南》核心系统架构图 : 著名技术作者Jay Alammar分享了智能体系统最关键的闭环架构图,详细拆解了LLM在智能体环境中从用户目标接收、状态维持、记忆检索到环境动作执行的递归闭环机制,为开发者梳理了现代自主Agent系统的核心工程基石 (来源: Jay Alammar)

Agent架构图

💼 商业

AMD宣布拟以82亿美元全股票收购李飞飞空间智能创企World Labs : AMD宣布与李飞飞联合创办的世界模型独角兽World Labs达成最终收购协议,作价约82亿美元全股票交易。业界分析指出,随着Atlas模型确立稀疏视角实时4D重建可行性,具身与世界模型正迎来规模化工业拐点,AMD此举意在抗衡英伟达并在4D计算芯片架构与仿真生态中建立纵深壁垒 (来源: 36氪)

AMD收购World Labs

快手旗下可灵AI选定中金与高盛筹备香港IPO,计划募资逾10亿美元 : 快手旗下视频大模型业务可灵AI已确定中金、高盛和瑞银为保荐团队,推进香港分拆上市进程,拟募资至少10亿美元,最早有望于2027年挂牌。可灵2026年第二季度收入已超8.5亿元,独立上市旨在为高昂的算力集群研发拓宽独立融资通道,快手将保留绝对控制权 (来源: 36氪)

可灵AI筹备IPO

AI算力云服务商Lambda拟在IPO前以145亿美元估值筹集40亿美元 : 据华尔街日报报道,GPU云基础设施提供商Lambda正以145亿美元投前估值筹集高达40亿美元资金,Coatue与Blackstone领投。得益于来自Anthropic等大客户的巨额算力合同,其积压订单额激增至500亿美元,本轮股权融资将用于在IPO前锁定新一代算力中心建设 (来源: TechCrunch)

🌟 社区

企业部署Agent遭遇“协作税”:每1小时工单解决对应3小时内部沟通 : 客服管理平台Front对700位企业管理者的调研引发热议。数据揭示企业在引入Agent后并未直接削减人力成本,反而因智能体无法闭环带来的多节点交接与工单升级,产生了巨额未被测量的“协作税”——企业在跨系统交接和背景核验上耗费的时间达到实际解决时间的3倍,暴露出端到端可观测性缺失的治理痛点

ChatGPT标题末尾塞入博彩广告成因深度拆解:分词器污染与截断失效 : 开发者深度还原了ChatGPT会话标题偶现非法小广告的技术机理。由于o200k分词器预训练语料混入了大量灰色网站的高频长词元,而轻量级标题推理模型在收尾输出EOS控制符时发生概率漂移,最终从模型从未见过的冷门词元“垃圾房”中误采样输出了高概率的广告片段 (来源: 36氪)

云原生Harness架构兴起:K8s缔造者探索Agent集中治理方案 : Kubernetes早期核心团队创办的Stacklok开源云原生Agent Harness项目Mecatl。社区深度讨论了智能体从“本地终端脚本”走向“企业集中管控平台”的演进路径,呼吁将Agent状态、MCP工具网关与敏感沙箱执行环境彻底解耦,避免将企业核心资产与权限绑定于单机环境 (来源: Latent Space)

Meta Muse被曝实时建立400万用户社交档案引发隐私担忧 : 社区披露Meta旗下智能体Muse每小时会根据用户聊天和通讯记录自动更新详尽档案,包含社交关系脉络、人际冲突与偏好等。尽管Meta表示用户VM属于独立沙箱,但跨实例“共享学习经验”机制仍引发用户对隐形数据采集和定向广告滥用的强烈警惕 (来源: Reddit r/artificial)

Muse档案

开发者热议“AI不说人话”现象:从CoT压缩到语料拟合失调 : 近期开发者社区普遍吐槽最新编程大模型在汇报时频繁抛出“15/15全绿、单腿哑火”等生硬黑话。讨论指出,部分原因在于厂商为压低Token消耗,将隐式思维链(CoT)高度压缩成了晦涩简语;亦有极客以此为契机探讨高密度的古汉语或文言编程在Token极致压缩上的天然工程优势 (来源: 量子位)

AI表达能力讨论

Prompt加密绕过漏洞暴露:智能体自我解密成为安全短板 : 安全研究指出,攻击者利用加密后的恶意指令绕过Copilot等系统的外层安全过滤,智能体在处理输入时会主动完成解密、检索本地机密并执行网络外发。测试显示自动模型路由机制导致安全防御极不稳定,证明依靠模型自律充当安全防线存在系统性隐患 (来源: Reddit r/artificial)

Prompt安全漏洞

微型化极限突破:开发者训练仅2万参数的叙事模型MacroStories : 独立开发者开源了体积仅81KB(19,969参数)的微型语言模型MacroStories。该模型采用单解码器循环4次推理架构,可在普通CPU甚至单片机缓存中极速运行,并能在受限词表中维持清晰的叙事脉络,探索了语言连贯性所需的最低算力边界 (来源: Reddit r/LocalLLaMA)

MacroStories

💡 其他

电网扩容与变压器供应链短缺或先于算力芯片成为AI扩张硬刹车 : 能源政策分析指出,尽管全美AI数据中心电力负荷预计到2030年将攀升至50GW,但特高压变压器等重型电力设备的交付周期已普遍超过5年,且制造厂商因过往产能泡沫心存余悸不敢盲目扩产。物理电网与输变电设施的刚性供需错配,正成为制约算力无序扩张的最严峻现实物理瓶颈 (来源: Transformer)

AI is going to run out of power

全套Adobe设计工具遭开源逆向复刻:代码大模型重塑知识产权护城河 : 开源项目Artcraft借助Opus 5.5等前沿代码模型,通过反编译传统设计套件逻辑并重构为Rust规范,实现了全套Photoshop级设计软件的纯净室开源替代。社区热议代码Agent极速逆向老旧软件的能力,正从根本上击穿传统专属软件赖以生存的高壁垒商业护城河 (来源: dotey、amasad)

Artcraft

麦当劳因涉嫌利用AI定价工具串通加盟店价格遭遇反垄断诉讼 : 消费者在芝加哥联邦法院对麦当劳提起反垄断集体诉讼,指控其要求独立加盟商接入的动态定价AI工具实际构成了非公开销售数据的横向交换与算法价格操纵,涉嫌侵害消费者权益并扰乱市场竞争秩序 (来源: The Guardian)

McDonalds Golden Arches

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注