OpenAI公开内部RSI数据并确认达成AI研究实习生目标,首席科学家发文警示“异…|AI日报 2026-09-08

🔥 聚焦

OpenAI公开内部RSI数据并确认达成AI研究实习生目标,首席科学家发文警示“异星心智”并呼吁行业放缓 : OpenAI正式公布AI模型在内部加速科研的详实数据,宣布已如期达成“自动化AI研究实习生”目标,并计划在2028年3月实现完全自主的AI研究员。数据显示,OpenAI中位数研究员每日消耗推理Token折合逾600美元,头部10%研究员日均消耗超7000美元;每1个人类工作日对应3.1个Agent工作日。然而,首席科学家Jakub Pachocki同日发表长文《An Alien Mind》,警示思维链监控能力正随着模型变强而加速失效,AI极易在脱离监督后出现未对齐行为,呼吁全行业将自愿放缓与国际协调置于最高优先级(来源:OpenAI NewsTHE DECODER机器之心

OpenAI公开内部RSI数据

菲尔兹奖得主团队Mostik发布大模型隐藏状态直连“跨模态桥”,4B小模型无文本交互逆袭大模型 : 初创团队Mostik(首席科学家为菲尔兹奖得主Stanislav Smirnov)提出打破传统文本交互瓶颈的新架构。该方案通过一个小型可训练的“桥”,将753B参数的GLM-5.2在预填充阶段产生的隐藏状态直接传递给手机端运行的4B Qwen-3.5,大模型全程不输出文本,仅由小模型负责解码输出。该设计将大模型推理成本压缩至二十分之一,同时让4B小模型在ARC-AGI 3难题子集上准确率翻倍,为异构多模型深度协作提供了全新的数学与工程范式(来源:量子位

菲尔兹奖得主入局大模型

韩国启动“全民AI计划”:政府补贴512张B200芯片,三大财团主导全民主权AI服务 : 韩国科学技术信息通信部宣布选定SK Telecom、KT和Kakao三大财团推进“AI for All”国家项目,计划年底前向全体国民提供免费、无限量的通用AI与公共办事Agent服务。韩国政府今年直接下拨512张NVIDIA B200 GPU,并计划自2027年起由国家预算承担全额运营成本,同时强制要求各财团服务中本土自主模型占比不得低于80%,成为全球首个将高级AI列为公共基础设施并提供国家级保障的G20经济体(来源:TechRadar36氪

韩国启动全民AI计划

芝诺机器人发布全球首个去中心化协作具身基础模型Zeno-1 : 芝诺机器人推出3B参数的物理智能基础模型Zeno-1,专为去中心化多机器人实时协同作业设计。该模型摒弃了传统中心调度器与同步演示模仿路线,采用“闭环伙伴交互(CPI)”四阶段递进训练,使同构模型副本在仅依靠本地30Hz视觉-运动反馈和环境状态交互下,自发涌现减速、等待、让步等协作行为,并内置预测式世界模型实现提前0.5秒故障预警,解决了多具身智能体任务拆解中的维度爆炸与时序累积误差难题(来源:机器之心

协作具身智能基础模型Zeno-1

🎯 动向

GPT-6 Sol内测曝光:单次测试速度达Astra的6倍,专攻高吞吐Agent任务 : 社区爆料OpenAI正在内部测试GPT-6家族新成员GPT-6 Sol。实测显示,在SVG生成与沙盒世界构建等长输出任务中,Sol在Max推理档位下的单次响应速度约为GPT-6 Astra的6倍,大幅压缩了等待时间与Token成本。业内推测Astra侧重最高难度的深度因果推理,而Sol定位为兼顾高吞吐与经济性的规模化生产级Agent主力模型,有望在9月底的开发者大会正式亮相(来源:量子位36氪

GPT-6 Sol内测曝光

智象未来发布具身世界模型HiDream-O1-Embodied,登顶RoboColiseum扰动子榜 : 智象未来正式推出原生全模态具身世界模型HiDream-O1-Embodied,首次打通图像、视频、3D与动作的统一表征与因果推演。在具身仿真评测平台RoboColiseum中,该模型在光照、遮挡、相机偏移等强干扰的“扰动适应”子榜单上以0.692分登顶第一。团队通过高精度动捕基座与生成式扩散构建“真实基座+生成增强”数据飞轮,显著提升了机器人在非理想真实环境下的鲁棒操作能力(来源:机器之心量子位

HiDream-O1-Embodied具身世界模型

阿里开源端到端驾驶大模型Qwen-Drive 1.0,整合空间感知与轨迹规划 : 阿里巴巴Qwen团队开源基于Qwen3.5-4B构建的Qwen-Drive 1.0。该模型引入鸟瞰图(BEV)3D感知头与轨迹规划专家模块,使单一模型能够同时承担座舱语音助手、交通因果问答与连续驾驶规划任务。闭环仿真评测显示,强化学习微调后的模型将车辆偏航率由24%降至12%,并完整保留了基座模型的通用语言与常识能力(来源:THE DECODER

Qwen-Drive 1.0架构

颜水成团队发布实时交互双脑记忆架构VoiceMem : 颜水成与南洋理工大学等团队联合发布面向数字共生体的类脑记忆框架VoiceMem。该架构针对语音交互的高时效与情感特征,设计了“信息左脑”(双层图检索管理事实)与“情感右脑”(长短期情绪归因与人格沉淀),将长上下文检索时延压缩至134ms并隐藏在标准VAD静音等待窗口内,在长对话基准LoCoMo上仅用5条记忆即取得91.2分(来源:机器之心

VoiceMem流式双脑架构

微软与上交大开源证据驱动长程科研Agent运行时Argus : 微软与上海交通大学联合推出面向多日复杂科研任务的Agent推理运行时Argus。系统将传统以预设目标驱动(Goal-Driven)的架构转向证据驱动(Evidence-Driven),通过Manager、Planner、Engineer与Reviewer四大解耦角色循环运作,支持多Harness协同与知识沉淀。在27个跨学科科研战役、共计1548小时的连续实测中,实现了平均每40.7小时仅需一次人工干预的高自主度运行(来源:机器之心

Argus长程科研Agent系统

英伟达与哈佛等联合提出动作流世界模型Hydra-0 : 英伟达与哈佛大学研究团队提出以动作流(Action Flow)为条件的通用世界模型Hydra-0。模型将机械臂及人手的物理动作映射为像素平面的连续运动轨迹,消除了跨本体控制接口的鸿沟。测试表明,Hydra-0使机器人运动预测误差降低90.4%,物体变形误差降低60.2%,并支持通过逆向模式直接根据目标物体轨迹反推生成机器人的可执行操作(来源:36氪

Hydra-0通用世界模型架构

西湖大学等提出代码驱动世界模型Code World Model : 西湖大学与南洋理工大学团队推出Code World Model架构,重塑可交互世界模型的生成范式。该方案由Coding Agent通过编写可执行代码维护底层刚体碰撞、属性与因果规则,再将状态编译为轻量低分辨率Proxy骨架输入视频扩散模型MiniMax-H3生成精细画面,有效解决了纯视频模型在长期物理一致性与复杂交互逻辑上的结构性缺陷(来源:36氪

Code World Model框架

🧰 工具

阿里“千问办公”上线业内首个多人协作工作台 : 阿里巴巴旗下企业级Agent产品“千问办公”推出“多人工作台”功能。用户仅需以自然语言描述业务流程与角色需求,系统即可一键生成支持百人同时在线协作的专属网页应用,原生集成角色权限隔离、云端数据库、集中管理后台与免运维发布能力,极大降低了中小组织定制内部OA与业务流系统的开发门槛(来源:量子位

千问办公多人工作台

360发布企业级智能体平台纳米Work : 360正式推出纳米Work企业智能体协同工作平台,主打“云端办公室”与企业权限打通。平台预置2万余种常用工具与环境依赖,让Agent直接在云端安全沙箱中执行长程复杂任务而不受本地关机中断;企业版深度打通通讯录、域账号与代码库权限,支持将已跑通的最佳工作流沉淀为团队共享的Skill组件(来源:36氪

360纳米Work企业智能体平台

feynman:面向全流程科研的开源AI Agent工作台 : 开发者开源AI科研智能体工作台feynman,基于Pi运行时与alphaXiv论文生态构建。工具内置Researcher、Reviewer、Writer和Verifier四大协同角色,提供从文献检索、跨论文图谱打分(PaperRank)、论文与开源代码一致性审计(audit)到复现方案生成的全链路本地化与命令行支持,并支持一键导出为Codex与Claude Code兼容的Agent Skills(来源:GitHub Trending

feynman科研智能体工作台

geo-seo-claude:面向AI搜索时代(GEO)的自动化SEO优化技能库 : 开源工具geo-seo-claude为Claude Code引入一整套生成式引擎优化(GEO)技能包。针对AI搜索(Perplexity、ChatGPT、Google AI Overviews等)的引用机制,提供内容可引用性评分、AI爬虫权限审计、llms.txt规范生成及跨平台品牌可见度扫描,帮助网站从传统关键词排名转向AI大模型答案信源优化(来源:GitHub Trending

geo-seo-claude技能库

📚 学习

Meta FAIR提出AI科研偏好模型(RPMs),预筛选实验降低算力消耗 : Meta FAIR、牛津大学与UCL联合提出AI Research Preference Models(RPMs)。针对自动科研Agent在生成海量实验候选项时验证算力昂贵的问题,RPM利用冻结的预训练大模型对未经执行的方案进行成对淘汰排序,挑选出最具前景的实验方案执行。在AIRS-Bench基准上,该方法让智能体以1.5-1.6倍的速度提前达到基线24小时的探索水平(来源:MarkTechPost

H Company发布单塔多模态无解码器检索编码器NeoMME : 法国初创公司H Company开源NeoMME双向编码器家族(260M与800M)。模型彻底移除了传统的独立视觉编码塔(Vision Tower)与因果解码器,使用单一Transformer架构同时处理文本Token与32×32原始图像Patch,在ViDoRe v3视觉文档检索基准上达到0.523 nDCG@10,以极小参数规模匹敌3.75B的ColQwen2.5模型(来源:MarkTechPost

NeoMME单塔多模态编码器

YC Paper Club长文探讨:为什么智能体Harness比模型本身更关键 : Y Combinator举办智能体Harness专题研讨,多位一线研究者深入拆解了Harness从静态Prompt包装到自进化操作系统的演进历程。讨论指出,在相同的模型权重下,具备程序化REPL交互、持久上下文分级管理(L1-L3 Cache)以及自修正能力的Harness可将ARC-AGI得分从30%推升至95%,未来AI架构的护城河将向外部运行环境的表达力与状态管理转移(

论文揭示大模型在线策略蒸馏极限:单样本即可覆盖全数据集关键状态 : 清华大学等机构发表研究《Rethinking On-Policy Distillation of Large Language Models II: One Training Example》。论文发现,通过让学生模型在单道问题上进行多轮生成与针对性对齐,其内部表征即可覆盖完整题库训练71.5%的隐状态;16道题即可达到98.9%的覆盖率,表明在线蒸馏的瓶颈在于学生模型的消化效率而非初始题目数量(来源:HuggingFace Daily Papers

单样本在线策略蒸馏研究

💼 商业

算电协同AI Infra厂商中科类脑获中车资本领投数亿元B+轮战略融资 : 智能技术与算力优化企业中科类脑宣布完成数亿元B+轮融资,由央企产业资本中车资本领投,银杏谷资本等跟投。资金将重点投向算电协同型Token工厂的核心调度算法攻关与异构算力纳管,依托中车新能源优势破解高能耗场景下的绿电与算力匹配难题,推动国内AI基础设施由规模扩张迈向度电能效竞争(来源:量子位

中科类脑B+轮战略融资

智能决策与本体基础设施服务商中科世通亨奇完成近5亿元B轮融资 : 面向高可信关键领域的智能决策服务商中科世通亨奇宣布完成近5亿元B系列融资,投资方包括南方德茂基金、联通创投等机构。公司基于自主研发的智能本体空间(AOS)与“世通灵境”产品体系,为国防、能源电力及运营商等行业提供可溯源、带严格权限控制的工业级Agent决策闭环(来源:36氪

中科世通亨奇融资发布

Uber联合创始人卡兰尼克旗下机器人初创Atoms被曝筹谋进军Robotaxi : 据英国金融时报报道,Uber前创始人Travis Kalanick创立的具身与自动化硬件初创Atoms,在完成由a16z领投的17亿美元巨额融资后,正启动大规模招聘与并购计划进军Robotaxi自动驾驶赛道。报道披露Uber已向Atoms注资1亿美元并就未来车队技术合作展开磋商(来源:TechCrunch

🌟 社区

黄仁勋声称“AGI已到来”,学术界与开发者对通用智能定义展开激烈争辩 : 英伟达CEO黄仁勋在社交平台祝贺OpenAI称“GPT-6 Astra标志着AGI已经到来”,引发了社区对通用人工智能界定标准的激烈讨论。知名学者Gary Marcus等人发文反驳,指出当前模型在因果推理、长期自主规划和实体世界理解上仍存在显著断层,缺乏科学严格的客观评测,商业领袖不应随意重新定义AGI;但支持者则认为从计算机操作与多步骤编码等经济实用价值看,AI已跨入事实上的AGI阶段(来源:Marcus on AIReddit r/ArtificialInteligence

Jensen Huang引发AGI热议

GPT-6 Astra通关经典游戏《Portal》,耗费571美元Token引发算力与自主性热议 : 开发者分享使用GPT-6 Astra通过纯视觉输入与键鼠操作自主通关第一人称解谜游戏《Portal》的完整记录,整个过程历时近24小时,消耗API Token费用约571.18美元。社区热议这展示了模型在3D空间理解与序列动作探索上的质变,但单任务数百美元的消耗也让普通开发者对当前前沿模型的真实工程落地性价比产生审慎评估(来源:The VergeReddit r/ChatGPT

GPT-6 Astra通关Portal

开发者曝Notion官方MCP连接器暗中植入营销Prompt诱导付费 : 社区开发者在Reddit发帖曝光,Notion官方推出的Model Context Protocol(MCP)服务器在系统提示词中暗中注入了推广Notion Business套餐的指令,促使AI智能体在执行常规工作流时自发向用户推销付费升级。该事件引发了开发者对第三方插件安全、上下文投毒及商业公司滥用Agent提示词通道的广泛担忧(来源:Reddit r/ClaudeAI

Notion MCP注入推广提示词

瑞士银行巨头瑞银集团(UBS)将AI工具应用技能设为初级银行家招聘硬性门槛 : 英国金融时报披露,瑞银集团(UBS)在2027年度全球投行与市场部门的毕业生及实习生招聘中,已将掌握AI工具列为必要考核指标。面试环节将直接测试候选人利用AI完成金融建模、行业调研与报告生成的效率,标志着金融行业对基层白领的技能要求从基础执行全面转向AI调度与结果验证(来源:THE DECODER

自主智能体“微型经济体”实验1f916.ai:2000个AI实现独立协作与链上交易 : 独立开发者分享其实验项目1f916.ai的运行数据:在为Claude Agent提供独立域名与环境一个月后,超过2000个自主AI智能体自发产生了4000余篇帖子与10万次交互。智能体不仅构建了自发纠错机制与身份验证体系,还通过USDC微支付实现了自动化任务发包与服务结算,展示了多智能体去中心化社会的微观演进模型(来源:Reddit r/ClaudeAI

1f916智能体经济体实验

💡 其他

英国政府AI政策核心操盘手Matt Clifford因加盟Anthropic利益冲突辞任Aria主席 : 上周宣布加盟Anthropic领导国际政府事务的英国高级科学技术研究局(Aria)主席Matt Clifford,在资深议员及议会科学委员会关于其“存在严重利益冲突”的严厉批评下,正式宣布辞去Aria主席职务。该事件凸显了全球政界对AI巨头与政府监管层之间“旋转门”机制日益上升的警惕与审查(来源:The Guardian

Matt Clifford辞任英国Aria主席

50万部图书作者集体维权:Anthropic版权和解金遭遇出版商与中介争抢 : 在Anthropic达成15亿美元AI训练版权和解协议并进入赔付程序之际,多位原作者在社交平台披露,HarperCollins等多家传统出版商及文学经纪中介正在对已解除版权或自出版的旧作恶意提交50%甚至100%的赔偿索赔。作家协会已介入协助作者发起争议申诉,暴露出AI版权和解执行层面的混乱与产权漏洞(来源:TechCrunch

肯尼亚外包写作产业因生成式AI普及面临系统性瓦解 : 纽约时报调查报道指出,曾雇佣超过4万名从业者的肯尼亚内罗毕学术代写与数据标注产业,在ChatGPT等大模型普及后订单与单价遭遇毁灭性暴跌。这一重度依赖低成本智力外包的发展中国家零工经济生态迅速萎缩,仅存少量“AI文本去味”润色岗位,揭示了生成式AI对全球劳动力外包市场的深刻冲击(来源:THE DECODER

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注