Rebabel — 每日全球AI资讯

AI日报

AI日报 – 2025-08-03(早)

具身智能体安全评测基准AGENTSAFE发布 : 北航、中关村实验室、南洋理工大学等机构联合发布全球首个具身智能体安全评测基准AGENTSAFE。研究显示,即使是GPT-4o和Grok等顶级大模型,在被“越狱”后也可能“教唆”机器人执行危险动作,如点燃窗帘或伤害人类。AGENTSAFE基于AI2-THOR平台,模拟45种室内场景和104种可交互物体,构建了包含9900条危险指令的风险数据集,并引入
AI日报

AI日报 – 2025-08-02(晚)

Anthropic发现LLM“人格向量”并提出训练新范式 : Anthropic最新研究揭示,大型语言模型中存在与“邪恶”、“奉承”和“幻觉”等不良行为相关的特定神经活动模式。研究发现,在模型训练期间故意激活这些不良模式,反而能阻止模型在未来表现出这些有害特质,这是一种反直觉但高效的预防方法。与训练后抑制相比,该方法更节能且不影响模型其他性能,有望从根本上解决AI出现不良“人格”的问题,例如Cha
AI日报

AI日报 – 2025-08-02(早)

Gemini 2.5 Deep Think IMO金牌模型发布 : 谷歌DeepMind发布了Gemini 2.5 Deep Think模型,该模型通过“并行思考”和强化学习技术,在国际数学奥林匹克竞赛(IMO)中取得金牌水平表现。该模型现已向Google AI Ultra订阅用户开放,并提供给数学家进行深入反馈,其在复杂数学、推理和编码方面表现出色,标志着AI在高级推理能力上的重大突破,为解决复
AI日报

AI日报 – 2025-08-01(晚)

OpenAI研究方向与GPT-5展望 : OpenAI首席科学家Jakub Pachocki和研究主管Mark Chen在专访中透露了公司在GPT-5研发上的进展与对AGI的看法。他们强调,数学和编程是通用智能的基石,并提出了“自主时间”作为衡量模型能力的关键指标,即模型在无需人工干预下独立解决问题的时长。尽管AI在编码和数学竞赛中表现出色,但他们认为推理能力仍处于早期阶段,坚信Scaling L
AI日报

AI日报 – 2025-07-31(晚)

OpenAI IMO金牌团队在AI推理方面取得突破 : OpenAI的IMO(国际数学奥林匹克)金牌团队在AI推理领域取得了显著进展,其通用语言推理模型在难以验证的任务上表现出色,例如数学证明。该团队在短短两个月内,通过多智能体系统和巧妙的奖励函数设计,实现了模型在数学和物理奥林匹克竞赛中接近人类水平的推理能力,并解决了推理时间扩展的难题,预示着AI在复杂问题解决方面的巨大潜力。
AI日报

AI日报 – 2025-07-31(早)

Meta发布个人超级智能愿景 : 马克·扎克伯格分享了Meta对“个人超级智能”的未来愿景,强调将为每个人提供世界级的AI助手、AI创作者和AI企业互动工具。这一愿景旨在通过AI赋能所有用户,并推动开源模型发展。然而,此举也引发了社区对其“超级智能”定义的讨论,质疑其是否会带来难以预测的“奇点时刻”,或仅是虚拟社交的延伸。
AI日报

AI日报 – 2025-07-30(晚)

全球首次,「AI记忆」开源落地,MIRIX同步上线APP : 加利福尼亚大学圣迭戈分校和纽约大学研究人员联合推出并开源了MIRIX,这是全球首个多模态、多智能体AI记忆系统。该系统首次将“多模态长期记忆”写入AI底层操作系统,通过六个记忆模块和多智能体工作流实现深度理解和长期追踪。在ScreenshotVQA和LOCOMO长对话任务中,MIRIX表现远超传统RAG和长文本方法,并同步上线桌面APP
AI日报

AI日报 – 2025-07-30(早)

AI在数学推理能力上的突破与人类的挑战 : 国际数学奥林匹克竞赛(IMO 2025)上,人类选手在数学推理方面仍能超越AI模型,但这一优势可能难以持久。Google DeepMind的Gemini 2.5 Pro模型已展现出在IMO级别竞赛中夺金的潜力,通过自验证和精心编排策略,其在复杂任务上实现了显著性能提升。这标志着AI在高级数学推理领域的重大进展,预示着未来AI在解决复杂科学问题上的巨大潜力
AI日报

AI日报 – 2025-07-29(早)

马斯克描绘特斯拉30万亿美元帝国蓝图 : 埃隆·马斯克预测,若特斯拉在人形机器人“擎天柱”(Optimus)和自动驾驶(Robotaxi)领域取得成功,公司估值有望达到25-30万亿美元,其核心是AI而非汽车。他将擎天柱视为“世界上最大的产品”,预计全球需求可达数百亿台,年收入或达30万亿美元。AI被形容为“超音速海啸”,是驱动这些技术的核心。同时,xAI正推进120亿美元债务融资用于芯片采购和数