作者: Rebabel Editorial

Rebabel Editorial 是 Rebabel 的编辑团队,每日聚合并梳理全球人工智能领域的重要资讯,以 12 种语言发布。The Rebabel Editorial team curates and summarizes the most important AI news worldwide, published daily in 12 languages.
AI日报

AI日报 – 2025-05-17(早)

OpenAI发布Codex研究预览版,集成于ChatGPT: OpenAI推出Codex,一个云端软件工程智能体,能理解大型代码库、编写新功能、修复错误,并可并行处理多任务。Codex基于o3微调的codex-1模型,在SWE-bench上表现优异。该功能将逐步向ChatGPT Pro、Team和Enterprise用户开放,旨在大幅提升开发者生产力,预示着AI在软件开发领域将扮演更核心角色。社区
AI日报

AI日报 – 2025-05-16(晚)

Meta旗舰AI模型”Behemoth”发布再三推迟,引发内部担忧与行业反思: Meta原计划4月发布、后推迟至6月的旗舰AI模型”Behemoth”再次延期至秋季或更晚。内部消息称,模型性能提升未达预期,引发对高额AI投入方向的质疑,并可能导致AI产品部门管理层调整。Meta曾宣称Behemoth在部分测试中领先,但实际训练遭遇瓶颈。此事件并非孤例,OpenAI的GPT-5、Anthropic的
AI日报

AI日报 – 2025-05-16(早)

DeepMind推出AlphaEvolve:Gemini驱动的进化编码智能体,推动算法发现 : AlphaEvolve结合Gemini模型的创造力与自动评估器,利用进化框架优化算法。它已在多个领域取得突破,如用48次标量乘法完成4x4复数矩阵乘法,改进了Strassen算法;在11维空间中发现593个外球配置,推进了300年历史的“接吻数问题”。此外,AlphaEvolve还优化了谷歌数据中心调度
AI日报

AI日报 – 2025-05-15(晚)

谷歌DeepMind发布AI编程智能体AlphaEvolve,实现算法自我进化与优化: 谷歌DeepMind推出AI编程智能体AlphaEvolve,该智能体能够利用Gemini大语言模型的创造力与自动化评估器相结合,自主发现、优化并迭代算法。AlphaEvolve已在谷歌内部署一年,成功应用于提升数据中心效率(Borg系统全球算力恢复0.7%)、加速Gemini模型训练(提速23%,整体训练时间
AI日报

AI日报 – 2025-05-15(早)

谷歌DeepMind发布AlphaEvolve:Gemini驱动的编码智能体,革新算法发现: 谷歌DeepMind推出AlphaEvolve,一个由Gemini驱动的AI编码智能体,旨在通过结合大型语言模型的创造力与自动化评估器来发现和优化复杂算法。AlphaEvolve已成功设计出更快的矩阵乘法算法,解决了如Erdős最小重叠问题和接吻数问题等开放数学难题,并在谷歌内部用于优化数据中心效率(平均
AI日报

AI日报 – 2025-05-14(晚)

MLSys 2025公布最佳论文奖,FlashInfer等项目入选 : 国际系统领域顶会MLSys 2025公布了两篇最佳论文,其中之一是来自华盛顿大学、英伟达等机构的FlashInfer,这是一个专为LLM推理优化的高效可定制注意力引擎库,通过优化KV-Cache存储、计算模板和调度机制,显著提升了LLM推理的吞吐和降低延迟。另一篇最佳论文是《The Hidden Bloat in Machin
AI日报

AI日报 – 2025-05-14(早)

OpenAI HealthBench基准发布,AI医疗能力显著提升: OpenAI发布了HealthBench,这是一个与全球262名医生合作构建的医疗AI评估基准。测试显示,最新的AI模型(如o3、GPT-4.1)在医疗对话场景中的表现已与医生辅助AI后的最佳水平相当,远超独立医生(约4倍)。小模型性能也有提升。这标志着AI在医疗健康领域的巨大潜力,评估体系旨在推动AI安全有效地应用于临床实践。
AI日报

AI日报 – 2025-05-13(晚)

OpenAI首席科学家Jakub Pachocki专访:AI五年内或可自主发现新科学,世界模型与强化学习是关键: OpenAI首席科学家Jakub Pachocki在《自然》杂志专访中表示,AI有望在5年内实现自主科学发现,并对经济产生重大影响。他认为,当前的推理模型(如o系列、Gemini 2.5 Pro、DeepSeek-R1)通过思维链等方式解决复杂问题,已展现出巨大潜力。Pachocki强
AI日报

AI日报 – 2025-05-13(早)

OpenAI发布HealthBench评估医疗AI性能: OpenAI推出了HealthBench,一个旨在衡量大型语言模型在医疗场景中性能和安全性的新基准。该基准由250多名全球医生参与开发,包含5000个真实医疗对话和48562条独特的医生撰写评估标准,覆盖急诊、全球健康等多种情境及准确性、指令遵循等行为维度。测试显示,o3模型准确率达60%,而GPT-4.1 nano在成本降低25倍的情况下