AI日报 – 2025-07-20(晚)
OpenAI 的实验性推理 LLM 在国际数学奥林匹克竞赛中获得金牌水平 : OpenAI 的最新实验性推理大型语言模型在 2025 年国际数学奥林匹克竞赛 (IMO) 中取得了金牌水平的成绩。该模型在与人类相同的时限内完成比赛,未使用任何工具,并以自然语言书写证明,这标志着 AI 在数学推理领域的重大突破。虽然该模型是实验性的,OpenAI 表示不会立即发布具有同等能力的模型,但这一成就预示着未
AI日报 – 2025-07-20(早)
OpenAI的实验性推理LLM在国际数学奥林匹克竞赛中获得金牌 : OpenAI 的最新实验性推理LLM在2025年国际数学奥林匹克竞赛(IMO)中取得了金牌级别的成绩,解决了6道题中的5道。该模型在与人类相同的规则下运行,包括每次4.5小时的限制,并且没有使用任何工具,以自然语言输出证明过程。这标志着AI在数学推理领域的重大突破,预示着AI在科学发现中的潜力。
AI日报 – 2025-07-19(晚)
ARC 发布交互式推理基准 ARC-AGI-3 预览版: ARC 发布了 ARC-AGI-3 的预览版,包含三个游戏,旨在挑战交互式推理能力。与前两版不同,ARC-AGI-3 更侧重于评估智能体在动态环境中的推理能力,而非静态推理。目前,前沿 AI 在该基准测试中得分 0%,而人类得分 100%。ARC 还发布了 API 供 AI 研究人员测试他们的智能体,并举办了奖金为 1 万美元的智能体竞赛。
AI日报 – 2025-07-19(早)
印度计划建立自己的大型咨询公司: 印度正在计划建立自己的“七大”咨询公司,以与全球巨头竞争。此举旨在减少在专业机构监管和政府招标中的自我限制,并提升印度在国内外咨询市场的地位。此举反映了印度希望在全球经济中扮演更重要角色的雄心,并可能对全球咨询业格局产生影响。
AI日报 – 2025-07-18(晚)
OpenAI 发布 ChatGPT Agent : OpenAI 发布了全新的 ChatGPT Agent,它融合了 Operator、Deep Research 和 ChatGPT 的优势,能够在虚拟机中自主选择和使用工具,完成复杂任务,如购物、预订、生成报告等。这标志着 AI 智能体能力的重大升级,也引发了对 AI 安全和未来工作模式的讨论。
AI日报 – 2025-07-18(早)
OpenAI 推出全新AI编程工具 Codex : OpenAI 发布 Codex,一款深度集成 ChatGPT 的 AI 编程工具。Codex 不仅能理解自然语言指令,还能生成高质量代码、修复 bug、甚至根据用户需求进行代码重构。该工具的发布标志着 AI 编程进入新阶段,有望大幅提升程序员的生产力,并降低编程门槛,让更多人参与到软件开发中来。
AI日报 – 2025-07-17(晚)
IMO 2025 竞赛结果公布,AI模型表现不佳: 在澳大利亚举行的 IMO 2025 国际数学奥林匹克竞赛中,多个AI模型参与其中,但成绩并不理想。Claude Sonnet 4、Gemini 2.5 Pro 和 ByteDance Seed 1.6 都只解决了 2/6 的问题,其中 Seed 1.6 和 Gemini 2.5 Pro 对其中一个问题给出了完整解答。值得关注的是,Seed 1.6
AI日报 – 2025-07-17(早)
AI教父联名OpenAI、DeepMind、Anthropic:警惕CoT: OpenAI、Google DeepMind、Anthropic 等公司以及包括 Yoshua Bengio 在内的多位 AI 研究员联合发表立场文件,呼吁加强对 CoT(思维链)监控技术的研究。CoT monitoring 允许监控 AI 模型的推理过程,从而及早发现不良意图。然而,CoT 可监控性并非一成不变,可能受
AI日报 – 2025-07-16(晚)
Andrew Ng携手贝恩成立AI咨询公司AI Aspire: 吴恩达宣布成立AI咨询公司AI Aspire,与贝恩公司合作,帮助企业制定AI战略并实现转型。新闻稿指出,企业高管意识到AI转型需要自上而下的领导,但AI对特定业务的影响极其复杂。AI Aspire将与贝恩合作,帮助企业应对AI战略、产品创新、生产力提升、技术投资、风险管理、人力资源、团队转型以及新市场等方面的挑战。