Rebabel — 每日全球AI资讯

AI日报

AI日报 – 2025-05-29(早)

LLM+RL训练有效性质疑:虚假奖励竟也能提升模型推理能力: 近期,华盛顿大学、艾伦人工智能实验室与伯克利的研究者发现,即使使用随机甚至错误的“虚假奖励”训练Qwen2.5-Math-7B模型,也能在MATH-500等数学基准测试上取得显著性能提升(随机奖励提升21%,错误奖励提升25%),与真实奖励(28.8%)效果相近。这一现象引发AI社区对当前强化学习(RLVR)方法有效性的广泛讨论与质疑,
AI日报

AI日报 – 2025-05-28(晚)

RLHF/RLAIF的未来:随机/错误奖励也能提升模型性能? : Stella Li的实验表明,使用随机奖励或不正确奖励训练Qwen2.5-Math-7B模型,在MATH-500测试集上分别提升了21%和25%,接近使用真实奖励28.8%的提升效果。natolambert转发的Rulin Shao的研究也发现,RLVR(Reinforcement Learning from Verifier Re
AI日报

AI日报 – 2025-05-28(早)

Omni-R1:新颖双系统强化学习框架提升全模态推理能力 : Omni-R1 提出了一种创新的双系统架构(全局推理系统+细节理解系统)来解决长时视频音频推理和像素级理解之间的冲突。该框架利用强化学习(特别是组相对策略优化 GRPO)端到端地训练全局推理系统,通过与细节理解系统的在线协作获得分层奖励,从而优化关键帧选择和任务重述。实验表明,Omni-R1 在 RefAVS 和 REVOS 等基准测试
AI日报

AI日报 – 2025-05-27(晚)

AMD与NVIDIA在AI推理领域的性能之争引发热议: SemiAnalysis指出SGLang在AMD ROCm平台上存在测试问题,如删除失败测试、降低通过门槛,并质疑MI325X CI被禁用。Anush Elangovan(AMD)回应称,最新SGLang下MI300X与H200在GSM8K准确率均为0.497,但MI300X在延迟(19.479s vs 24.016s)和吞吐量(9216.5
AI日报

AI日报 – 2025-05-27(早)

DeepSeek-V3-0526模型或将发布,对标GPT-4.5和Claude 4 Opus: 社区消息显示,深度寻求(DeepSeek)可能即将发布其V3模型的最新更新版本DeepSeek-V3-0526。据Unsloth文档页面信息,该模型性能与GPT-4.5及Claude 4 Opus相当,有望成为全球性能最佳的开源模型。这标志着DeepSeek对其V3模型的第二次重要更新。Unsloth已
AI日报

AI日报 – 2025-05-26(晚)

谷歌创始人谢尔盖·布林解读Gemini强大之谜与AI未来: 谷歌创始人谢尔盖·布林在访谈中深入探讨了Gemini模型的快速崛起及其背后的技术逻辑。他强调,语言模型已成为AI发展的主要驱动力,且其可解释性(如思维模型能洞察推理过程)对安全至关重要。布林指出,模型架构趋同,但后训练阶段(微调、强化学习)日益重要,赋予模型工具使用等强大能力。谷歌正致力于让模型能进行深度思考(数小时乃至数月),以解决复杂
AI日报

AI日报 – 2025-05-26(早)

字节开源GPT-4o级图像生成模型BAGEL: 字节跳动发布了开源多模态AI模型BAGEL-7B-MoT,该模型在图像生成、编辑和视觉理解方面展现出与OpenAI GPT-4o相媲美的能力。BAGEL采用混合变压器专家(MoT)架构,拥有70亿活跃参数(总计140亿),能够在一个统一模型中处理文本到图像生成、图像编辑(包括自由形式编辑、风格迁移、场景重建和多视角合成)以及视觉理解等多种任务。研究发
AI日报

AI日报 – 2025-05-25(晚)

Claude 4 系统提示泄露揭示其复杂内部运作与伦理考量: Claude 4 的系统提示被泄露,详细展示了其内部指令集,包括处理用户请求的多种模式、工具使用规范 (如网络搜索)、安全与伦理边界以及避免生成有害内容的机制。提示中包含了诸如“运行循环提示”、“输入分类与分派”、“结构化响应模式”等多种AI代理模式,并强调了在特定情境下的行为准则,例如在被要求执行不道德或非法行为时应如何回应,甚至包含
AI日报

AI日报 – 2025-05-25(早)

Anthropic发布Claude 4系列模型,Opus 4号称全球最强编码模型: Anthropic正式推出Claude Opus 4和Claude Sonnet 4,两款模型在编码、高级推理和AI Agent能力上树立新标杆。Opus 4在SWE-bench (72.5%) 和Terminal-bench (43.2%) 编码基准上领先,能处理数千步、数小时的复杂长时任务。Sonnet 4作为