AI日报 – 2025-05-28(晚)
RLHF/RLAIF的未来:随机/错误奖励也能提升模型性能? : Stella Li的实验表明,使用随机奖励或不正确奖励训练Qwen2.5-Math-7B模型,在MATH-500测试集上分别提升了21%和25%,接近使用真实奖励28.8%的提升效果。natolambert转发的Rulin Shao的研究也发现,RLVR(Reinforcement Learning from Verifier Re
AI日报 – 2025-05-28(早)
Omni-R1:新颖双系统强化学习框架提升全模态推理能力 : Omni-R1 提出了一种创新的双系统架构(全局推理系统+细节理解系统)来解决长时视频音频推理和像素级理解之间的冲突。该框架利用强化学习(特别是组相对策略优化 GRPO)端到端地训练全局推理系统,通过与细节理解系统的在线协作获得分层奖励,从而优化关键帧选择和任务重述。实验表明,Omni-R1 在 RefAVS 和 REVOS 等基准测试
AI日报 – 2025-05-27(晚)
AMD与NVIDIA在AI推理领域的性能之争引发热议: SemiAnalysis指出SGLang在AMD ROCm平台上存在测试问题,如删除失败测试、降低通过门槛,并质疑MI325X CI被禁用。Anush Elangovan(AMD)回应称,最新SGLang下MI300X与H200在GSM8K准确率均为0.497,但MI300X在延迟(19.479s vs 24.016s)和吞吐量(9216.5
AI日报 – 2025-05-27(早)
DeepSeek-V3-0526模型或将发布,对标GPT-4.5和Claude 4 Opus: 社区消息显示,深度寻求(DeepSeek)可能即将发布其V3模型的最新更新版本DeepSeek-V3-0526。据Unsloth文档页面信息,该模型性能与GPT-4.5及Claude 4 Opus相当,有望成为全球性能最佳的开源模型。这标志着DeepSeek对其V3模型的第二次重要更新。Unsloth已
AI日报 – 2025-05-26(晚)
谷歌创始人谢尔盖·布林解读Gemini强大之谜与AI未来: 谷歌创始人谢尔盖·布林在访谈中深入探讨了Gemini模型的快速崛起及其背后的技术逻辑。他强调,语言模型已成为AI发展的主要驱动力,且其可解释性(如思维模型能洞察推理过程)对安全至关重要。布林指出,模型架构趋同,但后训练阶段(微调、强化学习)日益重要,赋予模型工具使用等强大能力。谷歌正致力于让模型能进行深度思考(数小时乃至数月),以解决复杂
AI日报 – 2025-05-26(早)
字节开源GPT-4o级图像生成模型BAGEL: 字节跳动发布了开源多模态AI模型BAGEL-7B-MoT,该模型在图像生成、编辑和视觉理解方面展现出与OpenAI GPT-4o相媲美的能力。BAGEL采用混合变压器专家(MoT)架构,拥有70亿活跃参数(总计140亿),能够在一个统一模型中处理文本到图像生成、图像编辑(包括自由形式编辑、风格迁移、场景重建和多视角合成)以及视觉理解等多种任务。研究发
AI日报 – 2025-05-25(晚)
Claude 4 系统提示泄露揭示其复杂内部运作与伦理考量: Claude 4 的系统提示被泄露,详细展示了其内部指令集,包括处理用户请求的多种模式、工具使用规范 (如网络搜索)、安全与伦理边界以及避免生成有害内容的机制。提示中包含了诸如“运行循环提示”、“输入分类与分派”、“结构化响应模式”等多种AI代理模式,并强调了在特定情境下的行为准则,例如在被要求执行不道德或非法行为时应如何回应,甚至包含
AI日报 – 2025-05-25(早)
Anthropic发布Claude 4系列模型,Opus 4号称全球最强编码模型: Anthropic正式推出Claude Opus 4和Claude Sonnet 4,两款模型在编码、高级推理和AI Agent能力上树立新标杆。Opus 4在SWE-bench (72.5%) 和Terminal-bench (43.2%) 编码基准上领先,能处理数千步、数小时的复杂长时任务。Sonnet 4作为
AI日报 – 2025-05-24(晚)
Anthropic发布Claude 4系列模型,主打AI智能体编程与复杂任务处理: Anthropic推出了Claude Opus 4和Claude Sonnet 4两款混合模型,强调在及时响应与深度思考间的平衡。Opus 4在编码、研究、写作和科学发现等复杂任务上表现卓越,能独立编程7小时,持续玩《宝可梦》24小时;Sonnet 4则在性能与效率间取得平衡,适合需要自主性的日常场景。两款模型均提