AI日报 – 2025-05-31(早)
DeepSeek发布R1-0528新模型,性能大幅提升引发关注: DeepSeek 推出了其大型语言模型的新版本 R1-0528,在多个基准测试中表现优异,尤其在代码生成(LiveCodeBench)、科学推理(GPQA Diamond)和数学竞赛(AIME 2024)等领域取得显著进步。Artificial Analysis 指出,R1-0528 在其智能指数中从60分跃升至68分,与谷歌的Ge
AI日报 – 2025-05-30(晚)
DeepSeek发布R1-0528模型,性能逼近GPT-4o和Gemini 2.5 Pro,登顶开源榜首: DeepSeek-R1-0528在数学、编程和通用逻辑推理等多个基准测试中表现出色,尤其在AIME 2025测试中准确率从70%提升至87.5%。新版本显著降低了幻觉率(约45-50%),增强了前端代码生成能力,并支持JSON输出和函数调用。同时,DeepSeek基于Qwen3-8B Bas
AI日报 – 2025-05-29(晚)
DeepSeek R1迎来“小更新”实则大飞跃,编程与推理能力显著提升: DeepSeek发布R1推理模型新版(0528),参数量据称高达6850亿,采用MIT许可证。尽管官方称其为“小升级”,社区实测发现其在编程、数学及长思维链推理能力上均有显著提升,LiveCodeBench等基准测试成绩逼近甚至超越部分顶尖闭源模型。新模型展现出深度思考特质,有时思考时间长达数十分钟,但也带来了更精确的输出。
AI日报 – 2025-05-29(早)
LLM+RL训练有效性质疑:虚假奖励竟也能提升模型推理能力: 近期,华盛顿大学、艾伦人工智能实验室与伯克利的研究者发现,即使使用随机甚至错误的“虚假奖励”训练Qwen2.5-Math-7B模型,也能在MATH-500等数学基准测试上取得显著性能提升(随机奖励提升21%,错误奖励提升25%),与真实奖励(28.8%)效果相近。这一现象引发AI社区对当前强化学习(RLVR)方法有效性的广泛讨论与质疑,
AI日报 – 2025-05-28(晚)
RLHF/RLAIF的未来:随机/错误奖励也能提升模型性能? : Stella Li的实验表明,使用随机奖励或不正确奖励训练Qwen2.5-Math-7B模型,在MATH-500测试集上分别提升了21%和25%,接近使用真实奖励28.8%的提升效果。natolambert转发的Rulin Shao的研究也发现,RLVR(Reinforcement Learning from Verifier Re
AI日报 – 2025-05-28(早)
Omni-R1:新颖双系统强化学习框架提升全模态推理能力 : Omni-R1 提出了一种创新的双系统架构(全局推理系统+细节理解系统)来解决长时视频音频推理和像素级理解之间的冲突。该框架利用强化学习(特别是组相对策略优化 GRPO)端到端地训练全局推理系统,通过与细节理解系统的在线协作获得分层奖励,从而优化关键帧选择和任务重述。实验表明,Omni-R1 在 RefAVS 和 REVOS 等基准测试
AI日报 – 2025-05-27(晚)
AMD与NVIDIA在AI推理领域的性能之争引发热议: SemiAnalysis指出SGLang在AMD ROCm平台上存在测试问题,如删除失败测试、降低通过门槛,并质疑MI325X CI被禁用。Anush Elangovan(AMD)回应称,最新SGLang下MI300X与H200在GSM8K准确率均为0.497,但MI300X在延迟(19.479s vs 24.016s)和吞吐量(9216.5
AI日报 – 2025-05-27(早)
DeepSeek-V3-0526模型或将发布,对标GPT-4.5和Claude 4 Opus: 社区消息显示,深度寻求(DeepSeek)可能即将发布其V3模型的最新更新版本DeepSeek-V3-0526。据Unsloth文档页面信息,该模型性能与GPT-4.5及Claude 4 Opus相当,有望成为全球性能最佳的开源模型。这标志着DeepSeek对其V3模型的第二次重要更新。Unsloth已
AI日报 – 2025-05-26(晚)
谷歌创始人谢尔盖·布林解读Gemini强大之谜与AI未来: 谷歌创始人谢尔盖·布林在访谈中深入探讨了Gemini模型的快速崛起及其背后的技术逻辑。他强调,语言模型已成为AI发展的主要驱动力,且其可解释性(如思维模型能洞察推理过程)对安全至关重要。布林指出,模型架构趋同,但后训练阶段(微调、强化学习)日益重要,赋予模型工具使用等强大能力。谷歌正致力于让模型能进行深度思考(数小时乃至数月),以解决复杂