AI日报 – 2025-04-09(下)
Llama 4发布引争议,性能表现受质疑: Meta最新发布的Llama 4模型(包含Scout和Maverick两个版本)引发广泛争议。尽管Meta员否认了在测试集上训练的指控,但承认向LMArena排行榜提交了未公开的、经过优化的实验版本,导致其在榜单上表现优异,引发了社区对其“刷榜”和透明度的质疑。LMArena表示将更新政策以应对此类情况。此外,公开发布的Llama 4版本在多项独立基准测
AI日报 – 2025-04-09(上)
斯坦福发布年度AI指数报告,揭示全球AI格局新变化: 斯坦福大学HAI发布456页《AI指数报告2025》,报告显示美国在顶尖AI模型产出上仍领先,但中国正快速缩小性能差距(如MMLU和HumanEval上的差距已近乎消失)。产业界主导了重要模型的开发(占比90%),但模型数量有所减少。AI硬件成本以每年30%速度下降,性能每1.9年翻番。全球AI投资达2523亿美元,美国以1091亿美元遥遥领先
AI日报 – 2025-04-08(下)
斯坦福发布2025年AI指数报告,揭示行业关键趋势:斯坦福大学以人为本人工智能研究所(HAI)发布第八份年度AI指数报告(456页),全面追踪2024年全球AI发展。报告新增AI硬件、推理成本、企业负责任AI实践及AI在科学/医学应用等内容。核心趋势包括:1) AI在MMMU等高难度基准上性能显著提升;2) AI日益融入医疗、交通等日常生活;3) 企业投资和采用率创历史新高,美国投资远超中国,但中
AI日报 – 2025-04-08(上)
Llama 4 发布引发争议,性能被指未达预期且涉嫌刷榜: Meta 发布 Llama 4 系列模型(Scout、Maverick、Behemoth),采用 MoE 架构,支持高达 1000 万 token 上下文。然而,社区测试发现在编码、长文写作等任务上表现不如预期,甚至逊于 DeepSeek R1、Gemini 2.5 Pro 及部分现有开源模型。官方宣传图被指“针对对话优化”,引发刷榜质疑