分类: AI日报

AI日报

AI日报 – 2025-06-03(早)

DeepMind AlphaEvolve 刷新数学纪录,人机协作推动科学进步: DeepMind 的 AlphaEvolve 在一周内两次打破尘封18年的数学纪录,引发广泛关注。陶哲轩评论认为,这展现了不同方法如何互补以推动数学进步,而非简单的“赢家”和“输家”。这一事件凸显了 AI 与人类协作在科技和科学领域创造新范式的潜力,AI 并非简单取代人类,而是共同开创进步的新途径
AI日报

AI日报 – 2025-06-02(早)

斯坦福大学意外发现AI可生成超越人类专家的CUDA内核: 斯坦福大学研究团队在尝试生成合成数据训练内核生成模型时,意外发现AI(o3、Gemini 2.5 Pro)生成的CUDA内核在性能上超越了人类专家优化的版本。这些AI生成的内核在矩阵乘法、二维卷积、Softmax和LayerNorm等常见深度学习操作上,性能分别达到PyTorch原生实现的101.3%至484.4%。该方法通过先让AI生成自
AI日报

AI日报 – 2025-06-01(晚)

xAI公开Grok系统提示并加强审查机制: xAI公司近日宣布,由于其Grok响应机器人在X平台上被未经授权修改提示词并发表了违反公司政策和价值观的政治言论,公司决定将Grok系统提示在GitHub上公开。此举旨在增强Grok作为追求真相的AI的透明度和可靠性。xAI同时表示将加强内部代码审查流程,增设24/7监控团队,以防止类似事件再次发生,并更快响应未被自动系统捕获的问题。
AI日报

AI日报 – 2025-06-01(早)

斯坦福大学意外发现AI可生成超越人类专家的CUDA内核: 斯坦福大学研究团队在尝试为内核生成模型创建合成数据时,意外发现AI(OpenAI o3和Gemini 2.5 Pro)能够生成比人类专家手动优化性能更优的CUDA内核。这些AI生成的内核在矩阵乘法、二维卷积、Softmax和层归一化等常见深度学习操作上,性能远超原生PyTorch,部分操作性能提升近4倍。该方法通过让AI先以自然语言生成优化
AI日报

AI日报 – 2025-05-31(晚)

英伟达在中美市场间“踩钢丝”的困境与策略: The Information的深度报道揭示了英伟达在中美两大市场间的艰难处境。黄仁勋亲自游说美国政界,试图缓解出口禁令带来的压力。中国市场占英伟达营收的14%,H20芯片禁售已造成数十亿美元损失。尽管黄仁勋公开批评拜登政府限制并讨好特朗普,但政策突变仍时有发生。英伟达一方面强调尊重中国市场,另一方面又需应对美国政府对其“不老实”的指责。目前,英伟达正为
AI日报

AI日报 – 2025-05-31(早)

DeepSeek发布R1-0528新模型,性能大幅提升引发关注: DeepSeek 推出了其大型语言模型的新版本 R1-0528,在多个基准测试中表现优异,尤其在代码生成(LiveCodeBench)、科学推理(GPQA Diamond)和数学竞赛(AIME 2024)等领域取得显著进步。Artificial Analysis 指出,R1-0528 在其智能指数中从60分跃升至68分,与谷歌的Ge
AI日报

AI日报 – 2025-05-30(晚)

DeepSeek发布R1-0528模型,性能逼近GPT-4o和Gemini 2.5 Pro,登顶开源榜首: DeepSeek-R1-0528在数学、编程和通用逻辑推理等多个基准测试中表现出色,尤其在AIME 2025测试中准确率从70%提升至87.5%。新版本显著降低了幻觉率(约45-50%),增强了前端代码生成能力,并支持JSON输出和函数调用。同时,DeepSeek基于Qwen3-8B Bas
AI日报

AI日报 – 2025-05-29(晚)

DeepSeek R1迎来“小更新”实则大飞跃,编程与推理能力显著提升: DeepSeek发布R1推理模型新版(0528),参数量据称高达6850亿,采用MIT许可证。尽管官方称其为“小升级”,社区实测发现其在编程、数学及长思维链推理能力上均有显著提升,LiveCodeBench等基准测试成绩逼近甚至超越部分顶尖闭源模型。新模型展现出深度思考特质,有时思考时间长达数十分钟,但也带来了更精确的输出。
AI日报

AI日报 – 2025-05-29(早)

LLM+RL训练有效性质疑:虚假奖励竟也能提升模型推理能力: 近期,华盛顿大学、艾伦人工智能实验室与伯克利的研究者发现,即使使用随机甚至错误的“虚假奖励”训练Qwen2.5-Math-7B模型,也能在MATH-500等数学基准测试上取得显著性能提升(随机奖励提升21%,错误奖励提升25%),与真实奖励(28.8%)效果相近。这一现象引发AI社区对当前强化学习(RLVR)方法有效性的广泛讨论与质疑,