AI日报 – 2025-05-08(早)
清华大学发布Absolute Zero论文:AI无需外部数据即可自我进化: 清华大学LeapLabTHU团队发布名为”Absolute Zero”的新RLVR(Reinforcement Learning with Verifiable Rewards)范式。该范式下,单个模型能自我提出最大化学习进程的任务,并通过解决这些任务来提升推理能力,完全不依赖任何外部数据。其系统AZR(Absolute
AI日报 – 2025-05-07(晚)
PyTorch基金会接纳vLLM和DeepSpeed : PyTorch基金会扩展成为伞形基金会,正式接纳vLLM和DeepSpeed作为托管项目。这标志着AI开源社区的进一步发展和整合,旨在汇聚更广泛的社区力量,推动AI技术在整个生命周期内的创新和进步,获得多家科技巨头的支持。
AI日报 – 2025-05-07(早)
谷歌发布Gemini 2.5 Pro I/O版 : 谷歌发布Gemini 2.5 Pro I/O版,大幅提升编码能力,横扫LMArena编程、视觉和WebDev排行榜首,实现单一模型首次三榜称冠。新版本增强前端和UI开发,可从手绘草图生成应用,并修复了函数调用问题,显示出谷歌在AI模型能力上的快速进步。 (来源: JeffDean, lmarena.ai, dotey) Cognition发布Ke
AI日报 – 2025-05-06(晚)
OpenAI 放弃全面营利化,维持非营利组织控制: OpenAI 宣布调整公司架构,其营利性子公司将转型为公益公司 (PBC),但控制权仍归属于其非营利组织母公司。此举是对先前寻求完全营利化重组计划的重大转变,旨在回应外界对其偏离“造福全人类”初衷的担忧,以及来自马斯克诉讼、前员工和多家非营利组织的压力。新架构试图在吸引投资、激励员工与坚守使命之间取得平衡,但可能影响其与软银等投资者的融资协议。
AI日报 – 2025-05-06(早)
OpenAI 确认维持非营利结构: OpenAI 宣布其现有营利性实体将转变为公益公司(PBC),但控制权仍归属于当前的非营利组织。此举确认了 OpenAI 将继续由非营利组织控制,并重申其确保 AGI(通用人工智能)惠及全人类的使命。这一决定是在经历内部动荡和外界对其结构性质疑(包括马斯克的诉讼)后做出的,社区对此反应不一,有人认为这是坚守使命,也有人质疑其资本结构调整的真实意图
AI日报 – 2025-05-05(晚)
LLM综合排行榜引发热议,Gemini 2.5 Pro领先: Lisan al Gaib发布了一个综合28个基准测试的LLM Meta-Leaderboard,结果显示Gemini 2.5 Pro位居榜首,领先于o3和Sonnet 3.7 Thinking。该排行榜引发了社区广泛关注和讨论,一方面对Gemini的表现表示兴奋,另一方面也探讨了此类排行榜的局限性,包括模型命名匹配问题、不同模型在各基
AI日报 – 2025-05-05(早)
Qwen3系列模型发布与性能表现: 阿里巴巴发布了Qwen3系列模型,涵盖从0.6B到235B的多个尺寸。社区反馈显示,小模型(如4B)因易于微调而下载量较高,MoE模型中30B-A3B较受欢迎。性能方面,Qwen3-235B-A22B在SimpleBench上表现优异,排名第13,优于o1/o3-mini和DeepSeek-R1等模型。Qwen3-8B在本地运行表现良好,体积小(4.3GB量化版
AI日报 – 2025-05-04(下)
Qwen3 大模型性能表现突出: 阿里巴巴发布的新一代通义千问模型 Qwen3 在多个基准测试中展现出强大竞争力。其中 Qwen3-235B-A22B 在 Aider Polyglot 编程基准测试中击败了 Anthropic 的 Sonnet 3.7 和 OpenAI 的 o1,且成本大幅降低。同时,Qwen3-32B 在 Aider 测试中得分 65.3%,超越 GPT-4.5 和 GPT-4
AI日报 – 2025-05-04(上)
Anthropic发布LLM生物学研究,深入探究模型内部机制: Anthropic发布了题为《大型语言模型的生物学》(On the Biology of a Large Language Model)的深入研究博客文章,使用其电路追踪方法(Attribution Graphs)调查了Claude 3.5 Haiku模型在不同情境下的内部机制。研究通过训练一个更易于分析的“替代模型”(Transco