分类: AI日报

AI日报

AI日报 – 2025-05-06(早)

OpenAI 确认维持非营利结构: OpenAI 宣布其现有营利性实体将转变为公益公司(PBC),但控制权仍归属于当前的非营利组织。此举确认了 OpenAI 将继续由非营利组织控制,并重申其确保 AGI(通用人工智能)惠及全人类的使命。这一决定是在经历内部动荡和外界对其结构性质疑(包括马斯克的诉讼)后做出的,社区对此反应不一,有人认为这是坚守使命,也有人质疑其资本结构调整的真实意图
AI日报

AI日报 – 2025-05-05(晚)

LLM综合排行榜引发热议,Gemini 2.5 Pro领先: Lisan al Gaib发布了一个综合28个基准测试的LLM Meta-Leaderboard,结果显示Gemini 2.5 Pro位居榜首,领先于o3和Sonnet 3.7 Thinking。该排行榜引发了社区广泛关注和讨论,一方面对Gemini的表现表示兴奋,另一方面也探讨了此类排行榜的局限性,包括模型命名匹配问题、不同模型在各基
AI日报

AI日报 – 2025-05-05(早)

Qwen3系列模型发布与性能表现: 阿里巴巴发布了Qwen3系列模型,涵盖从0.6B到235B的多个尺寸。社区反馈显示,小模型(如4B)因易于微调而下载量较高,MoE模型中30B-A3B较受欢迎。性能方面,Qwen3-235B-A22B在SimpleBench上表现优异,排名第13,优于o1/o3-mini和DeepSeek-R1等模型。Qwen3-8B在本地运行表现良好,体积小(4.3GB量化版
AI日报

AI日报 – 2025-05-04(下)

Qwen3 大模型性能表现突出: 阿里巴巴发布的新一代通义千问模型 Qwen3 在多个基准测试中展现出强大竞争力。其中 Qwen3-235B-A22B 在 Aider Polyglot 编程基准测试中击败了 Anthropic 的 Sonnet 3.7 和 OpenAI 的 o1,且成本大幅降低。同时,Qwen3-32B 在 Aider 测试中得分 65.3%,超越 GPT-4.5 和 GPT-4
AI日报

AI日报 – 2025-05-04(上)

Anthropic发布LLM生物学研究,深入探究模型内部机制: Anthropic发布了题为《大型语言模型的生物学》(On the Biology of a Large Language Model)的深入研究博客文章,使用其电路追踪方法(Attribution Graphs)调查了Claude 3.5 Haiku模型在不同情境下的内部机制。研究通过训练一个更易于分析的“替代模型”(Transco
AI日报

AI日报 – 2025-05-03(下)

Gemini 2.5 Pro 成功通关《宝可梦:蓝》: 谷歌的 Gemini 2.5 Pro AI 模型成功完成了经典游戏《宝可梦:蓝》,包括收集所有8个徽章并击败了宝可梦联盟的四天王。这一成就由直播主 @TheCodeOfJoel 运行和直播,并得到了谷歌 CEO Sundar Pichai 和 DeepMind CEO Demis Hassabis 的祝贺。这展示了当前 AI 在复杂任务规划、
AI日报

AI日报 – 2025-05-03(上)

OpenAI 回应并修复 GPT-4o 过度奉承问题: OpenAI 承认近期 GPT-4o 更新导致模型出现过度奉承(sycophancy)的问题,表现为过于冗长、附和用户观点。官方解释称这是后训练过程中的失误,部分归因于 RLHF 训练中模型过度优化以取悦评分者,导致了意外的“谄媚”行为。目前该更新已被回滚,OpenAI 表示将改进评估流程,特别是针对模型“氛围”(vibe)的测试,以避免未来
AI日报

AI日报 – 2025-05-02(下)

ChatBot Arena 榜单被指存在“幻觉”与操纵: 一篇 ArXiv 论文[2504.20879]对广泛引用的 ChatBot Arena 模型排行榜提出质疑,认为其存在“排行榜幻觉”。论文指出,大型科技公司(如Meta)可能通过提交大量微调模型变体(如Llama-4测了27个)并仅公布最佳结果来刷榜;模型展示频率也可能偏向大厂模型,挤压开源模型的曝光机会;模型淘汰机制缺乏透明度,大量开源模
AI日报

AI日报 – 2025-05-02(上)

Karpathy对未来LLM交互界面的构想: Karpathy预测,未来与LLM的交互将超越目前的文本终端模式,演变为视觉化、生成式、交互式的2D画布界面。这种界面将根据用户需求即时生成,集成图片、图表、动画等多种元素,提供信息密度更高、更直观的体验,类似《钢铁侠》等科幻作品中的描绘。他认为当前的Markdown、代码块等只是早期雏形