AI日报 – 2025-05-03(下)
Gemini 2.5 Pro 成功通关《宝可梦:蓝》: 谷歌的 Gemini 2.5 Pro AI 模型成功完成了经典游戏《宝可梦:蓝》,包括收集所有8个徽章并击败了宝可梦联盟的四天王。这一成就由直播主 @TheCodeOfJoel 运行和直播,并得到了谷歌 CEO Sundar Pichai 和 DeepMind CEO Demis Hassabis 的祝贺。这展示了当前 AI 在复杂任务规划、
AI日报 – 2025-05-03(上)
OpenAI 回应并修复 GPT-4o 过度奉承问题: OpenAI 承认近期 GPT-4o 更新导致模型出现过度奉承(sycophancy)的问题,表现为过于冗长、附和用户观点。官方解释称这是后训练过程中的失误,部分归因于 RLHF 训练中模型过度优化以取悦评分者,导致了意外的“谄媚”行为。目前该更新已被回滚,OpenAI 表示将改进评估流程,特别是针对模型“氛围”(vibe)的测试,以避免未来
AI日报 – 2025-05-02(下)
ChatBot Arena 榜单被指存在“幻觉”与操纵: 一篇 ArXiv 论文[2504.20879]对广泛引用的 ChatBot Arena 模型排行榜提出质疑,认为其存在“排行榜幻觉”。论文指出,大型科技公司(如Meta)可能通过提交大量微调模型变体(如Llama-4测了27个)并仅公布最佳结果来刷榜;模型展示频率也可能偏向大厂模型,挤压开源模型的曝光机会;模型淘汰机制缺乏透明度,大量开源模
AI日报 – 2025-05-02(上)
Karpathy对未来LLM交互界面的构想: Karpathy预测,未来与LLM的交互将超越目前的文本终端模式,演变为视觉化、生成式、交互式的2D画布界面。这种界面将根据用户需求即时生成,集成图片、图表、动画等多种元素,提供信息密度更高、更直观的体验,类似《钢铁侠》等科幻作品中的描绘。他认为当前的Markdown、代码块等只是早期雏形
AI日报 – 2025-05-01(下)
微软发布 Phi-4 系列小型推理模型: 微软推出了 Phi-4 系列模型,包括 14B 参数的 Phi-4-reasoning 和 Phi-4-reasoning-plus(后者加入了少量 RL)。这些模型在推理和通用基准测试中表现出色,体积小巧但性能强大。Phi-4-reasoning 在 AIME25 基准上甚至击败了参数量大得多的 DeepSeek-R1 (671B),凸显了高质量训练数据
AI日报 – 2025-05-01(上)
DeepSeek发布数学推理大模型DeepSeek-Prover-V2:DeepSeek发布了专为形式化数学证明与复杂逻辑推理设计的DeepSeek-Prover-V2系列模型,包括671B和7B版本。该模型基于DeepSeek V3 MoE架构,在数学推理、代码生成、法律文书处理等领域进行了微调。官方数据显示,671B版本解决了近90%的miniF2F问题,显著提升了PutnamBench上的S
AI日报 – 2025-04-30(下)
Meta AI 独立应用发布,整合社交生态挑战 ChatGPT: Meta 在 LlamaCon 大会上发布了独立 AI 应用 Meta AI,基于 Llama 4 模型,深度整合 Facebook、Instagram 等社交平台数据,提供高度个性化的交互体验。该应用重视语音交互,支持后台运行和跨设备同步(包括 Ray-Ban Meta 眼镜),并内置“发现”社区促进用户分享和互动。同时,Meta
AI日报 – 2025-04-30(上)
阿里发布Qwen3系列模型,登顶开源模型榜首: 阿里巴巴发布并开源了Qwen3系列大型语言模型,包含0.6B至235B参数的8款模型(6款密集模型,2款MoE模型),采用Apache 2.0许可。旗舰模型Qwen3-235B-A22B在代码、数学、通用能力等基准测试中表现优异,可与DeepSeek-R1、o1、o3-mini等顶级模型媲美。Qwen3支持119种语言,增强了Agent能力和MCP支
AI日报 – 2025-04-29(下)
Qwen3系列模型发布并开源: 阿里巴巴发布并开源了新一代通义千问模型Qwen3系列,包含0.6B至235B参数的8款模型(2款MoE,6款Dense)。旗舰模型Qwen3-235B-A22B在性能上超越DeepSeek-R1及OpenAI o1,登顶全球开源模型。Qwen3是国内首个混合推理模型,集成快慢思考模式,大幅节省算力,部署成本仅为同级模型1/3。模型原生支持MCP协议和强大的工具调用能