AI日报 – 2025-06-09(晚)
苹果发布AI推理能力研究报告引发热议,质疑其并非真正“思考”: 苹果公司最新研究论文《思维的幻觉》通过汉诺塔等谜题测试指出,包括o3-mini、DeepSeek-R1、Claude 3.7在内的大型语言模型(LLM)在处理复杂问题时,其“推理”更像是模式匹配而非真正思考,当任务复杂度超过某个阈值,模型表现会彻底崩溃,准确率降至零。研究还发现,即使提供解题算法,模型性能也无显著提升,并观察到“推理努
AI日报 – 2025-06-09(早)
苹果研究揭示“思维幻觉”:当前“推理”模型并非真正思考,更依赖模式匹配: 苹果公司最新研究论文《思维的幻觉:通过问题复杂性视角理解推理模型的优势与局限性》指出,当前号称具备“推理”能力的大型语言模型(如Claude、DeepSeek-R1、GPT-4o-mini等),其表现更像是高效的模式匹配器而非真正意义上的逻辑推理。研究发现,这些模型在处理训练分布之外或复杂度较高的问题时,性能会显著下降,甚至
AI日报 – 2025-06-08(晚)
智源大会发布“悟界”系列大模型,聚焦物理AGI与多模态融合: 2025年智源大会上,智源研究院发布了全新的“悟界”系列大模型,标志着其研究方向从“悟道”的语言模型探索转向更广阔的物理世界与多模态融合。该系列包括原生多模态世界模型Emu3、全球首个脑科学多模态通用基础模型“见微Brainμ”、具身大脑RoboBrain 2.0以及全原子微观生命模型OpenComplex2。这一系列模型的发布,体现了
AI日报 – 2025-06-08(早)
Reddit与Anthropic法律纠纷升级,指控其违规使用数据训练Claude AI: Reddit正式起诉Anthropic,指控其未经授权抓取平台内容用于训练其大型语言模型Claude,严重违反了Reddit禁止商业利用内容的用户协议。诉讼文件指出,Anthropic不仅承认使用了Reddit数据,还在被质询后谎称已停止抓取,但实际上其爬虫仍在持续访问Reddit服务器。此外,Anthrop
AI日报 – 2025-06-07(晚)
EleutherAI 发布 Common Pile v0.1:8TB 开放授权文本数据集,挑战无授权数据训练语言模型 : EleutherAI 联合多家机构发布了 Common Pile v0.1,这是一个包含 8TB 开放授权和公共领域文本的大型数据集,旨在探索在不使用无授权文本的情况下训练高性能语言模型的可行性。团队使用该数据集训练了 7B 参数的模型(1T 和 2T tokens),其性能与
AI日报 – 2025-06-07(早)
谷歌发布Gemini 2.5 Pro预览版更新,性能全面提升: 谷歌宣布Gemini 2.5 Pro预览版迎来重要更新,在编码、推理、科学及数学能力上均有显著进步。新版本在AIDER Polyglot、GPQA、HLE等关键基准测试中表现更佳,并在LMArena上实现了24点的Elo分数跃升,再次登顶。此外,模型在回答风格和格式化方面根据用户反馈进行了改进,并引入了“思考预算”功能以提供更多控制。
AI日报 – 2025-06-06(晚)
中国AI智能体热潮兴起,初创与巨头争相布局: 继2024年基础大模型热潮后,2025年中国AI领域焦点转向AI智能体(AI Agents)——能自主完成任务的系统。Manus的发布(一款通用AI智能体,可规划旅行、设计网站等)引发市场高度关注和众多模仿者,如Genspark和Flowith。这些智能体构建于大模型之上,优化多步骤任务执行。中国凭借其高度整合的应用生态、快速产品迭代和庞大数字用户基础
AI日报 – 2025-06-06(早)
谷歌发布多项AI新进展,Gemini 2.5 Pro Deep Think模式提升复杂推理能力: 在Google I/O大会上,谷歌宣布了Gemini 2.5 Pro的Deep Think模式,旨在显著增强AI在处理复杂问题(如USAMO级别的数学难题)时的推理能力。同时,谷歌还推出了AlphaEvolve,一个由Gemini驱动的编码智能体,用于算法发现,已在矩阵乘法算法设计和解决开放数学问题上
AI日报 – 2025-06-05(晚)
Karpathy预言复杂UI应用前景黯淡,强调AI协同需脚本化交互: Andrej Karpathy指出,在人与AI高度协同的时代,仅依赖复杂图形用户界面(UI)而缺乏脚本支持的应用程序将面临困境。他认为,若大型语言模型(LLM)无法通过脚本读取和操作底层数据及设置,则无法有效辅助专业人士,也难以满足广大用户对“氛围编程”(vibe coding)的需求。Karpathy列举了Adobe系列产品、