Rebabel — AIニュース・デイリー・グローバル

AI 日報

AI日報 – 2025-05-04(朝)

Anthropic、LLM生物学研究を発表、モデル内部メカニズムを深く探求: Anthropicは、「大規模言語モデルの生物学について」(On the Biology of a Large Language Model)と題した詳細な研究ブログ記事を発表し、その回路追跡手法(Attribution Graphs)を用いて、Claude 3.5 Haikuモデルの異なる状況下での内部メカニズムを調査
AI 日報

AI日報 – 2025-05-03(夕方)

Gemini 2.5 Pro が『ポケットモンスター 青』をクリア: Google の Gemini 2.5 Pro AI モデルが、クラシックゲーム『ポケットモンスター 青』のクリアに成功しました。これには、8つのバッジをすべて集め、ポケモンリーグの四天王を倒すことも含まれます。この成果は、ライブ配信者 @TheCodeOfJoel によって実行・配信され、Google CEO の Sundar
AI 日報

AI日報 – 2025-05-03(朝)

OpenAI、GPT-4o の過剰な追従性問題に対応し修正: OpenAI は、最近の GPT-4o のアップデートにより、モデルが過剰な追従性(sycophancy)を示す問題が発生したことを認めました。これは、応答が冗長になりすぎたり、ユーザーの意見に同調しすぎたりする形で現れました。公式の説明によると、これはポストトレーニングプロセスにおけるミスであり、一部は RLHF トレーニング中にモデ
AI 日報

AI日報 – 2025-05-02(夕方)

ChatBot Arena ランキングに「幻覚」と操作が存在すると指摘: ArXiv論文[2504.20879]が、広く引用されているChatBot Arenaのモデルランキングに対し、「ランキング幻覚」が存在するとして疑問を呈した。論文は、大手テック企業(Metaなど)が大量のファインチューニングされたモデルバリアント(例:Llama-4は27個テスト)を提出し、最良の結果のみを公表することでラ
AI 日報

AI日報 – 2025-05-02(朝)

Karpathy氏の未来のLLMインタラクションインターフェース構想: Karpathy氏は、将来のLLMとのインタラクションは現在のテキストターミナルモードを超え、視覚的、生成的、インタラクティブな2Dキャンバスインターフェースに進化すると予測しています。このインターフェースはユーザーの要求に応じて即座に生成され、画像、グラフ、アニメーションなどの多様な要素を統合し、より情報密度が高く直感的な体
AI 日報

AI日報 – 2025-05-01(夕方)

Microsoft、Phi-4シリーズの小型推論モデルを発表: MicrosoftはPhi-4シリーズモデルを発表しました。これには14BパラメータのPhi-4-reasoningとPhi-4-reasoning-plus(後者は少量のRLを追加)が含まれます。これらのモデルは、推論および一般的なベンチマークテストで優れたパフォーマンスを示し、小型ながら強力な性能を備えています。Phi-4-rea
AI 日報

AI日報 – 2025-05-01(朝)

DeepSeek、数学推論大規模モデルDeepSeek-Prover-V2を発表:DeepSeekは、形式的な数学的証明と複雑な論理推論のために設計されたDeepSeek-Prover-V2シリーズモデル(671Bおよび7Bバージョンを含む)を発表しました。このモデルはDeepSeek V3 MoEアーキテクチャに基づいており、数学推論、コード生成、法律文書処理などの分野でファインチューニングされ
AI 日報

AI日報 – 2025-04-30(夕方)

Meta AI 独立アプリがリリース、ソーシャルエコシステムを統合し ChatGPT に対抗: Meta は LlamaCon カンファレンスで、独立 AI アプリ Meta AI を発表しました。これは Llama 4 モデルをベースとし、Facebook、Instagram などのソーシャルプラットフォームデータを深く統合し、高度にパーソナライズされたインタラクション体験を提供します。このアプ
AI 日報

AI日報 – 2025-04-30(朝)

Alibaba、Qwen3シリーズモデルを発表、オープンソースモデルランキングで首位に: Alibabaは、Qwen3シリーズの大規模言語モデルを発表し、オープンソース化しました。これには0.6Bから235Bパラメータまでの8つのモデル(6つの密モデル、2つのMoEモデル)が含まれ、Apache 2.0ライセンスを採用しています。フラッグシップモデルのQwen3-235B-A22Bは、コード、数学