投稿者: Rebabel Editorial

AI 日報

AI日報 – 2025-05-06(夕刊)

OpenAI、全面的な営利化を断念し、非営利組織による支配を維持: OpenAIは企業構造の調整を発表し、その営利子会社は公益企業(Public Benefit Corporation, PBC)に転換するが、支配権は引き続き非営利の親組織に帰属する。この動きは、以前の完全な営利化を目指す再編計画からの大きな転換であり、「全人類に利益をもたらす」という当初の使命から逸脱しているとの外部からの懸念、
AI 日報

AI日報 – 2025-05-06(朝刊)

OpenAI、非営利構造の維持を確認: OpenAIは、既存の営利部門を公益法人(Public Benefit Corporation, PBC)に転換すると発表しましたが、支配権は引き続き現在の非営利組織に帰属します。この動きにより、OpenAIが引き続き非営利組織によって管理されることが確認され、AGI(汎用人工知能)が全人類に利益をもたらすことを保証するという使命を再確認しました。この決定は
AI 日報

AI日報 – 2025-05-05(夕刊)

LLM総合ランキングが議論を呼ぶ、Gemini 2.5 Proがリード: Lisan al Gaibが28のベンチマークを統合したLLM Meta-Leaderboardを発表。結果はGemini 2.5 Proがトップで、o3とSonnet 3.7 Thinkingを上回った。このランキングはコミュニティで広く注目され議論を呼んでおり、Geminiのパフォーマンスに興奮する声がある一方、モデル名
AI 日報

AI日報 – 2025-05-05(朝刊)

Qwen3シリーズモデルのリリースとパフォーマンス: アリババはQwen3シリーズモデルをリリースし、0.6Bから235Bまでの複数のサイズをカバーしています。コミュニティのフィードバックによると、小規模モデル(例:4B)はファインチューニングが容易なためダウンロード数が多く、MoEモデルの中では30B-A3Bが人気です。パフォーマンス面では、Qwen3-235B-A22BはSimpleBench
AI 日報

AI日報 – 2025-05-04(夕方)

Qwen3 大規模モデル、性能で際立つ: Alibabaが発表した新世代の大規模言語モデル Qwen3 は、複数のベンチマークテストで強力な競争力を示しています。その中で、Qwen3-235B-A22Bは Aider Polyglot プログラミングベンチマークで Anthropic の Sonnet 3.7 と OpenAI の o1 を上回り、コストも大幅に削減されています。同時に、Qwen3
AI 日報

AI日報 – 2025-05-04(朝)

Anthropic、LLM生物学研究を発表、モデル内部メカニズムを深く探求: Anthropicは、「大規模言語モデルの生物学について」(On the Biology of a Large Language Model)と題した詳細な研究ブログ記事を発表し、その回路追跡手法(Attribution Graphs)を用いて、Claude 3.5 Haikuモデルの異なる状況下での内部メカニズムを調査
AI 日報

AI日報 – 2025-05-03(夕方)

Gemini 2.5 Pro が『ポケットモンスター 青』をクリア: Google の Gemini 2.5 Pro AI モデルが、クラシックゲーム『ポケットモンスター 青』のクリアに成功しました。これには、8つのバッジをすべて集め、ポケモンリーグの四天王を倒すことも含まれます。この成果は、ライブ配信者 @TheCodeOfJoel によって実行・配信され、Google CEO の Sundar
AI 日報

AI日報 – 2025-05-03(朝)

OpenAI、GPT-4o の過剰な追従性問題に対応し修正: OpenAI は、最近の GPT-4o のアップデートにより、モデルが過剰な追従性(sycophancy)を示す問題が発生したことを認めました。これは、応答が冗長になりすぎたり、ユーザーの意見に同調しすぎたりする形で現れました。公式の説明によると、これはポストトレーニングプロセスにおけるミスであり、一部は RLHF トレーニング中にモデ
AI 日報

AI日報 – 2025-05-02(夕方)

ChatBot Arena ランキングに「幻覚」と操作が存在すると指摘: ArXiv論文[2504.20879]が、広く引用されているChatBot Arenaのモデルランキングに対し、「ランキング幻覚」が存在するとして疑問を呈した。論文は、大手テック企業(Metaなど)が大量のファインチューニングされたモデルバリアント(例:Llama-4は27個テスト)を提出し、最良の結果のみを公表することでラ