AI日報 – 2025-06-01(夕刊)
xAI、Grokシステムプロンプトを公開し、審査メカニズムを強化: xAI社は最近、Grok応答ロボットがXプラットフォーム上で不正にプロンプトを変更され、同社の方針や価値観に反する政治的発言を行ったため、GrokシステムプロンプトをGitHub上で公開することを発表しました。この措置は、真実を追求するAIとしてのGrokの透明性と信頼性を高めることを目的としています。xAIは同時に、内部コード審
AI日報 – 2025-06-01(朝刊)
スタンフォード大学、AIが人間エキスパートを超えるCUDAカーネルを生成可能であることを偶然発見: スタンフォード大学の研究チームが、カーネル生成モデル用の合成データを作成しようとした際、AI(OpenAI o3およびGemini 2.5 Pro)が、人間エキスパートが手動で最適化した性能よりも優れたCUDAカーネルを生成できることを偶然発見しました。これらのAIが生成したカーネルは、行列乗算、2
AI日報 – 2025-05-31(夕刊)
NVIDIAの米中市場における「綱渡り」的苦境と戦略: The Informationの詳細な報道により、NVIDIAが米中という2大市場間で困難な状況に置かれていることが明らかになった。黄仁勋氏は自ら米政界に働きかけ、輸出禁止措置による圧力の緩和を試みている。中国市場はNVIDIAの収益の14%を占め、H20チップの禁輸により数十億ドルの損失が生じている。黄仁勋氏はバイデン政権の規制を公然と批判
AI日報 – 2025-05-31(朝刊)
DeepSeekがR1-0528新モデルを発表、性能の大幅向上で注目を集める: DeepSeekは、その大規模言語モデルの新バージョンR1-0528をリリースし、複数のベンチマークで優れたパフォーマンスを示し、特にコード生成(LiveCodeBench)、科学的推論(GPQA Diamond)、数学コンテスト(AIME 2024)などの分野で著しい進歩を遂げました。Artificial Analy
AI日報 – 2025-05-30(夕刊)
DeepSeek、R1-0528モデルをリリース、性能はGPT-4oおよびGemini 2.5 Proに迫り、オープンソースランキングで首位に: DeepSeek-R1-0528は、数学、プログラミング、汎用論理推論など複数のベンチマークテストで優れた性能を発揮し、特にAIME 2025テストでは正解率が70%から87.5%に向上しました。新バージョンでは、ハルシネーション率が大幅に低減(約45~
AI日報 – 2025-05-29(夕刊)
DeepSeek R1、「マイナーアップデート」と称しつつ実際には大きな飛躍、プログラミングと推論能力が著しく向上: DeepSeekはR1推論モデルの新バージョン(0528)をリリースし、パラメータ数は6850億に達するとされ、MITライセンスを採用しています。公式は「マイナーアップグレード」としていますが、コミュニティによる実測では、プログラミング、数学、および長い思考連鎖の推論能力において著
AI日報 – 2025-05-29(朝刊)
LLM+RL訓練の有効性に疑問:偽の報酬でもモデルの推論能力が向上: 最近、ワシントン大学、Allen Institute for AI、カリフォルニア大学バークレー校の研究者は、ランダムあるいは誤った「偽の報酬」を用いてQwen2.5-Math-7Bモデルを訓練した場合でも、MATH-500などの数学ベンチマークで顕著な性能向上(ランダム報酬で21%向上、誤った報酬で25%向上)が見られ、真の報
AI日報 – 2025-05-28(夕刊)
RLHF/RLAIFの未来:ランダム/誤った報酬でもモデル性能は向上するのか? : Stella Li氏の実験によると、ランダムな報酬または不正確な報酬を使用してQwen2.5-Math-7Bモデルを訓練した結果、MATH-500テストセットでそれぞれ21%と25%向上し、真の報酬を使用した場合の28.8%の向上効果に近かったことが示されました。natolambert氏が転送したRulin Sha
AI日報 – 2025-05-28(朝刊)
Omni-R1:新規デュアルシステム強化学習フレームワークが全モーダル推論能力を向上 : Omni-R1は、長時間ビデオ・オーディオ推論とピクセルレベル理解の間の矛盾を解決するために、革新的なデュアルシステムアーキテクチャ(グローバル推論システム+詳細理解システム)を提案しています。このフレームワークは強化学習(特にGroup Relative Policy Optimization GRPO)を