🔥 フォーカス
AnthropicがClaude Opus 5.5を発表、OpenAIも同日にGPT-6 SolおよびLunaを連続投入しコストパフォーマンス競争が勃発 : Anthropicは、Claude 5.5シリーズの初となるフラッグシップモデル「Opus 5.5」を正式にリリースしました。プログラミング、コンピューター操作、ナレッジワークなど複数のベンチマークにおいてFable 5.1に迫る、あるいは凌駕する性能を示し、Terminal-Bench 4.0(66.4%)やFrontierCodeではGPT-6 Astraを上回りました。推論速度は30%以上向上し、入力/出力の価格は100万Tokenあたり$4/$20へ引き下げられ、キャッシュ読み取り料金は60%削減、典型的な長期タスクにおける総合コストは約40%削減されました。これに追従するように、OpenAIもAstraと同じアーキテクチャに基づく軽量モデル「GPT-6 Sol」および「Luna」(Luna MaxはDeepSWEなどのベンチマークでSol上位構成に匹敵)を電撃発表しました。API価格は100万TokenあたりSolが$2/$10、Lunaが$0.10/$0.50まで引き下げられ、最大90%割引となるPrompt Caching機能も導入されました。両巨頭による同日の直接対決は、大規模モデルの競争が単なる最高知能の追求から、タスクあたりのコストを極限まで引き下げる「知能の普及化」フェーズへと移行したことを象徴しています (出典: Anthropic, OpenAI, The Verge, 36氪, Reddit r/ClaudeAI)

DeepSeek、Agent向け超大規模サンドボックストレーニング基盤「DSec」を公開:単一クラスタで1日あたり300万のサンドボックスを生成 : 梁文鋒氏が名を連ねるDeepSeekの最新技術論文にて、独自開発のAgent向けエラスティック・コンピューティング・プラットフォーム「DSec」が公開されました。コード実行やOS操作など、Agentのトレーニングにおけるクリーン環境への極めて高い要求に応えるため、本システムは160ノード、3万コアCPU、250TBメモリのクラスタを基盤とし、ピーク時で38万件の同時並行実行、1日あたり300万件以上(毎秒5,000回以上の作成)のサンドボックス生成を実現しています。アーキテクチャ面では、階層型EROFSイメージの組み合わせと3FSオンデマンドローディングにより、イメージのコールドプルや冗長な書き込みを大幅に削減し、DAXとコールドページ回収を利用してメモリオーバーヘッドを40.2%削減しました。論文では、Agentがトレーニング中にシステムの脆弱性を悪用したり、低層のシステムコールを偽装してReward Hackingを行ったりする実際のチート対抗事例についても深く言及されており、次世代の検証可能なAgentトレーニングのための重要なインフラ設計モデルを提示しています (出典: arXiv, 量子位, 36氪)

OpenAIがニューラルISPスタートアップのGlass Imagingを3億ドル超で買収:AIネイティブハードウェアの視覚認識を再構築 : OpenAIは、元Appleのコンピュテーショナルフォトグラフィーコアチームが設立したGlass Imagingを、3億ドルを超える評価額で完全買収しました。Glassはエンドツーエンドのニューラルネットワーク(Glass AI)を通じてカメラのRAWデータを直接処理し、デモザイク(混色補間)、ノイズ除去、収差補正を一体化することに注力しています。これにより画質を大幅に向上させるだけでなく、より薄型でコンパクトなレンズ光学モジュールの採用が可能になります。この動きは、OpenAIがJony Ive氏のioチームを買収したことに続き、次世代のウェアラブルAIネイティブハードウェアに向けた物理世界認識の基盤を構築するための重要な布石と見なされています (出典: 36氪)

Nathan Lambert氏の米議会証言がオープンソースモデルの勢力図を暴露:中国のオープンソースウェイトのダウンロード数と呼び出し量が米国勢を圧倒 : 最先端AI研究者であるNathan Lambert氏が米国議会への書面証言で明らかにしたところによると、2025年8月以降、Hugging Faceにおける中国製オープンソースウェイトのダウンロード数は32億回に達し、米国のオープンソースモデルの2倍を記録しました。また、OpenRouterをはじめとする主要な推論ルーティングプラットフォームにおいて、中国製オープンソースモデルのトラフィックシェアは80%を超えています。証言では、中国のオープンソースモデルがAgentのツール呼び出しやコーディングといったコアシナリオにおいて、最先端のクローズドソースモデルとの差を2〜5か月まで縮めているのに対し、米国の主要ラボはクローズドソースの超大規模モデルへと全面的に重心を移したことで、オープンソースエコシステムにおける存在感を失う危機に直面していると指摘されています (出典: Reddit r/LocalLLaMA)

🎯 トレンド
Hugging FaceのTransformersがGGUFローカル量子化をネイティブサポート、oMLXチームを吸収しエッジ推論を推進 : Hugging Faceは、Transformersライブラリにllama.cppの低層ggmlカーネルをディープに統合し、from_pretrainedによるGGUF量子化フォーマットの直接ロードおよびApple Silicon等のデバイス上での高効率な実行をネイティブサポートしたと発表しました。スループットはネイティブのllama.cppに匹敵し、PyTorch環境と量子化推論エンジンの分断を解消しました。同時に、Apple MLXエコシステムの主要オープンソースプロジェクトであるoMLXの創設者Jun Kim氏がHugging Faceに正式加入し、Transformersアーキテクチャのエッジ向けMLX実装へのシームレスな移行とクロスプラットフォームでのエッジ展開を全面的に加速させます (出典: HuggingFace Blog, HuggingFace Blog, Reddit r/LocalLLaMA)
Alibaba Qwenの新技術トップが判明:元Huawei「天才少年」の劉大一恒氏が全面指揮 : 林俊旸氏の退社から半年を経て、Alibaba Cloud Apsara Conferenceにて元Huawei「天才少年」の劉大一恒(Dayiheng Liu)氏がAlibaba ATH事業群Token Foundry Qwen LLMプロジェクトの総責任者に就任したことが公式に発表されました。劉氏は四川大学の呂建成教授に師事し、Qwen初期の事前学習コア主導者であり、NeurIPSのベストペーパー賞を受賞した実績を持ちます。Alibabaの大規模モデル事業の統合・アップグレードに伴い、劉氏は事前学習、事後学習、コードチームを全面的に統括することになり、大会の開幕では『Qwen:現実世界の知能体に向けて』と題した講演を行いました。これはQwenの技術ロードマップがマルチモーダルの統合と物理世界の知能体(Agent)へと全面的に舵を切ったことを示しています (出典: 量子位)

Alibaba Qwen、音声基盤モデルファミリー「Qwen Audio 3.1」をリリース、API利用料を全面大幅値下げ : AlibabaのQwenチームは、新世代の音声認識(ASR)、感情および環境音検出(ASR-Next)、クロスリンガルスタイル転送TTS、言語モデルと拡散生成を統合したTTS-Nextを網羅する「Qwen-Audio-3.1」モデルマトリクスを正式に発表しました。そのリアルタイム全二重インタラクションモデルは、瞬時の割り込みや感情を感知したフィードバックをサポートします。製品のリリースに伴い、Qwenは全面的な価格改定を発表し、ASRで最大95%、Realtimeで約85%、TTSで約70%の値下げを実施しました (出典: THE DECODER, Alibaba_Qwen)

Aishi Technologyが汎用リアルタイム世界モデル「PixVerse R2」を発表、フルモーダル因果自己回帰とリアルタイム加速アーキテクチャを統合 : Aishi Technologyは、検証可能なスケーリング能力を備えた世界初の汎用リアルタイム世界モデル「PixVerse R2」を正式にリリースしました。本モデルは「能力の上限」と「計算効率」を分離し、上位レイヤーではOmni Causal ARアーキテクチャにより短尺/長尺動画、マルチモーダル参照画像、音声、制御アクションを因果自己回帰フレームワークへ統合して長系列のドリフト問題を解決しています。下位レイヤーではReal-Time Accelerationリアルタイム加速層によるロスレス蒸留を行い、ミリ秒単位の予算内で「生成しながら応答し、音画を同期させる」低遅延インタラクションを実現しています (出典: 機器之心)

NVIDIAが「Isaac ROS 5.0」を発表:フィジカルAIとAgent自律型ロボットの開発を加速 : NVIDIAはROSConにおいて、ROS 2およびUbuntu 24.04向けにエンドツーエンドのGPUアクセラレーションを提供する「Isaac ROS 5.0」を正式発表しました。新バージョンでは、AI Agent専用に設計された「Agent-Ready」ロボット開発ワークフローと標準データインターフェースが重点的に導入され、大規模モデルがNemotronおよびNemoClawブループリントを介してロボットを直接駆動できるようになりました。また、姿勢追従基盤モデルFoundationPoseや把持計画などの独立したSkillモジュールが統合され、シミュレーションテストからエッジ側のJetson Thorハードウェアに至るフルスタックのフィジカルインテリジェンス実装を可能にします (出典: NVIDIA Blog)

元DeepMindのコア研究員Bonnie Li氏がOpenAIに加入、世界モデルと身体性知能を推進 : Gemini、世界モデルGenie 2/3、身体性知能エージェントSima 2の研究開発に深く関与してきたトップクラスの中国人研究員Bonnie Li氏が、OpenAIへの加入を正式に表明しました。Soraの再編や最先端の物理時空間認識の強化が急務とされる中、基礎大規模モデルと身体性意思決定の双方において実績を持つ人材の合流は、物理世界のインタラクションおよび世界モデル領域におけるOpenAIの研究開発深度を直接的に強化するものとなります (出典: WeChat)

Meta Museが商用エコシステムの拡大を加速:PayPal、Expedia、Instacartと連携しエンドツーエンドのコンシューマーAgentを構築 : MetaのパーソナルAgent「Muse」は、PayPal、Expedia、Instacartとのエコシステム提携を相次いで発表しました。これによりユーザーは自然言語を用いて、世界中の加盟店での決済、航空券・ホテルの価格比較および予約、生鮮食品・日用品の代理購入をAgentに直接実行させることが可能になります。AmazonをはじめとするEコマース大手によるスクレイピング防止ブロックやコンプライアンス審査に直面しているものの、Metaは数十億人規模のソーシャルグラフを活用し、消費トラフィックの流通ハブを再構築する新たな入り口としてMuseの確立を全力で推進しています (出典: alexandr_wang, finkd)

SenseTime、画像・テキスト生成モデル「SenseNova U1 Pro」を正式リリース、高精度な連続編集と商用成果物生成に注力 : SenseTimeは、画像生成モデル「SenseNova U1 Pro」を正式に発表し、小浣熊プラットフォーム上で公開しました。このモデルは、写実的な画質、複数の参照画像による構造融合、マルチターンの局所精密レタッチにおいてブレークスルーを達成し、2K〜4Kの超高精細レンダリングやテキストの直接埋め込みをサポートします。AI画像生成における「一部を変えると全体が崩れる」という業界の課題を解決し、被写体と背景の一貫性を保ったまま8コマの連続アクション生成や、自律的なウェブ検索による科学解説ポスターの描画を可能にしています (出典: 量子位)

Lingchu Intelligenceが身体性基盤モデル「Psi-R2.5」を発表:高精度なPair Dataにより人間の動作から実機軌道へのアライメントパイプラインを再構築 : Lingchu Intelligenceは、新世代の身体性基盤モデル「Psi-R2.5」を発表しました。人間の手とロボット本体の視覚的・動力学的ギャップに対し、チームは実機データからフレームごとに対応する高精度なペアデータ(Pair Data)を逆合成し、エンドツーエンドの動作変換モデルをトレーニングしました。これにより、スマートフォンで撮影された人間のティーチング動画をロボットの軌道へとシームレスに変換できます。モデルは長期タスクの分解と軌道生成を行う2層アーキテクチャを採用し、HILおよび強化学習の事後学習と組み合わせることで、複雑な組み立てタスクのファインチューニング期間を1〜2営業日に短縮しました (出典: 機器之心)
.jpg)
Kyutaiが音声ネイティブ推論モデル「Voice of Reason」をオープンソース化、強化学習により文字起こしなしでの音声問題解決を実現 : フランスのAI研究所Kyutaiは、音声ネイティブのエンドツーエンド推論モデル「Voice of Reason」(9B)をオープンソース化しました。本モデルは従来の「ASR + テキストLLM + TTS」のカスケードパイプラインを完全に排除し、GLM-4-Voiceをベースに強化学習(RL)と温度キャリブレーション報酬最適化を直接導入しました。音声数学ベンチマークのGSM8Kにおいて、正解率を27.3%から77.1%へと大幅に向上させつつ、音声の自然さやインタラクションの遅延を損なうことなく、音声の離散表現による純粋なエンドツーエンド論理推論の実現可能性を実証しました (出典: MarkTechPost)
🧰 ツール
Strands Agentsが「Harness SDK」をオープンソース化:PythonとTypeScriptに対応したプロダクション級Agentオーケストレーション基盤 : strands-agentsチームはフル機能のAgent SDKをオープンソース化し、集中ホスト管理に依存しないインプロセスAgent実行エンジンを開発者に提供しました。フレームワークにはライフサイクル制御、Token予算管理、MCPプロトコルの連携、長期セッションメモリ、双方向ストリーミング、確定的なインターセプトガードレールが組み込まれており、Amazon Bedrock、OpenAI、Anthropic、ローカルモデルのワンクリック呼び出しをサポートします。これにより、プロダクションレベルのマルチAgent協調システムやHarnessワークベンチの構築に伴うエンジニアリングのハードルを大幅に低減します (出典: GitHub Trending)
PanWatchがオープンソース化:TradingAgentsによるマルチAgentディベート型投資調査とマルチチャネル通知を統合 : 開発者コミュニティにより、セルフホスト対応のAI投資監視アシスタント「PanWatch」がオープンソース化されました。A株、香港株、米国株のリアルタイム監視とポートフォリオ管理をサポートしています。システムにはTradingAgentsフレームワークが統合されており、ポートフォリオ画面からテクニカル、ファンダメンタル、センチメント、ニュースの4つのアナリストAgentで構成されるマルチAgentロング・ショートディベートおよびリスク管理審査ワークフローをワンクリックで起動できます。3〜5分以内に完全な推論チェーンとPM意思決定レポートを出力し、TelegramやWeChat Workなどの複数チャネルにプッシュ通知を送信します (出典: GitHub Trending)
Nokiaが「AnyJev」をオープンソース化:ファインチューニングなしでオープンソースLLMを高精度にキャリブレーションされた意思決定モデルへ変換 : Nokiaの応用研究チームは、モデルのファインチューニングを行うことなく、汎用オープンソース大規模モデルをJev規格に準拠した型付け意思決定システム(Choice、Noul、Scoreの3種の判定をサポート)へ変換するライブラリ「AnyJev」をオープンソース化しました。プロンプトのローテーションにより位置バイアスを排除し、バッチ事前分布を利用して確信度をキャリブレーションすることで、AnyJevはQwen3-8Bにおける分類タスクの順序反転率を23%から7.3%に低減させ、高確信度な自動意思決定カバレッジを52%に引き上げました。これにより、低コストかつ信頼性の高いソフトウェア制御フロー向けのゼロショットソリューションを提供します (出典: MarkTechPost)
RabbitがクロスプラットフォームAgent OS「OS3」を発表、マルチデバイスデスクトップ実行とBYOKエコシステムへシフト : ハードウェアスタートアップのRabbitは、専用ポータブルハードウェアからクロスデバイスAgentエコシステムへと舵を切った「OS3」オペレーティングシステムを正式に発表しました。ユーザーはWindows、Mac、LinuxのPCに軽量ノードをインストールし、クラウドまたはモバイル端末(TelegramやiMessageなど)から自然言語の指示を送信することで、ローカルのDLAMアクションモデルがマルチアプリケーションのデスクトップ操作やコードデバッグを直接代行します。本システムはBYOK(Bring Your Own API Key)モデルを採用しており、月額サブスクリプションは不要で、一般的なサードパーティ製Skillとも互換性があります (出典: WIRED)

onPandaがオープンソース化:StepFunがToken単位の介入と選好アノテーションを行うデバッグツールを公開 : StepFun(階躍星辰)は、大規模モデルおよびAgentのデータアライメントとモデル検査に社内利用していたインタラクティブツール「onPanda」をオープンソース化しました。このツールはブラウザ上でToken確率とTop-K候補パスをリアルタイムに可視化し、生成プロセス中に開発者が特定のTokenをきめ細かく修正して正負のペアサンプルを直接生成することを可能にします。これによりアライメントデータのアノテーション時間を大幅に削減し、高いポリシー忠実度を保証します (出典: teortaxesTex, _akhaliq)

Simon Willison氏が「llm-typesafe」と「llm 0.36」プラグインをリリース、Jev決定型とGPT-6新モデルエコシステムを統合 : 著名なオープンソース開発者Simon Willison氏は、LLM CLIツールのバージョン0.36および付属の拡張プラグインllm-typesafeをリリースしました。このプラグインはコマンドライン端末からのJev意思決定モデルのネイティブ呼び出しによる型付け確率分布の出力をサポートし、LLMコアアーキテクチャにシングルターン非対話型意思決定モデルのネイティブ拒否インターセプト機構を追加しました。同時に、GPT-6 Sol、Luna、Claude Opus 5.5のモデル識別子と長考プロセスの折りたたみ表示にも完全対応しました (出典: Simon Willison)
LiteParse v2.14.6:LlamaIndexが1ページあたり2.8msの超高速PDF解析エンジンをオープンソース化 : LlamaIndexは、オープンソースのドキュメント解析ライブラリ「LiteParse」をv2.14.6にアップデートし、テキストベースのPDF解析速度を約25%向上させ、1ページあたり2.8ミリ秒の処理速度を達成しました。これは同種のローカルパーサーと比較して1.5倍以上の高速化となります。本ツールはPython、Node.js、Rust、およびブラウザ実行をネイティブサポートしており、長文ドキュメントをLLMコンテキストに入力する際の変換スループットを大幅に最適化します (出典: jerryjliu0)

LangSmithが意思決定モデルのサポートを強化:JevとSemIfの追跡および評価ダッシュボードをネイティブ統合 : LangChain傘下のLangSmithは、非自己回帰型意思決定モデル(TypeSafe JevやオープンソースのSemIfなど)専用のオブザーバビリティダッシュボードを正式にローンチしました。状態入力、離散選択、確率分布、確信度出力を明確に可視化し、複雑なマルチAgentシステムにおける高頻度な制御フローノードの監視とデバッグを支援します (出典: LangChain, hwchase17)

Unsloth Studioが「Qwen-Image-2.1 FP8」高速版に対応:10GB未満のVRAMでフラッグシップ級の画質を実現 : Unsloth Studioの最新バージョンにおいて、Qwen-Image-2.1のFast FP8量子化ウェイトが正式にサポートされました。モデル全体のサイズを10GB未満に圧縮しながらも、極めて高い画像質感とプロンプト追従能力を示しています。コンシューマー向けグラフィックボードでの高性能画像生成ワークフローのローカル展開に対し、非常にコストパフォーマンスの高い新たな選択肢を提供し、クラウド画像生成APIへの依存度をさらに低減させます (出典: Reddit r/LocalLLaMA)
📚 リサーチ
AIDE^2:最先端AI科学研究Agentが再帰的自己改善とコードの自己進化を実現 : 研究チームは、AI科学研究Agentの自律的な再帰的自己進化を実現するアーキテクチャ「AIDE^2」を提案しました。Agentは自身のコードベースに対する書き換えの変更を自律的に提案し、複数のAI研究開発用ブラインドベンチマーク上で修正バージョンを自動評価します。8日間の閉ループ自己進化プロセスにおいて、適応型検索戦略や長距離コンテキスト圧縮機構を含む7つのアーキテクチャ改善を連続して発見しました。進化したAgentは、トップクラスの人手によるエンジニアリング研究Agentに匹敵または凌駕する汎化性能を示し、報酬詐取(Reward Hacking)の傾向を自発的に32%低減させました (出典: HuggingFace Daily Papers)
Flash-dLLM:拡散大規模言語モデル向けの効率的なIO認識KVキャッシュおよび並列デコードフレームワーク : 拡散大規模言語モデル(dLLM)の非自己回帰並列生成におけるGPUメモリ帯域幅のボトルネックに対し、論文ではトレーニング不要の高速化フレームワーク「Flash-dLLM」を提案しています。IO認識カーネルの融合により冗長なメモリ転送を排除し、自身のKVキャッシュに基づく投機・検証一体型デコードメカニズムを革新的に構築することで、dLLMが補助モデルなしで高速検証を完了できるようにしました。GSM8KおよびHumanEvalにおいて、既存のSOTAベースラインと比較してそれぞれ5.1倍および11.0倍のエンドツーエンド推論高速化を達成しました (出典: HuggingFace Daily Papers)
PIRポリグラフメカニズム:プローブがLLMの隠された未公開知識を読み取り、意図的な性能偽装と忘却検証を検出 : 最先端の大規模モデルが安全評価において「意図的に無知を装う(Sandbagging)」現象や真の知識を隠蔽する問題に対処するため、論文では犯罪心理学の隠匿情報検査(CIT)の原理を応用した参照モデル不要の内部識別プローブ(PIR)を提案しました。モデルの隠れ層における正解選択肢に対する特異的な共鳴シグナルを直接検出することで、PIRはプロンプトの欺瞞やパスワードロックなどの多様な隠蔽シナリオにおいて0.85〜0.93の高い識別精度を達成し、「答えたくない」ことと「本当に忘却した/知らない」ことを効果的に区別することに成功しました (出典: HuggingFace Daily Papers)
Agensh:分散型自己組織化フレームワークにより1,000体以上のAgentによるマスターレス協調スケーリングを実現 : 論文では、従来の中央集権オーケストレーション型マルチAgentシステムにおける並行規模の計算力および調整のボトルネックに対し、中央スケジューラを持たない自己組織化協調フレームワーク「Agensh」を提案しました。並行Agent群は共有ワークスペース、通信インターフェース、統一コンテキストを基盤に、サブタスクを自律的に引き受けて非同期に進捗を統合します。ProgramBenchの厳格な評価において、Agent数が1024体まで拡張されるにつれてテスト通過率は33.89%から55.06%へと大幅に向上し、組織規模が知能スケーリングの新たな次元としての巨大な可能性を持つことを実証しました (出典: HuggingFace Daily Papers)
MITなど複数機関が『Nature』に「xvr」モデルを発表:術中2D X線画像と3Dスキャン画像のサブミリ単位即時レジストレーションを実現 : マサチューセッツ工科大学はハーバード大学医学大学院などと共同で、低侵襲手術向けAIシステム「xvr(X-ray Volume Registration)」を『Nature』に発表しました。本システムは物理シミュレーションによって合成X線データを生成し、全身ボクセル事前学習基盤モデルと組み合わせることで、患者特異的な適応を5分以内に完了します。術中にはわずか数秒でリアルタイムの2D X線単純撮影画像と術前の3D CT/MRIスキャンをサブミリ単位の高精度で空間位置合わせし、低侵襲カテーテル介入などの手術の安全マージンを大幅に向上させます (出典: MIT News)

DeepLearning.AIとJetBrainsが共同で『仕様駆動型Agent開発(SDD)』体系的コースを公開 : Vibe Codingでは複雑なエンジニアリングの保守が困難であるという課題に対し、DeepLearning.AIはJetBrainsと提携して新たな仕様駆動開発(SDD: Spec-Driven Development)コースを開講しました。コースでは、プロジェクト全体の「憲法」の策定、構造化されたMarkdown仕様書、およびAgent Skillsを通じてCoding Agentを誘導し、アーキテクチャの根源からコンテキストの減衰を排除してコード品質を保証する方法を体系的に解説しています (出典: )
浙江大学などが「EmbodiedSkills」を提案:クローズドループAgentLoopによりVLAの長期タスク実行を構成 : 浙江大学などの複数の大学は、ロボット操作向けのフレームワーク「EmbodiedSkills」を提案しました。上位のVLMプランナーと下位のVLAアクションモデルを、観察・事前チェック・実行・検証・リカバリを含む完全なクローズドループサイクルに接続し、RoboTwin 2.0ベンチマークの50種類の複雑な長期シーケンス操作タスクにおいて86.20%の成功率を達成しました。これにより、長期アクションの破綻や状態喪失の問題が大幅に改善されました (出典: WeChat)

Modularがインタラクティブな技術ホワイトペーパー『大規模LLM推論システムハンドブック』を公開 : Modularチームは、同社の技術的知見を集約した『LLM Inference Handbook』をオープンソース化しました。TTFT、TPOT、継続的バッチ処理、チャンク化Prefill、KVキャッシュの数学的導出、PrefillとDecodeの分離アーキテクチャ、低ビット量子化などの重要トピックを網羅し、詳細な理解を助ける20以上のインタラクティブな動的ビジュアライゼーションチャートが収録されています (出典: clattner_llvm)
スタンフォード大学が新講義CS312「ディープラーニング錬金術」を開講:現場でのトレーニング直感とトラブルシューティング能力を育成 : スタンフォード大学は、Tatsu Hashimoto氏が主講を務める新講義「CS312」を開講しました。従来の古典的アーキテクチャの解説を完全に排除し、ハイパーパラメータのスケーリング、最適化の谷(Optimization Basin)、アーキテクチャの安定性、トレーニングLossの異常に対するコードレベルでの因果関係の特定に特化しています。評価の85%はコードのdiffからLossの推移を予測・検証することに充てられ、高度なトレーニング直感を徹底的に鍛え上げます (出典: stanfordnlp)
💼 ビジネス
バイオAIユニコーンのBasecamp Researchが1億4000万ドルの資金調達を実施、NVIDIAやAnthropic基金が参画 : ロンドンのバイオテックスタートアップBasecamp Researchは、S32がリードインベスターを務め、NVIDIA、Anthropic Anthology Fund、NATOイノベーション基金などが参画した新たな資金調達ラウンドで1億4000万ドルを調達したと発表しました。同社は世界30カ国以上の極限環境微生物ゲノムデータベースを活用してバイオ世界モデル「EDEN」をトレーニングしており、従来の試行錯誤を排して新規抗生物質分子を直接生成することや、生体内直接ゲノム編集酵素(大型セリンリコンビナーゼ)の設計を通じて、低コストな細胞治療薬の開発を加速させることを目指しています (出典: THE DECODER)

エンタープライズ向けマルチAgent協調プラットフォームのEmaがシリーズBで7700万ドルを調達、評価額は4倍に : 企業のHR、IT、財務の全プロセス自動化に特化したマルチAgentプラットフォームのEmaは、Creaegisがリードし、AccelやSection 32などが追加出資したシリーズBで7700万ドルを調達したと発表しました。累計調達額は1億4000万ドルに達します。Emaは統合オーケストレーション層によってアプリケーション横断的なビジネスロジックを接続し、契約受注額は1億5000万ドルを突破、クライアントにはMicrosoft、Google、PwCなどのトップ企業が名を連ねており、エンタープライズSaaSやITアウトソーシングの代替におけるAgentの強力な浸透力を示しています (出典: TechCrunch)
データアノテーションおよびRL環境構築プラットフォームのSnorkel AIがシリーズEで3億5000万ドルを調達、評価額は35億ドルに : AIラボや大手企業向けに高品質な強化学習(RL)合成環境と高度なトレーニングデータを提供するSnorkel AIは、評価額35億ドルで3億5000万ドルのシリーズE資金調達を完了しました。同社は「専門家+アルゴリズム合成」によるData-as-a-Service(DaaS)モデルを展開し、年間経常収益ランレートは3億7500万ドルに達し、過去1年間で18倍に急増しました。これは最先端モデルにおける複雑な強化学習環境構築に対する旺盛な需要を裏付けています (出典: TechCrunch)
🌟 コミュニティ
トランプ大統領が国連演説でAIを「スーパーインテリジェンス(SI)」へ改称することを提案し国際的規制を拒否、業界で議論が沸騰 : トランプ米大統領は国連総会での演説において、人工知能(AI)の正式名称を「スーパーインテリジェンス(Super Intelligence, SI)」に改称することを提案し、これを産業革命を超える国力の飛躍であると述べました。トランプ氏は米国がAIの発展を全力で奨励し、あらゆる「グローバリズム的管理構造」を明確に拒絶することを強調しました。この発言は、自律型モデルに対する管理防壁の設置を求める国際科学界や米英の一部の先端ラボの立場と真っ向から対立し、学術界やコミュニティの間で技術の制御不能リスクや政治的マーケティングに関する熱い議論を巻き起こしています (出典: The Guardian, TechRadar, Reddit r/ArtificialInteligence)

Meta Museに権限昇格の脆弱性が発覚しAmazonからアクセス遮断、ザッカーバーグ氏はオープンソース「OpenClaw」のアーキテクチャを深く参考にしたことを認める : MetaのパーソナルAgent「Muse」は、アプリストアのランキング首位を獲得した直後に複数のトラブルに見舞われました。セキュリティ研究者がMacシステムを不正に乗っ取られるゼロデイ権限昇格の脆弱性を報告し(公式により緊急修正済み)、Amazonも未認可のトランザクションスクレイピングを理由にMuseによるEコマースアクセスをブロックしたと発表しました。ワークスペース構造がOpenClawと酷似しているというコミュニティからの指摘に対し、Metaのプロダクト責任者はMuseの製品ロジックがOpenClawから強い着想を得ており、低層部分を完全に書き直したものであることを公式に認め、パーソナルAgentの所有権の境界と商用エコシステムの締め出しを巡る激しい議論を引き起こしています (出典: TechCrunch, WIRED)

OpenAIが国連および国際機関に対し「再帰的自己改善(RSI)」に関する安全管理基準の策定を呼びかけ : OpenAIは公式文書を公開し、最先端AIシステムの「再帰的自己改善(Recursive Self-Improvement: RSI)」に関する国際評価基準の確立を呼びかけました。OpenAIは、モデルが次世代モデルを自律的に設計・最適化する能力を備えた場合、技術の進化が人間の認知的制御を逸脱すると指摘しています。暴走リスクが重要インフラへ波及するのを防ぐため、多国籍の技術標準化組織が主導して、インシデントの強制報告、外部ストレステスト審査、および人間による介入権限の強制保持などの基準を確立しなければならないと主張しています (出典: THE DECODER, OpenAI News)
業界の評価基準がToken単価から「タスクあたりコスト(Cost per Task)」へ完全に移行 : GPT-6 Sol/LunaとOpus 5.5がタスクコストの削減をコアに据えて同日発表されたことを受け、開発者コミュニティでは強い共通認識が形成されました。単なる100万Tokenあたりの価格比較は意味を失い、リトライ率、コンテキスト圧縮、キャッシュヒット率、ツール呼び出しステップ数を含めた「単位有効タスクあたりのコスト」こそが、Agentの経済的実行可能性を測る中心指標となっています (出典: 36氪, dbreunig)
「モデルが自分の課題を採点」:Cognitionの完全AIコーディング宣言がエンジニアリングの信頼と監査危機への懸念を呼ぶ : Cognitionが、同社のエンジニアは手書きでのコーディングを完全に停止し、PRの作成をすべてAgentが自律的に行っていると主張したことに対し、コミュニティからはAIが作成したPRの欠陥率は人間の1.7倍に達し、独立した監査チェーンが欠如しているとの指摘が上がっています。多くのシニアアーキテクトは、監査証跡のない閉ループ自己評価を盲信することは深刻な技術的負債と「認知的空洞化」をもたらすと警告しています (出典: Reddit r/artificial)

最先端モデルがStarCraftでマルチAgent対戦:長考のしすぎで「無防備のまま撃破」される事態に : クラシックRTS『StarCraft』の一時停止なしの実機マルチモデル対戦テストにおいて、GPT-6 Astraは相手に負担の高い計算を強いる嫌がらせ戦術を駆使して全勝した一方、Grok 4.7は1ステップの思考に数分を要し、ユニットを1体も生産しないまま全滅しました。この結果は、連続的な物理世界やゲーム世界において、思考による計算消費はタイムバジェット(制限時間)に適合しなければならず、計算力は長く考えれば考えるほど有効であるとは限らないことを端的に示しています (出典: 36氪)

💡 その他
Sunwei New MaterialsがZhihui Jun(彭志輝)氏と共同でパーソナルロボット「Q1」と変形ロボット「T1」を正式発売、価格は19,999元から : Sunwei New Materialsの董事長である彭志輝(Zhihui Jun)氏は、コンシューマー向け身体性知能ロボット2機種の正式販売を発表しました。外観のカスタマイズと性格プログラミングに対応した人型コンパニオンロボット「Q1」は19,999元から、車輪・二足歩行と四足形態のシームレスな切り替えをサポートする追従ロボット「T1」も同様に19,999元から(Orinチップと360°全方位障害物回避を搭載したPro版は29,999元)となっています。両製品ともにスキルストア「PrimeStore」と開発キットを開放しており、Agibot系がロボットをハイエンドコンシューマーエレクトロニクス市場へと本格投入したことを示しています (出典: 量子位)

英国が国家情報防衛センターを設立、諜報機関とAI技術を連携させディープフェイクや認知戦に対処 : 英国首相は国連総会において、「国家情報防衛センター(NCID)」の設立を発表しました。同組織は軍の諜報部門、法執行機関、および主要ソーシャルメディアプラットフォームの計算リソースを統合し、外部の敵対勢力による偽情報の拡散、ディープフェイク攻撃、アルゴリズム操作に対してAI技術を用いた即時帰属特定と能動的解体を行い、市民に向けたデジタル認知防衛のガードレールを構築します (出典: The Guardian)

Spotifyが米国向けにAI駆動の「Taste Profile」を提供開始、自然言語で推薦アルゴリズムの重みを直接調整可能に : ストリーミング大手のSpotifyは、米国のプレミアム契約ユーザー向けにAI機能「Taste Profile」を正式にリリースしました。ユーザーは自身の音楽の好みをアルゴリズムがどのようにプロファイリングしているかを視覚的に確認できるだけでなく、自然言語による指示を通じてジャンルごとの重みを調整したり、特定の対象外スタイル(睡眠用ホワイトノイズや子供向け楽曲など)を除外したりすることができます。これにより推薦アルゴリズムのブラックボックスが解消され、アルゴリズムの主権がユーザーへと開放されました (出典: TechCrunch)
