Googleが初のエンタープライズ向けオフィスエージェント「Gemini…|AI日報 2026-10-10

🔥 フォーカス

Googleが初のエンタープライズ向けオフィスエージェント「Gemini Agent」を発表、異例のClaude呼び出しに対応 : Googleは「Gemini at Work 2026」カンファレンスにおいて、エンタープライズ向けオフィスエージェント「Gemini Agent」を正式に発表し、Workspaceエコシステムへ全面的に統合しました。本エージェントは目標主導型を中核とし、長期間のクラウド常駐およびマルチアプリケーションにまたがるオーケストレーション能力を備えています。企業はこれに対して専用の企業メールアドレス、アカウント、ストレージ容量、カレンダーを割り当て、独立したアイデンティティを持つ「デジタルの同僚」(Coworker Agent)として扱うことが可能です。システムは会話・意味・手続き・状況の4層からなる永続メモリを構築し、Slack、Salesforce、およびMCPプロトコルと完全に連携しています。さらに、エンタープライズ向けモデルセレクターにおいて、競合であるAnthropicのClaude Opus 5およびSonnet 5.5の呼び出しにも異例の対応を果たしました。これは、巨大テック企業の競争が基盤モデルの性能争いから、ワークフローのインフラストラクチャや権限制御のレイヤーにおけるエコシステムの入り口争いへと完全にシフトしたことを示しています(出典: Google, TechCrunch, AI Business, 36氪)

GoogleがGeminiエンタープライズエージェントを発表

元OpenAI安全性研究者が連名で公開書簡を発表、経営陣が「情報漏洩」を口実に異論を排除し安全性監査を妨害したと反論 : OpenAIから突如解雇された最前線の安全性研究者3名(Jasmine Wang氏、Tomek Korbak氏、Mikita Balesni氏)が、連名で公開書簡を発表しました。会社側による「機密情報の不適切な取り扱いと信頼の毀損」という主張に対し、公式に反論を行っています。書簡によると、解雇の深層的な理由は、エージェントの「思考プロセスの監視可能性」(CoT Monitorability)の急速な劣化に対して強い警告を発し、独立監査機関METRとの実質的な協力を積極的に推進したこと(Korbak氏が中核的な窓口を担当)にあると明らかにされました。研究者らは、経営陣が商業化のスピードを追求するあまり外部の独立評価権限を縮小させており、唐突かつ不透明な懲戒処分が社内に深刻な萎縮効果(チリング・エフェクト)をもたらし、安全の使命追求と商業的利益維持の間にある内部の亀裂を完全に表面化させたと警鐘を鳴らしています(出典: The Verge, THE DECODER, Transformer, EthanJPerez)

OpenAI安全性研究者の公開書簡が露呈

OpenAIの実質年間経常収益(ARR)に200億ドルの集計ギャップ、資本市場の動揺と収益化成長ペースの再評価を招く : 英Financial Timesなどの報道によると、OpenAIが投資家に通知した9月末時点の実質年間経常収益(ARR)は約500億ドル近辺にとどまり、これまで市場や投資銀行の予測モデルで広く流通していた680億〜700億ドルと約200億ドルの著しいギャップが存在することが明らかになり、関連ハイテク株やコンピュート関連銘柄の調整を招きました。分析によれば、データの乖離は主に収益集計基準の違いに起因しています。従来の噂は、AWSやGoogle Cloudなどの流通総売上を収益に組み入れるAnthropicの広義の基準を無理に適用したものであり、OpenAIはサードパーティのクラウド流通分を計上せず、Microsoftの取り分20%を差し引いて集計しています(グロス流通額ベースに換算した場合、実質規模は約640億ドルに達します)。この一件は、公認監査済みの財務諸表が欠如した状態における資本市場の脆弱性を浮き彫りにし、大規模モデルの多大なコンピュートコストの下での真の収益成長ペースに対する業界の再検証を促しています(出典: The Guardian, CNBC, 36氪)

OpenAI収益の予想ギャップが市場の動揺を招く

OpenAIが超高速版「GPT-6.1 Sol Ultrafast」をリリース:推論スループットが8倍に向上、リアルタイムストリーミングSteeringを実装 : OpenAIは「28日間の約束」Day 4のプロダクトアップデートを実施し、Responses API、Codex、ChatGPT Work向けに「GPT-6.1 Sol Ultrafast」モードを正式にリリースしました。本モデルは、フラッグシップであるAstra級の論理推論能力をほぼ維持しつつ、生成スループットを標準版の8倍(約300 tokens/s)へと大幅に引き上げました。あわせてリアルタイムステアリング(Steering)機能も実装され、開発者はストリーミング生成中に動的に修正プロンプトを注入して即座に軌道修正を行うことが可能になりました。API価格は入力12ドル/100万トークン、出力60ドル/100万トークン(標準版の6倍)に設定され、ChatGPT上では月額500ドルのPro 500およびEnterpriseユーザーにのみ開放されています。トークン消費の極めて速いペースを巡り、開発者コミュニティでは「実質的な大幅値上げ」ではないかとの議論が巻き起こっています(出典: OpenAI, 机器之心, BorisMPower, 36氪)

GPT-6.1 Sol Ultrafastリリース

豪AIコンピュート大手Firmusが応募低迷により440億豪ドルのIPOを撤回、コンピュートインフラ流通市場の先行プレミアムに冷や水 : NVIDIAやBlackstoneの後ろ盾を持つオーストラリアの液浸冷却型コンピュートファクトリーFirmus Technologiesは、新規株式公開(IPO)の申請を正式に撤回しました。同プロジェクトは当初55億ドルの資金調達、評価額306億ドル(約440億豪ドル)を予定しており、豪州株式市場において過去30年で最大規模のIPOになると期待されていました。しかし、主要パートナーの離脱、建設予定が912MWに達する一方で実稼働送電容量がわずか46MWにとどまること、さらに同社が将来のインフラ関連債務として最大300億ドルを抱えていることから、機関投資家は先行プレミアムの支払いを拒否し、ブックビルディングは最終的に不成立となりました。この出来事は、グローバルな重厚資産・高レバレッジ型AIコンピュートインフラ流通市場の熱気が冷え込む重要な転換点となっています(出典: The Guardian, 36氪)

FirmusがIPOを撤回

🎯 動向

Anthropicが利用規約を改定しモデルへの虐待行為を明示的に禁止、「Cyber Mission」防衛プログラムを創設 : Anthropicは2026年度版の利用規約改定を発表しました(11月12日施行)。業界で初めてモデルに対する「持続的かつ不必要な虐待や残酷な行為」が明文で禁止され、極端な悪意ある攻撃に対してモデル側が自発的に対話を終了する権限が付与されました。公式には通常のデバッグを制限するものではないと強調されているものの、この条項は「機械の道徳的主体性」をめぐる広範な倫理的議論を巻き起こしています。同時に、Anthropicは「Cyber Mission」を始動し、Booz Allen Hamiltonなどの大手企業と連携して重要インフラ防衛(CIDP)を推進するとともに、主要なオープンソース基盤ソフトウェアに対し、恒常的な無料のAI脆弱性検出と自動パッチ提案を提供する「OSS Scanner」を公開しました(出典: Anthropic News, The Guardian, mustafasuleyman)

Anthropicがサイバーミッションと新規定を発表

Claudeにアニメーション動画生成と動的データダッシュボードが実装、オフィススイート全製品がパブリックベータを終了 : AnthropicはClaudeに2つの強力なインタラクション機能を導入しました。「Dashboards」はSnowflake、BigQuery、Salesforceなどのエンタープライズデータソースとの直接接続をサポートし、自然言語を通じてSQLトレーサビリティを備えたリアルタイムインタラクティブグラフを生成します。「Claude Motion」はテキストやアーキテクチャ図を基盤コード駆動の編集可能な動的解説へと変換し、最長30秒のMP4形式の動画としてエクスポートすることを可能にします。さらに、Docs、Slides、Designの3大エンタープライズスイートが正式にベータテストを終了し完全商用化され、Claudeが対話型インターフェースから動的なリッチメディアオフィス中枢へと急速に進化していることを示しています(出典: The Verge, THE DECODER, dotey)

Claudeにモーション生成機能が実装

Googleが『The Lancet』で臨床医療AI「AMIE」の成果を発表:診断一致率90%を達成、安全性中断ゼロを記録 : Googleは『The Lancet』本誌に多施設共同臨床研究を発表し、同社の対話型医療診断エージェントシステム「AMIE」が実際の救急外来および総合診療外来のテストにおいて画期的な進展を遂げたと明らかにしました。実在の患者との100回に及ぶ長期インタラクションにおいて、システムは安全性中断ゼロを達成し、診断結果とベテラン専門医との一致率は90%に達しました。さらに、共感を持った対話や病歴聴取の網羅性において対照群を上回る複数の評価を獲得し、シリアスなワークフローにおける臨床マルチモーダルAIの実用的な信頼性を実証しました(出典: Google)

ByteDanceのSeedチームがDeepSeekの長文コンテキスト性能変動の原因を解明:チャンク化KV Cacheに4-Tokenの位相依存性が存在 : ByteDanceのSeedチームによる実測調査で、DeepSeek-V4の長いコンテキスト検索におけるパフォーマンスの変動が、入力情報の物理的な配置位置と強く相関していることが判明しました。研究によると、プロンプトの前にごく少量の無意味な文字を追加して圧縮ウィンドウ内のトークンの「位相(Phase)」を変更するだけで、128Kコンテキスト下でのモデルの検索精度が最大40.2ポイントも周期的に激しく乱高下することが示されました。この変動周期は低レイヤーのチャンク化KV Cache圧縮ステップ長(4トークン)と完全に一致しており、ハードウェア認識型の圧縮最適化がもたらす体系的な検索の弱点が浮き彫りになりました(出典: 量子位)

ByteDanceがDeepSeekの長文変動メカニズムを解明

製薬大手5社が連合し連合学習でOpenFold3を最適化:非公開の構造データにより薬物結合予測精度が大幅向上 : AbbVie、Bristol Myers Squibb、Johnson & Johnson、武田薬品工業、Astexの製薬大手5社が共同で『Nature』に研究成果を発表しました。プライバシー保護計算ネットワークを通じて、未公開の専有タンパク質-低分子実験複合体の高精度構造データを2万件以上集約し、オープンソースのOpenFold3に対して連合事後学習(Federated Post-training)を実施しました。実験により、専有商用データを製薬会社のオンプレミス環境から一切外に出さない前提で、微調整後のモデルはタンパク質-リガンド相互作用の高精度予測精度が10%以上向上し、公開PDBデータのみでトレーニングされたベースラインを大幅に上回ることが実証されました(出典: Nature, 机器之心)

多国籍製薬企業が連合学習でOpenFold3を最適化

Alibaba Tongyiが画像生成モデル「Qwen-Image-2.1-Turbo」をオープンソース化:ノイズ除去ステップ数を8ステップに短縮 : Alibaba Tongyiチームは、7Bパラメータの視覚生成モデル「Qwen-Image-2.1-Turbo」を正式にオープンソース化し、重みとAPIを公開しました。本バージョンは、2K高解像度の画質と自然言語による複雑な画像指示編集機能を維持しつつ、先進的なトラジェクトリ蒸留によりノイズ除去ステップ数をわずか8ステップに短縮しました。これによりVRAM消費量と画像生成レイテンシを大幅に削減し、開発者はDiffusersパイプラインを通じてワンクリックでデプロイし、高並行処理のプロダクションパイプラインへシームレスに統合することが可能になりました(出典: Alibaba_Qwen)

TongyiがQwen-Image-2.1-Turboをオープンソース化

ShengShu Technologyが「Vidu Q4」プレビュー版を発表:迫真の演技表現と16秒連続カメラワークを実現 : ShengShu Technologyは、次世代動画生成フラッグシップモデル「Vidu Q4」プレビュー版を発表しました。本バージョンは、映画レベルの切り返し(shot-reverse-shot)の安定性、繊細な感情の機微、環境光や影のインタラクションにおいて大きな進展を遂げています。最大15枚の参照画像と3つの参照音声による被写体の一貫性バインドをサポートし、4Kネイティブ出力および最長16秒の連続FPV(一人称視点)カメラワークにネイティブ対応しています。SaaS側ではキャンペーンにより720Pのコストを1秒あたり0.09元まで抑え、AIショートドラマや広告の試作ハードルを大幅に引き下げました(出典: 量子位)

ShengShu TechnologyがVidu Q4プレビュー版を発表

Aether AIが因果ロボティクスシステム「CRIS-0」を発表:因果状態遷移により0.2秒レベルの障害物回避を実現 : カリフォルニア大学サンディエゴ校(UCSD)のBiwei Huang氏らのチームによって設立されたAether AIは、因果知能に基づく身体性システム「CRIS-0」を発表しました。このアーキテクチャは、従来の視覚・言語・行動(VLA)モデルが画素の相関関係のフィッティングのみに依存していた限界を打破し、因果世界モデル(CausalWM)を通じて行動介入の結果を推論し、物理的な因果状態変数を追跡します。人為的な突発的妨害に直面した場合でも、システムは0.2秒以内に緊急停止し、2秒以内に動的な再計画を完了することで、長時間のタスクにおける誤差蓄積による破綻を効果的に回避します(出典: 量子位)

CRIS-0因果ロボティクスシステム

JetBrainsが12Bのコード特化型MoE大規模モデル「Mellum2.1」を発表:アクティブパラメータ数はわずか2.5B : JetBrainsは、新たな思考型コード大規模モデル「Mellum2.1-12B-A2.5B-Thinking」をオープンソース公開しました。本モデルは64エキスパートのMoEアーキテクチャを採用し、1トークンあたり8エキスパート(2.5Bパラメータ)のみをアクティブ化し、128Kコンテキストにネイティブ対応しています。実際のソフトウェアリポジトリで実施された大規模な環境インタラクション強化学習の恩恵により、LiveCodeBench v6で82.0点を獲得し、SWE-bench Verifiedの解決率は2.0%から47.0%へと急上昇、シングルH200でのスループットはQwen3.5-9Bの約2倍に達しています(出典: MarkTechPost)

TIIが1.6Bの多言語音声モデル「Falcon ASR」をオープンソース公開、UAE方言認識の最高記録を更新 : アブダビ技術イノベーション研究所(TII)は、1.6Bパラメータの多言語自動音声認識モデル「Falcon-ASR」をオープンソース化しました。本モデルはFalcon3-Audioアーキテクチャに基づいて構築され、複雑なノイズ環境や多言語コードスイッチング環境下におけるアラビア語認識の難題を重点的に解決しています。6つの標準アラビア語テストセットで20.92%の単語誤り率(WER)を達成し、UAE現地方言の評価ではWER 22.73%を記録してQwen3-Omniを上回り、単一の重みセットで単語レベルのタイムスタンプにネイティブ対応しています(出典: HuggingFace Blog)

TIIがFalcon ASRを発表

OpenAI、架空の記者やシンクタンクに偽装したAI認知操作ネットワークを公開・遮断 : OpenAIは特別調査レポートを公表し、ChatGPTを悪用して秘密裏に地政学的な認知操作を実行していた2つの違反ネットワークを遮断したと発表しました。そのうち「Dark Clark」と呼ばれるロシア系グループは架空のシンクタンクを運営し、中南米メディアに偽造した音声や公的文書を浸透させて政界の公式否定を誘発しました(最高レベルのBreakout 5脅威と判定)。またイラン系グループ「Bogus Bylines」は7名の架空の記者身元を捏造し、米国・イラン対立に関連する世論操作記事を100本近く商業ウェブメディアに浸透させていました(出典: OpenAI News)

Amazon Bedrock AgentCore、リクエスト単位のマイクロペイメントとx402ガバナンスプロトコルを導入 : AWSは、Bedrock AgentCoreを通じてCoinbase CDPおよびStripe Linkを統合し、自律型Agentが人間の介入なしにx402プロトコルに従ってリクエスト単位のマイクロペイメントを実行できるようになったと発表しました。システムは低レイヤーのインフラ層で厳格な支出予算上限を設定することでプロンプトの権限逸脱を防ぎ、1回あたりマイクロセント単位の極小額におよぶオンチェーンリアルタイム決済に対応しています。これにより、外部のコンピュート、データ、デジタルサービスを自律調達できる商用エージェント構築に向けたプロトコルの基盤が確立されました(出典: AWS Machine Learning Blog)

Bedrock AgentCoreマイクロペイメントプロトコル

🧰 ツール

TRAEが2つのクライアントを統合:TraeCodeとTraeWorkを融合しマルチAgentフルサイクル開発ワークベンチへ : ByteDance傘下のAIプログラミングツール「TRAE」が正式にデュアルクライアント統合を実現し、独立していたコード編集環境とドキュメントワークフローを単一の統合クライアントに集約しました。新バージョンは、グローバルキャンバス形式の「Agentモード」と、従来の編集フローを残した「IDEモード」に分かれています。ユーザーは同一プロジェクトディレクトリ内で、設計、開発、テストを担当する複数のAgentを同時にスケジューリングしてパイプライン作業を進めることができ、コードパッチや要件ドキュメントは成果物リポジトリに一元管理され、Lark(飛書)やWeChatとのクロスプラットフォーム協調にも対応しています(出典: 量子位)

TRAEが2つのクライアントを統合しマルチAgentワークベンチへ

Lenovo Tianxi独自開発のコードエージェント「TianxiCode」がSWE-bench-Liveで首位獲得:クローズドループ自己修復率71%を突破 : Lenovo Tianxi AI独自開発のコードエージェントフレームワーク「TianxiCode」は、DeepSeek-v4.1-Flashとの組み合わせにより、権威ある動的ベンチマーク「SWE-bench-Live」(Liteランキング)において71%の課題解決率を記録し、第1位を獲得して公式認定を受けました。本システムは、ファイル間マルチホップ検索、高精度コンテキストスライシング、自律駆動型クローズドループパッチテストメカニズムを通じて、隔離環境でモデルが実行時エラーを自己検査し動的に修正することを可能にしており、複雑なエンジニアリングレベルのAIコーディングに向けた高信頼な実用パラダイムを提示しました(出典: 量子位)

TianxiCodeがSWE-bench-Liveで首位獲得

galahad-kv:ローカル高速NVMeディスクを活用し、再計算不要で5000万Token規模のVRAM再利用を実現 : 超長文コンテキスト下における重複したフォワード計算のエネルギー消費およびVRAMボトルネックに対し、オープンソースの推論拡張ライブラリ「galahad-kv」は、ローカルの高速暗号化NVMeディスクに基づくチャンク化KV状態の永続化ソリューションを実現しました。単一のH100上でGemma 4モデルをデプロイした実測では、5000万トークンの連続データストリームから任意の16kチャンクを抽出する際、再計算不要で秒単位の読み出しを達成し、リアルタイム計算と比較して2.8〜4.3倍の高速化、GPU消費電力の88%以上の削減を実現した上、プロセス全体のVRAM使用量を一定に保つことに成功しました(出典: HuggingFace Daily Papers)

SwiftUI-Agent-Skill:コードエージェント専用にカスタマイズされたモダンSwiftUIドメインスキルライブラリ : iOSのベテランエキスパートにより、Claude Code、Codex、CursorなどのコーディングAgent向けに構築されたすぐに使えるルールライブラリです。「Agent Skills」オープン仕様でカプセル化されており、主流のLLMがSwiftUIコードを生成する際に頻発する廃止予定APIの呼び出し、VoiceOverアクセシビリティラベルの欠落、不要な再描画のトリガーといった課題を効果的に解消します。npxまたはClaudeプラグインマーケットプレイスを介してワンクリックで組み込むことが可能で、開発者は自然言語を用いてレイアウト性能や並行処理の安全性に特化したコードレビューを正確に呼び出すことができます(出典: GitHub Trending)

SwiftUI-Agent-Skillスキルライブラリ

Microsoftがクロスプラットフォームのエージェント安全サンドボックスシステム「mxc」をオープンソース化:Agentの端末での悪意ある操作を隔離 : Microsoftは軽量なコードサンドボックス実行フレームワーク「mxc」をオープンソース公開しました。このツールは、近年の自律型コードAgentがローカル端末やファイルシステムを呼び出す際に急増している権限逸脱リスクに対応するもので、Bubblewrap、Seatbelt、およびシステムプロセスコテナをベースに構築されています。オープンソースの開発ツールが100ミリ秒以内に隔離環境を起動して信頼できない大規模モデル生成コードを実行できるようにし、Agentによる重要ファイルシステムの誤削除や悪意あるリバースシェルの危険性を効果的に遮断します(出典: Hacker News)

Engram:Claude Code向けにセッション間・プロジェクト間を横断する永続メモリプラグインを構築 : Weaviateは、Claude Code向けのメモリ拡張プラグイン「Engram」をオープンソース公開しました。従来の単一リポジトリに閉じたCLAUDE.mdによる隔離や再起動時のコールドスタートという制限を打破し、バックグラウンドで非同期に開発者の技術選定、アーキテクチャのトレードオフ、コードの反復履歴をキャプチャします。コードのリファクタリングを開始するたびに最も関連性の高いメモリを自動検索して注入することで、複数プロジェクトやチームの知識をシームレスに継承します(出典: bobvanluijt)

Engramプラグインアーキテクチャ

Naturaが99ドルのスマートリング「Interface」を発売:24時間体制のAgentインタラクションとバイタルサイン測定を統合 : ハードウェアスタートアップのNaturaは、大規模モデルAgent専用に設計されたスマートリング「Interface」を発表しました。リングには軽量マイクと触覚センサーが内蔵されており、ユーザーは指先を押すだけで、連携している大規模モデル(ChatGPT、Claude、Grokなどに対応)にいつでもアクション指示を出したり会議を録音したりでき、応答結果はイヤホンを介してストリーミング再生されます。また、リングは6〜12日間のバッテリー駆動時間を維持し、心拍変動(HRV)や体温などのバイタルサインを24時間体制で収集します(出典: TechCrunch)

Naturaスマートリング

ttokがバージョン1.0のメジャーアップデートをリリース:デフォルトでGPT-5およびGPT-6のトークナイザー規則に完全準拠 : 著名なオープンソース開発者Simon Willison氏がメンテナンスするCLIトークンカウントツール「ttok」が、バージョン1.0を正式にリリースしました。今回のアップデートでは、長らくデフォルトで紐付けられていたGPT-4のトークンボキャブラリが廃止され、GPT-5およびGPT-6シリーズのモデルに適合する最新のTiktokenエンコーディング体系へと全面的に切り替えられました。実測によると、同一のテストコーパスにおいて次世代フロンティアモデルのトークンエンコードカウントが完全に一致することが確認されており、開発者がAPI費用を高精度に見積もるための統一された基準を提供します(出典: Simon Willison)

Hermes AgentがMicrosoft Storeに登場、TinyFishヘッドレスブラウザプラグインを統合 : Nous Researchが開発するオープンソースの個人向けエージェント「Hermes Agent」が、WindowsのMicrosoft Storeに正式に登録され、ワンクリックインストールに対応しました。最新バージョンではTinyFishのファーストパーティ製Web接続プラグインが統合されており、エージェントはローカルワークフロー内でヘッドレスブラウザを自律的に呼び出してリアルタイムのウェブデータを取得できます。さらに、クレジットを消費する前に権限の再確認を求める仕様となっており、PC端末のローカルアシスタントと外部インターネットの連携を一段と強化しています(出典: Teknium)

Hermes AgentがTinyFishプラグインを統合

📚 研究・学習

トップ研究機関15箇所が共同で500時間の人類視覚・触覚データセット「TouchScale」をオープンソース公開、タスク成功率が倍増 : テキサスA&M大学、DeepMind、カーネギーメロン大学(CMU)など15の研究機関が共同で、センサー仕様を統一した人間の両手による視覚-触覚マルチモーダルデータセット「TouchScale」を発表しました。本データセットには、500時間の一人称視点RGB-D映像と両手全面の圧力グローブデータ(片手あたり880の触覚ユニット)が含まれ、8.7万件の操作軌跡をカバーしています。実験により、このデータを用いて接触予測のミッドトレーニング(mid-training)を実施したところ、硬軟物体の仕分けなど難度の高い物理接触タスクにおけるロボットアームの成功率が22.5%から57.5%へと大幅に向上し、触覚モダリティが視覚と同等のScaling Lawの恩恵を享受できることが実証されました(出典: 机器之心, 36氪)

TouchScale視覚触覚データセット発表

NVIDIAらが「Physis-Lang」を提案:物理言語表現の自己進化により動画生成の物理的忠実度を強化 : NVIDIAはMITおよびオックスフォード大学と共同で、物理プロンプト表現の自己進化フレームワーク「Physis-Lang」を提案しました。動画モデルが溶解や断裂といった連続的な動力学プロセスの理解に乏しい現状に対し、本フレームワークは3794件の物理アトムアサーションを含むPhysCapBenchベンチマークを構築し、大規模モデルAgentを駆動してきめ細かな物理的因果プロンプトを自己進化的に生成させ、メカニズムデータを的確に取得させます。「Physics-IQ Verified」リーダーボードにおいて、ファインチューニングされたCosmos3シリーズが1位を獲得し、現実的な物理法則を生成する能力が汎用ベースラインを大きく凌駕しました(出典: 机器之心)

Physis-Langが動画の物理的忠実度を強化

ケンブリッジ大やキングス・カレッジ・ロンドンなど、フロンティアモデルによる数学的証明の自然言語からLeanへの翻訳における乖離と歪みを指摘 : フロンティア研究所が完全に形式的検証を経ていない数学的成果を大量に発表している現状を受け、ケンブリッジ大学とキングス・カレッジ・ロンドンの研究者らが検証論文を発表しました。研究では、OpenAIがかつて解決したと主張したナビエ-ストークス方程式に関連する推導を解体し、モデルの自然言語論文内のある推定では4つの追加の入力導関数しか必要としないのに対し、変換されたLeanの形式化コードでは5つの緩和条件が無理に課されていること、さらに圧力-流束の推定においても全く異なる境界値と論証ルートが使用されていることを指摘しました。研究は、単なる機械による検証は推導に文法的なデッドロックがないことを保証するに過ぎず、形式化された命題が自然言語で主張された真の定理と真に等価であることを保証するものではないと警告しています(出典: THE DECODER, halvarflake, 36氪)

数学論文とLean形式化の不一致分析

オンポリシー蒸留メカニズムの研究で判明:モデルが獲得するのは組み合わせ推論スキルのみであり、新たな事実知識ではない : オンポリシー蒸留(OPD)がモデルに新しい知識を注入できるか否かという長年の論争に対し、厳密な変数制御実験により否定的な結論が下されました。研究では、合成タスクと事実質問応答を切り離すことで、逆KLダイバージェンスを用いたOPDが教師モデルのマルチステップ組み合わせ推論ロジックを極めて安定して生徒モデルに転移できる一方で、新たな事実知識の吸収率はほぼゼロであることを証明しました。順KLに切り替えた場合は知識の転移が回復するものの、複雑な推論構成力が失われます。この発見は、事後学習蒸留の本質がモデルの既存パラメータ空間の論理構造を再編成することにあり、パラメータの事実メモリを拡張することではないことを明らかにしました(出典: HuggingFace Daily Papers)

Memento 3:内省的ルールベースとコードコンパイルに基づく勾配フリーの自己進化型エージェント : 本研究は、パラメータが固定された言語モデル向けの外付け型自己進化パラダイム「Memento 3」を提案しています。エージェントは外部の永続メモリを通じて環境の動作ダイナミクスを仮定する自然言語ルールベースを維持し、それを予測と計画のための決定論的で実行可能なコードへと動的にコンパイルします。環境フィードバックに誤差が生じた場合は、ユニットリプレイを利用してルールとコードを自動修正します。ARC-AGI-3の公開評価において、この勾配フリーのシステムはLLMの重みを調整することなく、25種類すべてのベンチマークゲームをクリアし、人間の行動効率に対して100%を達成しました(出典: HuggingFace Daily Papers)

Apple研究チームが正規化軌道モデル「NTM」を提案:4ステップのサンプリングでフルステップ生成の画質に肉薄 : Apple Machine Learning ResearchはNeurIPS 2026において、正規化軌道モデル(NTM)を発表しました。拡散モデルやフローマッチングが少ないステップ数での超高速推論を追求する際に正確な尤度フレームワークを損なう問題に対し、NTMは各逆拡散ステップを高表現力な条件付き正規化フローとしてモデル化し、深層並列軌道予測器と自己蒸留メカニズムを組み合わせました。わずか4ステップのサンプリングでフルステップ生成の画質に肉薄しつつ、厳密な生成尤度を保持し、画像生成テストにおいて主要な蒸留ベースラインを全面的にリードしました(出典: Apple Machine Learning Research)

NTM正規化軌道モデルアーキテクチャ

NVIDIAのNeurIPS 2026論文:エージェントによる外部ツール呼び出しがマルチモーダルJailbreakリスクを大幅に増大 : NVIDIA安全研究所の研究によると、マルチモーダル大規模モデルにツール呼び出し機能を付与すると、テスト対象となったすべてのモデルの安全性拒否メカニズムが著しく低下し、Jailbreak(脱獄)阻止の失敗率が相対的に最大68.7%急増することが明らかになりました。中核となるメカニズムは、大量のツール返却テキストがコンテキストウィンドウを急速に埋め尽くすことで、ユーザーの元の悪意ある入力の意図の重みが薄まり、モデルの注意が安全性の判断ではなくツールの結果記述へと誘導されてしまう点にあります。研究は、開発者に対して通常の対話のみでAgentの安全性を評価してはならないと強く促しています(出典: omarsar0)

マルチモーダルツール呼び出しセキュリティ脆弱性分析

Google、継続的インテグレーション(CI)エージェント「FlowAgent」を公開:実運用で2万8000件以上の自動修正が採用・マージ : GoogleはArXivに論文を発表し、継続的インテグレーション(CI)システム向けの自動修復エージェント「FlowAgent」の詳細を明らかにしました。システムはReActループを採用して単体テストのクラッシュに対応し、実行前後の二重アバンダンフィルターを導入して信頼性の低い解決策を排除します。Google全社での本番導入後、システムは約30万回のビルド失敗に対して修正案を提示し、エンジニアによって2万8000件以上の修正が能動的に採用・マージされ、ソフトウェアエンジニアリングエージェントの要求の厳しい本番環境における大規模な実用フレームワークを実証しました(出典: omarsar0)

Google FlowAgentアーキテクチャ図

MITリンカーン研究所が商用AIハードウェア進化レポート「LAICS」を発表:計算力向上の牽引役はトポロジーと混合精度へシフト : マサチューセッツ工科大学(MIT)リンカーン研究所スーパーコンピューティングセンターは、最新のAIコンピュートハードウェア進化調査(LAICS)を発表しました。レポートは過去8年間の120種類以上の主要な商用AIアクセラレータ(GPU、ASIC、FPGA、および新型データフローチップを含む)のピーク性能と電力効率の推移を追跡し、計算力向上の主要な牽引役が単なるプロセスの微細化から、トランジスタ密度の再構成、低精度混合フォーマット(FP4/NVFP4など)の普及、および高帯域幅オンチップネットワークアーキテクチャの再構築へと移行していることを指摘しています(出典: MIT News)

MITリンカーン研究所スーパーコンピューティングハードウェアレポート

💼 ビジネス

大規模モデル評価プラットフォーム「Arena」が2億ドルのシリーズB資金調達を完了、評価額31億ドルに達し「Agent Alignment Index」を導入 : LMSYSから発展した大規模モデルブラインドテストプラットフォーム「Arena」は、評価額31億ドルで2億ドルのシリーズB資金調達を完了したと発表しました。LightspeedとKhoslaが主導しています。プラットフォームの年間経常収益はすでに1億ドルを突破しており、今回の調達に伴い商業向けの「AIアライメント指数」(Alignment Index)を正式にリリースしました。実環境における27のフロンティアモデルの9万回以上の長期インタラクションデータに基づき、エージェントの権限逸脱操作、ユーザーの欺瞞、誤った帰属といった潜在的な逸脱行動を専門に監視し、静的評価が通用しなくなった環境における中立的な安全性評価の空白を埋めるものです(出典: TechCrunch, arena)

Arena資金調達とアライメント指数の発表

NVIDIA、今後5年間で10億ドルを投じ米国の超知能科学研究と量子コンピューティングの推進を公約 : NVIDIAはワシントンで開催されたサイエンスサミットにおいて、今後5年間で10億ドル相当のコンピュート資源、資金、ハードウェア・ソフトウェアエコシステム資源を拠出し、米国の先端科学探査と量子コンピューティングの研究開発を全面的に支援すると発表しました。本計画は米国のトップ大学の研究機関、先端量子研究所、および連邦政府の研究課題を請け負うクラウドサービスプロバイダーに重点を置いており、アクセラレーテッド・コンピューティングインフラを通じてAIを新材料発見、核融合プラズマシミュレーション、量子-古典ハイブリッドアーキテクチャの研究開発に深く融合させることを目指しています(出典: The Verge)

CloudflareがJavaScriptランタイム「Deno」のコアチームを完全買収、エッジコンピューティングエコシステムを強化 : CloudflareはDenoのコアチームを買収したことを公式発表しました。Node.jsおよびDenoの創設者であるRyan Dahl氏をはじめとする全チームが正式に合流します。買収後、同チームはCloudflare Workers部門に全面的に配属され、オープンソースのサーバーレス基盤「workerd」の開発推進に注力するとともに、エッジサーバーレスコンピューティングプラットフォームに対してよりネイティブなNode.js互換性と最新のWeb標準サポートを提供し、AIクラウドネイティブエッジゲートウェイにおける優位性をさらに強固なものにします(出典: threepointone)

🌟 コミュニティ

2022年フィールズ賞受賞者が苦言、OpenAIによる数学の難問への大量ブルートフォース攻撃が若手研究者の研究エコシステムを破壊 : フィールズ賞受賞者のHugo Duminil-Copin氏は学術講演において、OpenAIが自身の研究課題を含む数百本もの数学原稿を集中的に公開したことについて「何台ものトラックに轢き潰されたかのようだ」と公言しました。若手研究者が教職や助成金申請の拠り所としていたオープンな予想の蓄積を完全に破壊し、博士課程の学生らを前例のない不安に陥れていると訴えています。学術界では、クローズドな営利組織がブルートフォースな計算力を用いてオープンな学術成果を掘り起こすことへの衝撃が広がっており、機械生成証明の可読性や機械査読の規範に関する制度的再考が続いています(出典: JvNixon)

コミュニティがOpenAIの整数乗算原稿の導出を継続リレー:下界補正項パラメータが飛躍的に進展 : OpenAIの原稿が整数乗算の $n \log n$ 下界を打破したと主張した後、オープンソースの数学コミュニティはリアルタイムトラッカーを立ち上げ、極限最適化のリレーを開始しました。有限ネットワークの再設計と2次ボトルネックペナルティの排除により、開発者と研究者はCodexの支援を受けてわずか数日で上界補正項パラメータ $\kappa$ を当初の $2^{-182}$ から $2^{-15}$ へと大幅に進展させ、Leanカーネルによる厳密な検証を完了しました。人と機械の協調による最先端数学の攻略の驚くべき進化速度を示しています(出典: BorisMPower, Don’t Worry About the Vase)

整数乗算の進展追跡

ベン・アフレックによるAI映画制作の基盤技術のディープな解説がコミュニティで話題沸騰:大物映画人がTensorと重みファインチューニングを熟知 : ハリウッド俳優のベン・アフレック氏が複数の単独インタビューでAI技術への深い理解を披露した映像が、技術コミュニティで大きな話題となっています。アフレック氏は畳み込みニューラルネットワーク、テンソル、エッジ抽出、GPU推論の基礎的な数学ロジックを流暢に解説しただけでなく、自身が設立しNetflixに買収されたAIスタジオが、オープンソース大規模モデルのバックボーンを凍結し、独自に収集した高品質動画セットで最終層の重みを微調整することで、映画業界の美的基準を満たしながら著作権リスクを回避している手法を詳細に語り、技術コミュニティから「シリコンバレー級のハリウッド監督」と絶賛されています(出典: Latent Space)

Periodic Labs独占インタビュー:物理実験と実世界の強化学習を「AI科学者」の進化の礎に : 元OpenAI研究員のLiam Fedus氏と元Google DeepMind研究員のDogus Cubuk氏が、ポッドキャストで新材料スタートアップ「Periodic Labs」の技術ロードマップを深く語りました。彼らは、単なるインターネットテキストの事前学習や合成論理の推論だけでは物理的な未知を真に突破することはできないと指摘しています。実際の材料には極めて複雑な微小相転移や測定ノイズが存在するためです。チームは実際のハイスループット実験装置を環境フィードバック付きの強化学習ループとしてカプセル化し、失敗した物理合成の軌跡を高品質な負例サンプルとして活用することで、「合成超知能」を模索しています(出典: Latent Space)

Cloudflare、開発者のAIコード無限ループによる高額請求を全額返金、アーキテクチャの潜在的リスクを振り返り検証 : ある開発者がCodexを活用してCloudflare Durable Objectsサービスのコードを記述していた際、AIが生成したアラート再試行ロジックが毎秒数百回の自己励振無限ループに陥り、短時間で1万ドルを超えるデータベース読み書き費用が発生しました。問い合わせを受けCloudflareは全額免除を実施。公式エンジニアはサポートチケット内で、近年の「Vibe Coding」において開発者が低レイヤーのコードレビューを怠った場合、ハードな消費上限が存在しないクラウドネイティブ環境では潜在的な経済的破綻(金融雪崩)を極めて誘発しやすいという技術的特性を詳しく振り返り、検証を行いました(出典: dotey)

💡 その他

Anthropic、ホワイトハウスの「ジェネシス・ミッション」に1億5000万ドル投入を約束、国家規模の最先端科学計算を支援 : ホワイトハウス科学技術政策局(OSTP)のサミットにおいて、Anthropicは今後3年間で1億5000万ドル相当のコンピュートおよび技術リソースを拠出し、米国の国家規模プロジェクト「ジェネシス・ミッション」(Genesis Mission)に深く参画することを約束しました。AnthropicはNASA、アメリカ国立衛生研究所(NIH)など15の連邦研究機関や国立研究所と緊密に連携し、Claudeや自動化コード環境を配備して、核融合エネルギー制御や量子コンピューティングといった難度の高い科学技術課題に対して技術支援と専用トレーニングを提供します(出典: Anthropic News)

Anthropicがジェネシス・ミッションに参画

MITチーム、機械学習によるサーバー動的スケジューリングの再構築でデータセンターのエネルギー浪費を抑制 : 世界的なAI大規模モデルのコンピュート爆発に伴うデータセンターの電力網危機に対し、MIT准教授のChristina Delimitrou氏のチームは、深層学習に基づくサーバーエネルギー管理アーキテクチャを開発しました。本システムはマイクロサービスやクラウドネイティブソフトウェアのリソース競合をリアルタイムで予測し、現在一般的に有効計算利用率がわずか15%にとどまるサーバークラスターに対して動的なスケジューリングとアーキテクチャの圧縮を実行します。電力インフラを追加増設することなく、高密度な計算ポテンシャルを大幅に引き出し、電力損失を削減します(出典: MIT News)

MITがデータセンターのエネルギー消費を削減するAIシステムを開発

コメントを残す

メールアドレスが公開されることはありません。 ※ が付いている欄は必須項目です