🔥 注目ニュース
謎のモデル Ox Alpha が OpenRouter と OpenCode に突如登場 : OpenRouter と OpenCode に「Ox Alpha」というコードネームの謎のステルスモデルが突如リリースされ、100 万 Token のコンテキストウィンドウを提供し、テキスト、画像、動画入力をネイティブでサポートしている。このモデルは長周期の Agent プログラミング、複雑な推論、および実際のプロダクション環境向けに構築されており、毎日 100 兆 Token の無料テスト枠が提供されている。多くの開発者による実測テストでは、そのプログラミングおよび推論能力が Fable 5 や GPT-5.6 Sol を凌駕していることが示された。ネット上ではその正体についての予想が加熱しており、現在コミュニティの推測は主に Zhipu GLM-5.4/5.5 または Xiaomi MiMo V3 を指している(出典:OpenRouter、36氪)
DeepSeek 公式がマルチモーダル視覚モデル V4-Flash-Vision-Exp を突如リリース : DeepSeek の公式 API プラットフォームにて、初のネイティブ視覚理解モデル DeepSeek-V4-Flash-Vision-Exp が突如リリースされた。本モデルは V4-Flash の強力なテキスト能力を維持しつつ、マルチモーダル Agent 性能が大幅に向上し Opus 4.8 に迫る勢いを見せている。画像はサイズに応じて Token に換算され(1枚あたり上限 384 tokens)、料金設定は V4-Flash と完全に同一(画像 1,000 枚あたりわずか約 1 元相当)であり、無料で利用可能な Files API および Harness 0.1.1 への適応も同時に公開され、視覚 Agent の開発および運用コストが大幅に削減された(出典:DeepSeek、机器之心)

Google が Gemini 3.7 Flash を発表、数々の Agent ベンチマークを更新 : Google が Gemini 3.7 Flash を正式に発表した。API 価格は 3.6 Flash より 50% 削減され、アルゴリズム面で大幅なインテリジェンスの飛躍を実現した。Artificial Analysis の AA-AnalystAgent 実データ分析ベンチマークにおいて、Gemini 3.7 Flash は首位を獲得し、競合他社より 60%〜90% 高速にタスクを完了した。また、ARC-AGI の検証評価においては極めて低いコストで ARC-AGI-2 84.6% という高スコアを記録し、高いコストパフォーマンスと視覚 Agent 実力を実証した(出典:demishassabis、Google Research Blog)

OpenAI が財団を設立し AI Futures プロジェクトを始動 : OpenAI は AGI の能力を広範な社会的公共利益へと転換することを目指し、OpenAI Foundation 財団を正式に設立し AI Futures プロジェクトを始動した。同財団はライフサイエンス(タンパク質設計や新薬開発など)および AI の社会的レジリエンス(バイオ/サイバー脅威からの防御)にフォーカスしており、最初の 5 か月間ですでに数億ドルを投入し、将来的には数百億ドル規模を投入する計画である。これには早期警戒システムの構築に向けた SecureBio への 1,720 万ドルの寄付が含まれる。この動きは、トップクラスの AI ラボが技術の誤用や社会的リスクを防ぐための公共インフラ構築を加速させていることを象徴している(出典:OpenAI News、woj_zaremba)

🎯 動向
NVIDIA が AVO エージェントを発表、ARC-AGI-3 で 100% の満点を記録 : NVIDIA の AI チームが汎用プログラミングおよび対話型推論エージェント AVO を発表した。明示的な指示、ルール、または事前設定された目標が一切ない状態で、Claude Opus 5 を駆動源とする AVO Harness は ARC-AGI-3 対話型推論ベンチマークの全 25 環境・183 ステージを完遂し、100% の満点スコアを獲得、アクション実行効率も同種システムより 12% 向上した(出典:ClementDelangue)
Alibaba が Qwen-UI-Agent エージェント基盤モデルをオープンソース化 : Alibaba がモバイル、デスクトップ、ウェブでの実行に向けた GUI エージェント基盤モデル Qwen-UI-Agent(27B / 35B-A3B / 4B バージョンを提供)を発表した。100 台以上の実機スマートフォン環境に基づいて学習されており、GUI のクリックと CLI コマンドラインのアクションスペースを統合し、5 つの中核的な GUI ベンチマークテストで GPT-5.6 Sol および Opus 4.8 を撃破した(出典:36氪)
Xiaohongshu が FireRedTTS3 統合音声生成・編集モデルをオープンソース化 : Xiaohongshu が新世代の音声モデル FireRedTTS3 を公開した。初創の RedAE 意味拡張連続表現に基づき、単一モデル内で 24 の言語および 21 の中国語方言のゼロショットクローン、自然言語によるサウンドデザイン、および精密な局所音声編集を統合し、Seed-TTS-Eval をはじめとする 4 大公開ベンチマークで全面首位を獲得した(出典:机器之心)

Replit が GPT-5.6 Luna 駆動の無料モード(Free Mode)を提供開始 : Replit が OpenAI と共同で GPT-5.6 Luna 駆動の Free Mode を発表した。全ユーザーが対話型 AI プログラミングや Agent アプリ開発を無料で体験できるようになり、ゼロからの完全なソフトウェア構築のハードルを大幅に下げた(出典:amasad)

Meta が Muse Spark 1.2 ネイティブフルモーダル大規模モデルを発表 : Meta が Muse Spark 1.2 を正式発表した。強力な視覚コード生成、ロボットプランニング、音響・動画理解能力を備える。Design Arena 評価において Video-to-Website で首位を獲得し、Image-to-HTML ランキングでも上位に入るなど、極めて高いフルモーダルの実用価値を示した(出典:alexandr_wang)

OpenAI が GPT-Image-2 の透明背景ネイティブ生成機能をプレビュー公開 : OpenAI が GPT-Image-2 API 内で background=transparent パラメータのプレビューを開始した。生成段階でアルファチャンネル付きの透明 PNG レイヤーを直接出力できるようになり、ガラスの透明感や縁の繊細な毛羽立ちなどの複雑なテクスチャにおいて、従来の切り抜き後処理を遥かに凌ぐ効果を発揮する(出典:THE DECODER)
Adobe Firefly が Google Gemini Omni Flash を統合し AI オーディオツールをリリース : Adobe は Firefly 制作プラットフォームに Google Gemini Omni Flash マルチモーダル動画モデルを統合したと発表した。同時に、商用利用可能な AI オーディオ生成ツール Generate Music、Generate Speech、Generate Sound Effects の 3 つを全面的にローンチした(出典:THE DECODER)
Google が TIPS 空間認識視覚言語モデルを発表 : Google が Hugging Face 上で空間認識視覚言語モデル TIPS(および TIPSv2)をオープンソース化した。画像セグメンテーションや深度推定などの高密度視覚理解タスク向けに設計されている(出典:gabriberton)

Runway が 16-bit HDR 動画エンハンスモデル Ruby を発表 : Runway が動画モデル Ruby をリリースした。SDR 動画を 16-bit HDR ProRes/EXR シーケンスに変換することをサポートし、生成動画やアップロード素材の色深度と画質表現を向上させる(出典:c_valenzuelab)
NetEase Bee(網易小蜜蜂)が AI インタラクティブコミュニティと次世代 UGC 供給を模索 : NetEase Bee は、オープンソースおよび自社開発モデルに基づく AI 能力を若者向け趣味コミュニティへ深く融合させ、「万脳龍蝦(WanNao LongXia)」パーソナルアシスタントや AI インタラクティブゲーム/インタラクティブ画像テキストコンテンツを導入。コミュニティのコンテンツ形態を、プレイ可能かつ二次創作可能な対話型 UGC へとシフトさせている(出典:36氪)

🧰 ツール
MiniMax が動画生成・制作プラットフォーム MiniMax Design を発表 : MiniMax は商用動画制作向けの MiniMax Design プラットフォームを立ち上げた。Agent を中核のエントリポイントとし、脚本、絵コンテ、生成、アフレコ、編集を同一キャンバスに統合。さらに再利用可能な Skill 機構を導入し、Adobe や Canva の商用動画制作パイプラインに直接対抗する(出典:36氪)

DP Technology(深勢科技)がデスクトップ向け AI 科研協働環境「Bohr Science Space(玻爾・科学空間)」を発表 : DP Technology がデスクトップアプリケーション「Bohr Science Space」をリリースした。SciMaster、BioMaster、PharmMaster などの学科別 AI エキスパートを内蔵し、文献調査、仮説推論、データ計算、論文執筆の全プロセスを連携させ、研究者の煩雑な研究「力仕事」の肩代わりを支援する(出典:量子位)

Lindy が Chrome 拡張機能を提供開始、受信トレイのスマート管理を実現 : AI Agent プラットフォーム Lindy が Gmail の受信トレイに直接組み込める Chrome 拡張機能を公開した。個人メモリーバンクを活用して、夜間のメール要約の自動生成、返信作成、自動タグ分類を完遂できる(出典:omarsar0)
ChatGPT / Codex が ExaAI 検索プラグインを統合 : OpenAI が ChatGPT Work と Codex に ExaAI プラグインを統合した。これにより AI Agent が全ウェブ上の 1,000 億を超えるウェブページ、学術論文、企業ドキュメントを直接検索できるようになった(出典:OpenAIDevs)
OpenHistory が Mac ネイティブのワークフロートラッキングアプリをオープンソース化 : 開発者が OpenHistory アプリをオープンソース化した。Mac のオンデバイスモデルを利用して作業軌跡を自動記録・要約し、セキュアな MCP プロトコルを介してローカル Agent との協働をサポートする(出典:zachtratar)
OpenBot が Grok Bot のクロス Harness 代替ソリューションをオープンソース化 : CopilotKit チームが OpenBot をオープンソース化した。任意の Agent Harness に適応可能な Grok Bot 代替製品を提供し、ジェネラティブ UI、コンピューター制御、Agent-Human 協働、およびデータのプライベート保持をサポートする(出典:hwchase17)
📚 研究・学習
Pleias の研究者が 0.63M パラメータの超小型検証器(Verifier)を提案 : 研究者が検証器モデルの規模の下限を調査し、単一の H100 上でわずか 2 分間の事前学習を行うだけで、63 万パラメータの超小型モデルが特定の検証タスクにおいて 7B の大規模モデルと同等のパフォーマンスを達成できることを示した(出典:Dorialexander)

Spark-to-Paper エンドツーエンドオープンソース論文生成システム : 研究チームがコーディングアシスタントに基づくオープンソース論文生成システム Spark-to-Paper を発表した。13 の組み合わせ可能なスキルを含み、研究アイデアから出発して自動的に実験を実行し、ベクター画像を直接描画し、データを検証してコンパイル可能な LaTeX 論文を直接出力する。誤った結論の検知率は 92% に達する(出典:机器之心)

浙江大学と百度が BEACON 長期 Agent 強化学習フレームワークを提案(ICML 2026) : 浙江大学と百度(Baidu)がマイルストーンガイド型方策学習フレームワーク BEACON を提案した。マイルストーン境界で軌跡を分割し、デュアルスケールアドバンテージ推定と組み合わせることで、長期 Agent タスクにおけるクレジットの誤割当問題を解決。ALFWorld 長期タスクにおける成功率を GRPO の 53.5% から 92.9% へ引き上げた(出典:机器之心)

AutoResearch 評価レポート:Agent の「メタ認知ループ」欠如が研究判断の破綻を招く : スタンフォード大学や Prentis AI などの機関が 800 件の Agent 研究軌跡を診断した結果、失敗の 92.1% はエンジニアリング以外の認知・論理的エラーに起因し、軌跡の 82.5% で「問題を認識しているにもかかわらず修正しない」メタ認知の断絶が発生していたことが発覚した。自動研究が単なるエンジニアリングの実行から高度な意思決定へ移行する際のボトルネックが浮き彫りとなった(出典:机器之心)

Patronus AI が FigmaTrace デザイン Computer-use データセットをオープンソース化 : Patronus AI が UI/UX デザイン領域向けとして初となる Computer-use データセット FigmaTrace を公開した。実際のデザイナーが Figma 内で行った 200 時間以上、3,400 件を超える長周期で複雑な操作軌跡が収録されている(出典:rebeccatqian)
LangChain 創設者が Managed Deep Agents シリーズチュートリアルを公開 : Harrison Chase が Managed Deep Agents シリーズ動画およびチュートリアルを公開した。本番環境において高度な Agent Harness や実行環境を構築、デプロイ、管理する方法を体系的に解説している(出典:hwchase17)

Google が Pandora’s Router インテリジェントモデルルーティング理論を提案 : Google DeepMind チームがマルチモデルルーティングを「パンドラの箱」探索問題として定式化した。計算評価コストとエキスパートからのリターンを総合的に評価することで、完全探索と同等のクオリティを維持しながら高コストなエスティメーターの呼び出し回数を大幅に削減した(出典:dair_ai)

💼 ビジネス
GPT-5.6 Sol が推進し OpenAI の第3四半期企業向け支出が前四半期比 82% 増 : Ramp の最新データと分析によると、GPT-5.6 Sol モデルの強力なパフォーマンスに支えられ、OpenAI の 2026 年第 3 四半期における企業向け API 支出の前四半期比増加率は 82% に達し、Anthropic の 76% を逆転。第 3 四半期の売上高を 35% 大幅増へと押し上げた(出典:THE DECODER、GavinSBaker)

River AI が Cisco Investments 出資の 1 億 1,000 万ドル/評価額 11 億ドルの資金調達を実施 : Cisco Investments は、分散型パーソナル AI スタートアップ River AI の 11 億ドル評価での 1 億 1,000 万ドル規模の資金調達ラウンドへの戦略的参加を発表した。ユーザーが自己所有・管理する AI インフラストラクチャを推進していく(出典:ibab)
Hark が AT&T と提携し AI ネイティブなコンシューマー向けハードウェア機器を発表 : AI ハードウェアスタートアップ Hark が、米通信大手 AT&T との戦略的提携を発表した。AT&T は出資を行うとともにネットワークおよび機器認定のサポートを提供し、両社は共同で次世代 AI ネイティブ・パーソナル・スマートデバイスを導入する(出典:adcock_brett)

🌟 コミュニティ
Pangram の分析:RLHF ポストトレーニングのガードレールが「Mode Collapse」を引き起こし、逆に AI テキストの検出を容易に : AI 検出機関 Pangram は、ファインチューニングされていない基盤大規模モデルは元々人間と同等の言語多様性を備えているものの、RLHF や安全ガードレールによって課された行動ルールがモード崩壊(Mode Collapse)を引き起こしていると指摘。これによりモデルが特定の定型表現を好むようになり、かえって AI 生成テキストが高精度で検出される主な特徴になっているとした(出典:THE DECODER)

💡 その他
JavaScript ランタイム Bun 1.4 安定版がリリース(Rust で完全再構築) : Anthropic に買収された後、Bun は Rust で完全に書き直された Bun 1.4 安定版を正式にリリースした。2,900 件以上の Issue を修正しメモリリークを解消。画像処理、ブラウザ自動化、HTTP/3 デプロイメントを内蔵し、月間ダウンロード数は 2,000 万回を突破した(出典:36氪)

RayNeo(雷鳥創新)が軽量級 AI グラス RayNeo iO を発表 : RayNeo が光学とフレーム形状を再構築した RayNeo iO AI グラスを発表した。重量は 34g に軽量化され、2 日間のバッテリー持続時間と度付きレンズ装着に対応。終日メモリーエンジンと DeepSeek V4 Pro / Qwen 3.7 Max などのマルチモデル基盤を背景に、能動的な知識、記憶、およびリアルタイム翻訳拡張を提供する(出典:量子位)

米中 AI 競争の激化と Pax Silica 同盟による陣営分け : 米国が下案を作成した文書において、同盟国に対し米中 AI 競争における明確な態度表明を求め、中国の AI 協力機構(WAICO)に参加する国は Pax Silica 同盟から除外される方針を示した。世界的な AI インフラとサプライチェーン分断に伴う政治的リスクが浮き彫りとなっている(出典:THE DECODER)