🔥 フォーカス
トランプ氏、国家情報長官のJay Clayton氏をホワイトハウスのAI皇帝に兼任任命 : トランプ氏は、アメリカ国家情報長官のJay Clayton氏をホワイトハウスのAI皇帝(AI Czar)に兼任させ、新設される「スーパーインテリジェンス部隊」(Super Intelligence Force, SIF)の指揮を執らせることを公式に発表しました。Clayton氏はこれまで米SEC委員長を務め、米国内18の情報機関を統括した経歴を持ち、AIは歴史的機会であると同時に国家安全保障上の脅威でもあると公に表明していました。SIFは連邦政府を統括し、一般消費者、公益団体、宗教団体、重要インフラ、および最先端のスーパーインテリジェンス研究開発機関との連携・対応を担います。この任命は、米国のフロンティアAIに対する規制と安全ガバナンスが、戦時即応レベルの省庁横断的な統括段階に突入したことを示しています。(出典:The Guardian)

欧州Aleph Alphaが78BバイリンガルMoEモデル「Kolibri」をオープンソース化 : ドイツのAIスタートアップAleph Alphaは、ソブリン基幹モデル「Kolibri-1」を正式にオープンソース化しました。本モデルは総パラメータ数78.1Bで、ハイブリッド・スライディングウィンドウとグローバル・アテンションのアーキテクチャを採用しており、Tokenあたりのアクティブパラメータはわずか3.46B(全体の4.4%)に抑えられつつ、100万Tokenのコンテキストをサポートします。Kolibriは完全に欧州現地のインフラ上でトレーニングされ、「EU AI法」およびGDPR基準に準拠しています。AIME 2025数学テストで96.9%、GPQA Diamondで84.3%の高スコアを記録し、そのFP8ウェイトはApache 2.0ライセンスのもとで公開され、単一のB200カードまたはデュアルH100カードでのデプロイに対応しています。(出典:MarkTechPost)
何愷明氏のチームによる視覚強化アーキテクチャ「VISTA」がARC-AGI-3ベンチマークを完全制覇 : 何愷明(Kaiming He)氏らの研究チームは新研究「VISTA」を発表しました。インタラクティブゲームを抽象的なデジタル記号に変換する従来のアプローチを覆し、純粋なネイティブ画像入力と外付けの「ロスレス視覚アルバム」メカニズム(明示的アテンション)を組み合わせた手法を採用しています。モデルは探索プロセス中に必要に応じて過去の画面を並べて閲覧・比較することができ、追加トレーニングを一切行っていないClaude Opus 5が全25のゲームで100点満点を獲得し、ステップ数は人間の初回クリア時のわずか0.43倍にとどまり、GPT-5.6 Solも99点に達しました。この成果は、抽象的推論には長い思考の連鎖やコードシミュレータが不可欠であるという固定観念を打ち破り、視覚的知覚と作業記憶がAGIの抽象的一般化を攻略するための重要な鍵であることを実証しました。(出典:36氪)

NASAとIBMがオープンソースの月科学基盤モデルを共同発表 : NASAとIBM Researchは、TerraMindマルチモーダルアーキテクチャに基づく月科学基盤モデルを共同発表しました。月周回軌道衛星(LRO)などが17年間にわたり蓄積した約200万個の高解像度・低解像度のリモートセンシングタイルデータが統合されています。本モデルは日照角と太陽空間幾何を明示的な事前入力として扱い、極域の永久影クレーターにおける氷堆積確率の予測誤差を最大22%削減し、クレーター検出においても卓越した性能を発揮しました。関連するモデルウェイト、コード、およびベンチマークデータセットは、Hugging FaceとGitHubで完全にオープンソースとして公開されています。(出典:The Decoder)

🎯 トレンド
GoogleがGemini個人サブスクリプション体系を改定:無料版はFlash-Liteに引き下げ、有料化の敷居を設定 : Googleは個人アカウントにおけるGeminiのアクセス権限を引き締めると発表しました。無料ユーザーは最小構成のFlash-Liteモデルのみ利用可能となり、FlashおよびProへのアクセス権を失います。また、月額5ドルのAI Plus加入者もPro権限から外され、Flash-LiteとFlashのみが維持されます。全モデルの完全なアクセス権を得るには、月額20ドルから100ドルのProプランまたはUltraプランの契約が必要となります。業界内では、この動きは大規模モデルの高頻度な推論赤字を圧縮する狙いがある一方、より高価な新フラッグシップモデル「Gemini 4 Argon」の正式商用化に向けた布石であるとみられています。(出典:The Decoder)
DeepSeek Harnessがv0.2.1をリリース、Claude Code Mods実験的互換レイヤーを導入 : DeepSeekは、オープンソースのAgentスキャフォールドのv0.2.1-alpha.1バージョンをアップデートしました。公式デスクトップアプリケーションのパッケージ化に加え、最も重要な拡張としてClaude Code Mods API向けの実験的互換レイヤーが追加され、ブリッジを介してToken WeatherやBlast RadiusなどのモジュールがDSHプラグインシステム内で実行可能になりました。チーム責任者の崔添翼氏は、DSHは「すべてはプラグインである」という哲学を貫いており、今回の対応は競合のModメカニズムがDSHプラグインアーキテクチャのサブセットとしてエコシステムを跨いで再利用可能であることを検証するものだと述べています。(出典:機器之心)

OpenAIがAstra 6.1でコード削減およびリファクタリング機能の強化を予告 : OpenAIのプロダクト責任者であるTibo Sottiaux氏とポストトレーニング研究員のRajan Agarwal氏は、次世代モデルにおいて「コードの削減と簡素化」機能に重点を置いて取り組んでいることを明かしました。これは、Agentが冗長なスパゲッティコードを生成してしまう技術的負債の問題を根本から解消するためのものです。研究開発チームは開発者のペインポイントに対処すべくポストトレーニング戦略を最適化し、モデルに洗練されたコードリファクタリングと自己スリム化の能力を持たせようとしており、安全性への懸念から延期されていたAstra 6.1が間もなく正式にユーザーへ展開されることを示唆しました。(出典:機器之心)

GoogleがTEEベースの検証可能な差分プライバシー連合学習を開発 : Google Researchは、トラステッド実行環境(TEE)に基づく次世代連合学習(FL)アーキテクチャを発表し、Gboardの英日バイリンガル予測モデルに導入しました。このアーキテクチャは、デバイス側の勾配計算をクラウド上のリモート構成証明済みハードウェアTEEに移行し、Sigstoreを介して改ざん不可能なコードアクセスポリシーログを公開することで、外部監査人がGoogleを信頼することなく中央差分プライバシーのノイズ付加プロセスを検証できるようにし、大規模な協調トレーニングにおけるプライバシー信頼のギャップを解消しました。(出典:MarkTechPost)
bilibiliが多言語翻訳モデルファミリー「Index-Translate」をオープンソース化 : bilibiliは、Qwen3.5をファインチューニングしたIndex-Translateシリーズモデルをオープンソース化しました。150言語の高精度な相互翻訳に対応し、専門用語の制約やフォーマット・レイアウトの保持能力を重点的に強化しています。本シリーズはさらに、Index-Echo(音声クローン同時通訳)、Index-Homura(目標音節数アラインメント翻訳)、Index-NativeLong(段落を跨ぐコンテキスト整合性を備えた長文文書翻訳)へと拡張されており、コミュニティの実測において中日英の相互翻訳性能で複数の商用ベースラインを上回りました。(出典:Reddit r/LocalLLaMA)
🧰 ツール
pstack-claude:複数Harness間で移植可能な厳格なAgentエンジニアリングスキルライブラリ : コミュニティ開発者がCursorチームのプラクティスに基づき、Claude Code、Codex、Piなどのプラットフォーム向けにpstackのマルチ環境移植版を開発しました。このプラグインはpoteto-mode自動実行フローを統合しており、コードのバグに対処する際に「再現・双方向確認・ピンポイント修正・再テスト」の検証プロセスを厳格に実行し、関数境界を跨ぐ際にはアーキテクチャレビューを強制的にトリガーすることで、開発者が高品質な自動コミットパイプラインを構築できるよう支援します。(出典:GitHub Trending)

e2e:自然言語駆動のアプリケーション向けエンドツーエンドAIテストフレームワーク : オープンソースのテストフレームワーク「e2e」は、自然言語の記述を用いてWebおよびモバイル向けテストを直接駆動することをサポートします。そのコアメカニズムは、初回にAgentがPromptに従って探索しテスト目標を達成した後、UI操作シーケンスをモデル不要の実行スクリプトとして自動的に固着化させ、以後の回帰テストではTokenコストを発生させることなく直接正確にリプレイするというもので、アジャイルなアサーションを担保しながら、長期テストにおけるTokenの浪費を完全に防ぎます。(出典:GitHub Trending)

local-codex-proxy:オープンソースのローカル大規模モデルをCodexおよびChatGPTインターフェースへシークレットレス接続 : 開発者が軽量なCodexプロキシミドルウェアをオープンソース化し、ユーザーがvLLMやOllamaを通じてローカルにデプロイしたオープンソースモデル(Gemma、Qwenなど)をChatGPTデスクトップアプリやCodex実行環境に直接ブリッジできるようにしました。OpenAIのエンドポイントと状態同期をローカルでエミュレートすることにより、開発者は社内コードをクラウドに公開することなく、洗練されたデスクトップGUIの対話体験を享受できます。(出典:TheZachMueller)

Texting Bubbles:Open WebUI向け人間らしい分割メッセージバブルプラグイン : コミュニティにより、Open WebUI向けの「Texting Bubbles」機能スイートがリリースされました。従来の単一かつ長大なストリーミングMarkdownの回答を、人間同士のチャットのような連続したメッセージバブルへと再構築します。付属のフィルターはプロンプトを通じてモデルに簡潔な短い文を出力させ、動的な入力休止エフェクトを伴うディレイスケジューリングと組み合わせることで、対話やロールプレイにより自然な没入感をもたらします。(出典:Reddit r/OpenWebUI)
NInfer-4080:16GB GPU専用の極限スループット推論エンジン : 開発者がRTX 4080(VRAM 16GB)に特化して高度にカスタマイズされた推論エンジン「NInfer-4080」をリリースしました。ISTA-DASLabのGSQ高圧縮量子化とDFlash2投機的デコーディングを組み合わせることで、100Kのロングコンテキストにおいて最大2720 tok/sのプリフィルと262 tok/sの生成速度を達成し、特定のハードウェアアーキテクチャに対して極限まで最適化されたバーティカル推論エンジンが汎用フレームワークを圧倒する優位性を示しました。(出典:Reddit r/LocalLLaMA)
📚 学習
南洋理工大学の安波氏のチームがモデルとHarnessの相互作用メカニズムを解明 : NTUのチームがAgentエコシステムに関する評価レポートを発表し、OpenHands、DSH、PI、openJiuwen、および公式ネイティブHarnessの66通りの組み合わせにおけるパフォーマンスを比較しました。実験により「ネイティブな組み合わせが常に最適である」というわけではないことが実証されました。例えば、GPT-6 AstraはPI上でのパフォーマンスがCodexを全面的に上回っており、さらにHarnessの詳細なメカニズム(タイムアウト信号フィードバック、ファイル書き込みと編集の分離、コンテキストKVキャッシュヒット率など)がモデルの自己修復と最終的なタスクコストに対して決定的な役割を果たしていることが判明しました。(出典:機器之心)

AlphaGoのコア開発者がLLMにおける真のシステム2推論欠如の根本原因を寄稿 : 元DeepMindシニアリサーチフェローのThore Graepel氏が『MITテクノロジーレビュー』に寄稿し、現在のLLMにおける思考の連鎖は単に延長されたシステム1の連想生成に過ぎず、AlphaGoのような監査可能な探索メカニズムや明示的な可変認知的状態木が欠落していると指摘しました。真のマシン推論を実現するには、「知識の表現」と「適用の推論」を完全に切り離し、パラメータ規模の拡大に偏重するのではなく、証拠評価と仮説検証の能力を備えた独立した調停アーキテクチャに依存しなければならないと述べています。(出典:機器之心)

Meta超知性ラボが強化学習ポストトレーニングにおける「先鋭化税」現象を解明 : Metaの研究チームは、42組のベースモデルとRLポストトレーニングモデルを分析した結果、RLはpass@1の成功率を大幅に引き上げるものの、出力空間の多様性を犠牲にし、タスクが極端な一貫性(常に正解するか、常に不正解となるか)に陥ることを発見しました。十分なサンプリングテストバジェット(Large K)が与えられた場合、過度なポストトレーニングを受けていないベースモデルと軽量なHarnessの組み合わせの方が、RLモデルがまったく解決できないロングテールの複雑な難問を攻略できることが示されました。(出典:dair_ai)

スタンフォード大学がシステムレベルの大規模モデルトレーニング公開講座「CS336」を開設 : スタンフォード大学NLPラボは、言語モデルシステム工学実践講座「CS336」の教材を公開しました。本講座は大規模モデルをゼロから構築するための実践的なハードコアエンジニアリングに焦点を当てており、トークナイザーの実装、分散Transformerトレーニングの最適化、GPUメモリウォールの克服、Scaling Lawsの検証、データクリーニングパイプライン、推論強化学習などの内容を網羅し、理論の厳密性と本番環境レベルのエンジニアリング要件を兼ね備えた課題設計となっています。(出典:stanfordnlp)
Metaがマルチエージェント型科学研究エラー修正パイプライン「RankEvolve」を提案 : Metaチームは、AIが自律的に機械学習の実験を進める際に生じやすいデータリークや勾配のサイレント切断といった潜在的欠陥に対処するため、マルチエージェント型科学研究Harness「RankEvolve」を提案しました。このシステムはClaude CodeとCodexを相互に冗長なレビューノードとして構成し、コンパイルプロトコルを通じて互いにコードの変更を監査・修正することで、完全自律的な科学研究実験の精度を45.8%から62.5%へと大幅に向上させました。(出典:dair_ai)
💼 ビジネス
3D生成ユニコーン企業のMeshy、ARRが1億ドルを突破し専門モダリティの参入障壁を実証 : ビジネス分析によると、3D生成スタートアップのMeshyは2年足らずで年間経常収益(ARR)を100万ドルから1億ドルへと急成長させました。汎用大規模モデルも初歩的な幾何スクリプトの作成能力を備えつつあるものの、高詳細なトポロジー構造、テクスチャアラインメント、および産業用パイプラインへの適応において、特化型3D生成は大手ゲーム会社のAPI利用や3Dプリンティングのハードウェアエコシステムを背景に、強固な収益化ループを確立しています。(出典:量子位)

マスク氏、Terafabチップのファウンドリ協業についてTSMCと交渉中であることを認める : イーロン・マスク氏は、超大規模垂直統合型チップ製造プロジェクト「Terafab」についてTSMCと詳細な協議を行っていることを公に認めました。Terafabは、Tesla、SpaceX、およびxAIの需要を満たすために年間1TWのコンピュート生産を計画しています。Intelの14Aプロセスの量産スケジュールに対するプレッシャーに直面する中、マスク氏はTSMCの工場運用力と確立された歩留まり実績を取り込むことでサプライチェーンのリスクをヘッジし、カスタムチップのサプライチェーンにおいて絶対的な主導権を確保することを目指しています。(出典:量子位)

豪クイーンズランド州、310億豪ドル規模のAnthropicコンピュートセンターに対し地元住民が反発 : Anthropicのモデルへ計算能力を提供するために計画された総工費310億豪ドルのウェスタン・ダウンズ・データセンタープロジェクトが、地元住民の強い反対に直面しています。同施設のピーク消費電力は2.16GW(クイーンズランド州全体の消費電力の4分の1に相当)に達すると予想されており、すでに2万人以上が反対の署名活動に賛同しています。エネルギー転換と経済的メリットを確保するため、クイーンズランド州政府は承認権限を地方自治体から回収して一括管理すると発表し、コンピュートインフラの拡大と地域住民の民意との間の深刻な対立が浮き彫りになっています。(出典:The Guardian)

🌟 コミュニティ
アルトマン氏、AIの神格化に反対する強硬な姿勢を示しシリコンバレーのイデオロギー的分裂が激化 : Anthropicの幹部陣がAIの意識や機械の道徳的地位を巡って宗教指導者らと頻繁に接触しているとの報道に対し、OpenAIのCEOであるSam Altman氏は「AIモデルに宗教的権威を与えたり、人間に自らの判断を放棄させたりすることは重大な安全上のリスクである」と公に投稿しました。チューリング賞受賞者のYann LeCun氏をはじめとする複数の研究者もこれを支持し、大規模モデルを知覚能力を備えた意識体として描写することは哲学的に疑似科学であるだけでなく、モデルの権利侵害や違法行為に対する厳格な製造物責任を回避するための法的抗弁としてテック大手に利用されかねないと指摘しています。(出典:sama)
最前線デプロイエンジニア(FDE)急増の背景にある業界変革への考察 : 最前線デプロイエンジニア(FDE)という職種が急速に認知されるにつれ、同職種の役割が従来の「コードを書いて納品する」ことから、「ビジネスオントロジー(Ontology)の整理と組織関係の再構築」へと完全にシフトしていることが業界関係者から指摘されています。AIによってソフトウェア開発の限界費用が劇的に低下する中、部門間のデータサイロ、権限の壁、従業員の抵抗感こそがAI導入における最大のボトルネックとなっており、FDEの本質は技術を理解したディープなビジネスコンサルティングへと進化しています。(出典:量子位)
アリババのAI権限が90年代生まれへ移行、現場導入がYunqi大会の焦点に : 2026年のYunqi大会(Apsara Conference)では、明確な世代交代と戦略的シグナルが示されました。通義千問(Tongyi Qianwen)モデルは、事前学習を主導した劉大一恒氏と千問オフィスの商業化導入を担当した陳宇森氏という2人の90年代生まれ(1990年代生まれの世代)が全面的に引き継ぎ、モデル開発から製品の商業化までのエコシステムを完結させました。会場には工場のAI導入に向けた選定を急ぐ製造業の後継者たちが大挙して訪れ、関心は「何時間でプロセスを完了できるか、どれだけの期間でコストを回収できるか」という具体的な財務リターンに完全にシフトしていました。(出典:36氪)
ターミナルCLIとデスクトップGUIの論争:開発者が熱弁するAgentの新たなインタラクションUI : AIコーディングツールの形態をめぐる議論がコミュニティで活発化しています。複数の開発者は、マルチタブのターミナルCLIは廃れつつあり、高すぎるコンテキストの認知的負荷により、ツールはCodexデスクトップ版や独立したキャンバスに代表されるAgent専用UIへと向かっていると指摘しています。ユーザーはもはやファイルを直接細かく操作するのではなく、永続化されたワークスペースを通じて複数のAgentに対してマクロな指示や非同期レビューを行うようになっています。(出典:Yuchenj_UW)
開発者らがクラウドプロバイダーやモデルゲートウェイに対しデフォルトのハードリミット予算設定の義務化を要求 : 複数のAgentが自律ループを実行したことによる想定外の高額請求事故を受け、Simon Willison氏やコミュニティのエンジニアらは、各種APIゲートウェイやクラウドプラットフォームに対し「設定金額を超過した場合は即座にハードリミットとしてエラー停止する」設定をデフォルトにすることを強く求めました。自律型Agentが深夜に暴走した際、緩やかなメールアラートは全く機能せず、きめ細かなコスト管理と厳格なブレーカー機能がAgent運用の前提条件となりつつあります。(出典:Simon Willison)
💡 その他
NVIDIA Shield TV、AIによるメモリコスト上昇で100ドルの異例の値上げ : 発売から7年が経過したNVIDIAのセットトップボックス「Shield TV Pro」の価格が、突如100ドル引き上げられ299.99ドルとなりました。NVIDIA公式は、業界全体でのAIコンピュートインフラの拡大に伴いメモリや電子部品の調達コストが急激に上昇したため、成熟したアーキテクチャを採用した旧型コンシューマー向けハードウェアであっても生産ラインを維持するために値上げを余儀なくされたと認めました。(出典:WIRED)

AIブームの影で女性就業者比率とリーダーシップ層への参加が逆行して後退していることが調査で判明 : 調査機関の最新データによると、世界的なAI関連雇用の採用規模と給与プレミアムが過去最高を記録しているにもかかわらず、新たに創出されたAI雇用のうち女性の割合はわずか4分の1、経営幹部層ではわずか13%にとどまり、その大半が低賃金のデータアノテーション職に追いやられていることが明らかになりました。過度な残業競争や既存の人脈を重視する採用慣行が、女性をAIに代替されるリスクが高い周辺領域へと追いやりつつあります。(出典:The Guardian)

米地方部データセンター向け税額控除に対しテック大手が距離を置き市民から疑問の声 : 地方の「機会区域(Opportunity Zones)」におけるデータセンターを対象とした数十億ドル規模の米連邦税額控除政策が来年施行されます。しかし、Microsoft、Meta、Amazonなどの大手テック企業はこの政策と距離を置く姿勢を相次いで表明しています。批評家らは、こうした減税措置は投下資本の規模のみを基準としており、地方に長期的な実質的雇用をもたらさないばかりか、水資源や電力の奪い合いと住民との対立を悪化させていると指摘しています。(出典:WIRED)
