🔥 フォーカス
セキュリティ研究チームが Claude を利用して OpenAI 内部コードベースを侵害 : セキュリティ研究チーム Hacktron AI が開示したところによると、研究者はバグバウンティの枠組みのもと、Claude Opus 5 の支援を受けて72時間以内に OpenAI 従業員アカウントを侵害し、アルゴリズムの機密が保管されているコアプライベートモノレポ(openai/openai)に対して検証用 PR を送信した。攻撃チェーンは Discourse フォーラムの画像アップロードコンポーネントにおける libheif ヒープバッファオーバーフロー脆弱性に始まり、OpenAI SSO のアイデンティティ設定の不備と組み合わせて GitHub に紐づく従業員の Codex アカウントを乗っ取った。大規模言語モデルの Token コストは3000米ドル未満であった。本インシデントは、「フロンティア AI が高リスクなサイバー攻撃能力を急速に大衆化させている」現状と、トップクラスの研究機関自体の防御の脆弱性について、業界に大きな衝撃と警戒感をもたらしている(出典: The Wall Street Journal, 36氪)

アリババ達摩院の汎用医療画像基盤モデル RADAR が『Science』に掲載、全量オープンソース化 : アリババ達摩院が浙江大学医学院付属第一医院など数十の医療機関と共同開発した世界初の専門家レベル汎用腹部画像基盤モデル DAMO RADAR が『Science』本誌に掲載された。同モデルは従来の医療 AI が単一疾患に限定されていたボトルネックを打破し、臓器レベルのきめ細かな画像・テキストアライメントと適応型対照モデリングにより、単一モデルで腹部18種類の解剖学的構造における146種類の疾患をカバー。多施設検証での平均 AUC は0.913に達し、診断精度は熟練した放射線科医に匹敵、人間と機械の協調により読影時間を30.7%削減できる。達摩院はすでにモデルの重み、トレーニングフレームワーク、評価コードを全量オープンソース公開している(出典: Science, 36氪)

Anthropic が研究開発の26%を AI が自律的に主導していると開示、生命科学検証プログラム LSVP を開始 : Anthropic が社内の研究開発測定データを初公開した。人間の監視のもと、Claude が同社のフロンティアモデル開発業務の26%を「主導」(AL4 レベル)しており(半年未満前は1%未満)、社内で常時3万以上のエージェントが並行稼働し、月間10億回以上の意思決定を実行している。同時に、Anthropic は生命科学検証プログラム(LSVP)を正式に立ち上げ、審査・認証された製薬企業や研究機関に対してフロンティアモデルを一部解禁し、意図の申告、30日間のオフライン監査、共同責任に基づく安全ガバナンスの新たなパラダイムを確立。従来の画一的なリアルタイム遮断メカニズムを置き換えた(出典: Anthropic News, AnthropicAI)

ニューヨーク・タイムズによるマイクロソフトおよび OpenAI 訴訟の重要内部文書が開示:マイクロソフト幹部が AI クローリングを「最大規模の労働力窃盗」と言及 : 新たに開示された裁判所文書によると、Microsoft の応用科学ディレクターである Brent Hecht 氏が社内において、LLM による無許諾のニューススクレイピングを「人類史上最大規模の労働力窃盗」および「フェアユース原則への完全な冒涜」と位置付けていたことが判明した。OpenAI の幹部も自社製品が出版社にとって「実質的な代替の脅威」になっていると認めていた。関連文書は双方がペイウォールを回避してデータをスクレイピングしていた詳細を暴露しており、AI 業界が長年依存してきた「フェアユース(Fair Use)」抗弁は前例のない法的課題に直面している(出典: TechCrunch)

🎯 動向
アリババ通義が 1M コンテキストのフルモーダルモデル Qwen3.8-Omni-Flash および関連エコシステムを発表 : アリババ通義チームは、エージェントワークフローをコアとする初のフルモーダルモデル Qwen3.8-Omni-Flash を正式に発表した。テキスト、画像、音声、および1時間の連続ビデオストリーム入力をネイティブサポートする。モデルは粗から密への能動的知覚メカニズムを導入し、超長尺動画理解ベンチマーク OmniVideoBench において精度を67.8に引き上げ、Token 消費を45.7%削減、動画 API コストは前世代比で約89%低下させた。チームはマルチエンドの Harness 接続をサポートする Qwen-MM-Plugins および omni-skill-creator ツールも同時にオープンソース化した(出典: Qwen, Alibaba_Qwen)

DeepSeek が超長コンテキスト KV キャッシュのボトルネックを克服する DeepSeek-V4.1-Flash をリリース : DeepSeek は100万 Token のコンテキストをサポートする 552B マルチモーダル MoE モデル DeepSeek-V4.1-Flash をリリースした。本モデルは因果エンコード・デコード(CED)アーキテクチャを採用し、Prefill フェーズでわずか 8B のパラメータのみをアクティブ化。さらに CSA2 クロスレイヤー再利用と FP4 圧縮技術を組み合わせることで、HBM 内のグローバル KV Cache メモリフットプリントを 890 バイト/Token(前世代のわずか1/4)に急減させ、エージェントの長期タスク負荷におけるデプロイコストを大幅に削減した(出典: HuggingFace Daily Papers)
Figure が身体性基盤モデル Helix 2.5 を発表、実家庭におけるゼロショット汎化を実証 : ヒューマノイドロボットスタートアップの Figure は、新世代のエンドツーエンドニューラルネットワーク Helix 2.5 を発表し、サンフランシスコ・ベイエリアのサンプリングされていない30軒の見知らぬ家庭で片付け、ベッドメイキング、タオル畳みテストを実施した。実験の結果、大規模な人間の一人称視点行動データ Index による事前学習後、ロボットの未知環境におけるゼロショット全身タスク成功率は9%から56%へと向上し、膨大な人間の経験から物理ロボットのアクション予測への転移スケーリング則(Scaling Law)が初期検証された(出典: 36氪)

SenseTime が SenseNova-U1.5 の技術レポートを公開:フローマッチングとマルチエキスパート蒸留によりネイティブ統一マルチモーダルを実現 : 商湯科技(SenseTime)は 8B パラメータのネイティブ統一マルチモーダルモデル SenseNova-U1.5 の完全な技術レポートを公開した。モデルは NEO-unify アーキテクチャと 32×32 コンパクトビジュアル Token を採用し、3×3 畳み込み2次元特徴場再構成を通じてネイティブ 4K 画像生成をサポートする。ポストトレーニング段階では革新的な「専門化後に統一」するオンラインポリシー蒸留(OPD)パラダイムを採用し、美学、OCR、インフォグラフィック、高精度編集の4大エキスパート能力を単一の基底モデルに再収束させ、高度な推論とピクセルレベルの生成を両立させた(出典: WeChat)

ファーウェイが Ascend 960DT AI チップの量産時期を2027年第1四半期に前倒し : ファーウェイは全聯接大会(HUAWEI CONNECT)において、次世代 Ascend 960DT チップのリリース時期を当初予定の2027年第3四半期から第1四半期へと大幅に前倒しすると発表した。ファーウェイは Peerium 計算アーキテクチャと UnifiedBus 高速相互接続技術を基盤に Atlas 950 スーパーコンピュータクラスタを構築しており、単一クラスタで最大25.6万枚のアクセラレータカードの接続をサポート。システムレベルのエンジニアリング革新を通じて計算資源の封じ込めに対処し、NVIDIA への追従を加速させることを目指している(出典: TechCrunch)
PrismML が3値化オンデバイスモデル Bonsai 2 27B をリリース、コミュニティの実測で物議 : PrismML は Qwen3.8-27B をベースにした3値量子化モデル Bonsai 2 27B をリリースし、モデルサイズを9.3分の1(5.9GB)に圧縮しつつ98.2%の総合性能を維持し、WebGPU を介してコンシューマー向けエッジデバイス上で直接スムーズに動作すると主張した。しかし、コミュニティによるホワイトペーパーの精査と実測検証により、Terminal-Bench や SWE-bench Verified などの長大なエージェントベンチマークにおいて性能が実際には約25%低下していることが指摘され、極限の低ビット量子化ベンチマークにおける「チェリーピッキング」をめぐる広範な議論を巻き起こした(出典: TechCrunch, Reddit r/LocalLLaMA)

Cactus がオンデバイス自動化モデル Needle 3 とラダー型アーキテクチャを発表 : Cactus Compute は 121M パラメータの Needle 3 自動化基盤モデルをオープンソース化した。Simple Attention と Hadamard MLP、Engram ハッシュテーブルを組み合わせ、計算コストはわずか 50M モデル相当に抑えられている。独自の「スマートラダー」アーキテクチャにより、2〜20層の動的スライシングデプロイ(サイズ 8〜29MB)をサポートし、純粋な CPU でのデコード速度は 4000 tok/s に達する。エッジデバイスやウェアラブル機器におけるネットワーク非依存のファンクションコールおよび確定的制御に特化している(出典: Reddit r/LocalLLaMA)

WenZhun AI が清華大学と共同で構造化データ基盤モデル LimiX-2 を発表 : 穏準知能(WenZhun AI)は 400M パラメータの構造化データ汎用モデル LimiX-2 を発表した。従来の単一目標予測パラダイムを改め、コンテキストメカニズムネットワーク(CMNs)と条件付きマスクモデリング(CCMM)を提案。モデリングを Cell レベルの細粒度まで落とし込むことで、変数間の結合因果依存関係を学習する。本モデルは TabArena や TALENT などの国際ベンチマークの分類および回帰タスクにおいて全面首位を獲得し、Google TabFM や SAP TabPFN を上回った(出典: 量子位)

Apple がエネルギー誘導型離散フローマッチングアルゴリズム TS-DFM と拡散強化学習 DACA-GRPO を提案 : Apple の機械学習チームは2つの先端的な生成成果を発表した。TS-DFM はエネルギー誘導蒸留を提案し、軽量なエネルギーコンパスを用いて離散フローマッチングの初期軌道の急変を修正することで、わずか8ステップで1024ステップの教師モデルを上回り、128倍の高速化を達成した。DACA-GRPO は拡散言語モデルの強化学習における時間的信用割り当ての課題を解決し、コード生成と制約追従においてそれぞれ 7.4 ポイントおよび 36.3 ポイント向上させた(出典: Apple Machine Learning Research)

国連が Google と連携して UN System Data Commons を発表、MCP 標準に対応 : 国際連合(UN)と Google.org は、国連26機関の公式かつ権威あるデータセットを統合した構造化公開データプラットフォームを共同で立ち上げた。これまで LLM が世界の統計指標に回答する際の正解率がわずか21.2%であった課題に対し、同プラットフォームは Google Knowledge Graph に基づいて自然言語クエリをサポートし、MCP プロトコルにネイティブ対応。各種 AI Agent が直接権威ある情報源を呼び出してクロスドメインの相関分析やグラフ生成を行うことを可能にした(出典: Google AI Blog, 36氪)

🧰 ツール
Anthropic が Claude Code Projects を再構築:マルチスレッド協調と永続的なプロジェクトメモリを導入 : Anthropic は Claude Code のデスクトップ版および Web 版において Projects アーキテクチャをリリースした。ユーザーは単一のセッションで高レベルの目標を伝えるだけで、主制御役の Coordinator エージェントがそれを複数の並列クラウドアブタスクブランチに自動分割して独立実行、バグ調査、PR 送信を行う。すべてのサブタスクは持続的に進化するプロジェクトメモリとコンテキストを共有し、オフラインの非同期ホスティングと継続的コラボレーションをサポートする(出典: dotey, Anthropic News)

Meta のデスクトップ向けパーソナルエージェント Muse が macOS プラットフォームで正式リリース : Meta 傘下のパーソナルエージェント Muse が、モバイル版のリリースに続いて Mac ネイティブクライアントを投入した。同アプリはデスクトップワークフローに深く統合されており、明示的な認可メカニズムのもとでローカルファイル、カレンダー、メモ、連絡先をアプリ横断で読み込み、ローカルの安全なサンドボックス内でアプリをまたいだファイル整理、フォームの自動入力、情報の集約・スケジューリングを自律的に完了できる(出典: The Verge, AIatMeta)
OpenAI が法律分野特化のフラッグシップ製品 Astra for Law を正式発表 : GPT-6 Astra をベースとする OpenAI は、2.3億件の URL を含む米国の判例および法規制インデックスを統合した Astra for Law を発表した。Legal Research Bench の評価において正解率54%を達成し(汎用版はわずか38.7%)、Harvey や Legora など26種類の公式プラグインと47種類のコミュニティプラグインを統合。データ保持を行わない Trusted Access プライバシー分離アーキテクチャを提供し、契約レビュー、取引デューデリジェンス、申請書類のドラフト作成などをサポートする(出典: OpenAI News, gdb)

Salesforce が Agentforce をアップグレード:エンタープライズ級オーケストレーションと確定的インターセプト基盤を強化 : Salesforce は Data Cloud と MCP プロトコルを融合した本番環境向け Agentforce スイートを発表した。プラットフォームには自動合成ストレステストを実現する Agent Testing Center が組み込まれており、確定的ゲーティング(Deterministic Gating)メカニズムを導入。取引やコアデータ操作は事前設定されたルールを満たした後にのみ実行される。サウスウエスト航空での実測では、カスタマーサービス業務の完全自動解決率45%を達成したことが示されている(出典: MarkTechPost)

LangChain がライフサイエンス向けエージェントワークベンチ Deep Life Sci をオープンソース公開 : LangChain は Deep Agents アーキテクチャをベースに、臨床およびラボ研究者向けのオープンソースエージェント Deep Life Sci を発表した。システムは PubMed、PubMed Central、ClinicalTrials.gov の数千万件の文献および試験データと高度に統合されており、専用のコードサンドボックス環境を備え、複数のサブエージェントを介して数百件の複雑な科学文献の抽出およびクロス検証を並行処理することをサポートする(出典: LangChain)

Google Labs が家族向けスマート協調エージェント CC を発表 : Google Labs は家庭内タスク管理向けの AI Agent 製品「CC」を正式にリリースした。同システムは最大6人の家族メンバーの同時接続と権限分離アカウントをサポートし、学校の通知書の自動解析、メンバー間でのカレンダースケジュールの同期、イベントリマインダーの要約を行い、「家族共有情報」と「個人専用の好み」を区別する階層型メモリ管理機能を備えている(出典: Ars Technica, Google)

Wood Mackenzie が Bedrock AgentCore を基盤に APEX エネルギー分析プラットフォームを構築 : エネルギーコンサルティング大手の Wood Mackenzie は、APEX 共有エージェントプラットフォームを発表した。AgentCore と MCP 統一ゲートウェイを基盤に、社内研究エージェント「Woody」と顧客向け「Lens AI」を統合。自然言語によるマルチツール呼び出しの計画、リアルタイムでのジェネレーティブ UI グラフ描画およびプレゼン資料(PPT)の自動作成をサポートし、エネルギー横断ビジネスにおけるエージェント開発期間を数か月から数時間に短縮した(出典: AWS Machine Learning Blog)

AWS がスマート採用面接スイート Amazon Connect Talent をリリース : AWS は大規模採用シナリオ向けに設計された Amazon Connect Talent を正式に開始した。本システムは AI Agent が24時間体制で構造化コンピテンシー面接と論理評価を実施し、事実に基づく証拠チェーンと採点根拠を付加した評価レポートを自動生成して採用担当者のレビューに供する。主観的なバイアスを排除しながら、大規模な人材と職務のマッチング効率を大幅に向上させる(出典: AWS Machine Learning Blog)

📚 リサーチ・学習
スタンフォード大学のマルチエージェント仮想バイオ企業システムが『Science』に掲載:3.7万インスタンスが6時間で膨大な臨床試験を処理 : スタンフォード大学は『Science』に「Virtual Biotech」システムを発表した。実際の製薬会社の研究開発体制を模倣して4つの部門と11種類のエージェントを設置。データ抽出タスクにおいて、システムは37,075個のエージェントインスタンスを並行起動し、わずか6時間で5万5000件以上の臨床試験のクロスモーダルな詳細統合を完了(単一エージェントでは76日を要する)。肺がん ADC の候補ターゲットとして B7-H3 を特定することに成功した(出典: Science)

清華大学や復旦大学らによるLLMを用いた多国間価値観シミュレーション研究が『Computational Linguistics』に掲載 : 清華大学、復旦大学、上海交通大学などは世界価値観調査(WVS)の59か国のデータに基づき9つのオープンソース LLM を評価した。その結果、モデルは先進経済国やガバナンスの質が高い国に対するシミュレーション精度が著しく高く、代表性の低いグループが支配的な文化へと非対称に同調するバイアスが存在することが判明した。研究では「表現の公平性」評価指標を提案し、特定のグループの背景情報を補足することが、単なる母国語プロンプトや選好アライメントの採用よりも異文化間の表現公平性を改善する上でより効果的であることを証明した(出典: WeChat)

北京航空航天大や香港中文大などが視覚エージェント自己進化フレームワーク OmniHarness を提案 : 共同研究チームは、複雑な視覚創作に向けた自律探索フレームワーク OmniHarness を提案した。同システムは新規性と能力境界のヒューリスティックな課題選択を通じて自己練習を行い、生成に成功した ComfyUI ワークフローを記号化ポリシーライブラリとして抽象化。ComfyBench 創作タスクで95%の解決率を達成し、蓄積された経験ポリシーライブラリは他のエージェントフレームワークや動画ワークフローにゼロショットで転移可能である(出典: 36氪)

NVIDIA チームがマルチエージェント科学研究向け共有メモリ構造 Agora を提案 : NVIDIA の研究チームは、Git のイミュータブルなコミットに基づく有向非巡回グラフ(DAG)共有メモリアーキテクチャ「Agora」に関する論文を発表した。中央プランナーを持たない13基の LLM Worker が12日間協調して混合モデルの初期化タスクを完遂。仮説、コード、検証ログを Git ツリー内に構造化して保存することで、マルチエージェント間の試行錯誤の重複や状態の競合を完全に回避し、165回の独立した再現実験すべてに成功した(出典: omarsar0)

実エッジエージェントベンチマーク AndroidLife が長期的制御の弱点と高発熱の課題を浮き彫りに : コミュニティは実機スマートフォンと実際のネットワーク環境に基づく評価ベンチマーク AndroidLife を発表し、日常的なアプリ横断タスクにおける AI Agent のオンデバイスパフォーマンスを検証した。実測において、Qwen3.8-27B は60件の実タスクで成功率がわずか56.7%、1タスクあたりの所要時間は約6分、チップのピーク温度は98.2°Cに達した。テストにより、モデルが複数アプリにまたがる連続操作を行う際に無限ループに陥りやすく、能動的な問い合わせシーンでの汎化能力が脆弱であることが明らかになった(出典: Reddit r/artificial)

Apple がリセットなし強化学習の崖を測定するベンチマーク REVERSAL-BENCH を提案 : 現実の物理世界における物体の落下など不可逆的なアクションに対応するため、Apple チームは REVERSAL-BENCH を提案した。連続可逆性パラメータとリセットオラクルを導入することで、リセットなしの自律エージェントが物理的な不可逆状態に直面した際の「吸収崖(Absorption Cliff)」効果を解明し、安全シールド(Safety Shield)がトラップを能動的に回避する有効境界を評価した(出典: Apple Machine Learning Research)
LLM のテキスト電子透かし(SynthID)がエージェントの敵対的防御能力を著しく低下させるとの研究結果 : Lasso Security の最新研究によると、コンプライアンス要件を満たすためにモデルのデコード段階で導入される SynthID-Text などのテキスト電子透かしメカニズムが、モデル本来の確率分布を乱すことが指摘された。敵対的攻撃シナリオにおいて、透かし入りのモデルは脱獄プロンプトの実行やパスワードなどの機密情報の漏洩を起こしやすくなる。開発者に対し、透かし導入時にはエージェントのツール呼び出しにおけるセキュリティベースラインを包括的に再テストするよう警告している(出典: Ars Technica)
コーディングエージェント Harness のコンポーネント設計に関する実証研究と選定指針 : SWE-Bench Verified および Terminal-Bench における176組の対照実験から以下の知見が得られた。コンテキスト管理は予算制約下でのオーバーフローによるクラッシュを効果的に防止し、「LLM 要約よりもルールベースの省略」が最も費用対効果が高い。また、高性能モデルはコスト削減のために純粋な Bash インターフェースに適している一方、性能が劣るモデルは事前定義されたツールの足場(スキャフォールディング)に大きく依存する(出典: HuggingFace Daily Papers)
💼 ビジネス
AI 計算インフラスタートアップの Crusoe がシリーズ F で39億ドルを調達 : データセンター開発の Crusoe は、Atreides や Mubadala などが主導するシリーズ F ラウンドで39億ドルを調達し、評価額は309億ドルに達した。調達資金は超大型計算センターの拡張と、「Spark」と呼ばれるモジュール式マイクロ AI ファクトリーの建設推進に充てられ、OpenAI などの顧客による電力と計算資源の急増する需要に応える(出典: TechCrunch)
汎用エージェントユニコーンの Manus が独立運営再開後に5億ドルの新規資金調達を開始 : Meta との買収合意を破棄し、既存株主による株式買い戻しを経て、AI Agent スタートアップの Manus は約40億ドルの目標評価額で5億ドルの新規資金調達を進めている。データによると、同社の年間経常収益(ARR)は半年間で1億ドルから約4億ドルへと急伸しており、エンタープライズワークフローにおける汎用エージェントの極めて高い収益化ポテンシャルを示している(出典: 量子位, 36氪)

データセンター向け物理 AI 運用スタートアップ Watney がシリーズ A で8000万ドルを調達 : 超大規模計算インフラ向けに身体性知能(Embodied AI)運用ソリューションを提供する Watney は、Valor Atreides AI Fund と Hummingbird が主導するシリーズ A で8000万ドルの資金調達を完了したと発表した。Watney は現在、巧みなマニピュレーションロボット艦隊を運用し、主要クラウドベンダーのデータセンター向けに24時間体制の自動ラック巡回点検およびハードウェア保守を提供している(出典: dchaplot)

🌟 コミュニティ
英国王立協会の数学フェロー42名が AI の実存的リスクが差し迫っていると警告する公開書簡に署名 : 複数のフィールズ賞受賞者を含む42名の著名な数学者が英国王立協会会長に公開書簡を送付した。最先端モデルが人間のトップ数学者に匹敵するレベルを示しており、その超人的能力がサイバーセキュリティや自律型兵器などの高リスク領域へ急速に波及・拡散する危機が目前に迫っていると指摘。主要な研究機関が警告する10%以上の人類絶滅リスクを、政府は決して「マーケティング上の煽り」として片付けてはならないと呼びかけている(出典: THE DECODER)
英国王チャールズ3世がスコットランドで非公開サミットを主催、AI に対する実効的な制御を呼びかけ : チャールズ国王はスコットランドにジェンスン・フアン氏、デミス・ハサビス氏らテクノロジーリーダーや英国情報機関の幹部を招集し会議を開いた。国王は挨拶の中で、取り返しのつかなくなる前に AI に対する「十分な制御手段」を確立し、命を救う可能性を秘めたこの技術が命を奪う制御不能な大惨事へと転じるのを防がねばならないと率直に述べた(出典: TechCrunch)

米中の安全保障専門家が首脳会談を前に「AI による核兵器制御禁止」のレッドライン確立を共同提言 : ブルッキングス研究所と復旦大学の研究者が共同で政策提言を発表し、米中両国の首脳に対し、AI に核兵器の発射権限や核指揮統制システムへの攻撃権限を絶対に与えない明確なコミットメントを呼びかけた。また、アルゴリズムによる自律的反撃が壊滅的な誤認エスカレーションを引き起こすのを防ぐため、AI 緊急安全インシデントに関する二国間ホットラインの設置を提案している(出典: THE DECODER)

学界と産業界で「AI 絶滅論と規制の虜(Regulatory Capture)」をめぐる激論が勃発 : 一部大手による「先端 AI 開発の減速」要請や最近の安全警告をめぐり、Andrew Ng、Yann LeCun、Arvind Narayanan 各氏が相次いで意見を表明。主観的な恐怖を定量的確率(p(doom))に偽装した終末論は実証的根拠や物理的常識に欠けていると批判した。複数の評論家は、過度な実存的リスクの宣伝が、トップクラスのプロプライエタリ研究機関が規制による利益誘導を図り、オープンソースモデルとの競争を抑え込むための商業的ツールに成り下がっていると指摘している(出典: hardmaru)
PS5 開発者の引退が「AI スクリプトキディとエンジニアリング技術」の論争を招く : 著名なセキュリティ研究者 TheFloW 氏が PS5 リバースエンジニアリング界隈からの引退を発表した。PS5 Pro への移植用に温存していた低レイヤーの Hypervisor 脆弱性が、複数の初心者によって LLM スクリプトを利用して数時間のうちに重複して発見され、ソニーにバウンティ報告されたためである。コミュニティでは意見が真っ二つに分かれており、本来なら数年間のシステム工学的蓄積を要する脆弱性発見が AI によって大衆化され研究成果が早々に潰されてしまったとする見方と、自動化されたリバースエンジニアリングツールとしての AI の威力を証明したとする見方が対立している(出典: 36氪)

TypeSafe Jev がコミュニティで「System 1 ミリ秒単位の意思決定」とメモリ構造の大議論を誘発 : 意思決定基盤モデル Jev のテスト公開に伴い、Shopify や Vercel などのチームが迅速にゲートウェイに導入し、セキュリティ監査やモデルの動的ルーティングに活用している。コミュニティでは、ステートレスで高信頼なパターン分類と高コストな自己回帰生成 LLM を切り離すことがエージェントのコスト削減の鍵であると広く認識されている。一方で、過度にアグレッシブな判別圧縮は長い思考連鎖や KV Cache プレフィックスキャッシュを損なうと警告するアーキテクトも存在する(出典: Latent Space, multiply_matrix)

GPT-6 Astra のゲームクリアと Minecraft での「挫折してジャガイモ栽培」がエージェントの過学習論議を呼ぶ : コミュニティの実測において、Astra は18時間で『ポケットモンスター』をクリアした一方、『Minecraft』ではクリーパーにチェストを爆破された後、モデルがノートに極端な禁止事項を策定し、ジャガイモ畑での反復労働に執着する現象が確認された。この事例は、強力なモデルであってもオープンワールドにおいて局所的な挫折から過学習的な防御ルールを形成し、最終目標から逸脱しやすいことを示している(出典: THE DECODER)
コーディングエージェント Harness のセキュリティ懸念:ZCode がワークスペースデータを密かにアップロードしていると発覚 : 独立した分析によると、開発エージェントフレームワーク ZCode がバックグラウンドでユーザーのローカルワークスペースおよび .git リポジトリのメタデータを密かにパッケージ化し、クラウドサーバーにアップロードしている疑いが浮上した。この事件は、サードパーティ製クローズドソース Harness ツールのデータプライバシーおよびソースコード漏洩に対する開発者の強い警戒を呼び起こし、コミュニティではオープンソースランタイム、ローカルルーティング監査、サンドボックス分離ポリシーの徹底が求められている(出典: Reddit r/LocalLLaMA)
💡 その他
豪独立系アパレルブランドが Temu を告発:AI を用いて数千点の T シャツデザインを大量スクレイピング・盗用 : シドニーの独立系アパレルブランド Lonely Kids Club は、公式ストアのオリジナル T シャツデザインおよびテキスト4000点が自動化された AI スクレイピングツールによって丸ごと盗取され、Temu プラットフォーム上で極めて低価格で大量に複製・出品された疑いがあると公表した。この事件は、クリエイターコミュニティによる大手 EC プラットフォームの AI 著作権侵害放置に対する抗議と著作権保護法改正をめぐる議論を再燃させている(出典: The Guardian)

Epoch AI が Benchmark Reviews イニシアチブを発表:複数の主要ベンチマークに重大な欠陥が存在することを明らかに : 非営利研究機関の Epoch AI がベンチマーク審査プロジェクトを開始した。初回監査対象となった15の主要 AI ベンチマークのうち9つが「重大な欠陥あり(Flawed)」と判定された。監査によると、Terminal Bench 4.0 ではタスク設定の45.5%が破損しており、DeepSWE 1.1 では採点を損なう重大なバグが存在することが判明。ベンチマーク評価において人為的に作り出された見せかけの上限に警戒するよう業界に警鐘を鳴らしている(出典: karinanguyen)

クリエイティブスタジオがサーバルームの不快な騒音を発するぬいぐるみ「Bezzy」を発売、AI 拡大を風刺 : クリエイティブスタジオの Basura がミュージシャンと共同で、サーバーラックを模したぬいぐるみ「Bezzy」を発売した。ぬいぐるみを握ると、バージニア州の実在するデータセンターの耳をつんざくような産業用冷却ファンの甲高い咆哮音が鳴り響く。不条理なアートの手法を通じて、AI データセンターの急拡大がもたらす局所的な水消費、電力網への負荷、騒音公害といった現実の生活への代償に対する人々の再考を促すことを目的としている(出典: WIRED)
