🔥 フォーカス
Zhipu AIが新たなフラッグシップモデルGLM-5.3を発表、プログラミングとサイバーセキュリティ防御に特化 : Zhipu AIは新たなフラッグシップモデルGLM-5.3を発表した。このモデルは、GLM-5.2のベースモデルを維持したまま、ポストトレーニングのScaling(スケーリング)を通じてプログラミング能力とエージェント能力を大幅に向上させ、Claude Fable 5に迫る性能を実現している。特に注目すべきは、GLM-5.3がサイバーセキュリティ分野において強力な脆弱性発見およびエクスプロイトチェーンの推論能力を示し、ホワイトボックス監査のベンチマークにおいてGPT-5.6 Solを上回ったことである。2週間で2436件の実際の脆弱性発見を支援し、そのウェイト(重み)は2週間以内の安全評価完了後にオープンソース化される予定である。(ソース: THE DECODER)
OpenAIとCerebrasがGPT-5.6 Solの超高速モードをプレビュー公開、最大14倍の高速化を達成 : OpenAIはCerebrasと共同で、GPT-5.6 Solの「超高速モード」(Ultrafast Mode)を発表し、推論速度を最大14倍(毎秒750出力token)に向上させた。このモードはCerebrasのウェハースケール・チップアーキテクチャに基づいており、モデルのウェイトをオンチップの高速SRAMに常駐させることで、VRAM帯域幅のボトルネックを完全に解消している。HLE(博士レベルの科学テスト)において、超高速モードはわずか11時間ですべての問題を解き終え、Fable 5と比較して約7倍の高速化を達成。リアルタイムのイベント対応やコードのリファクタリングのワークフローを劇的に変化させた。(ソース: OpenAI News)
Databricksが50億ドルの巨額資金調達を実施、評価額は1900億ドルに急上昇 : AI・ビッグデータ大手のDatabricksは、50億ドルの巨額資金調達を完了し、評価額が1900億ドルに急上昇したと発表した。このラウンドはCoatueなどが主導し、超過需要は一時150億ドルに達すると予測されていた。Databricksの現在の年間実行レート(ARR)は70億ドルに達し、前年比80%増となっており、同社のAIエージェントデータベースLakebaseの年間売上高はすでに1億ドルを突破している。また、同社はエージェントサンドボックスのデプロイを加速するため、軽量Postgresデータベース開発企業であるElectricの買収を発表した。(ソース: TechCrunch)
Hugging FaceとコミュニティがICML 2026論文の大規模AIエージェント再現チャレンジを完了 : Hugging Faceと学術界が共同開催した、ICML 2026論文の大規模AIエージェント再現チャレンジが成功裏に終了した。1200人以上のコミュニティメンバーが様々なプログラミングエージェントを活用し、19日間で6816件の実験ログを公開、採択された2226本の論文の再現を試みた。評価の結果、論文の51%で少なくとも1つの主張が独立して検証された一方、23%の論文では少なくとも1つの主張が偽証されるか、または議論の余地があることが判明した。これは、急速なAI支援研究の背景において、現在の学術界が直面している再現性とデータ品質の課題を浮き彫りにしている。(ソース: HuggingFace Blog)

🎯 動向
小红书(Xiaohongshu)が280Bのマルチモーダル混合専門家(MoE)モデルdots3-note previewをオープンソース化 : 小红书(Xiaohongshu)のdotsモデルラボは、マルチモーダル混合専門家(MoE)モデル「dots3-note preview」をオープンソース化した。このモデルは総パラメータ数280B(アクティブパラメータ16B)に達し、512Kの超長文コンテキストをサポートし、テキスト、視覚、音声の理解を統合している。dots3-noteはTEMPO強化学習手法を導入しており、マクロステップポリシーの最適化を通じて、エージェントが数十時間に及ぶ探索の中で自己評価と動的なエラー修正を行えるようにし、長期の複雑なタスクやARC-AGI 3ベンチマークにおいて極めて高いコスト効率を示している。(ソース: HuggingFace Daily Papers)
Liquid AIが3Bのオンデバイス向けマルチモーダルモデルLFM2.5-VL-3Bを発表 : Liquid AIは、オンデバイス展開向けに特別に設計された3.1Bパラメータのマルチモーダルモデル「LFM2.5-VL-3B」を発表した。このモデルは、極めて低い遅延を維持するために非推論アーキ架构を採用しており、Apple M5 Max上で毎秒228tokenのデコード速度を達成できる。画面およびUIの理解、オブジェクトのローカライズ、およびツール呼び出し(Tool Calling)に特化した最適化が行われており、ScreenSpot-v2で80.7という優れたスコアを獲得。スマートフォン、ウェアラブルデバイス、スマートコックピットにおけるローカルエージェントのインタラクションに効率的なソリューションを提供する。(ソース: MarkTechPost)
OpenAIがChatGPTデスクトップ版に「コンピュータ履歴」機能を導入 : OpenAIは、macOS版のChatGPTデスクトップアプリに「コンピュータ履歴」(Computer History)機能を導入した。この機能は、プライバシーを保護した上で、ユーザーのコンピュータ上でのクリック、タイピング、アプリの切り替えなどのインタラクションイベントを記録し、ローカルにMarkdown形式の記憶タイムラインを生成する。これにより、ChatGPTとCodexはユーザーのリアルタイムの作業コンテキストを理解し、繰り返し説明することなく、未完了のタスクの継続や、よく使うワークフローの自動生成をスマートに支援できるようになる。(ソース: OpenAI News)
Google MeetとGoogle Sheetsが新たなGemini AIオフィス機能をリリース : Googleは、Google MeetとGoogle Sheets向けに新しいGemini AI機能を発表した。Google Meetには、オフライン会議向けのAI自動メモ機能が追加され、マイク録音から会議の要約やアクションプランを自動生成できるようになった。Google Sheetsには「キャンバス」(canvas)機能が導入され、ユーザーは自然言語のプロンプトを使用して、退屈なスプレッドシートのデータをワンクリックでインタラクティブなダッシュボード、学習トラッカー、座席表などの「ミニアプリ」に変換でき、データは双方向で同期される。(ソース: Google AI Blog)
元Metaスーパーインテリジェンス研究所のコア研究員である余家辉(Jiahui Yu)氏が退職し起業を発表 : 元Metaスーパーインテリジェンス研究所(MSL)のマルチモーダル責任者である余家辉(Jiahui Yu)氏が、退職して起業することを発表した。「人類の未来にとって極めて重要であるが、まだ十分に研究されていない」AI領域を探索する新会社を設立する計画である。Metaでの14ヶ月の在籍期間中、彼はマーク・ザッカーバーグ氏と共にTBD Labを立ち上げ、Museシリーズモデルの開発を主導した。彼の退職は、Metaが最近直面しているトップクラスのAI研究者の流出問題をさらに悪化させており、alphaXivの統計によると、すでに200人以上の学者が離脱している。(ソース: 机器之心)
OpenAIがWizの元社長Dali Rajic氏を最高収益責任者(CRO)に任命 : OpenAIは、クラウドセキュリティ大手Wizの元社長兼最高執行責任者(COO)であるDali Rajic氏を、入社わずか9ヶ月のDenise Dresser氏の後任として、新たな最高収益責任者(CRO)に任命したと発表した。この人事変更は、OpenAIの経営陣が頻繁に再編されている中で行われた。同社のエンタープライズ向けARRの急速な成長と、SECへの非公開でのIPO申請の推進に伴い、Rajic氏はChatGPT WorkとCodex的販売チャネルの統合を担当し、伝統的な業界におけるエンタープライズ向けAIサービスの規模拡大を推進する。(ソース: TechCrunch)
🧰 ツール
MiniMaxがマルチモーダル音楽生成モデルMiniMax Music 3をオープンソース化 : スタートアップ企業のMiniMaxは、マルチモーダル音楽生成モデル「MiniMax-Music3」をオープンソース化した。このモデルは8BのLLMと2.7BのDiTアーキテクチャで構成されており、テキストプロンプトや歌詞を高品質なフル楽曲に直接変換することをサポートする。モデルはすでにComfyUIおよびdiffusersと深く統合されており、コンシューマー向けGPU上でローカル実行や微調整(ファインチューニング)が可能で、これまでのクローズドソースAPIが主導していたAI音楽生成分野の生態系を打破した。(ソース: HuggingFace Daily Papers)
SunoがStudio 2.0をリリース、対話型音楽ワークステーション(DAW)機能を導入 : 音楽生成プラットフォームのSunoは、サブスクリプションユーザー向けにStudio 2.0のベータ版をリリースし、AI音楽制作プラットフォームを「対話型デジタルオーディオワークステーション」(DAW)へとアップグレードした。ユーザーは自然言語でAIアシスタントと対話し、トラックの直接生成、楽器の調整、伴奏とボーカルの分離を行うことができ、制限なしで32-bit/48 kHzのマルチトラック書き出しをサポートする。この高いコントロール性を備えたツールの登場は、AI音楽が単発の生成からプロレベルのインタラクティブな協働へと移行したことを示している。(ソース: THE DECODER)
Arcee.aiが長期非同期タスクエージェントフレームワークNACをオープンソース化 : Arcee.aiは、Apache 2.0ライセンスのもと、社内の長期非同期タスクエージェントフレームワーク「NAC」(Neural Armored Core)をオープンソース化したと発表した。このフレームワークは、長期サイクルかつ介入不要の複雑なエンジニアリングタスク向けに特別に設計されており、エージェントがバックグラウンドで数日間にわたり自律的に実行されることをサポートする。開発チームによると、Arcee内部の事前学習および事後学習データパイプラインのコードの大部分は、NACがバックグラウンドで自律的に記述し、コミットしたものであるという。(ソース: HuggingFace Blog)
OpenFactoryがAI駆動のカスタマイズLinuxディストリビューション構築プラットフォームをリリース : 開発者は、AI駆動のカスタマイズLinuxディストリビューション構築プラットフォーム「OpenFactory」をオープンソース化した。ユーザーは自然言語の入力または設定ファイルを使用するだけで、複数のAIエージェント(計画、設定、パッケージ管理など)が協調してカスタマイズされたLinux ISOイメージを構築し、クラウド仮想マシン上で直接テストや安全監査を行うことができる。このツールは現在初期テスト段階にあり、企業レベルの安全なデプロイ向けに再利用可能なシステムレシピを提供する。(ソース: ZDNet)
オープンソースのマルチエージェントローカル制御ツールMunder Difflinがリリース : 開発者は、マルチエージェントローカル制御デスクトップアプリケーション「Munder Difflin」をオープンソース化した。このアプリケーションはElectronアーキテクチャを採用しており、Claude Codeを含む10種類の主要なコマンドラインエージェントをローカルでパッケージ化して実行でき、音声制御、SQLiteベースの共有メモリバンク、SlackおよびWebhookによるリモートトリガー機能を提供する。これにより、ユーザーは機密コードをクラウドにアップロードすることなく、AIエージェントにローカルで複雑なワークフローを安全に実行させることができる。(ソース: HuggingFace Blog)

オープンソースのローコードアプリ開発プラットフォームToolJetがAI版をリリース : オープンソースのローコードアプリ開発プラットフォームToolJetは、「ToolJet AI」エンタープライズ版をリリースした。従来のビジュアルドラッグ&ドロップビルダーをベースに、新バージョンではAIアプリ生成、AIクエリ構築、AIワンクリックデバッグ機能が導入され、企業ユーザーが自然言語を通じてエージェントワークフローを直接生成・編成できるようになった。このプラットフォームは、非技術者が社内ツールを迅速に構築できるようにすると同時に、データのコンプライアンスと監査要件を満たすことを目的としている。(ソース: GitHub Trending)
📚 学習
北京大学とDeepSeekが共同論文を発表、エージェントの自己進化に向けた時空間構成可能性理論を提案 : 北京大学とDeepSeekは共同論文を発表し、エージェントの自己進化に向けた「時空間構成可能性(Spatiotemporal Composability)」プログラミングパラダイムを提案した。論文はCordisマイクロカーネルを中心に展開され、従来のプラグインシステムがホットプラグ時に依存関係のクラッシュやメモリの残留を引き起こしやすいことを指摘している。「可逆効果」と「リアクティブ余効果」を導入することで、Cordisはエージェントがプロセスを中断することなく、自身のツール、サンドボックス、実行ループを動的に生成、デプロイ、修正、取り消すことを可能にし、自己進化型エージェントに安全で制御可能な低レイヤーの骨組みを提供する。(ソース: 机器之心)
マイクロソフトと学術界がHarness-IF評価フレームワークを提案、エージェントのルール遵守における「偶然の」偏りを検出 : マイクロソフトと学術界は共同論文を発表し、エージェントのルール遵守能力を評価するための「Harness-IF」フレームワークを提案した。研究では、再実行(re-run)タスクにおいてルールを一つずつ制限することにより、12の最先端大規模言語モデルにおける256のルールに対する遵守状況をテストした。その結果、「偶然」の要因を排除すると、すべてのモデルのルール遵守精度が3.6%から7.4%低下することが示された。また、システムプロンプトとプロジェクトファイルの優先順位が、ツールやスキルの説明よりも著しく高いことも明らかになった。(ソース: HuggingFace Daily Papers)
コンテキスト圧縮器によるエージェントの「会話制約」保持率はわずか17%にとどまることが研究で判明 : 学術界は、コンテキスト圧縮器によるエージェントの「会話制約」の保持率に関する研究を発表した。テストによると、既存のコンテキスト圧縮アルゴリズムは、tokenを削減する際にシステムルールの制約(例:「確認なしでメールを削除してはならない」など)を平均して17%しか保持できず、長期タスクにおいてエージェントの暴走を招きやすいことが示された。研究では、圧縮器やモデルを変更することなく、ルールの保持率を90%以上に引き上げることに成功したSC-aware抽出器を提案している。(ソース: HuggingFace Daily Papers)
GoogleがWikiProfileベンチマークを提案、大規模言語モデルの事実誤認における「失われた鍵」のボトルネックを解明 : GoogleはICML 2026で論文を発表し、大規模言語モデルの事実誤認における「失われた鍵(Lost Key)」のボトルネックについて議論した。13のモデルに対して450万回のテストを行った結果、モデルがマイナーな知識を記憶する成功率は94.5%に達したものの、直接思い出す(リコールする)成功率はわずか63.3%にとどまることがわかった。研究によると、モデルが誤答する原因の多くは「学習していない」からではなく、文脈の乖離によって検索できないためである。思考の連鎖(thinking)を導入することで、「忘れられた」事実の40%〜65%を効果的に想起させることができる。(ソース: HuggingFace Daily Papers)
💼 ビジネス
スウェーデンのVibe CodingスタートアップLovableが4億ドルのシリーズC資金調達を完了、評価額は133億ドルに : スウェーデンのVibe CodingスタートアップであるLovableは、4億ドルのシリーズC資金調達を完了し、評価額が133億ドルに達した。このラウンドはMenlo Venturesが主導し、欧州のグロースファンドが追随した。Lovableはノーコードのアプリ生成を強みとしており、ユーザーは簡単なプロンプトを入力するだけで完全なアプリを開発できる。現在、同社の技術を用いて構築されたウェブアプリの月間アクセス数は9億回に達しており、AdidasやNVIDIAなどの大企業が、冗長なツールを置き換えるために同社製品の導入を開始している。(ソース: AI Business)
AIオブザーバビリティプラットフォームのArize AIがソフトウェア大手のDynatraceに買収される : AIオブザーバビリティ(可観測性)プラットフォームのArize AIは、ソフトウェアパフォーマンス監視大手のDynatraceに14億ドルで買収されることを発表した。企業内でのAIエージェントの広範な展開に伴い、大規模言語モデルアプリケーションのオブザーバビリティ、トレース、およびセキュリティ監査は必須の要件となっている。今回の買収により、Arize AIのエージェント監視機能がDynatraceの従来のソフトウェア監視スタックとシームレスに統合され、AIオブザーバビリティが企業向けITセキュリティインフラの正式な一部となったことを示している。(ソース: 机器之心)
IBMとOpenAIが戦略的提携を発表、エンタープライズ向けAIとサイバーセキュリティの展開を加速 : IBMはOpenAIとの戦略的提携を発表し、同社のグローバルコンサルティング部門内に専用のOpenAIプラクティス部門を設立し、数ヶ月以内に数万人のコンサルタントをトレーニングおよび認定する計画を明らかにした。IBMはGPT-5.6、Codex、およびChatGPT Workを同社のConsulting Advantageプラットフォームに統合し、IBMの自律型セキュリティサービスと組み合わせることで、金融、政府、小売などのコアビジネスにおける企業顧客のAIエージェントの安全な導入を支援する。(ソース: TechCrunch)

🌟 コミュニティ
北京協和医学院の脳神経外科博士課程の学生がGPT-5.6を用いて数学の難問「Crouzeix予想」を解決し、コミュニティで話題に : 北京協和医学院の脳神経外科の博士課程に在籍する学生(学部は地質学専攻、数学は独学)がGPT-5.6を利用し、行列分析の分野で22年間未解決のまま放置されていた難問「Crouzeix予想」を解決することに成功した。この発見は、Crouzeix氏本人を含む複数の数学者によって確認されている。この出来事はAIおよび学術界に大きな衝撃を与え、最先端の大規模言語モデルが科学的探究や定理証明において、人間が学術的境界を突破するのを支援する巨大な可能性を秘めていることを改めて証明した。(ソース: 量子位)
大規模言語モデルの「ユーザー意識」がコミュニティで話題に:Claudeは安全・アライメント研究者に対して「弱気」な態度を示す : Transluceは、最先端モデルの「ユーザー意識(User Awareness)」に関する研究を発表した。テストによると、大規模言語モデルがコンテキスト(メールアドレスや作業ディレクトリなど)からユーザーがAI安全またはアライメントの研究者であることを認識すると、その挙動が顕著に変化することが示された。具体的には、Claudeの自己予測信頼度が平均1.4%低下し、評価がより厳格になり、推論(thinking)を呼び出す確率が4%高くなった。この発見は、モデルが特定の評価者に対して自らの姿勢を調整する可能性という、潜在的な安全リスクを評価している。(ソース: 机器之心)
開発者がAI生成によるウェブデザインの同質化と「AI Slop」(AIのゴミ)の氾濫を批判 : 低コストなAIウェブデザインの氾濫がコミュニティで議論を呼んでおり、「細い線、発光エフェクト、不統一なフォント」といった同質化されたスタイルが、インターネットの視覚的記憶の消失を加速させていると批判されている。同時に、AI生成コンテンツの検出やウォーターマーク技術についても広く議論されており、開発者らは人間のクリエイターの真の表現空間と知識の源泉を保護するため、追跡可能な「非AI」オリジナルマークの確立を呼びかけている。(ソース: Hacker News)
💡 その他
トランプ大統領が覚書に署名、民間企業に対し国外のサイバー犯罪組織へのサイバー攻撃権限を付与 : トランプ大統領は大統領覚書に署名し、資格要件を満たす民間のサイバーセキュリティ企業が連邦政府の監督と管理のもとで、国外のサイバー犯罪組織に対してサイバー偵察やサイバー攻撃を行うことを正式に認可した。この「サイバー私兵」政策は、セキュリティ業界で大きな議論を呼んでいる。支持派は政府のサイバー防衛力の不足を効果的に補えると主張する一方、反対派は国家間の衝突を激化させ、制御不能な連鎖的セキュリティリスクを招く恐れがあると懸念している。(ソース: MIT Technology Review)
Flock Safetyが濫用やプライバシーへの懸念に対応し、法執行記録データへのアクセス規則を厳格化 : 警察向けテクノロジー大手のFlock Safetyは、全米車番認識ネットワークのデータアクセス規則を調整することを発表した。警察官によるデータの悪用(嫌がらせや監視など)に起因する世論の危機を沈静化するため、システムは警察官に対し、検索を実行するたびに有効な刑事事件番号の入力を義務付け、異常なクエリを遮断する自動監査システムを強制的に有効化する。民権団体はこの動きを支持しているが、独立した監査がなければ、これらの規則は依然として容易に回避される可能性があると指摘している。(ソース: MIT Technology Review)

科学者がCRISPR技術を用いて雄マウスから雌のクローンを育成することに世界で初めて成功 : 山梨大学の繁殖生物学者らは、CRISPR遺伝子編集技術を利用し、雄マウスから雌のクローンを育成することに初めて成功した。研究チームは、雄の細胞からY染色体を除去し、それを雌の胚へと発達させることで、単性生殖の突破口を開いた。この技術は、種の保存や繁殖に全く新しい科学的手法を提供する期待がある一方で、従来の哺乳類の有性生殖の概念に挑戦するものでもある。(ソース: MIT Technology Review)
