新智具身が復旦大学と共同でN0シリーズモデルとNeoDataデータセットを発表|AI日報 2026-07-27

🔥 フォーカス

新智具身が復旦大学と共同でN0シリーズモデルとNeoDataデータセットを発表 : 新智具身(Xinzhi Embodied)は復旦大学と共同で、N0シリーズのエンボディドAIモデルおよびNeoDataデータセットを発表した。NeoDataは3万時間以上の視覚・触覚インタラクションデータを含んでおり、NeoForce統一表現モデルは異なる触覚センサーのデータ融合の難題を解決した。N0-VTLAは将来の50ステップの触覚変化を予測することで操作の成功率を向上させ、N0-TWAMは世界モデルに触覚予測を導入することで、エンボディドAIを「視覚駆動」から「視触覚融合」へと進化させる。(情報源:量子位

新智具身が復旦大学と共同でN0シリーズモデルとNeoDataデータセットを発表

Induction LabsがPhoton-1モデルを発表 : Induction Labsは、106B-A5Bの稀疏混合専門家(MoE)モデルであるPhoton-1モデルをリリースした。その革新的な点は、アクションアノテーションのないビデオを使用して事前学習を行い、暗黙的なポリシーを学習することにある。Photon-1はコンピュータ使用のベンチマークテストでGemini 3.1 Flash-Liteを上回り、事前学習に必要な計算資源の消費を大幅に削減し、推論コストを約3分の1に抑えた。デスクトップのビデオのみを学習したにもかかわらず、微調整されたPhoton-1はチェッカーやビリヤードの物理シミュレーションにおいて依然として優れたパフォーマンスを示した。(情報源:MarkTechPost

KwaiKATチームがKAT-Coder-V2.5をリリース : 快手(Kuaishou)のKwaiKATチームは、実際に実行可能なコードベースでトレーニングされたエージェントコーディングモデルであるKAT-Coder-V2.5をリリースした。チームはAutoBuilderを通じて10万以上の検証可能なリポジトリ環境を自動構築し、プロセスベースのフィルタリングメカニズムと非対称AFT-PPO算法を利用して強化学習を行った。KAT-Coder-V2.5はPinchBenchで94.9という高スコアを獲得して首位に立ち、サンドボックスインフラとアルゴリズム設計の最適化を通じて、長期的なプログラミングエージェントの性能を向上させる道筋を示した。(情報源:MarkTechPost

MonkeyOCRv2ドキュメント視覚基盤モデルがオープンソース化 : 華中科技大学などのチームは、事前学習の目標として「再構成をドキュメントの視覚的メモリとする」ことを導入したMonkeyOCRv2をオープンソース化した。バックエンドの言語モデルであるQwen3-1.7Bを凍結した対照実験において、MonkeyOCRv2は8つのドキュメント理解ベンチマークで最強の対照モデルを13.2ポイント上回った。同時に、チームは1億1300万枚の画像を含むMonkeyDoc v2データセットをオープンソース化し、コミュニティに統一されたドキュメント視覚事前学習の実験場を提供し、ドキュメントAIが意味補完から視覚的忠実度へと進化するのを後押しした。(情報源:機器之心

MonkeyOCRv2ドキュメント視覚基盤モデルがオープンソース化

Valkorが浙江大学などと共同でエージェント状態管理フレームワークLoomをオープンソース化 : AIプログラミングエージェントが長期タスクにおいて「デバッグのブラックホール」や「局所的な記憶喪失」に陥りやすいという課題に対し、Valkorは浙江大学およびUCLのチームと共同で、オープンソースフレームワークLoomをリリースした。Loomは、複雑なソフトウェアデリバリータスクを構造化され、いつでも復元可能な状態チェーンに分解する。テストが失敗した際、Loomはそれをチャット履歴とは独立したToDo状態としてキャプチャするため、開発者はモデルやエージェントをシームレスに切り替えてタスクを続行できる。これにより、本格的な本番環境におけるAIプログラミングのための重要な状態インフラを提供する。(情報源:機器之心

Valkorが浙江大学などと共同でエージェント状態管理フレームワークLoomをオープンソース化

🎯 動向

Sakana AIがサイバーセキュリティ向けルーティングモデルFugu-Cyberを発表 : Sakana AIは、同社のFuguオーケストレーターにおけるサイバーセキュリティ専用のルーティングモデルFugu-Cyberをリリースした。このモデルはCyberGymで86.9%の成功率、CTI-REALMで72.1%のスコアを達成し、GPT-5.5-Cyberなどの最先端モデルと競合できる性能を持つ。Fugu-Cyberは、TRINITYおよびConductorフレームワークを通じて、複数のセキュリティ領域のサブエージェントを動的に調整し、脆弱性の検証や検知ルールの生成を行う。料金体系にはトークン数に応じた段階的課金モデルが採用されている。(情報源:MarkTechPost

Open DreamerがDreamer 4世界モデルのJAX実装をオープンソース化 : 独立研究チームのReactorは、JAXおよびFlax NNXに基づくDreamer 4世界モデルパイプラインの再現実装であるOpen Dreamerをオープンソース化した。このモデルには、敵対的損失を必要としないMasked Autoencoderビデオトークナイザーと、1.6Bパラメータのアクションアノテーションなしの時空間アテンションダイナミクスモデルが含まれている。チームはトレーニングレシピを完全に公開し、B200 GPUでのVRAM最適化やMuonオプティマイザのドリフト解決といった安定性向上のためのエンジニアリングの詳細を共有しており、世界モデルの再現に向けた貴重な参考資料となっている。(情報源:MarkTechPost

InclusionAIがOpenRouterでLing-3.0-flashをリリース : エージェントのワークフロー実行に特化した軽量MoEモデルLing-3.0-flashが、OpenRouterでAPIとして提供開始された。このモデルは総パラメータ数124B、アクティブパラメータ数5.1Bで、256Kのコンテキストウィンドウをサポートし、TTFTは100ms未満である。大型プランナーと連携して使用する低コストで高速な実行ノードとして位置づけられており、長期のツール呼び出しや指示追従向けに最適化され、切り替え可能なハイブリッド推論モードを提供する。(情報源:Reddit

Ling-3.0-flash

Abliterated版GLM-5.2モデルがリリース : コミュニティにより、「拒否解除(Abliterated)」および微調整が施されたGLM-5.2大規模モデルがリリースされた。このモデルは安全拒否の方向性を排除し、長期の対話やエージェントタスク向けに特化した微調整が行われており、技術的または機微なタスクを処理する際にモデルが理由なく処理を中断するのを防ぐ。評価によると、CyberGymやAgentHarmなどのセキュリティおよびコードのベンチマークで優れたパフォーマンスを示している。デフォルトでデータは保持されず、ルールはシステムプロンプトを通じてユーザーが完全に定義する。(情報源:Reddit

Abliterated版GLM-5.2モデル

🧰 ツール

Llama.cppがネイティブMCPサポートをマージ : 開発者ngxson氏が主導したPRがllama.cppに正常にマージされ、そのWebUIおよびコマンドラインツールがモデルコンテキストプロトコル(MCP)をネイティブにサポートするようになった。ユーザーは外部の中継を必要とせず、ローカルクライアント内で各種MCPサーバー(Serenaコードアシスタントなど)を直接設定・呼び出しできるようになり、完全にローカル化された依存関係のないエージェント開発とデバッグが実現した。これにより、ローカルのオープンソースモデルによるエージェントエコシステム構築のハードルが大幅に下がった。(情報源:Reddit

オンデバイスエージェントフレームワークOpen Minisがオープンソース化 : 開発者のEthan Wang氏は、モバイル端末上でローカルに動作するAIエージェントアプリであるOpen Minisのオープンソース化を発表した。iOSおよびAndroidシステムをサポートし、ローカルのLinux Shell、ブラウザ自動化、拡張可能なスキル、永続メモリを統合している。スキルのメタ情報をシステムプロンプトに読み込み、Prompt Cachingと組み合わせることで、モデルは1ターンの会話の中でツールの選択と実行を一貫して完了させることができ、オンデバイスエージェント開発の軽量なリファレンスを提供する。(情報源:X

Aethos_Memoryがエージェントのセッション間における忘却問題を解決 : AIコーディングアシスタントが異なるセッション間でコンテキストを共有できないという課題に対し、開発者はAethos_Memoryツールをオープンソース化した。このツールはエージェントに永続的なメモリレイヤーを提供し、セッション内の重要な決定、コードベースのアーキテクチャ、バグ修正の記録を自動的に抽出して保存する。新しいセッションを開始する際、エージェントは構造化されたメモリを直接読み取ることができるため、開発者が手動で履歴をコピー&ペーストする繁雑な作業を回避できる。(情報源:Reddit

Aethos_Memory

RunwayがメディアルーティングツールMedia Routerをリリース : 動画生成プラットフォームのRunwayは、生成メディア向けの初の嗜好最適化ルーティングツールであるMedia Routerをリリースした。企業チームが複数の動画、画像、音声モデルを含むプロダクションパイプラインを運用する際、リクエストごとに手動でモデルを選択する必要はなく、Router内でコスト、品質、または遅延に関する優先設定を一度定義するだけで、ルーティングシステムが自動的にトークンリクエストを配信し、コストと効果の最適なバランスを実現する。(情報源:X

📚 学習

GPUカーネルの設計と最適化を行うTileLangツールがリリース : 本文では、TVMに基づくGPUカーネル設計用DSLツールであるTileLangを紹介している。チュートリアルでは完全なPythonコードが提供され、ベクトル加算、Tensor Core行列乗算、融合Softmax、FlashAttentionなどのカーネルの設計方法が示されている。TileLangの共有メモリTileとレジスタタイリングにより、コンパイラはスレッドマッピングと同期を自動的に処理し、@tilelang.autotuneを通じて固定されたGPUバジェット内で最適なハードウェア構成を探索することをサポートする。(情報源:MarkTechPost

FAIRChem v2とUMAによる原子シミュレーションの可能性に関するチュートリアルが公開 : チュートリアルでは、MetaのFAIRChem v2フレームワークおよびUMA(汎用機械学習原子間ポテンシャル:MLIP)の使用方法について詳しく紹介している。内容は、Hugging Faceからゲート付きモデルの重みを取得する方法、ASE(Atomic Simulation Environment)で計算機を設定する方法、単一点エネルギー予測、分子幾何構造の最適化、スピン状態の比較、反応エネルギーの見積もり、格子緩和、状態方程式のフィッティング、および分子動力学シミュレーションなど、一連の計算化学ワークフローの実行方法をカバーしている。(情報源:MarkTechPost

Relative Representationが異種LLMのベクトル空間アライメント問題を解決 : コミュニティにおいて、相対表現法(Relative Representation Method)とLowdin対称直交化を利用して、異なるLLM(Llama、Mistral、Phiの混用など)の埋め込み空間をアライメントする幾何学的技術が共有された。この手法は微調整を必要とせず、特定のセマンティックドメイン内に参照アンカーを導入し、列方向のZ-score標準化を行うことで、異なる次元のベクトルを統一された共通空間にマッピングする。これにより、マルチエージェントルーティングにおける異方性コーンと次元の不一致の問題を解決する。(情報源:Reddit

Relative Representation

U-Netの手書き数式推導と計算プロセスの図解 : コンピュータビジョン研究者のProf. Tom Yeh氏が、U-Netネットワークの手書き計算図解を公開した。チュートリアルは17のステップで構成され、R、G、Bの3チャンネルを含む画像が畳み込みと最大プーリングによって2×4のBottleneckへと圧縮され、その後、転置畳み込みとスキップ接続(Skip Connection)によって段階的に元のサイズへと復元される様子を、直感的な行列乗算のプロセスを通じて示し、この拡散モデルのコア骨格の数学的原理を解説している。(情報源:X

💼 ビジネス

Stripeが100億ドルでOpenRouterの買収を計画 : 決済大手のStripeは、AIモデルアグリゲーションプラットフォームであるOpenRouterとの間で、評価額100億ドルに達する大型買収交渉を進めている。これは2ヶ月前の13億ドルから約8倍の急騰となる。企業がリスク分散のためにマルチモデルを使用する傾向が強まる中、OpenRouterのトラフィックと戦略的価値が浮き彫りになっている。Stripeは1行の決済コードを通じてAI時代に「密かに利益を上げて」おり、以前にもMetronomeを買収している。今回の買収により、同社のビジネスは決済からAIエコシステムの基盤インフラへと拡張されることになる。(情報源:機器之心

Stripeが100億ドルでOpenRouterの买收を計画

眸深智能が1億元近いPre-Aラウンドの追加資金調達を完了 : オンデバイスのエンボディドAIブレイン企業である「眸深智能」は、1億元近いPre-Aラウンドの追加資金調達を完了したと発表した。Pre-A+ラウンドの約5億元の調達も手続き中であり、評価額は半年で10倍以上に増加した。同社は復旦大学の陳涛教授と元Intelの科学者である張益民氏によって設立された。同社のSTI-WM時空一体世界アクションモデルは、アクションをトークン化することで実機データの需要を90%削減し、HiSiliconやHorizon Roboticsなどの中国産チップ上で超低コストのオンデバイス適応を実現した。(情報源:36kr

眸深智能が1億元近いPre-Aラウンドの追加資金調達を完了

手術ロボット企業Vicarious Surgicalが破産清算へ : かつてビル・ゲイツ氏やジェリー・ヤン(楊致遠)氏らから投資を受けた手術ロボットのユニコーン企業であるVicarious Surgicalは、研究開発の大幅な遅れと資金ショートにより、株主投票で運営停止と破産清算を決定した。同社は累計で20億元以上の資金を調達していたが、その過激なデカップリング駆動方式とVR制御コンセプトがFDA承認や量産化の段階で壁にぶつかった。これは、現在評価額が高騰しているものの商業化が困難なエンボディドAI分野に対して警鐘を鳴らすものとなった。(情報源:36kr

手術ロボット企業Vicarious Surgicalが破産清算へ

🌟 コミュニティ

AIプログラミングアシスタントの台頭によりCS教育界で評価方法の再構築が進む : 計算機学会(ACM)が世界49カ国700人以上のコンピュータサイエンス(CS)教育者を対象に行った調査によると、69%の教師が「AIによってソフトウェア開発に必要なスキルが変化した」と考えており、64%の授業の重点が「ゼロからのコーディング」から「コードの理解とデバッグ」へと移行している。AIによる不正行為や過度な依存に対処するため、68%の教師が評価方法を調整し、対面でのクローズドブック試験、口頭試問、コードディフェンスなどを追加することで、AI時代におけるプログラミングスキルの評価を再定義している。(情報源:THE DECODER

AIプログラミングアシスタントの台頭によりCS教育界で評価方法の再構築が進む

Claudeの共有会話リンクがGoogleにインデックスされプライバシーの懸念が浮上 : ユーザーがClaudeの「公開リンクを作成」機能を通じて共有した会話やArtifactsが、Googleなどの検索エンジンに公開インデックスされていることがコミュニティで発見された。さらに、これらのリンクを専門にスクレイピングするサードパーティのウェブサイトも出現している。漏洩した内容には、暗号資産の秘密鍵、企業の機密情報、個人の医療プライバシーなどが含まれる。ユーザーは、Anthropicが共有ページにnoindexメタタグを追加していなかったことをセキュリティ設計上の初歩的なミスであると批判し、設定から共有済みの会話を速やかに削除するよう呼びかけている。(情報源:Reddit

Claudeの共有会話リンクがGoogleにインデックスされプライバシーの懸念が浮上

シリコンバレーで「Avoiding AI」という逆デジタルリテラシーワークショップがブームに : テック大手がAIをあらゆる端末に強制的に導入する中、全米各地の図書館が主催する「Avoiding AI(AIを避ける)」オフラインワークショップがSNSで大きな話題となっている。司書たちが市民に対し、Apple IntelligenceやGeminiなどのシステム内蔵AIを完全にオフにする方法を直接指導し、Google検索のAI概要をブロックするブラウザ拡張機能などを共有している。市民はこれを通じて、巨大テック企業の独占、プライバシー侵害、データセンターのエネルギー消費に対する懸念を表明し、技術的自主権を求めている。(情報源:TechCrunch

Avoiding AI

Lutnick商務長官が中国に対抗するためオープンソースAIの支持を表明 : ホワイトハウス記者夕食会におけるHoward Lutnick米国務長官(※実際は商務長官)の発言がコミュニティで話題となっている。彼は「現政権はオープンソースAIを保護する」と明言した。これに先立ち、APECはオープンソースAIを支持する声明に署名しており、米政府内では一律の封鎖の代わりに特定モデルに対するピンポイントの禁止措置を導入することが議論されている。これにより、計算資源が制限された状況下でも、米国のオープンソースエコシステムが「フォーク」や「微調整」を通じて閉源の最先端に急速に追いつき、米国の技術的優位性を確保することを目指している。(情報源:X

Andrej Karpathyがプロフィールを変更し退職の憶測が広がる : 著名なAI研究者であるAndrej Karpathy氏が、自身のSNSアカウントのプロフィールから「Anthropic」の文字を削除したことで、退職したのではないかという憶測がコミュニティ内で広がっている。一部のリーク情報によると、輸出規制により米国籍を持たない彼が同社の最先端モデルにアクセスできなくなったため退職を選んだとされているが、プロフィールの変更は数日前に行われていたと指摘するネットユーザーもいる。Anthropicが最近、ジェンスン・フアン氏が主導したオープンソースに関する公開書簡に署名しなかったこともあり、同社の保守的なビジネスおよび規制戦略はコミュニティ内で一部の反発を招いている。(情報源:機器之心

Andrej Karpathyがプロフィールを変更し退職の憶測が広がる

DeepSeekが投資家会議の議事録漏洩により第2ラウンドの資金調達を一時停止 : SNS上で拡散されたDeepSeek創業者である梁文锋氏と投資家との対話に関する会議の議事録により、DeepSeek公式は潜在的な投資家に対し、第2ラウンドの資金調達を一時的に保留する旨を緊急通知した。漏洩した書き起こしテキストには、米中の計算資源の格差、トークン価格戦略、およびオープンソースビジネスモデルに関するDeepSeekのデリケートな発言が含まれていた。コミュニティでは、エンジニアリングの最適化によって推論コストを欧米の競合の3分の1に抑えたDeepSeekの「トークン工場」モデルについての微調整やデプロイに関する議論が活発に行われている。(情報源:Hacker News

💡 その他

ChatGPTがMacBookのAtomicStealer感染の発見を支援 : あるMacユーザーがローカル大規模モデルの実行メモリを最適化しようとした際、ChatGPTを使ってシステムプロセスを分析したところ、システムサービスを装った2つのLaunchDaemonファイルがLibrary内の隠しスクリプトを指しているのを偶然発見した。ChatGPTはすぐにこれをマルウェアとして警告し、汚染されたPDFオープンソースライブラリのインストールによって感染したOSX.AtomicStealer情報窃取型トロイの木馬の特定を支援した。これにより、日常の端末セキュリティ対策におけるAIの意外な役割が示された。(情報源:Reddit

ChatGPTがMacBookのAtomicStealer感染の発見を支援

Decoy Fontが視覚的差異を利用してマルチモーダルAIを欺く : デザインスタジオのMixfontは「Decoy Font(誘餌フォント)」をリリースした。このフォントは、通常の文字の上に細線で描かれた妨害文字を重ねることで、ChatGPTやClaudeなどの視覚能力を持つマルチモーダルAIがOCR認識を行う際に誤ったテキスト(例:「Sorry Robot」)しか読み取れないようにする一方で、人間の肉眼では一定の距離からでも実際のテキスト(例:「Happy Human」)を正常に読めるようにする。これは、新しいタイプの物理レベルのAIクローラー対策/敵対的サンプル技術となっている。(情報源:Reddit

Decoy Fontが視覚的差異を利用してマルチモーダルAIを欺く

ニューヨークの高校が人型ロボットの導入を計画し教師らが抗議 : ニューヨークのある公立高校が、校舎内に授業補助用として人型ロボットを導入する計画を立てたが、これに対し教職員組合が強く反対している。教師らは、教育予算の逼迫や教員不足が進む中で、高額な人型ロボットの購入・維持費はリソースの誤配分であると主張している。また、ロボットは感情的なコミュニケーションや個別指導における人間の教師の中核的な役割を代替することはできず、学校への技術導入には境界を設けるべきだとしている。(情報源:Reddit

ニューヨークの高校が人型ロボットの導入を計画し教師らが抗議

コメントを残す

メールアドレスが公開されることはありません。 が付いている欄は必須項目です