OpenAI、Astraモデルが10の大数学難題を解決した249ページの論文与検証コー…|AI日報 2026-08-03

🔥 フォーカス

OpenAI、Astraモデルが10の大数学難題を解決した249ページの論文与検証コードを正式発表 : OpenAIは、次世代推論モデルAstraがフィールズ賞級の数学難題10件を攻略した249ページの技術論文を正式に発表し、GitHubでLean 4形式化検証コードをオープンソース化した。Astraは初めて非sofic群の反例を構築し、1978年以来の高次元球体充填問題における減衰率の限界を突破した。この画期的な進歩は、純粋数学分野におけるAIの深い構造化能力を証明しており、単一の証明にかかる平均Tokenコストはわずか200ドルである。これは「計算資源で数学の定理を購入する」時代の到来を予兆している(情報源:OpenAI News

OpenAI、Astraモデルが10の大数学難題を解決した249ページの論文与検証コードを正式発表

Andrej Karpathy、Claude Opus 5が単一プロンプトで完全な3D物理ゲーム世界を生成したことを热く議論 : 元TeslaのAI責任者であるAndrej KarpathyがAnthropic加入後初めて投稿し、Claude Opus 5が100万Tokenの予算内で、単一のプロンプトのみから複雑な物理挙動、マテリアル、音楽を含む『ロード・オブ・ザ・リング』の3Dゲーム世界を生成したことを紹介した。この進展は、AIがシンプルな2DのSVG描画からプログラムによる3Dプロトタイプ生成へとパラダイムシフトしたことを示している。しかし、Karpathyは、モデルがビデオに対するリアルタイムの知覚やゲームの監査能力を欠いているため、生成された画面でオブジェクトが壁を突き抜ける(クリッピング)などの限界が依然として存在することも指摘している(情報源:THE DECODER

Andrej Karpathy、Claude Opus 5が単一プロンプトで完全な3D物理ゲーム世界を生成したことを热く議論

MicrosoftのサイバーセキュリティシステムMDASH、CyberGymベンチマークで95.95%の画期的なスコアを達成 : Microsoftは、マルチエージェント・サイバーセキュリティシステムMDASHのCyberGymベンチマークにおける最新の成果を公表し、95.95%の脆弱性再現率で業界を圧倒的にリードした。同システムは、極めてコストパフォーマンスの高いハイブリッドルーティングアーキテクチャを採用している。わずか5Bパラメータのみをアクティブにする軽量モデルMAI-Cyber-1-Flashが一般的なセキュリティクエリの90%を処理し、最も困難な10%のタスクのみをGPT-5.4に振り分けることで、トップクラスの防御性能を維持しつつ推論コストを半減させた。これは、AIサイバーセキュリティが「大規模モデルの積み上げ」から「システム的なコスト削減」へと進化していることを示している(情報源:36氪

MicrosoftのサイバーセキュリティシステムMDASH、CyberGymベンチマークで95.95%の画期的なスコアを達成

AIデータチェーンの仲介業者が2022年以前の希少本を大量購入し、破壊的にスキャンしていることが発覚 : オーストラリアの書店や業界の調査により、AIトレーニングデータソースに関する新たな詳細が明らかになった。ISBNdbなどのデータ仲介業者が、AI生成コンテンツによる「汚染」を受けていない2022年以前に出版された絶版書や希少本を、中古プラットフォームを通じて匿名で大量に購入している。デジタル化の効率を向上させるため、スキャン機関は本の背表紙を切り落として実物の本を廃棄しており、AIトレーニングが人類の文化遺産の喪失につながるという倫理的論争が文化界で巻き起こっている(情報源:The Guardian

AI数据链中介被曝大量采购并毁灭性扫描2022年前珍稀图书

🎯 動向

GoogleのGemini Robotics 2、「全身エンドツーエンド協調」制御を特徴とする : Google DeepMindは汎用ロボットモデルGemini Robotics 2を発表した。その核心は、「まず安定して立ち、それから手を伸ばす」という従来の段階的な制御を打破し、両脚、体幹、そして多指の器用な手による全身の協調を実現した点にある。テストでは、同モデルがFranka DuoやApollo 2においてクロス本体適応を実現したことが示されたが、電球の締め付けやジッパーバッグの密閉といった「最後の数センチメートル」の微細な操作の成功率には依然として改善の余地がある(情報源:36氪

NVIDIA、極めてシンプルなエージェント強化学習フレームワークMoltをオープンソース化 : NVIDIAのNeMoチームは、PyTorchネイティブなエージェント強化学習フレームワークMoltをオープンソース化した。このフレームワークは極限までシンプルな設計を特徴としており、コード量はわずか約8.6K行で、AIコーディングアシスタントによる理解や修正が非常に容易である。MoltはRayとvLLMを通じてトレーニングとRolloutの効率的な非同期協調を実現し、「Rolloutルーティングリプレイ」技術を導入することで、MoEモデルのトレーニング時と推論時におけるエキスパート選択の不一致という課題を解決した(情報源:MarkTechPost

AMD、完全オープンソースの混合エキスパートモデルInstella-MoE-16B-A3Bを発表 : AMDは、Instinct MI300X/MI325X GPU上でトレーニングされたオープンソースの混合エキスパート(MoE)モデルInstella-MoE-16B-A3B(アクティブパラメータ2.8B)を発表した。このモデルは、Gated MLA(ゲート付きマルチヘッド潜在アテンション)とFarSkip-Collective非同期通信技術を導入しており、事前トレーニング速度を12.7%向上させ、最初のトークン出力(TTFT)の遅延を39.2%削減した。複数のベンチマークテストにおいて、同サイズのオープンソースモデルをリードしている(情報源:MarkTechPost

AMD、完全オープンソースの混合エキスパートモデルInstella-MoE-16B-A3Bを発表

Meta AI、「行動状態の減退」を解決するためのアクティブメモリ・エージェントアーキテクチャを提案 : Meta AIの研究者らは、状態、知識、プロセスを含む構造化されたメモリバンクを維持するために、独立した「メモリコーチ」エージェントを導入する「アクティブメモリ・エージェント」アーキテクチャを提案した。このコーチエージェントは、実行エージェントにプロンプトを送信するタイミングを能動的に判断することができ、Terminal-Benchなどのテストにおいて長期タスクの成功率を大幅に向上させ、エージェントが長いコンテキストの中で制約を忘れたり、失敗した試行を繰り返したりする問題を効果的に回避する(情報源:THE DECODER

Meta AI、「行動状態の減退」を解決するためのアクティブメモリ・エージェントアーキテクチャを提案

OpenAI、企業向けエージェントデプロイ・統合プラットフォームPresenceをリリース : OpenAIは、企業顧客向けのPresence服务をリリースした。これは、ChatGPT Workspaceエージェントを、カスタマーサービスや内部ワークフローで直接使用できるプロダクションレベルのアプリケーションに変換することを目的としている。OpenAIは最先端のデプロイメントエンジニアを派遣して、企業顧客のシステム統合、セキュリティ境界の設定、およびテスト管理を支援する。これは、大規模モデルベンダーがAIエージェントを企業のコアビジネスシナリオへ導入することを加速させていることを示している(情報源:THE DECODER

EUの「人工知能法」が正式発効、「開示疲労」への懸念が高まる : EUの「人工知能法」(EU AI Act)が8月2日に正式に発効した。新規則では、AIシステムと対話する、またはAIによって生成・編集されたすべてのメディアコンテンツにラベルを表示することを義務付けており、違反した場合は最大1500万ユーロ、または世界年間売上高の3%の罰金が科される。業界のアナリストは、いたるところに存在するAIラベルが、GDPRのCookieポップアップのように、一般の人々に「開示疲労」や視覚的な無関心を引き起こすのではないかと懸念している(情報源:WIRED

EUの「人工知能法」が正式発効、「開示疲労」への懸念が高まる

🧰 ツール

DwarfStar:DeepSeek V4向けに最適化されたC语言ローカル推論エンジン : 開発者のantirezは、DeepSeek V4 Flash向けに高度に最適化されたC言語ローカル推論エンジンDwarfStarをオープンソース化した。このエンジンは完全に自己完結しており、Metal、CUDA、ROCmバックエンドをサポートしている。また、SSDエキスパートストリーミングモードを特別に設計しており、メモリが不足しているコンシューマー向けデバイス(96GBのMacなど)でも、許容可能な速度で大規模パラメータのMoEモデルを実行できる(情報源:GitHub

DwarfStar:DeepSeek V4向けに最適化されたC语言ローカル推論エンジン

Xberg v1:レイアウトを認識するRust製コンテンツインテリジェント抽出フレームワーク : 開発者は、高効率なコンテンツインテリジェント抽出フレームワークXberg v1(旧名Kreuzberg)をオープンソース化した。このフレームワークは純Rustで記述されており、101種類のドキュメント形式と367種類のコード形式のディープパースをサポートしている。ONNXベースのレイアウト検出とDoclingスタイルの読み取り順序再構築を導入しており、ネイティブPDFの抽出品質と表の復元度において、doclingやmineruなどの同種ツールを大幅に凌駕している(情報源:Reddit

Xberg v1:レイアウトを認識するRust製コンテンツインテリジェント抽出フレームワーク

mem-port:AIコラボレーションにおけるコンテキストの乖離を解消するローカルメモリサーバー : 開発者は、ローカルMCPメモリサーバーmem-portをオープンソース化した。このツールは、組み込みのSurrealDBを使用してグラフとベクトルストレージを実現しており、複雑な外部データベースを設定する必要がない。mem-portは、ChatGPT、Claude Code、Cursorなどの複数のAIプログラミングツールに対して統一された共有長期記憶を提供し、アーキテクチャの選択や過去の試行を記録することで、複数のツールを切り替える際のコンテキスト喪失問題を効果的に解決する(情報源:Reddit

📚 学習

NVIDIA Transformer Engine FP8自動混合精度トレーニングチュートリアル : 本チュートリアルでは、NVIDIA Transformer Engineを使用してTransformerモデルのトレーニングプロセスを加速する方法を詳しく説明する。内容は、te.Linearなどの融合カーネルの使用、FP8自動混合精度に基づくAutocastの設定、および遅延スケーリング(Delayed Scaling)とamax履歴を通じて低精度テンソル計算を安定させる方法をカバーしており、PyTorchネイティブ実装との比較ベンチマークも提供している(情報源:MarkTechPost

TimesFM 2.5に基づくエンドツーエンドの時系列予測とバックテストの実践 : 本チュートリアルでは、Googleのオープンソースモデルgoogle/timesfm-2.5-200m-pytorchに基づくエンドツーエンドの時系列予測ワークフローを紹介する。チュートリアルは、ゼロショット確率予測、ローリングオリジン(rolling origin)バックテスト、予測区間に基づく異常検出、およびXRegモジュールを介して価格やプロモーションなどの数値・カテゴリ共変量をTimesFMモデルに統合し、小売などのシナリオに高精度な予測を提供する方法をカバーしている(情報源:MarkTechPost

💼 ビジネス

CuspAI、シリーズBで4億5000万ドルを調達、評価額は26億ドルに : 英国のAI材料設計企業CuspAIは、シリーズBラウンドで4億5000万ドルの資金調達を完了し、評価額が26億ドルに急騰したことを発表した。このラウンドはKleiner PerkinsとNEAが主導し、ジェフ・ベゾス氏傘下のファンドも参画した。CuspAIは、目標とする性能に基づいて材料構造を逆方向に生成する「逆設計」アプローチを特徴としており、すでにNVIDIAや現代自動車などと共同でAI材料ワークショップを設立し、半導体、バッテリー、炭素回収材料の研究開発の加速を目指している(情報源:36氪

CuspAI、シリーズBで4億5000万ドルを調達、評価額は26億ドルに

SGLangチームのRadixArk、1億ドル超の資金調達を実施しMilesフレームワークを発表 : オープンソース推論エンジンSGLangのコアチームによってインキュベートされたRadixArkは、1億ドルを超えるシードラウンドの資金調達を完了した。NVIDIA、AMD、およびPyTorchの生みの親らが投資に参画した。RadixArkはGPUの限界を引き出すことを目指しており、オープンソースのポストトレーニング(事後学習)フレームワークMilesを発表した。このフレームワークは、強化学習における推論、評価、パラメータ更新をシステム層で深く協調させ、ポストトレーニングプロセスにおける計算資源の無駄を大幅に削減する(情報源:36氪

SGLangチームのRadixArk、1億ドル超の資金調達を実施しMilesフレームワークを発表

🌟 コミュニティ

AIによる数学難題の攻略が、数学界に「機械による人間代替」という精神的危機をもたらす : OpenAIのAstraがわずか2000ドルのコストで非sofic群などの10大数学難題を攻略したことを受け、数学界は複雑な感情に陥っている。一部の数学者は研究効率向上のために積極的にAIを取り入れているが、Kirwin Hampshire氏などの学者は、AIが機械で検証可能であるものの人間には直感的に理解しにくい証明を大量に生成することで、人間が未知を探索する精神的な喜びを奪っていると指摘し、数学界に深い「精神的危機」を引き起こしている(情報源:THE DECODER

Sam Altmanが提唱する「ChatGPT子育て」の提案がSNSで一斉に嘲笑される : OpenAIのCEOであるSam Altmanは、保護者がChatGPT Workを使用して家族のカレンダーや子供の興味から「通学用ポッドキャスト」を自動生成し、登校中の車内で流すことを提案する投稿を行った。この提案に対し、『グラビティフォールズ』のクリエイターであるAlex Hirsch氏が「なぜ直接子供と話さないのか?」と冷ややかに反論した。この返信は12万件以上の「いいね」を獲得し、テクノロジーが親子関係に過度に介入し、人間の本物の感情的なつながりを希薄にすることに対するコミュニティからの広範な非難を巻き起こした(情報源:TechCrunch

科学系インフルエンサーのHank Green、AI調査への過度な依存を公開謝罪し更新を一時停止 : 著名な科学系インフルエンサーであるHank Greenは、動画内でAI特有の不自然な接続詞を誤って使用したことから、視聴者にAIで台本を執筆しているのではないかと疑問視された。Greenはその後、Redditに長文の謝罪文を投稿し、高い生産性を追求するあまりAIへの「不健康な」依存が生じていたことを認め、これが個人創作の純粋性を薄めてしまったと述べた。彼はチャンネルの更新を一時停止または削減し、AIに依存しない独自のリサーチおよび執筆プロセスを再構築する予定である(情報源:TechCrunch

プラットフォーム各社が「AIスパム(Slop)」防御戦を開始、逆効果も発生 : 生成AIの普及に伴い、低品質なコンテンツが氾濫している。LinkedInは従来の通報システムとは独立した「AI Slop」ワンクリック通報ボタンを導入し、SnapchatはSpotlightショート動画推奨アルゴリズムにおいて、完全にAIで生成された動画を推奨しないことを発表した。同時に、AIが自動生成した低品質な脆弱性レポートがAppleのセキュリティメールボックスを埋め尽くしたため、20万ドルの価値がある本物のmacOS脆弱性が適時に報告できなくなるなど、AIスパム情報が防御エコシステムを破壊している現状が浮き彫りになった(情報源:THE DECODER

💡 その他

Autonomous Key、画面依存症に対抗するため9ドルの物理NFCアプリロックを発売 : ソフトウェアによるアプリ制限がユーザー自身によって簡単に回避されやすいという問題に対し、Autonomous Keyはわずか9ドルの物理NFCキーを発売した。ユーザーは制限されたアプリのロックを解除するために、このキーを物理的にスキャンする必要があり、1回の解除は60分間に限定される。キーを別の部屋に置くことで物理的なハードル(摩擦)を増やし、AIによる「辛口な」習慣分析と組み合わせることで、ユーザーがソーシャルメディア依存症に対抗するのを支援する(情報源:TechCrunch

Autonomous Key、画面依存症に対抗するため9ドルの物理NFCアプリロックを発売

裁判官、ミネソタ州の「ワンクリック脱衣」禁止令に対するxAIの差し止め請求を却下 : 同意のないAI「脱衣(nudify)」アプリに対するミネソタ州の禁止令が正式に発効した。xAIはこの禁止令が「過度な制限」であるとして訴訟を起こし、執行猶予(一時差し止め)を申請したが、連邦判事のDon Donovanは差し止め申請を却下した。判事は、xAIが法案署名から約3ヶ月後、かつ発効のわずか3日前に緊急提訴したことを指摘し、彼らが主張する「差し迫った損害」は論理的に成り立たないと述べた(情報源:TechCrunch

開発者、大規模モデルの軍拡競争を皮肉る16.5Tの虚無パラメータモデルVacuum 16Tをオープンソース化 : 大手クローズドソース研究所によるパラメータ数の盲目的な競い合いに対し、開発者がHugging Face上で16.5兆のパラメータを持つ空のモデルVacuum 16Tをオープンソース化した。このモデルは、safetensorsのヘッダーに大量のゼロ値テンソルを宣言することで、Hugging Faceのパラメータ数ランキングで首位を獲得したが、実際の転送時には重複排除により1MB未満の帯域幅しか消費しない。これにより、業界における「巨大パラメータ」への盲目的な崇拝を風刺している(情報源:Reddit

開発者、大規模モデルの軍拡競争を皮肉る16.5Tの虚无パラメータモデルVacuum 16Tをオープンソース化

コメントを残す

メールアドレスが公開されることはありません。 が付いている欄は必須項目です