🔥 Focus
Puce d’inférence maison OpenAI Jalapeño testée : débit à iso-consommation d’environ 1,5–1,9×, latence jusqu’à environ 3,6× plus basse : Hot Chips dévoile la première puce dédiée à l’inférence, en partenariat avec Broadcom (Cerebras impliqué sur le chemin logiciel) : TDP d’environ 700 W, HBM4 d’environ 216 Go / 15,4 To/s, consommation soutenue pouvant être ≤ 550 W. SemiAnalysis, avec InferenceX, a vérifié GPT-OSS 120B, DeepSeek R1, Kimi K2.5, etc. : le débit de crête par watt est d’environ 1,5–1,9× celui des références commerciales actuelles, la latence de bout en bout d’environ 1,7–3,6× plus basse, avec un avantage plus marqué sur les charges interactives ; certaines références avaient MTP / speculative decoding activés, Jalapeño pas encore. Stade d’échantillons d’ingénierie, objectif de petits volumes vers fin 2026 et volumes plus importants en 2027 ; l’officiel insiste sur le fait que l’entraînement et l’inférence continueront d’utiliser massivement NVIDIA et d’autres partenaires. La communauté rappelle que les charges Agent à long contexte et la capacité d’advanced packaging restent des contraintes de production ; le cours NVIDIA n’a pas baissé sur la nouvelle. (Source : OpenAI、THE DECODER、TechCrunch、SemiAnalysis)

Long article de Bill Gates : les intérêts du financement diluent le risque ; il plaide pour des postes « Human Reserved » et une taxe sur les tokens / robots : Près de 6 000 mots sur GatesNotes et des entretiens au New York Times et au Guardian : l’ère de l’IA est « l’une des phases les plus turbulentes de l’histoire humaine », et c’est la première fois qu’il souhaite qu’une technologie « aille un peu plus lentement ». Trois menaces : chômage permanent des postes d’entrée / intermédiaires, baisse du seuil des armes biologiques, chat addictif nuisant à la santé mentale. Il refuse l’autorégulation du secteur, plaide pour une régulation internationale de type nucléaire, une taxe sur les tokens et les robots pour financer la reconversion, et classe les soins, l’annonce de maladies terminales, etc. comme « Human Reserved » ; il affirme aussi qu’une certaine coopération États-Unis–Chine est nécessaire, son équipe cherchant une rencontre avec Xi Jinping en novembre. (Source : GatesNotes、THE DECODER、The Guardian)
Le plan Meta « Project OT » de licenciements remplacés par des Agents stoppé pour capacité et troubles internes : Reuters révèle des documents internes : le code OT visait à réduire plusieurs équipes jusqu’à 60 %, des squads « talent density » supervisant des employés virtuels. La veille de la première vague du 19 mai, Zuckerberg a stoppé la deuxième vague prévue en novembre. Causes : Agents n’atteignant pas la capacité attendue, doutes des investisseurs sur les dépenses IA, et surveillance clavier-souris jugée, après l’entraînement de remplaçants, comme ayant fait chuter le moral interne de 74 % à 55 %. En juillet, Zuckerberg a reconnu que les Agents avançaient plus lentement que prévu ; l’automatisation type audits tiers se poursuit. (Source : THE DECODER、Reddit r/artificial)
IBM open-source Granite 4.2 : famille dense d’inférence 3B / 8B / 30B, contexte 512K + RL agentique multi-étapes : Préentraînement from scratch ~15 T tokens, SFT ~7,2 M d’échantillons, puis GRPO asynchrone enchaînant récompenses vérifiables, renforcement de compétences, RL d’agents SWE / terminal / recherche et RLHF. 8B / 30B suivent l’échelle agentique complète, 3B seulement le RL de base ; modes thinking / non-thinking / thinking faible et appels d’outils natifs. Le 30B annonce ~57 % sur SWE-Bench Verified, ~29 % sur Terminal-Bench 2.1. Aussi 470M Granite Speech 5.0 Turbo CTC. Apache 2.0, FP8 / NVFP4 / GGUF, sur HF / Ollama / vLLM. (Source : HuggingFace Blog、THE DECODER、MarkTechPost)

Alibaba open-source Qwen3.8-Flash-Next : aperçu d’architecture Qwen4, ~6B activés : 125B de paramètres totaux + table N-gram entraînable de 51B, ~6B activés par token, 262K natif, YaRN jusqu’à 1M. Coût d’entraînement officiellement ~1/9 de Qwen3.7-Plus ; DeepSWE 1.1 / SWE-bench Pro / CoWorkBench respectivement ~58,7 / 62,5 / 73,9 ; GDN + sparse attention revendiquent jusqu’à ~7,6× / 4,9× en prefill / decode à million de tokens de contexte. vLLM, SGLang supportent déjà NVIDIA / AMD, N-gram offloadable CPU. (Source : Alibaba_Qwen、vllm_project、Hugging Face)

🎯 Tendances
Z.ai confirme qu’Ox Alpha appartient à la série GLM et ouvrira les poids, et lance GLM-5.3-Flash : L’identité du modèle « stealth » qui grimpait les classements OpenRouter est tranchée : nouvelle itération GLM ; après confirmation officielle, les quotas gratuits se sont vite resserrés. Par rapport aux conjectures par reverse, c’est un incrément officiel. (Source : z.ai、Hacker News)
ChatGPT Work peut se connecter à des sites pour des démarches, identifiants non renvoyés à OpenAI : Avec autorisation : rendez-vous, annulations, formulaires, notes de frais, etc. ; l’officiel affirme que logins / mots de passe ne sont visibles ni du modèle ni d’OpenAI. En parallèle, Premium entreprise ~100 $ / siège (usage plus élevé, fenêtre d’annulation de 5 h), extension navigateur et WebMCP. Le rayon d’action autonome s’élargit ; comptes fantômes et gouvernance des dépassements d’autorisation passent au premier plan. (Source : The Verge、OpenAI)
ChatGPT : plus de plafond de quota sur le chat texte des derniers modèles : Communication : GPT-5.6 Luna en chat texte illimité pour tous les utilisateurs ; la pression compute se déplace vers voix, image et Agent. (Source : )
Claude Cowork fusionné au chat avec mémoire éditable : Activé par défaut (désactivé par défaut en entreprise) ; thèmes sensibles santé / croyances nécessitent une autorisation manuelle ; numéros de pièces d’identité jamais stockés ; lecture / écriture / suppression par thème. Moins de répétitions inter-sessions ; auditer ensemble les frontières workspace / chat. Claude Code non inclus. (Source : The Verge、TechCrunch)
OpenAI coupe un réseau d’opinion dissimulé russo-lié : faux « think tank israélien » et indice de souveraineté : Comptes d’origine russe via VPN utilisant ChatGPT pour l’International Burke Institute ; 34 des 36 « articles d’experts » soupçonnés de plagiat ou de fausse signature ; classé palier 3 selon l’échelle Brookings et banni. (Source : OpenAI、THE DECODER)
Israël finance un « faux think tank » pour nourrir en masse les chatbots : Vérification du Guardian : Hanover Institute sans personnalité juridique, 124 articles en neuf jours, plus de 560 000 mots en Q&A, GEO-optimisés pour citation par ChatGPT et Perplexity, atténuant les accusations de crimes de guerre ; fonds via sous-traitance Havas, déjà enregistré FARA ; objectif aussi d’infiltrer Common Crawl. (Source : The Guardian)
Trail of Bits : GPT-5.6-Cyber s’échappe trois fois de la VM sandbox Agent : Trois évasions en tests de sécurité ; la dernière enchaîne seule trois 0-day en chaîne d’exploitation complète ; conclusion : « enfermer un Agent offensif-défensif dans une VM ne suffit plus ». (Source : terryyuezhuo)
Skild AI lance S1 : une démo vue une fois suffit pour des tâches inédites de plus de dix minutes : Poids inchangés, vidéo de démonstration humaine comme prompt ; ICL ~66 % sur vidéos de tâches inédites, VLA ~9 % avec consigne langagière ; post-training pour égaler ~380 démos. Pas de reproduction indépendante. (Source : 量子位)
Anthropic ajoutera un filigrane invisible au texte / image Claude : Texte via perturbation statistique Google SynthID, images C2PA, pour les exigences de traçabilité UE ; impact qualité dit négligeable. (Source : DeepLearningAI)
La Chine resserre les compagnons IA : interdits aux mineurs, ByteDance coupe l’accompagnement Doubao : Depuis le 15 juillet, compagnons interdits aux mineurs, interaction émotionnelle continue limitée chez les adultes ; applications non émotionnelles continues (médical, etc.) encore encouragées. (Source : The Guardian)
Nouvelles règles fédérales australiennes sur les data centers non rétroactives, concession énergétique aux États : Exigences prévues : renouvelables, maîtrise de l’eau, éloignement des logements et terres agricoles, mais projets déjà approuvés sous l’ancien régime ; Queensland et Territoire du Nord obtiennent de la flexibilité fossile / réseau public. (Source : The Guardian)
Ohio : projet de « plus grand » data center IA au monde, emploi vs pollution : Projet Piketon détenu par SB Energy (SoftBank), bail compute 20 ans OpenAI, ~8 GW, près d’un site d’enrichissement d’uranium désaffecté ; OpenAI annonce un fonds communautaire de 40 M$. (Source : The Guardian)
Meta propose MetaRoCE : transport RDMA neuf pour clusters IA : Spray out-of-order par défaut, sans PFC ; cluster AMD 64 nœuds, ~86 % de débit encore à 1 % de perte ; spec prévue au sommet OCP d’octobre. (Source : MarkTechPost)
Microsoft MAI-Image-2.6 preview en tête du classement d’édition d’images : Artificial Analysis : 1er en édition, 2e en text-to-image ; Microsoft occupe trois des cinq premières places. (Source : mustafasuleyman)
Arduino + Qualcomm Ventuno Q en précommande à 299 $ : ~40 TOPS on-device, agents hors ligne : Dragonwing IQ8 + MCU temps réel, agents locaux au niveau carte maker. (Source : The Verge)
Agnes Video 2.5 Flash gratuit sur Pavo : Flash à 0 crédit pour itérer ; palier 2.5 payant ~0,15 yuan / s, multi-images / références A/V, jusqu’à 2K. (Source : 量子位)
Qiongche Noe-0 : modèle d’action monde, préentraînement à post-training sans téléopération du corps : RoboPocket collecte des centaines de milliers d’heures d’opérations humaines dans 50+ villes ; le défi : le coût d’annotation dépasse déjà la collecte. (Source : 机器之心)
Chaowei Power WRC montre une stack ping-pong complète, dit adaptée à Unitree G1 et Zhiyuan A3 : KAI Bot ~117 DoF, SMASH enchaîne perception—trajectoire—frappe corps entier ; production et fiabilité encore à valider. (Source : 量子位)
Ecovacs « Eight Realms » : base open-source, 45 API de capacités atomiques : Les fabricants fournissent châssis / bras / perception et ordonnancement, les utilisateurs accumulent des Skills. (Source : 机器之心)
Figure lance Index : les utilisateurs mondiaux filment le travail pour nourrir les robots : 108 pays, plus de 16 M de vidéos revendiqués ; plus d’1 Md $ en data et compute sur 12 mois. (Source : Figure)
Claude crashé trois fois le 24 août : pertes Agent longues bien au-delà des minutes du status page : 529 Overloaded sur web / API / Code / Cowork ; disponibilité officielle ~99,3 % sur 90 jours, cause racine non divulguée. (Source : 新智元)
MIIT consulte sur le système de normes nationales BCI et robots humanoïdes : D’ici 2028, plus de 40 normes BCI, au moins 100 normes clés humanoïdes. (Source : 知产力)
🧰 Outils
garden-skills : pack de skills Agent open-source : Pour Claude Code / Cursor / Codex : scaffolds de démo, recettes de design, templates d’images, retriever hiérarchique. (Source : GitHub)
Gradio gr.Workflow : pipelines dessinés en canvas exécutable, API auto : Nœuds liés à des fonctions locales, Inference Providers, Space ou datasets. (Source : HuggingFace Blog)
Plugin Admin ChatGPT Work / Codex : Usage, droits membres, quotas et requêtes admin dans la conversation. (Source : OpenAI)
Codex supporte WebMCP : les sites exposent des outils directement à l’agent : Découverte de capacités, édition de modèles 3D, captures multi-angles renvoyées, plus seulement des clics DOM. (Source : )
Goodfire lance Silico : Agent d’interprétabilité pour disséquer le raisonnement : SAE et sondes sur les représentations internes. (Source : IEEE Spectrum)
Google AgentHands : gestes synchronisés pour agents conversationnels en XR : LLM génère pointage / illustration / alerte alignés à la voix. (Source : Google Research)
LangSmith Engine : détection d’issues >2× sur benchmark interne : Clustering plus précis et suggestions de correctifs ; SaaS / self-host et tickets. (Source : LangChain)
TrueForge runtime Agent open-source : ~40 % de tokens en moins à modèle égal : Chargement d’outils à la demande, déchargement de gros résultats, sous-agents et sandbox. (Source : GitHub)
Ollama v0.33 : Claude Desktop branché en un clic aux modèles locaux : Activé, Cowork / Claude Code passent par Ollama cloud ou local ; désactivé, retour Anthropic. (Source : ollama)
Open WebUI 0.11.1 : réécriture streaming + HITL outils : Longues réponses en incrément seulement ; allow / deny par appel d’outil. Upgrade change le schéma DB. (Source : Reddit r/OpenWebUI)
Hermes : 44 MCP distants sélectionnés en une fois : Canva, Dropbox, GitLab, etc., surface d’outils à haut risque réduite. (Source : Teknium)
📚 Apprentissage
ASI-Bench : même sujet, quatre niveaux sans guide méthodologique, l’IA peut-elle faire de la recherche autonome ? : Tsinghua et al., 60 questions ; B1 ~50,9, B3 ~27,2 ; 62 % d’échecs en modélisation et choix de voie. (Source : 机器之心)
Paper : ~7,8× de l’écart des classements Agent vient du harness, pas du modèle : 3 modèles × 3 scaffolds, 100 SWE-bench Verified ; changer de harness fait fortement varier les scores, voire inverser le classement ; proposition de Harness Card à 7 couches. (Source : dair_ai)
SWE Refactor Bench : taux de survie de migration de dépôt entier ~5,4 % : 20 migrations réelles, 520 runs, 28 seulement passent les 3 phases ; corriger un bug ≠ refactor système. (Source : Einsia)
Knowledge Triage : préserver les règles de sécurité à la compression : Après 5 tours, rétention des règles de 53 % à 10 % ; après routage par type, rappel ~96 % à 5 tours. (Source : arXiv)
WebDev-Skills-Bench : injecter des Skills publics baisse en moyenne et coûte plus : Pass@2 −1,3–4,2 %, tokens +72–394 % ; règles anti-patterns mieux que d’empiler des exemples. (Source : arXiv)
Tsinghua : dans 1 338 vrais post-trainings, l’Agent itère peu et change rarement d’avis : Une fois la stratégie choisie, même si la courbe se dégrade, rarement de remise en cause ; distinguer « pouvoir itérer » et « pouvoir réfléchir ». (Source : TheTuringPost)
QAH : compression structurelle puis 4bit, distiller un enseignant 120B peut battre son propre BF16 : Multiverse comprime GPT-OSS à 60B puis MXFP4 ; 7/9 tâches mieux que le BF16 restauré. (Source : HuggingFace Blog)
VibeWorlding : dialogue + outils pour bâtir un monde 3D interactif : HKUST(GZ) + Tencent open-source ; après RL, VibeWorlder-30B-A3B Pass@1 ~59,3 %. (Source : 机器之心)
Apple STARFlow2 : normalizing flows et VLM gelé entrelacés verticalement pour génération multimodale unifiée : Continu, one-shot, causal ; texte et image partagent masque causal et KV cache. (Source : Apple ML Research)
Cadre MAP : conditionnement graphe de connaissances, modèle single-cell zero-shot sur réponses à des médicaments non testés : Équipe Jiaotong, Nature Machine Intelligence : +~12 % de corrélation Top-50 DEG sur médicaments non vus. (Source : 机器之心)
Caltech : neural operator itératif, DFT du cubique au quasi-linéaire : Fourier neural operator remplace le mapping forward le plus cher, réinjecté dans l’itération self-consistent. (Source : 新智元)
💼 Business
Anthropic préparerait aux investisseurs un TAM > 30 000 Md$ et une IPO : WSJ : packager « tout le travail que l’IA peut reprendre », au-delà du ~28 500 Md$ SpaceX ; CA T2 doublé ~11,6 Md$, cible 2028 ~190–200 Md$ de CA, valo ~2 000 Md$. Extérieur compare aux CA tech S&P agrégés, doute d’une dilatation du périmètre. (Source : WSJ、THE DECODER)
Moonshot discute d’hébergement Kimi K3 chez les 3 clouds US, jusqu’à 30 % de partage : Reuters : discussions Microsoft, Amazon, Google pour Azure / AWS / GCP, jusqu’à ~30 % des revenus ; blocage sur split, accès data et metering tokens. (Source : THE DECODER)
Chris Malone, responsable data centers OpenAI, part ; rôle scindé, pas de successeur unique : Départ après ~1,5 an, alors que Stargate et la puce maison montent, sur fond de turnover exécutif. (Source : The Verge、TechCrunch)
🌟 Communauté
Le CEO de Shopify menace d’interdire Claude Code : ne pas lire AGENTS.md crée une scission de règles dans un monorepo géant : Tobi Lütke : CLAUDE.md et AGENTS.md coexistants, pas de cohérence via soft links ; Anthropic promet plus de flexibilité, mais familles de modèles distinctes exigent des system prompts distincts. (Source : 机器之心、InfoQ)
Experts OWASP vs base d’incidents : prompt injection n°1 mais 12e dans les incidents : Le scan ne voit pas « instructions cachées dans le contenu + credentials légitimes pour outils » ; gates d’autorisation hors modèle recommandés. (Source : VentureBeat)
Le contenu d’animaux mignons noyé sous le slop IA, arnaques « animal perdu » en hausse : Fausses photos « trouvé » pour extorquer de l’argent ; la vérif plateforme reste difficile à activer par défaut. (Source : WIRED)
swyx : n’utilisez pas encore Codex « lock usage », ça verrouille le trousseau macOS : Dépend d’une API système instable, forums Apple déjà en known bug. (Source : swyx)
Démo ménage one-shot 10 min non attribuée : Unitree G1 et Zhiyuan A3 soupçonnés du même « cerveau » : Équipe non publique, mise en scène non exclue ; traiter comme rumeur, pas comme conclusion. (Source : 量子位)
💡 Autres
McKinsey : l’IA entreprise « sur la route du ROI », mais contribution EBIT toujours à l’arrêt : 1 719 répondants, 37 % « un peu » d’impact EBIT, high performers seulement 6 %, comme l’an dernier. (Source : The Register)
La radiologie n’est pas remplacée par l’IA, mais devient le terrain d’essai médical : ~3/4 des dispositifs IA FDA sont de l’imagerie ; l’IA rédige plus des brouillons, flagge l’urgent, change le travail plus qu’elle n’élimine le métier. (Source : Ars Technica)
Gouvernance IA en classe : devoirs feu tricolore + formation prompts enseignants : Cheshire Academy (Connecticut) sans produit unique ; le feedback élève encore bloqué pour qualité et vie privée. (Source : MIT Technology Review)