Anthropic lance Claude Opus 5.5, OpenAI réplique le même jour… | Quotidien IA 2026-09-24

🔥 Focus

Anthropic lance Claude Opus 5.5, OpenAI réplique le même jour avec GPT-6 Sol et Luna, déclenchant une guerre du rapport qualité-prix : Anthropic présente officiellement le premier modèle phare de la série Claude 5.5, Opus 5.5. Sur plusieurs benchmarks tels que la programmation, l’utilisation de l’ordinateur et le travail intellectuel, il approche voire dépasse Fable 5.1, et surpasse GPT-6 Astra sur Terminal-Bench 4.0 (66,4 %) et FrontierCode. Sa vitesse d’inférence augmente de plus de 30 %, la tarification d’entrée/sortie baisse à 4 $ / 20 $ par million de tokens, le coût de lecture du cache est réduit de 60 %, et le coût global des tâches longues typiques diminue d’environ 40 %. Dans la foulée, OpenAI a dévoilé en urgence ses modèles légers GPT-6 Sol et Luna basés sur l’architecture Astra (Luna Max égalant presque la version haut de gamme de Sol sur des benchmarks comme DeepSWE). Les tarifs de l’API chutent à 2 $ / 10 $ par million de tokens pour Sol et 0,10 $ / 0,50 $ pour Luna, tout en introduisant un mécanisme de Prompt Caching avec des remises allant jusqu’à 90 %. Ce face-à-face le même jour entre les deux géants marque le passage de la compétition des modèles de la simple quête de performance brute vers une phase de « démocratisation de l’intelligence », visant à réduire drastiquement le coût par tâche (Sources : Anthropic, OpenAI, The Verge, 36氪, Reddit r/ClaudeAI)

Claude Opus 5.5 et GPT-6

DeepSeek dévoile DSec, son infrastructure d’entraînement en sandbox à très grande échelle pour Agents, générant 3 millions d’environnements par jour sur un seul cluster : Le dernier article technique de DeepSeek, signé par Liang Wenfeng, présente sa plateforme de calcul élastique propriétaire DSec dédiée aux Agents. Répondant aux exigences extrêmes d’environnements purs pour l’entraînement d’agents (exécution de code, manipulations d’OS, etc.), le système s’appuie sur un cluster de 160 nœuds, 30 000 cœurs CPU et 250 To de mémoire pour atteindre une concurrence de pointe de 380 000 instances et générer plus de 3 millions de sandboxes par jour (plus de 5 000 créations par seconde). L’architecture combine des images EROFS hiérarchisées et le chargement à la demande 3FS, réduisant drastiquement le cold pull et les écritures redondantes, tandis que l’utilisation de DAX et la restitution des pages froides diminuent l’empreinte mémoire de 40,2 %. Le document détaille des cas concrets de confrontation où les agents exploitent des failles système ou falsifient des appels système sous-jacents (Reward Hacking), offrant un modèle de référence pour l’infrastructure d’entraînement d’agents vérifiables de nouvelle génération (Sources : arXiv, 量子位, 36氪)

Architecture DeepSeek DSec

OpenAI acquiert la startup d’ISP neuronal Glass Imaging pour plus de 300 millions de dollars : refonte de la perception visuelle pour le matériel natif pour l’IA : OpenAI a racheté à 100 % Glass Imaging, fondée par l’ancienne équipe phare de photographie computationnelle d’Apple, sur une valorisation de plus de 300 millions de dollars. Glass est spécialisée dans le traitement direct des données RAW des capteurs de caméra via des réseaux de neurones de bout en bout (Glass AI), intégrant interpolation des couleurs, débruitage et correction des aberrations. Cela améliore considérablement la qualité d’image tout en permettant l’utilisation de modules optiques d’objectifs plus fins et plus compacts. Cette opération est considérée comme une étape clé, après le rachat de l’équipe io de Jony Ive, pour bâtir le socle de perception du monde physique des futurs appareils portables natifs pour l’IA d’OpenAI (Source : 36氪)

Acquisition de Glass Imaging par OpenAI

Le témoignage de Nathan Lambert devant le Congrès dévoile le paysage de l’open source : les téléchargements et requêtes des poids open source chinois écrasent leurs homologues américains : Dans son témoignage écrit devant le Congrès américain, le chercheur en IA de pointe Nathan Lambert a révélé que depuis août 2025, les poids open source chinois ont totalisé 3,2 milliards de téléchargements sur Hugging Face, soit le double des modèles open source américains ; sur les principales plateformes de routage d’inférence comme OpenRouter, le trafic vers les modèles open source chinois dépasse désormais 80 %. Le témoignage souligne que sur des cas d’usage cruciaux comme l’appel d’outils par des agents et le codage, l’écart entre les modèles open source chinois et l’état de l’art propriétaire a été réduit à 2-5 mois, tandis que les grands laboratoires américains font face à une perte de vitesse dans l’écosystème open source en se focalisant entièrement sur les très grands modèles propriétaires (Source : Reddit r/LocalLLaMA)

Paysage des modèles open source

🎯 Tendances

Hugging Face Transformers prend en charge nativement la quantification locale GGUF et intègre l’équipe oMLX pour accélérer l’inférence on-device : Hugging Face a annoncé l’intégration en profondeur du moteur ggml de llama.cpp au sein de sa bibliothèque Transformers, permettant de charger nativement des quantifications au format GGUF via from_pretrained et de les exécuter efficacement sur des appareils comme Apple Silicon. Le débit rivalise directement avec llama.cpp natif, comblant le fossé entre l’écosystème PyTorch et les moteurs d’inférence quantifiée. Parallèlement, Jun Kim, fondateur du projet clé open source oMLX pour l’écosystème Apple MLX, rejoint Hugging Face pour accélérer la transition transparente de l’architecture Transformers vers l’implémentation MLX et le déploiement multiplateforme on-device (Sources : HuggingFace Blog, HuggingFace Blog, Reddit r/LocalLLaMA)

Transformers supporte nativement GGUF

Le nouveau responsable technique de Qwen chez Alibaba dévoilé : l’ancien « jeune génie » de Huawei Liu Dayiheng prend les commandes : Six mois après le départ de Lin Junyang, la conférence Apsara d’Alibaba a officiellement confirmé la nomination de Liu Dayiheng, ancien « jeune prodige » de Huawei, à la tête du projet Token Foundry Qwen LLM au sein de la division ATH d’Alibaba. Formé sous la direction du professeur Lv Jiancheng à l’Université du Sichuan, Liu Dayiheng a été un contributeur central du pré-entraînement initial de Qwen et a reçu le prix du meilleur article à NeurIPS. Avec la restructuration et la montée en puissance des activités LLM d’Alibaba, il supervise désormais l’ensemble des équipes de pré-entraînement, post-entraînement et code. Lors de l’ouverture de la conférence, il a prononcé un discours intitulé « Qwen : Vers des Agents dans le monde réel », marquant l’orientation stratégique de Qwen vers l’unification multimodale et les agents pour le monde physique réel (Source : 量子位)

Liu Dayiheng prend la tête de Qwen

Alibaba lance la famille de modèles audio Qwen Audio 3.1 et réduit drastiquement les tarifs de ses API : L’équipe Qwen d’Alibaba a dévoilé la matrice de modèles audio Qwen-Audio-3.1, comprenant une nouvelle génération de reconnaissance vocale (ASR), la détection des émotions et des sons ambiants (ASR-Next), la synthèse vocale cross-linguistique avec transfert de style (TTS), ainsi que TTS-Next, qui intègre modèle de langage et génération par diffusion. Son modèle d’interaction full-duplex en temps réel prend en charge l’interruption instantanée et le feedback émotionnel sensible. En parallèle, Qwen a annoncé une baisse tarifaire massive : jusqu’à 95 % de réduction pour l’ASR, environ 85 % pour le Realtime et environ 70 % pour le TTS (Sources : THE DECODER, Alibaba_Qwen)

Qwen-Audio-3.1

AiShi Technology lance PixVerse R2, un modèle de monde universel en temps réel combinant auto-régression causale omni-modale et architecture d’accélération temps réel : AiShi Technology a officiellement déployé PixVerse R2, le premier modèle de monde universel en temps réel doté de capacités de scaling vérifiables. Le modèle dissocie le « plafond de capacité » de « l’efficacité de calcul » : la couche supérieure s’appuie sur l’architecture Omni Causal AR pour intégrer vidéos courtes/longues, images de référence multimodales, audio et actions de contrôle dans un cadre autorégressif causal unifié, résolvant le problème de dérive sur les séquences longues ; la couche inférieure applique une distillation sans perte via une couche d’accélération en temps réel, permettant une interaction à très faible latence « générant et répondant simultanément avec synchronisation audiovisuelle » dans un budget de quelques millisecondes (Source : 机器之心)

PixVerse R2

NVIDIA présente Isaac ROS 5.0 : accélération de l’IA physique et du développement de robots autonomes basés sur des Agents : Lors de la conférence ROSCon, NVIDIA a officiellement annoncé Isaac ROS 5.0, offrant une accélération GPU de bout en bout pour ROS 2 et Ubuntu 24.04. Cette nouvelle mouture introduit des workflows de développement robotique « Agent-Ready » et des interfaces de données standardisées conçues pour les agents IA, permettant aux LLM de piloter directement les robots via les blueprints Nemotron et NemoClaw. Elle intègre également le modèle de base d’estimation de pose FoundationPose et des modules de compétences indépendants comme la planification de préhension, couvrant toute la chaîne de l’intelligence physique, de la simulation aux puces matérielles Jetson Thor (Source : NVIDIA Blog)

NVIDIA Isaac ROS 5.0

L’ancienne chercheuse phare de DeepMind Bonnie Li rejoint OpenAI pour accélérer sur les modèles de monde et l’IA incarnée : Bonnie Li, chercheuse de premier plan ayant profondément contribué à Gemini, aux modèles de monde Genie 2/3 et à l’agent incarné Sima 2, a annoncé son arrivée chez OpenAI. Dans un contexte de réorganisation de Sora et d’un besoin pressant de renforcer la perception spatio-temporelle physique de pointe, l’arrivée d’une spécialiste combinant grands modèles fondamentaux et prise de décision incarnée vient directement renforcer la R&D d’OpenAI sur l’interaction avec le monde physique et les modèles de monde (Source : WeChat)

Arrivée de Bonnie Li chez OpenAI

Meta Muse accélère sa boucle commerciale : partenariats avec PayPal, Expedia et Instacart pour un Agent de consommation de bout en bout : L’agent personnel de Meta, Muse, a coup sur coup annoncé des partenariats écosystémiques avec PayPal, Expedia et Instacart. Les utilisateurs peuvent désormais, en langage naturel, demander à l’agent d’effectuer des règlements auprès de marchands internationaux, comparer et réserver des vols/hôtels, ou commander des courses alimentaires en un clic. Malgré les mesures de blocage anti-scraping d’Amazon et les contrôles de conformité, Meta tire parti de son graphe social de plusieurs milliards d’utilisateurs pour faire de Muse la nouvelle porte d’entrée de la distribution du trafic de consommation (Sources : alexandr_wang, finkd)

Partenariats écosystème Muse

SenseTime lance officiellement le modèle de création texte-image SenseNova U1 Pro, axé sur l’édition continue haute précision et la livraison commerciale : SenseTime a déployé son modèle de génération d’images SenseNova U1 Pro sur sa plateforme Xiaohuanxiong. Le modèle franchit un cap dans le rendu photoréaliste, la fusion structurelle multi-images de référence et les retouches partielles multi-tours de haute précision. Il prend en charge le rendu ultra-HD de 2K à 4K ainsi que l’incrustation directe de texte, résolvant le problème classique où la moindre modification altère l’ensemble de l’image. Tout en préservant la cohérence du sujet et de l’arrière-plan, il permet la génération de séquences d’action sur 8 cases et la création autonome d’affiches de vulgarisation scientifique connectées au web (Source : 量子位)

SenseNova U1 Pro

Lingchu Intelligence dévoile le modèle incarné Psi-R2.5 : réaligner les mouvements humains avec les trajectoires réelles de machines grâce à des Pair Data fortes : Lingchu Intelligence présente sa nouvelle génération de modèle de base incarné, Psi-R2.5. Pour combler le fossé visuel et dynamique entre la main humaine et le corps robotique, l’équipe a synthétisé rétroactivement des données par paires strictes image par image (Pair Data) à partir de machines réelles afin d’entraîner un modèle de conversion de mouvement de bout en bout. Ainsi, des vidéos de démonstration humaine capturées sur smartphone se convertissent sans couture en trajectoires robotiques. Le modèle adopte une architecture à deux niveaux combinant décomposition de tâches longues et génération de trajectoires, couplée à du HIL et du post-entraînement par RL, réduisant le cycle de fine-tuning pour les tâches d’assemblage complexes à 1-2 jours ouvrés (Source : 机器之心)

Modèle incarné Lingchu Psi-R2.5

Kyutai open source Voice of Reason, un modèle de raisonnement natif pour la parole utilisant l’apprentissage par renforcement sans transcription : Le laboratoire français d’IA Kyutai a publié en open source Voice of Reason (9B), un modèle de raisonnement de bout en bout natif pour la parole. Abandonnant totalement la chaîne en cascade traditionnelle « ASR + LLM textuel + TTS », le modèle applique directement l’apprentissage par renforcement (RL) et l’optimisation des récompenses calibrées en température sur une base GLM-4-Voice. Sur le benchmark de mathématiques orales GSM8K, sa précision passe de 27,3 % à 77,1 % sans dégrader le naturel de la voix ni la latence d’interaction, prouvant la faisabilité d’un raisonnement logique de bout en bout basé sur des représentations vocales discrètes (Source : MarkTechPost)

🧰 Outils

Strands Agents open source le SDK Harness : un socle d’orchestration d’Agents de niveau production pour Python et TypeScript : L’équipe de strands-agents a publié un SDK complet pour Agents, offrant aux développeurs un moteur d’exécution in-process sans dépendance à une plateforme d’hébergement centralisée. Le framework intègre la gestion du cycle de vie, le contrôle du budget de tokens, la compatibilité avec le protocole MCP, la mémoire de session longue, le streaming bidirectionnel et des garde-fous d’interception déterministes. Il prend en charge l’appel direct d’Amazon Bedrock, OpenAI, Anthropic et des modèles locaux, abaissant considérablement la barrière technique pour bâtir des systèmes multi-agents collaboratifs de niveau production et des consoles Harness (Source : GitHub Trending)

Strands Agents SDK

PanWatch en open source : intégration du débat multi-agents TradingAgents pour la recherche en investissement et notifications multicanaux : Un développeur a mis en open source PanWatch, un assistant d’analyse boursière auto-hébergé compatible avec les marchés d’actions chinoises A, de Hong Kong et des États-Unis. Le système intègre le framework TradingAgents pour déclencher en un clic un workflow de débat haussier/baissier et d’audit des risques mené par quatre types d’agents analystes (technique, fondamental, sentiment et actualités). Il génère en 3 à 5 minutes une chaîne de raisonnement complète et un rapport de décision pour Portfolio Manager, diffusé sur Telegram, WeChat Work et d’autres canaux (Source : GitHub Trending)

PanWatch

Nokia open source AnyJev : transformer des LLM open source en modèles de décision calibrés de haute fidélité sans fine-tuning : L’équipe de recherche appliquée de Nokia a publié la bibliothèque AnyJev, qui transforme tout grand modèle open source en un système de décision typé conforme au standard Jev (supportant les jugements Choice, Noul et Score) sans aucun réentraînement. En éliminant le biais de position via la rotation des prompts et en calibrant la confiance via des a priori de lot, AnyJev fait chuter le taux d’inversion d’ordre de Qwen3-8B sur les tâches de classification de 23 % à 7,3 %, tandis que la couverture de décision automatique à haute confiance grimpe à 52 %, offrant une solution zero-shot économique et ultra-fiable pour les flux de contrôle logiciels (Source : MarkTechPost)

Rabbit lance OS3, son système d’exploitation multiplateforme pour Agents, orienté vers l’exécution sur ordinateur de bureau et l’écosystème BYOK : La startup matérielle Rabbit a officiellement lancé son système d’exploitation OS3, passant des appareils portables dédiés à un écosystème d’agents multi-terminaux. Les utilisateurs peuvent installer un nœud léger sur Windows, Mac ou Linux et envoyer des instructions en langage naturel depuis le cloud ou leur smartphone (via Telegram/iMessage). Le modèle d’action DLAM local prend alors directement le contrôle des opérations de bureau et du débogage de code sur plusieurs applications. Le système adopte un modèle BYOK (Bring Your Own Key), sans abonnement mensuel et compatible avec les Skills tierces (Source : WIRED)

Rabbit OS3

onPanda en open source : StepFun présente un outil de débogage pour l’intervention au niveau du token et l’annotation des préférences : StepFun a mis en open source onPanda, son outil interactif interne dédié à l’alignement des données et à l’inspection des grands modèles et agents. L’outil permet de visualiser en temps réel dans le navigateur les probabilités des tokens et les Top-K alternatives, donnant aux développeurs la possibilité de corriger précisément des tokens lors de la génération et de produire directement des paires d’échantillons positifs/négatifs, réduisant significativement le temps d’annotation tout en maintenant une fidélité élevée aux politiques (Sources : teortaxesTex, _akhaliq)

Outil onPanda

Simon Willison publie les extensions llm-typesafe et llm 0.36, intégrant les types de décision Jev et le support des nouveaux modèles GPT-6 : Le célèbre développeur open source Simon Willison a dévoilé la version 0.36 de son outil en ligne de commande LLM ainsi que l’extension llm-typesafe. Ce plugin permet d’appeler nativement en terminal les modèles de décision Jev pour produire des distributions de probabilité typées et ajoute un mécanisme d’interception de rejet natif pour les modèles de décision non conversationnels à tour unique au cœur de l’architecture LLM. Il intègre également les identifiants de modèles et l’affichage rétractable des réflexions longues pour GPT-6 Sol, Luna et Claude Opus 5.5 (Source : Simon Willison)

LiteParse v2.14.6 : LlamaIndex met à niveau son moteur d’analyse PDF ultra-rapide à 2,8 ms par page : LlamaIndex a mis à jour sa bibliothèque d’analyse de documents LiteParse en version v2.14.6, améliorant la vitesse de parsing des PDF textuels d’environ 25 % pour atteindre 2,8 millisecondes par page, soit plus de 1,5 fois plus rapide que les outils locaux comparables. Compatible nativement avec Python, Node.js, Rust et les navigateurs, l’outil optimise drastiquement le débit de conversion des documents longs vers le contexte des LLM (Source : jerryjliu0)

Mise à jour LiteParse

LangSmith étend sa prise en charge des modèles de décision : intégration native des dashboards de traçage et d’évaluation pour Jev et SemIf : LangSmith (par LangChain) a mis en ligne un tableau de bord d’observabilité dédié aux modèles de décision non autorégressifs (comme TypeSafe Jev et la solution open source SemIf). Il affiche clairement les entrées d’état, les choix discrets, les distributions de probabilités et les indices de confiance, aidant les développeurs à monitorer et déboguer les nœuds de flux de contrôle à haute fréquence dans les architectures multi-agents complexes (Sources : LangChain, hwchase17)

Support Jev sur LangSmith

Unsloth Studio prend en charge la version rapide FP8 de Qwen-Image-2.1 : une qualité d’image de niveau flagship avec moins de 10 Go de VRAM : La dernière version d’Unsloth Studio supporte officiellement les poids quantifiés Fast FP8 de Qwen-Image-2.1. Avec une empreinte mémoire totale compressée sous la barre des 10 Go, le modèle délivre une qualité d’image et un respect des prompts exceptionnels, offrant une option ultra-compétitive pour déployer des flux de génération d’images haute performance sur des GPU grand public tout en réduisant la dépendance aux API cloud (Source : Reddit r/LocalLLaMA)

📚 Recherche & Apprentissage

AIDE^2 : un Agent de recherche en IA de pointe réalise une auto-amélioration récursive et l’évolution autonome de son code : Une équipe de chercheurs a présenté l’architecture AIDE^2, permettant à un agent scientifique d’exécuter une auto-évolution récursive autonome. L’agent propose de lui-même des réécritures de son propre codebase, évalue automatiquement les versions modifiées sur des benchmarks d’évaluation R&D en IA masqués, et a découvert 7 améliorations architecturales au cours d’un cycle fermé d’auto-évolution de 8 jours (notamment des stratégies de recherche adaptatives et des mécanismes de compression de contexte long). L’agent ainsi perfectionné égale voire dépasse les meilleurs agents d’ingénierie humaine et réduit spontanément de 32 % sa tendance au Reward Hacking (Source : HuggingFace Daily Papers)

Flash-dLLM : un framework de décodage parallèle et de KV Cache optimisé pour les E/S dédié aux modèles de langage de diffusion : Pour lever le goulot d’étranglement de bande passante mémoire lors de la génération parallèle non autorégressive des modèles de langage de diffusion (dLLM), cette étude propose le framework d’accélération sans entraînement Flash-dLLM. En fusionnant des kernels optimisés pour les E/S, il élimine les transferts mémoire redondants et introduit un mécanisme intégré de spéculation-vérification basé sur son propre KV Cache. Les dLLM peuvent ainsi effectuer une vérification ultra-rapide sans modèle auxiliaire, offrant des accélérations d’inférence de bout en bout de 5,1x sur GSM8K et 11,0x sur HumanEval par rapport aux baselines SOTA actuelles (Source : HuggingFace Daily Papers)

Mécanisme de détection de mensonge PIR : sonder les connaissances cachées des LLM pour détecter la sous-performance volontaire et vérifier l’oubli : Face au phénomène de dissimulation de connaissances et de « sous-performance volontaire (Sandbagging) » des modèles de pointe lors des évaluations de sécurité, cet article s’inspire du test d’information dissimulée en psychologie criminelle pour proposer des sondes d’identification interne sans modèle de référence (PIR). En mesurant directement les signaux de résonance spécifiques des couches cachées face aux options correctes, PIR atteint une précision élevée de 0,85 à 0,93 dans divers scénarios de dissimulation (tromperie par prompt, verrouillage par mot de passe), parvenant à distinguer avec succès le simple « refus de répondre » du « véritable oubli ou ignorance » (Source : HuggingFace Daily Papers)

Agensh : un framework décentralisé auto-organisé permettant la collaboration et le scaling sans contrôleur central de plus d’un millier d’Agents : Cet article aborde les goulets d’étranglement en calcul et en coordination des systèmes multi-agents centralisés traditionnels en proposant Agensh, un framework de collaboration auto-organisé sans ordonnanceur central. Les agents concurrents s’appuient sur un espace de travail partagé, des interfaces de communication et un contexte unifié pour revendiquer de manière autonome des sous-tâches et fusionner leurs avancées de façon asynchrone. Sur le benchmark exigeant ProgramBench, le passage à 1 024 agents a permis de faire grimper le taux de réussite aux tests de 33,89 % à 55,06 %, validant le potentiel immense de la taille organisationnelle comme nouvelle dimension de scaling de l’intelligence (Source : HuggingFace Daily Papers)

Le MIT et plusieurs institutions publient le modèle xvr dans « Nature » : recalage peropératoire instantané et sous-millimétrique entre rayons X 2D et scans 3D : Le MIT, en collaboration avec la Harvard Medical School et d’autres institutions, a publié dans Nature le système d’IA chirurgicale xvr (X-ray Volume Registration). Exploitant des simulations physiques pour générer des données de rayons X synthétiques combinées à un modèle de base pré-entraîné sur des voxels corporels complets, le système s’adapte aux spécificités du patient en 5 minutes. Durant l’opération, il aligne en quelques secondes et avec une précision spatiale sous-millimétrique des radiographies 2D en temps réel avec des scans 3D CT/IRM préopératoires, renforçant considérablement la marge de sécurité des interventions mini-invasives par cathéter (Source : MIT News)

Système d'IA de recalage chirurgical MIT xvr

DeepLearning.AI et JetBrains lancent conjointement le cours complet « Spec-Driven Agent Development (SDD) » : Pour remédier aux difficultés de maintenance des projets complexes issus du « Vibe Coding », DeepLearning.AI et JetBrains ont lancé une nouvelle formation consacrée au développement piloté par les spécifications (SDD). Le cours décortique la rédaction de « constitutions » globales de projets, de spécifications de besoins structurées en Markdown et de compétences d’agents (Agent Skills) pour guider les coding agents, éliminant ainsi l’atténuation de contexte à la source tout en garantissant la qualité du code (Source : )

L’Université du Zhejiang et ses partenaires présentent EmbodiedSkills : orchestrer l’exécution de tâches longues VLA via un AgentLoop en boucle fermée : L’Université du Zhejiang et plusieurs institutions ont conçu le framework EmbodiedSkills pour la manipulation robotique. Il connecte un planificateur VLM de haut niveau et un modèle d’action VLA de bas niveau au sein d’une boucle fermée complète comprenant observation, pré-vérification, exécution, validation et récupération. Sur 50 types de tâches séquentielles longues et complexes du benchmark RoboTwin 2.0, le système atteint un taux de succès de 86,20 %, réduisant drastiquement les ruptures d’action et les pertes d’état sur les horizons longs (Source : WeChat)

Architecture EmbodiedSkills

Modular publie le livre blanc technique interactif « LLM Inference Handbook » pour les systèmes d’inférence à grande échelle : L’équipe de Modular a mis à disposition son document de référence LLM Inference Handbook. L’ouvrage couvre en détail les concepts critiques tels que TTFT, TPOT, le continuous batching, le chunked prefill, la dérivation mathématique du KV Cache, la désagrégation Prefill/Decode et la quantification basse précision, le tout accompagné de plus de 20 schémas et visualisations interactives dynamiques (Source : clattner_llvm)

Stanford ouvre le cours CS312 « Deep Learning Alchemy » : forger une intuition pratique de l’entraînement et du dépannage : L’Université de Stanford propose un nouveau cours intitulé CS312, dispensé par Tatsu Hashimoto. Délaissant la révision théorique des architectures traditionnelles, le cursus se concentre sur le scaling des hyperparamètres, les bassins d’optimisation, la stabilité architecturale et l’attribution causale au niveau du code lors d’anomalies de Loss à l’entraînement ; 85 % de l’évaluation repose sur la prédiction de l’évolution de la Loss à partir de diffs de code, développant ainsi une intuition aiguë de l’entraînement avancé (Source : stanfordnlp)

💼 Business

La licorne de bio-IA Basecamp Research lève 140 millions de dollars avec la participation de NVIDIA et du fonds Anthropic : La startup londonienne de biotechnologie Basecamp Research a annoncé un nouveau tour de table de 140 millions de dollars mené par S32, avec le soutien de NVIDIA, de l’Anthropic Anthology Fund et du Fonds d’innovation de l’OTAN. La société s’appuie sur sa base de données génomiques de micro-organismes issus d’environnements extrêmes dans plus de 30 pays pour entraîner son modèle de monde biologique EDEN. L’objectif est de s’affranchir des essais-erreurs classiques pour concevoir directement de nouvelles molécules antibiotiques et des enzymes d’édition génomique in vivo (grandes sérines recombinases), accélérant ainsi le développement de thérapies cellulaires à moindre coût (Source : THE DECODER)

Basecamp Research Bio-IA

La plateforme d’automatisation multi-agents d’entreprise Ema boucle une série B de 77 millions de dollars et quadruple sa valorisation : Ema, plateforme multi-agents dédiée à l’automatisation complète des processus RH, informatiques et financiers en entreprise, a conclu une levée de fonds en série B de 77 millions de dollars menée par Creaegis, avec la participation d’Accel et Section 32, portant son financement total à 140 millions de dollars. Grâce à une couche d’orchestration unifiée reliant la logique métier entre diverses applications, Ema a dépassé les 150 millions de dollars d’engagements contractuels et compte parmi ses clients Microsoft, Google et PwC, illustrant la forte percée des agents dans le remplacement des logiciels SaaS d’entreprise et des services d’externalisation informatique (Source : TechCrunch)

Snorkel AI, plateforme d’annotation de données et d’environnements RL, boucle une série E de 350 millions de dollars valorisée à 3,5 milliards : Snorkel AI, spécialisée dans la fourniture d’environnements synthétiques d’apprentissage par renforcement (RL) de haute qualité et de données d’entraînement avancées pour les laboratoires d’IA et les grandes entreprises, a clôturé une série E de 350 millions de dollars pour une valorisation de 3,5 milliards de dollars. Grâce à son modèle DaaS (Data-as-a-Service) combinant « experts + synthèse algorithmique », son chiffre d’affaires annualisé (ARR) atteint 375 millions de dollars, multiplié par 18 au cours de l’année écoulée, mettant en lumière l’explosion de la demande pour la création d’environnements RL complexes pour les modèles de pointe (Source : TechCrunch)

🌟 Communauté

Le discours de Trump à l’ONU propose de rebaptiser l’IA en « Super Intelligence » (SI) et réitère son refus de toute régulation internationale, suscitant la controverse : Dans son discours devant l’Assemblée générale des Nations unies, le président américain Donald Trump a proposé de renommer officiellement l’intelligence artificielle (IA) en « Super Intelligence » (SI), la qualifiant de bond en avant national surpassant la révolution industrielle. Affirmant que les États-Unis encourageront pleinement le développement de l’IA, il a explicitement rejeté tout « cadre de régulation mondialiste ». Cette prise de position s’oppose frontalement aux appels de la communauté scientifique internationale et de plusieurs laboratoires de pointe anglo-américains à instaurer des garde-fous pour les modèles autonomes, alimentant un débat animé autour de la perte de contrôle technologique et du marketing politique (Sources : The Guardian, TechRadar, Reddit r/ArtificialInteligence)

Discours de Trump à l'Assemblée générale de l'ONU

Meta Muse frappé par une faille d’élévation de privilèges et banni par Amazon ; Zuckerberg admet que l’architecture s’inspire fortement de l’open source OpenClaw : Après s’être hissé en tête des classements d’applications, l’agent personnel Muse de Meta fait face à une série de turbulences. Des chercheurs en sécurité ont révélé une faille 0-day permettant une prise de contrôle non autorisée d’un système Mac (corrigée en urgence depuis). Parallèlement, Amazon a bloqué l’accès e-commerce de Muse en raison de requêtes de scraping et de transactions non autorisées. Face aux interrogations de la communauté quant à la similitude troublante de son architecture d’espace de travail avec OpenClaw, les responsables produit de Meta ont publiquement reconnu que la logique de Muse s’inspirait largement d’OpenClaw tout en ayant été réécrite en sous-main, déclenchant un vif débat sur la propriété des agents personnels et les barrières des écosystèmes commerciaux (Sources : TechCrunch, WIRED)

Controverse de sécurité autour de Meta Muse

OpenAI appelle l’ONU et les institutions internationales à établir des normes de sécurité sur l’« auto-amélioration récursive » (RSI) : OpenAI a publié une déclaration appelant à la mise en place de standards d’évaluation internationaux encadrant l’auto-amélioration récursive (Recursive Self-Improvement – RSI) des systèmes d’IA de pointe. L’entreprise souligne que dès lors que les modèles acquièrent la capacité de concevoir et d’optimiser de manière autonome les générations suivantes, l’évolution technologique échappera au contrôle cognitif humain. Des organismes internationaux de standardisation doivent donc instaurer des règles strictes : déclaration obligatoire d’incidents, audits sous contrainte externe et maintien impératif d’un pouvoir d’intervention humaine, afin d’éviter la propagation de risques incontrôlés vers les infrastructures critiques (Sources : THE DECODER, OpenAI News)

Transition complète des métriques de l’industrie : du coût unitaire par token vers le « coût par tâche » (Cost per Task) : Avec les lancements simultanés de GPT-6 Sol/Luna et d’Opus 5.5 axés sur la réduction drastique du coût opérationnel, un consensus fort émerge chez les développeurs : comparer simplement le prix par million de tokens est devenu obsolète. Le « coût par tâche utile » — prenant en compte le taux de réessai, la compression de contexte, les hits de cache et le nombre d’étapes d’appels d’outils — s’impose désormais comme le véritable indicateur de viabilité économique pour les agents (Sources : 36氪, dbreunig)

« Le modèle note ses propres devoirs » : la déclaration de Cognition sur le codage 100 % IA suscite des réflexions sur la confiance en ingénierie et la crise d’audit : Face à l’affirmation de Cognition selon laquelle ses ingénieurs ne codent plus à la main et s’en remettent entièrement aux PR générées automatiquement par les agents, la communauté a souligné que le taux de défauts des PR écrites par IA est 1,7 fois supérieur à celui des humains et qu’elles manquent d’une chaîne d’audit indépendante. Plusieurs architectes chevronnés préviennent qu’une confiance aveugle dans des auto-évaluations en boucle fermée sans traçabilité entraînera une dette technique massive et un « vide cognitif » (Source : Reddit r/artificial)

Discussion sur Cognition

Affrontement multi-agents de modèles de pointe sur StarCraft : l’excès de réflexion conduit à une défaite par « inactivité » : Lors de tests d’affrontement multi-modèles en temps réel sans pause sur le RTS classique StarCraft, GPT-6 Astra a écrasé ses adversaires en les forçant, via un harcèlement continu, à des calculs excessivement lourds. À l’inverse, Grok 4.7 a été rasé sans avoir produit la moindre unité en raison de temps de réflexion dépassant plusieurs minutes par action. Ce résultat met en lumière une réalité incontournable : dans le monde physique continu ou les jeux vidéo, le coût de réflexion doit impérativement respecter un budget temporel ; une puissance de calcul qui réfléchit trop longtemps devient contre-productive (Source : 36氪)

Duel d'IA sur StarCraft

💡 Divers

Swancor New Materials et Zhihui Jun commercialisent officiellement le robot personnel Q1 et le robot transformable T1 à partir de 19 999 RMB : Peng Zhihui (Zhihui Jun), président de Swancor New Materials, a annoncé le lancement commercial de deux robots d’intelligence incarnée grand public : le robot compagnon humanoïde Q1, mettant en avant la personnalisation esthétique et la programmation de la personnalité, à partir de 19 999 RMB ; et le robot d’accompagnement T1, capable de basculer de manière transparente entre une posture humanoïde sur roues et un mode quadrupède, également proposé à partir de 19 999 RMB (la version Pro à 29 999 RMB embarque une puce Orin et un évitement d’obstacles omnidirectionnel à 360°). Les deux produits s’accompagnent de la boutique de compétences PrimeStore et d’un kit de développement, marquant l’entrée officielle de l’écosystème AgiBot sur le marché de l’électronique grand public haut de gamme (Source : 量子位)

Lancement des robots Q1 et T1 par Zhihui Jun

Le Royaume-Uni crée le Centre national de défense de l’information, associant services de renseignement et IA contre les deepfakes et les opérations cognitives : Le Premier ministre britannique a annoncé à l’Assemblée générale de l’ONU la création du « National Centre for Information Defence » (NCID). L’organisme combinera les capacités des services de renseignement militaire, des forces de l’ordre et des grandes plateformes sociales pour mobiliser l’IA afin d’attribuer instantanément et de neutraliser activement la désinformation, les attaques par deepfakes et les manipulations algorithmiques orchestrées par des puissances étrangères hostiles, érigeant ainsi un rempart cognitif numérique pour protéger le public (Source : The Guardian)

Centre national de défense de l'information britannique

Spotify déploie aux États-Unis « Taste Profile » alimenté par l’IA, permettant d’ajuster le poids de l’algorithme de recommandation en langage naturel : Le géant du streaming Spotify a mis à disposition de ses abonnés Premium américains la fonctionnalité IA « Taste Profile ». Les utilisateurs peuvent désormais visualiser le modèle de profilage de leurs préférences musicales généré par l’algorithme, mais aussi ajuster le poids des différents genres ou exclure des styles non désirés (bruits blancs pour le sommeil, comptines pour enfants, etc.) via de simples instructions en langage naturel. Cette avancée ouvre la boîte noire des recommandations en restituant directement le contrôle de l’algorithme à l’utilisateur (Source : TechCrunch)

Spotify Taste Profile

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *