🔥 À la une
xAI lance Grok 4.6 et présente l’agent Grok Bot : xAI a officiellement lancé le modèle Grok 4.6, prenant en charge un contexte de 500K et des entrées multimodales. Ce modèle a obtenu un score de 61 sur l’indice d’intelligence AA, égalant GPT-5.6 Sol, et s’est classé deuxième avec un score Elo de 1753 sur l’évaluation de travail réel GDPVal-AA v2. Le tarif de son API est de 2 $ par million de tokens en entrée et 6 $ en sortie, soit plus de 60 % moins cher que ses concurrents. Lancé simultanément, Grok Bot prend en charge la collaboration multi-agents et l’exécution indépendante dans le cloud, capable de se connecter automatiquement à des applications tierces et d’apprendre les flux de travail des utilisateurs. (Source : xAI)

La version officielle de DeepSeek V4 Pro est en ligne et le framework Harness est open-source : DeepSeek a publié la version officielle de V4 Pro (0813), utilisant une architecture MoE à 1,6T de paramètres, prenant en charge un contexte de 1M et des entrées d’images. Ses capacités d’Agent ont fait un bond spectaculaire, passant de 12,8 points dans la version preview à 62,7 points sur le benchmark DeepSWE. Parallèlement, l’équipe a rendu open-source le framework d’agents DeepSeek Harness v0.1 basé sur le micro-noyau Cordis, permettant d’assembler de manière flexible des modèles, des outils et des bacs à sable (sandboxes) sous forme de plug-ins. (Source : DeepSeek)
.jpg)
Alibaba rend open-source son grand modèle Qwen3.8-Max à 2,4 billions de paramètres : L’équipe Qwen d’Alibaba a rendu open-source les poids du modèle Qwen3.8-2.4T-A95B (Qwen3.8-Max), avec 95B de paramètres activés et une prise en charge native d’un contexte de 262K. Ce modèle a obtenu un score de 93 sur PaperBench et a réalisé d’excellentes performances sur des tâches d’agents telles que OSWorld. Unsloth a utilisé la quantification 1-bit pour compresser sa taille de 91 % à 397 Go, rendant le déploiement local possible. (Source : Hugging Face)
Google DeepMind présente SL2T, un modèle de traduction de la langue des signes en texte : Google DeepMind a publié le modèle de traduction de la langue des signes en texte SL2T, désormais disponible dans Gboard et Live Transcribe sur le Pixel 11. Ce modèle a obtenu un score élevé de 70 BLEURT en zero-shot sur le benchmark de traduction FLEURS-ASL. Pour protéger la vie privée, le système utilise MediaPipe Holistic pour extraire localement les coordonnées de la posture corporelle, envoyant uniquement les données géométriques vers le cloud pour effectuer la traduction en temps réel de l’ASL vers l’anglais. (Source : Google DeepMind)
Le premier modèle de raisonnement basé sur TTT de SSI (fondé par Ilya) dévoilé : Selon des fuites de la communauté, SSI, fondée par Ilya Sutskever, développe un petit moteur de raisonnement basé sur le Test-Time Training (TTT). Ce modèle peut mettre à jour certains poids en temps réel via la descente de gradient lors de l’inférence pour s’adapter aux données hors distribution, s’affranchissant ainsi des limites des fenêtres de contexte statiques pour réaliser un apprentissage continu efficace en termes d’échantillons, avec des performances compétitives face à des modèles beaucoup plus grands. (Source : X)

🎯 Tendances
Dyna Robotics publie le modèle Dyna-2 pré-entraîné sur un million d’heures de vidéos egocentric : Dyna Robotics a publié Dyna-2, un modèle d’action du monde pour la manipulation robotique. Ce modèle a été pré-entraîné sur plus d’un million d’heures de vidéos à la première personne (egocentric), validant pour la première fois la capacité de généralisation cross-embodiment de la Scaling Law sur des données robotiques inédites. Les expériences montrent que le co-entraînement combinant la prédiction vidéo et le débruitage d’action est la clé pour parvenir à la généralisation. (Source : Dyna Robotics)
Xiaohongshu et l’Université Jiao Tong de Shanghai rendent open-source dots.tts, un modèle de synthèse vocale autorégressif continu : Ce modèle doté de 2 milliards de paramètres modélise directement bloc par bloc de manière autorégressive dans un espace latent continu, évitant la perte d’informations causée par les tokens acoustiques discrets. Sur le benchmark Seed-TTS-Eval, sa similarité moyenne du locuteur et sa précision du contenu ont toutes deux atteint l’état de l’art (SOTA), et il prend en charge la sortie en streaming ainsi que le mode d’interaction double flux. (Source : JiQiZhiXin)
.jpg)
Microsoft publie MAI-Code-1.1-Flash et réduit considérablement ses prix : Microsoft a mis à jour son modèle de code et publié MAI-Code-1.1-Flash, optimisant la consommation de tokens pour le CLI et les tâches d’agents. Parallèlement, Microsoft a réduit de 75 % les prix de ses API sur GitHub (0,2 $ / million en entrée, 1,2 $ / million en sortie), visant à rester compétitif sur le marché de la programmation dominé par Anthropic. (Source : AI Business)

L’équipe de sécurité d’Alibaba publie Yuvion VL, un modèle de base de sécurité multimodal : L’équipe de sécurité d’Alibaba a lancé la série de modèles Yuvion VL, axée sur l’IA et la sécurité des contenus. Ce modèle introduit le framework d’apprentissage contrastif C2FT (Confused Contrastive Fine-Tuning), qui extrait dynamiquement des exemples négatifs difficiles et faciles à confondre. Les évaluations montrent que sa version 8B surpasse des modèles commerciaux comme GPT-5.4, pourtant 50 fois plus grands en termes de paramètres, sur plusieurs tâches de sécurité. (Source : arXiv)
Oxford et l’Université nationale de Singapour proposent le framework MWM de “modèle de monde mental” : Une équipe de recherche conjointe a proposé le framework de modélisation du monde mental (MWM), préconisant d’intégrer les variables mentales des agents telles que les croyances, les objectifs et les émotions dans l’état global du monde. Les tests du système de référence MENTIS montrent que, par rapport aux modèles de monde purement physiques, la modélisation explicite des états mentaux améliore considérablement le score F1 des prédictions de décisions humaines. (Source : arXiv)
.jpg)
L’Université de Pékin et d’autres équipes proposent ContactSeek, un framework d’optimisation d’éditeurs de gènes basé sur la probabilité de contact d’AF3 : Une équipe de recherche conjointe a publié un article dans Nature, proposant ContactSeek, un framework d’IA qui utilise la probabilité de contact (CP) prédite par AlphaFold3 pour optimiser la spécificité des éditeurs de gènes. Ce framework a réussi à identifier les résidus de contact clés dans l’interaction entre la protéine Cas et l’ADN/ARN, concevant des variantes d’éditeurs de bases de haute fidélité. (Source : Nature)
.jpg)
LiteLLM subit une attaque massive de la chaîne d’approvisionnement entraînant la fuite de plusieurs téraoctets de clés d’accès : Des agences de sécurité ont révélé que l’outil de développement d’IA open-source LiteLLM a subi une attaque de la chaîne d’approvisionnement en mars. Via une version malveillante sur la source officielle PyPI, des pirates ont dérobé en 40 minutes des clés cloud, des tokens d’API et des clés privées SSH de 2 500 entreprises, dont Microsoft, Amazon et Salesforce, pour un volume de données divulguées atteignant 195 To. (Source : Ars Technica)
Apple négocie des paiements aux éditeurs de presse pour améliorer le service d’actualités IA de Siri : Selon certaines informations, Apple négocie actuellement avec plusieurs grands éditeurs de presse, proposant de les rémunérer lorsque Siri utilise leurs contenus d’actualités pour répondre aux questions des utilisateurs ou générer des résumés. Cette initiative vise à obtenir des données en temps réel de haute qualité et conformes afin d’améliorer l’expérience de l’assistant intelligent Siri. (Source : The Wall Street Journal)
Google lance la série Pixel 11 et met à niveau globalement les fonctionnalités de Gemini AI : Google a dévoilé la série de téléphones Pixel 11 lors de l’événement Made by Google ‘26. Les nouveaux appareils sont équipés du processeur Tensor G6 et intègrent profondément Gemini. Les nouvelles fonctionnalités incluent la traduction en temps réel de la langue des signes ASL en texte, la saisie vocale Rambler capable de comprendre les expressions familières, ainsi que la synchronisation des données de santé avec la Pixel Watch 5. (Source : TechCrunch)

iFlytek lance une matrice d’agents de services aux entreprises couvrant sept scénarios clés : iFlytek a introduit une matrice d’agents couvrant sept scénarios, dont la gestion intelligente, l’informatique des processus et les transactions de la chaîne d’approvisionnement, poussant l’IA d’entreprise à passer de “l’exécution d’actions isolées” à la “livraison de résultats commerciaux”. Les produits comprennent un agent d’audit de conformité pour la supervision des achats, ainsi que l’agent SparkOS doté d’une interaction ultra-humanisée. (Source : QbitAI)

L’ancien responsable de la robotique de ByteDance, Kong Tao, rejoint Xiaomi en tant que directeur du département d’intelligence incarnée et d’applications : Kong Tao, ancien responsable de l’équipe robotique de ByteDance, a récemment rejoint Xiaomi pour diriger le nouveau département “Intelligence incarnée et applications”. Les scénarios physiques réels de Xiaomi dans son écosystème global “Humain-Voiture-Maison”, notamment dans la fabrication de voitures intelligentes, sont considérés comme les facteurs clés ayant attiré ce docteur en informatique de l’Université Tsinghua. (Source : 36Kr)
Canva réduit d’un tiers ses prévisions de croissance des revenus en raison des coûts élevés de calcul de l’IA : La licorne des logiciels de conception Canva a abaissé son taux de croissance des revenus attendu à 20 %. La CEO Melanie Perkins a révélé que la demande des utilisateurs pour les fonctionnalités d’IA a largement dépassé les attentes, entraînant une explosion des coûts de calcul. L’entreprise a décidé de ralentir le déploiement de certaines fonctionnalités d’IA et de reconstruire son architecture sous-jacente pour réduire le coût en tokens par tâche. (Source : Reddit)

🧰 Outils
LlamaIndex publie ExtractBench et LlamaExtract Agentic Plus : LlamaIndex a lancé ExtractBench, un jeu d’évaluation de l’extraction d’informations de documents d’entreprise. Pour résoudre le problème de l’effondrement du taux de rappel des VLM de pointe lors de l’extraction de documents longs, ils ont introduit LlamaExtract Agentic Plus, qui traite les documents longs de manière itérative par segments, atteignant un score F1 de 96,1 % dans les tâches d’extraction de listes longues. (Source : LlamaIndex)
OpenAI présente ChatGPT Work, un espace de travail pour entreprises, et l’outil de génération de pages web Sites : Cet outil permet d’intégrer de manière transparente les documents des entreprises dans Google Drive, les performances financières dans NetSuite et les discussions d’équipe dans Slack. Les utilisateurs peuvent automatiser des audits financiers trimestriels complexes et des analyses de données prévisionnelles via des instructions en langage naturel, et générer en un clic des tableaux de bord de données interactifs Sites. (Source : OpenAI)

Mesh, l’outil de gestion des relations d’Automattic, arrive sur Android : L’outil de gestion des relations personnelles et CRM Mesh (anciennement Clay) lance sa version Android. L’application prend en charge le partage d’écran et les fenêtres contextuelles, et peut s’associer à des logiciels de messagerie multiplateformes comme Beeper. Son outil intégré Nexus AI permet aux utilisateurs d’interroger leur réseau de contacts en langage naturel pour trouver des experts du secteur ou des contacts dans des villes spécifiques. (Source : TechCrunch)

📚 Apprentissage
DeepLearning.AI s’associe à JetBrains pour lancer le cours court “AI Coding Workflows: On-Cloud to On-Premise” : Ce cours, animé par Paul Everitt, Developer Advocate chez JetBrains, guide les apprenants dans la construction d’applications Python dans des environnements cloud, hybrides et entièrement locaux. Le programme couvre la décomposition des tâches à l’aide de sous-agents, la réduction des coûts via le routage de modèles, et la configuration locale d’agents de codage open-source. (Source : DeepLearning.AI)
L’IIT Bombay et Adobe Research proposent la méthode PTP pour l’extraction inverse des prompts de LLM : Une équipe de recherche conjointe a publié un article présentant une méthode d’extraction inverse appelée Prior Token Prediction (PTP). En entraînant un modèle inverse sur les sorties synthétiques du LLM cible, cette méthode est capable de reconstituer les prompts système et les données privées des utilisateurs du grand modèle avec une fidélité extrêmement élevée, sans nécessiter d’accès aux poids du modèle. (Source : arXiv)

L’équipe OpenMOSS rend open-source le modèle World Critic Model (WCM) pour le contrôle RL incarné : Une équipe de recherche conjoines a rendu open-source le framework WCM. Pour répondre au problème d’observabilité partielle dans le contrôle robotique, WCM estime la valeur de l’état tout en prédisant l’état latent du moment suivant après l’exécution d’une action. Les expériences montrent que l’introduction de la prédiction de l’état futur améliore considérablement l’efficacité des modèles VLA dans l’apprentissage par renforcement sur de vrais robots. (Source : arXiv)
.jpg)
Le jeu de données open-source OpenWALDO s’engage à fournir des sources de données d’entraînement d’IA sûres et transparentes : Face au manque de transparence des données d’entraînement des modèles open-source, le fondateur de CentOS, Gregory Kurtzer, a lancé le projet OpenWALDO. Ce projet vise à établir un jeu de données d’entraînement d’IA entièrement public et auditable, contenant actuellement 167,3 milliards de tokens de référence issus de la littérature du domaine public et d’articles académiques. (Source : The Register)
💼 Business
La plateforme de développement de logiciels no-code Lovable lève 400 millions de dollars en série C : La start-up suédoise de “programmation visuelle” Lovable a annoncé avoir levé 400 millions de dollars lors d’un tour de table de série C mené par Menlo Ventures, avec la participation de Tencent et d’autres investisseurs, doublant sa valorisation à 13,3 milliards de dollars en 7 mois. L’ARR de l’entreprise a atteint 600 millions de dollars, permettant aux utilisateurs de réaliser l’ensemble du processus, de la conception de l’application à sa mise en ligne opérationnelle, directement sur la plateforme. (Source : TechCrunch)

Thrive Holdings lève 2 milliards de dollars pour accélérer le déploiement des modèles d’OpenAI dans les secteurs traditionnels : La société de capital-investissement Thrive Holdings, spécialisée dans le déploiement de l’IA, a annoncé avoir obtenu 2 milliards de dollars de nouveaux fonds, portant sa valorisation à 12 milliards de dollars. L’entreprise acquiert des sociétés traditionnelles dans des domaines tels que la comptabilité et l’informatique, et intègre directement les modèles d’OpenAI pour optimiser leurs flux de travail. Ces nouveaux fonds seront utilisés pour développer de nouvelles activités telles que la supervision d’actifs physiques. (Source : TechCrunch)
IBM et Together AI concluent un accord de location de 240 millions de dollars pour un cluster Nvidia Blackwell : IBM et Together AI ont signé un accord de collaboration pluriannuel d’une valeur de 240 millions de dollars. Together AI déploiera sur IBM Cloud un cluster de calcul d’IA comprenant 2 000 puces Nvidia B300 (Blackwell), afin de fournir des services d’inférence cloud hautement efficaces pour des grands modèles open-source tels que DeepSeek et Kimi. (Source : IBM)

🌟 Communauté
La communauté débat de la faible adoption commerciale de Fable 5 et du plafond des dépenses d’IA des entreprises : Selon les données du fournisseur de services financiers Ramp, Fable 5 n’a représenté que 11,4 % des dépenses totales des entreprises pour les modèles d’Anthropic au cours de son premier mois de lancement. Les analyses indiquent que le prix élevé de 50 $ par million de tokens en sortie a atteint le plafond des dépenses d’IA des entreprises. Faute de pouvoir quantifier le ROI, les entreprises se tournent vers des modèles open-source ou de taille intermédiaire plus rentables. (Source : Ramp)

Les développeurs débattent de la frontière entre le “harnais” (Harness) et les capacités des modèles dans les outils de programmation IA : Après qu’Opus 5 a réussi le test ARC-AGI-3 en écrivant de manière autonome 269 programmes, les développeurs s’accordent à dire qu’avec le renforcement des capacités de raisonnement des modèles, les prompts sur-conçus et les frameworks d’agents externes complexes (Harness) deviennent des “cordes” qui limitent les performances du modèle. À l’avenir, la tendance sera aux interfaces d’environnement minimalistes. (Source : 36Kr)
Le groupe de travail sur l’IA de la Royal Statistical Society appelle à introduire des principes statistiques dans la régulation de l’IA : La Royal Statistical Society a publié un rapport soulignant que, les modèles d’IA évoluant de manière dynamique après leur déploiement, les examens de conformité statiques traditionnels ne permettent pas de prévenir efficacement les risques. Le groupe de travail appelle les régulateurs à développer des capacités d’évaluation statistique pour auditer en continu le comportement des agents d’IA dans des scénarios commerciaux réels. (Source : RSS)

Les pertes agricoles causées par des hallucinations de l’IA suscitent un débat sur les limites des décisions automatisées : La communauté discute vivement d’un incident où 25 acres de cultures ont été détruits après avoir suivi les conseils d’une IA. L’application d’IA a recommandé par erreur un agent chimique qui détruit à la fois les mauvaises herbes et les cultures. Les internautes soulignent que, dans les décisions impliquant le monde physique, faire aveuglément confiance aux suggestions automatisées de l’IA sans vérification humaine peut avoir de graves conséquences. (Source : X)
💡 Divers
Kellanova utilise la technologie de jumeau numérique de Siemens pour optimiser sa ligne de production de chips : Le géant des snacks Kellanova a investi 5 millions de dollars pour déployer un système de jumeau numérique en temps réel pour la purée de pommes de terre dans son usine en Pologne. Des capteurs collectent 200 points de données par milliseconde et les injectent dans un modèle de machine learning pour ajuster automatiquement la recette, réduisant ainsi les déchets de la ligne de production de 13 % et la consommation d’énergie de 7 %. (Source : X)
L’IPO d’Unitree Robotics souscrite par près de 10 millions de comptes, établissant un nouveau record de taux d’attribution le plus bas sur le STAR Market : Les souscriptions en ligne pour l’IPO d’Unitree Robotics sur le marché des actions A ont dépassé les 9,78 millions de comptes, avec un taux d’attribution de seulement 0,018 %, un plus bas historique pour le STAR Market. La capitalisation boursière à l’émission a atteint 61 milliards de yuans. De plus, la société d’intelligence artificielle DeepSeek a confirmé sa participation au placement en tant qu’investisseur stratégique, et les deux parties mèneront des recherches et développements conjoints autour de l’intelligence incarnée et des grands modèles. (Source : 36Kr)
Suno s’associe à BMG, mais le filigrane numérique suscite l’inquiétude des créateurs : La plateforme de génération musicale Suno a annoncé un partenariat mondial avec BMG afin de placer les créateurs humains au centre de l’écosystème de la musique IA. Cependant, l’ajout obligatoire de filigranes numériques irréversibles dans les pistes audio par Suno a provoqué une réaction négative de la communauté, les créateurs craignant que cela ne devienne un outil de surveillance des droits d’auteur et de retrait de contenu pour les labels et les plateformes. (Source : Suno)