Xinzhi Embodied s’associe à l’Université Fudan pour lancer… | Quotidien IA 2026-07-27

🔥 Focus

Xinzhi Embodied s’associe à l’Université Fudan pour lancer la série de modèles N0 et le jeu de données NeoData : Xinzhi Embodied et l’Université Fudan ont publié conjointement la série de modèles d’intelligence incarnée N0 et le jeu de données NeoData. NeoData contient plus de 30 000 heures de données d’interaction visuo-tactile, et le modèle de représentation unifiée NeoForce résout le problème de la fusion des données provenant de différents capteurs tactiles. N0-VTLA améliore le taux de réussite des opérations en prédisant l’évolution tactile sur les 50 prochaines étapes, tandis que N0-TWAM introduit la prédiction tactile dans le modèle du monde (world model), faisant évoluer l’intelligence incarnée d’une approche “guidée par la vision” vers une “fusion visuo-tactile”. (Source : QbitAI)

新智具身联合复旦发布N0系列模型与NeoData数据集

Induction Labs publie le modèle Photon-1 : Induction Labs a lancé le modèle Photon-1, un modèle de mélange d’experts (MoE) éparse de 106B-A5B. Son innovation réside dans son pré-entraînement sur des vidéos sans annotation d’action, lui permettant d’apprendre des politiques implicites. Photon-1 surpasse Gemini 3.1 Flash-Lite dans les benchmarks d’utilisation d’ordinateurs, avec une consommation de puissance de calcul de pré-entraînement considérablement réduite et des coûts d’inférence environ 3 fois inférieurs. Même en n’ayant appris qu’à partir de vidéos de bureau, Photon-1 affiné (fine-tuned) affiche d’excellentes performances dans le jeu de dames et la simulation physique de billard. (Source : MarkTechPost)

L’équipe KwaiKAT publie KAT-Coder-V2.5 : L’équipe KwaiKAT de Kuaishou a lancé KAT-Coder-V2.5, un modèle de programmation agentique entraîné sur des dépôts de code réels et exécutables. L’équipe a construit automatiquement plus de 100 000 environnements de dépôts vérifiables via AutoBuilder, et a utilisé un mécanisme de filtrage basé sur les processus ainsi que l’algorithme asymétrique AFT-PPO pour l’apprentissage par renforcement. KAT-Coder-V2.5 est en tête sur PinchBench avec un score élevé de 94,9, démontrant une voie pour améliorer les performances des agents de programmation à long terme en optimisant l’infrastructure de sandbox et la conception des algorithmes. (Source : MarkTechPost)

Le modèle de base de vision de documents MonkeyOCRv2 est open source : Des équipes, notamment de l’Université des sciences et technologies de Huazhong (HUST), ont publié en open source MonkeyOCRv2, un modèle qui introduit l’objectif de pré-entraînement “la reconstruction comme mémoire visuelle de document”. Dans des expériences contrôlées maintenant le modèle de langage dorsal Qwen3-1.7B gelé, MonkeyOCRv2 a devancé le groupe de contrôle le plus fort de 13,2 points sur 8 benchmarks de compréhension de documents. Parallèlement, l’équipe a rendu open source le jeu de données MonkeyDoc v2 contenant 113 millions d’images, offrant à la communauté un terrain d’expérimentation unifié pour le pré-entraînement visuel de documents, et faisant évoluer l’IA de documents de la complétion sémantique vers la fidélité visuelle. (Source : Heart of Machine)

MonkeyOCRv2文档视觉底座开源

Valkor s’associe à l’Université du Zhejiang et à d’autres pour lancer Loom, un framework open source de gestion d’état des agents : Pour répondre aux points de douleur des agents de programmation IA qui tombent facilement dans des “trous noirs de débogage” et souffrent d‘“amnésie locale” lors de tâches longues, Valkor, en collaboration avec l’Université du Zhejiang et l’UCL, a lancé le framework open source Loom. Loom décompose les tâches complexes de livraison de logiciels en chaînes d’états structurées et restaurables à tout moment. Lorsqu’un test échoue, Loom le capture sous forme d’un état de tâche à faire indépendant de l’historique de discussion, permettant aux développeurs de basculer de manière transparente entre les modèles ou les agents pour poursuivre la tâche, fournissant ainsi une infrastructure d’état essentielle pour la programmation IA en environnement de production sérieux. (Source : Heart of Machine)

Valkor联合浙大等开源智能体状态管理框架Loom

🎯 Tendances

Sakana AI publie le modèle de routage en cybersécurité Fugu-Cyber : Sakana AI a lancé Fugu-Cyber, un modèle de routage dédié à la cybersécurité sur son orchestrateur Fugu. Ce modèle a obtenu un taux de réussite de 86,9 % sur CyberGym et un score de 72,1 % sur CTI-REALM, rivalisant avec des modèles de pointe tels que GPT-5.5-Cyber. Grâce aux frameworks TRINITY et Conductor, Fugu-Cyber coordonne de manière dynamique des sous-agents spécialisés dans plusieurs domaines de la sécurité pour la validation des vulnérabilités et la génération de règles de détection, en adoptant un modèle de tarification dégressive par Token. (Source : MarkTechPost)

Open Dreamer rend open source l’implémentation JAX du modèle du monde Dreamer 4 : L’équipe de recherche indépendante Reactor a rendu open source Open Dreamer, une réplication du pipeline du modèle du monde Dreamer 4 basée sur JAX et Flax NNX. Ce modèle comprend un tokenizer vidéo Masked Autoencoder sans perte antagoniste, ainsi qu’un modèle de dynamique d’attention spatio-temporelle de 1,6B paramètres sans annotation d’action. L’équipe a publié l’intégralité de la recette d’entraînement et a partagé des détails d’ingénierie de stabilité, tels que l’optimisation de la mémoire vidéo sur les GPU B200 et la résolution de la dérive de l’optimiseur Muon, offrant une référence précieuse pour la réplication des modèles du monde. (Source : MarkTechPost)

InclusionAI lance Ling-3.0-flash sur OpenRouter : Ling-3.0-flash, un modèle MoE léger axé sur l’exécution de flux de travail d’agents, est désormais disponible sous forme d’API sur OpenRouter. Le modèle dispose d’un nombre total de paramètres de 124B, avec 5,1B paramètres actifs, prend en charge un contexte de 256K et affiche un TTFT inférieur à 100 ms. Positionné comme un nœud d’exécution rapide et à faible coût à utiliser en tandem avec de grands planificateurs, il est optimisé pour les appels d’outils à long terme et le suivi des instructions, offrant un mode d’inférence hybride commutable. (Source : Reddit)

Ling-3.0-flash

Publication de la version abliterated du modèle GLM-5.2 : La communauté a publié une version “abliterated” (sans refus) et affinée du grand modèle GLM-5.2. Ce modèle supprime les directions de refus de sécurité et a été spécifiquement affiné pour les tâches contradictoires à long terme et les tâches d’agent, afin d’éviter que le modèle ne s’arrête sans raison lors du traitement de tâches techniques ou sensibles. Les évaluations montrent d’excellentes performances sur les benchmarks de sécurité et de code tels que CyberGym et AgentHarm. Par défaut, aucune donnée n’est conservée, et les règles sont entièrement définies par l’utilisateur via des system prompts. (Source : Reddit)

Abliterated版GLM-5.2模型

🧰 Outils

Llama.cpp intègre le support natif de MCP : Une PR menée par le développeur ngxson a été fusionnée avec succès dans llama.cpp, apportant un support natif du Model Context Protocol (MCP) à son interface WebUI et à ses outils en ligne de commande. Les utilisateurs peuvent désormais configurer et appeler directement divers serveurs MCP (tels que l’assistant de code Serena) dans leur client local sans intermédiaire externe. Cela permet un développement et un débogage d’agents entièrement localisés et sans dépendances, réduisant considérablement la barrière à l’entrée pour la construction d’écosystèmes d’agents avec des modèles open source locaux. (Source : Reddit)

Le framework d’agent sur appareil Open Minis est open source : Le développeur Ethan Wang a annoncé la mise en open source d’Open Minis, une application d’agent IA capable de s’exécuter localement sur mobile. Compatible avec iOS et Android, elle intègre un shell Linux local, l’automatisation de navigateur, des compétences extensibles et une mémoire persistante. En chargeant les métadonnées des compétences (Skills) dans l’invite système et en combinant cela avec le Prompt Caching, le modèle peut sélectionner et exécuter des outils de manière cohérente au cours d’un seul tour de conversation, offrant une référence légère pour le développement d’agents sur appareil. (Source : X)

Aethos_Memory résout le problème de l’oubli des agents entre les sessions : Pour remédier au problème des assistants de codage IA incapables de partager le contexte d’une session à l’autre, un développeur a rendu open source l’outil Aethos_Memory. Cet outil fournit aux agents une couche de mémoire persistante capable d’extraire et de stocker automatiquement les décisions clés, l’architecture de la base de code et les historiques de correction de bugs des sessions. Lors de la création d’une nouvelle session, l’agent peut lire directement la mémoire structurée, évitant ainsi aux développeurs la tâche fastidieuse de copier-coller manuellement l’historique. (Source : Reddit)

Aethos_Memory

Runway lance Media Router, un outil de routage de médias : La plateforme de génération vidéo Runway a lancé Media Router, le premier outil de routage optimisé selon les préférences pour les médias génératifs. Les équipes d’entreprise exécutant des pipelines de production impliquant plusieurs modèles vidéo, image et audio n’ont plus besoin de sélectionner manuellement un modèle pour chaque requête. Il leur suffit de définir une seule fois leurs préférences en matière de coût, de qualité ou de latence dans le routeur, et le système de routage distribuera automatiquement les requêtes de Token, réalisant ainsi un équilibre optimal entre coût et performance. (Source : X)

📚 Apprentissage

Publication de l’outil TileLang pour la conception et l’optimisation de noyaux GPU : Cet article présente TileLang, un outil DSL de conception de noyaux GPU basé sur TVM. Le tutoriel fournit un code Python complet démontrant comment concevoir des noyaux pour l’addition de vecteurs, la multiplication de matrices Tensor Core, le Softmax fusionné, FlashAttention, etc. Grâce aux tuiles (tiles) de mémoire partagée et au découpage des registres de TileLang, le compilateur gère automatiquement le mappage et la synchronisation des threads, et prend en charge la recherche de la configuration matérielle optimale sous un budget GPU fixe via @tilelang.autotune. (Source : MarkTechPost)

Publication d’un tutoriel sur le potentiel de simulation atomique de FAIRChem v2 et UMA : Ce tutoriel présente en détail le framework FAIRChem v2 de Meta ainsi que l’utilisation du potentiel interatomique d’apprentissage automatique universel (MLIP) UMA. Le contenu explique comment obtenir les poids des modèles restreints (gated) via Hugging Face, configurer un calculateur dans ASE (Atomic Simulation Environment) et réaliser une série de flux de travail en chimie computationnelle, notamment la prédiction d’énergie ponctuelle, l’optimisation de la géométrie moléculaire, la comparaison des états de spin, l’estimation de l’énergie de réaction, la relaxation de réseau, l’ajustement de l’équation d’état et les simulations de dynamique moléculaire. (Source : MarkTechPost)

Relative Representation résout l’alignement de l’espace vectoriel des LLM hétérogènes : La communauté a partagé une technique géométrique utilisant la méthode de représentation relative (Relative Representation Method) et l’orthogonalisation symétrique de Lowdin pour aligner les espaces d’intégration (embeddings) de différents LLM (comme le mélange de Llama, Mistral et Phi). Sans nécessiter d’affinage (fine-tuning), cette méthode introduit des points d’ancrage de référence dans un domaine sémantique spécifique et applique une normalisation Z-score par colonne pour projeter des vecteurs de différentes dimensions dans un espace commun unifié, résolvant ainsi les problèmes de cône anisotrope et d’incompatibilité dimensionnelle dans le routage multi-agents. (Source : Reddit)

Relative Representation

Schéma explicatif dessiné à la main de la dérivation et du calcul d’U-Net : Le chercheur en vision par ordinateur, le Prof. Tom Yeh, a publié un schéma de calcul dessiné à la main du réseau U-Net. En 17 étapes, le tutoriel montre comment une image à trois canaux R, G, B est compressée par convolution et max pooling jusqu’à un Bottleneck de 2×4, puis progressivement restaurée à sa taille d’origine via des convolutions transposées et des connexions sautées (Skip Connections), illustrant ainsi les principes mathématiques de cette structure centrale des modèles de diffusion à travers un flux intuitif de multiplications matricielles. (Source : X)

💼 Business

Stripe envisage d’acquérir OpenRouter pour 10 milliards de dollars : Le géant des paiements Stripe est en négociations majeures pour acquérir OpenRouter, une plateforme d’agrégation de modèles d’IA, pour une valorisation atteignant 10 milliards de dollars, soit une multiplication par près de 8 par rapport aux 1,3 milliard de dollars d’il y a deux mois. Alors que les entreprises ont tendance à utiliser plusieurs modèles pour diversifier les risques, le trafic et la valeur stratégique d’OpenRouter sont devenus évidents. Stripe, qui a prospéré discrètement à l’ère de l’IA grâce à une simple ligne de code de paiement et a précédemment acquis Metronome, verrait cette acquisition étendre ses activités des paiements vers l’infrastructure sous-jacente de l’écosystème de l’IA. (Source : Heart of Machine)

Stripe拟以100亿美元收购OpenRouter

Moushen Intelligent lève près de 100 millions de yuans supplémentaires lors de son tour de table Pre-A : La start-up de cerveaux incarnés sur appareil Moushen Intelligent a annoncé la clôture d’un financement supplémentaire de près de 100 millions de yuans pour son tour Pre-A. Un tour Pre-A+ de près de 500 millions de yuans est également en cours de finalisation, sa valorisation ayant été multipliée par plus de 10 en six mois. Fondée par le professeur Chen Tao de l’Université Fudan et l’ancien chercheur d’Intel Zhang Yimin, son modèle d’action mondial spatio-temporel intégré STI-WM réduit de 90 % le besoin en données réelles sur machine en tokenisant les actions, et réalise une adaptation sur appareil à très bas coût sur des puces nationales telles que HiSilicon et Horizon Robotics. (Source : 36Kr)

眸深智能完成近亿元Pre-A轮追加融资

La société de robotique chirurgicale Vicarious Surgical en liquidation judiciaire : La licorne de robotique chirurgicale Vicarious Surgical, qui avait attiré des investissements de Bill Gates et Jerry Yang, a vu ses actionnaires voter l’arrêt des opérations et la liquidation judiciaire en raison d’un retard important dans la R&D et d’une rupture de sa chaîne de financement. La société, qui avait levé plus de 2 milliards de yuans au total, a vu sa solution de transmission découplée agressive et son concept de contrôle VR se heurter à des obstacles lors de l’approbation de la FDA et de la production de masse, sonnant l’alarme pour le secteur de l’intelligence incarnée, actuellement très valorisé mais confronté à des difficultés de commercialisation. (Source : 36Kr)

手术机器人公司Vicarious Surgical清算破产

🌟 Communauté

Les assistants de programmation IA poussent le monde de l’éducation en informatique à repenser les méthodes d’évaluation : Une enquête de l’Association for Computing Machinery (ACM) menée auprès de plus de 700 éducateurs en informatique dans 49 pays révèle que 69 % des enseignants estiment que l’IA a modifié les compétences requises pour le développement de logiciels, et que 64 % ont réorienté leur enseignement de “l’écriture de code à partir de zéro” vers la compréhension et le débogage de code. Pour faire face à la triche et à la dépendance excessive induites par l’IA, 68 % des enseignants ont ajusté leurs méthodes d’évaluation, en ajoutant des examens sur table à livre fermé, des soutenances orales et des séances de défense de code, afin de redéfinir l’évaluation des compétences en programmation à l’ère de l’IA. (Source : THE DECODER)

AI编程助手引发CS教育界对考核方式的重构

L’indexation par Google des liens de conversation partagés de Claude suscite des inquiétudes en matière de confidentialité : La communauté a découvert que les conversations et les Artifacts partagés par les utilisateurs via la fonction “créer un lien public” de Claude sont publiquement indexés par des moteurs de recherche comme Google, et que des sites tiers spécialisés dans le scraping de ces liens sont apparus. Les informations divulguées comprennent des clés privées de crypto-monnaies, des secrets d’entreprise et des données médicales personnelles confidentielles. Les utilisateurs reprochent à Anthropic de ne pas avoir ajouté de balise meta noindex sur les pages de partage, ce qui constitue une erreur élémentaire de conception de sécurité, et appellent les utilisateurs à nettoyer rapidement leurs conversations partagées dans les paramètres. (Source : Reddit)

Claude共享对话链接被Google索引

La Silicon Valley s’enflamme pour les ateliers de littératie numérique inversée “Avoiding AI” : Alors que les géants de la technologie imposent l’IA sur tous les types de terminaux, les ateliers physiques “Avoiding AI” (Éviter l’IA) lancés par plusieurs bibliothèques américaines font un carton sur les réseaux sociaux. Les bibliothécaires guident pas à pas les citoyens sur la manière de désactiver complètement les IA intégrées au système comme Apple Intelligence et Gemini, et partagent des extensions de navigateur pour bloquer les résumés IA de Google Search. Les citoyens expriment ainsi leurs inquiétudes face aux monopoles de la Big Tech, aux violations de la vie privée et à la consommation d’énergie des centres de données, tout en réclamant leur souveraineté technologique. (Source : TechCrunch)

Avoiding AI

Le secrétaire au Commerce Lutnick se prononce en faveur de l’IA open source pour contrer la Chine : La communauté discute vivement des déclarations du secrétaire américain au Commerce, Howard Lutnick, lors du dîner des correspondants de la Maison-Blanche, où il a affirmé directement que “cette Maison-Blanche protégera l’IA open source”. Auparavant, l’APEC avait signé une déclaration de soutien à l’IA open source, et le gouvernement américain discute en interne du remplacement des blocages généralisés par des interdictions ciblées sur des modèles spécifiques. L’objectif est d’aider l’écosystème open source américain à rattraper rapidement les modèles propriétaires de pointe par le biais de “forks” et de “fine-tuning” dans un contexte de puissance de calcul limitée, garantissant ainsi la domination technologique des États-Unis. (Source : X)

Andrej Karpathy modifie sa biographie personnelle, alimentant les spéculations sur son départ : Le célèbre chercheur en IA Andrej Karpathy a retiré la mention “Anthropic” de la biographie de son compte sur les réseaux sociaux, suscitant de nombreuses spéculations au sein de la communauté quant à son éventuel départ. Certaines rumeurs suggèrent qu’il aurait choisi de partir car son statut de non-citoyen américain l’empêchait d’accéder aux modèles les plus avancés de l’entreprise en raison des restrictions à l’exportation, bien que d’autres internautes soulignent que la modification de sa biographie remonte à plusieurs jours. Anthropic n’ayant pas signé la récente lettre ouverte sur l’open source initiée par Jensen Huang, sa stratégie commerciale et réglementaire conservatrice fait face à des réactions négatives de la part d’une partie de la communauté. (Source : Heart of Machine)

Andrej Karpathy修改个人简介引发离职猜测

DeepSeek suspend son deuxième tour de financement après la fuite d’un compte rendu de réunion d’investisseurs : La diffusion virale sur les réseaux sociaux d’un compte rendu de réunion entre le fondateur de DeepSeek, Liang Wenfeng, et des investisseurs a poussé DeepSeek à informer d’urgence les investisseurs potentiels de la suspension temporaire de son deuxième tour de financement. La transcription divulguée contient des déclarations sensibles de DeepSeek concernant l’écart de puissance de calcul entre la Chine et les États-Unis, la stratégie de tarification des Tokens et le modèle commercial open source. La communauté a entamé des discussions sur l’affinage et le déploiement autour du modèle de “fabrique de Tokens” de DeepSeek, qui réduit les coûts d’inférence à un tiers de ceux de ses homologues occidentaux grâce à l’optimisation technique. (Source : Hacker News)

💡 Divers

ChatGPT aide un utilisateur à découvrir que son MacBook est infecté par AtomicStealer : Un utilisateur de Mac, tentant d’optimiser la mémoire d’exécution pour des modèles locaux de grande taille, a utilisé ChatGPT pour analyser les processus système. Il a découvert par hasard deux fichiers LaunchDaemon déguisés en services système pointant vers des scripts cachés dans la bibliothèque (Library). ChatGPT l’a immédiatement alerté sur la présence d’un logiciel malveillant, l’aidant à localiser le cheval de Troie de vol d’informations OSX.AtomicStealer, contracté après l’installation d’une bibliothèque PDF open source corrompue. Cela démontre le rôle inattendu de l’IA dans la protection de la sécurité des terminaux au quotidien. (Source : Reddit)

ChatGPT协助用户发现MacBook感染AtomicStealer

Decoy Font utilise les différences visuelles pour tromper les IA multimodales : Le studio de design Mixfont a publié “Decoy Font” (police leurre). En superposant des caractères perturbateurs dessinés par de fines lignes sur des lettres ordinaires, cette police fait en sorte que les IA multimodales dotées de capacités visuelles comme ChatGPT ou Claude ne lisent que des textes erronés (comme “Sorry Robot”) lors de la reconnaissance OCR. En revanche, l’œil humain peut toujours lire normalement le texte réel (comme “Happy Human”) à une certaine distance, ce qui en fait une nouvelle technologie anti-crawler/exemple adverse au niveau physique pour l’IA. (Source : Reddit)

Decoy Font利用视觉差异欺骗多模态AI

Le projet d’introduction de robots humanoïdes dans un lycée de New York suscite la protestation des enseignants : Un lycée public de New York prévoit d’introduire des robots humanoïdes dans ses locaux pour assister l’enseignement, une initiative qui se heurte à la ferme opposition du syndicat des enseignants. Les enseignants estiment que, dans un contexte de budgets éducatifs serrés et de pénurie d’enseignants, les coûts élevés d’achat et de maintenance des robots humanoïdes constituent une mauvaise allocation des ressources. De plus, les robots ne peuvent remplacer le rôle central des enseignants humains dans la communication émotionnelle et l’orientation personnalisée, affirmant que l’entrée de la technologie à l’école doit respecter des limites. (Source : Reddit)

纽约一高中拟引入人形机器人引发教师抗议

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *