Fei-Fei Li / World Labs lance Atlas : reconstruction 3D à… | Quotidien IA 2026-09-03

🔥 Focus

Anthropic lance Claude Fable 5.1 / Mythos 5.1 : bond en coding scientifique, prix de lecture du cache réduit de 75 %, et lancement de l’anti-distillation, du watermark et de la rétention zéro entreprise : les deux partagent la même base, avec des politiques de sécurité divergentes. Fable arrive dès aujourd’hui sur l’API/Bedrock/Azure, etc. ; Mythos n’est ouvert qu’aux institutions de cybersécurité et de sciences de la vie ayant passé un audit. Terminal-Bench-Science 0.1 atteint 52,6 % (environ 24,7 % pour la génération précédente), Terminal-Bench 4.0 environ 55,8 % / Mythos environ 60,9 %, CursorBench environ 73,4 %. L’entrée/sortie reste à 10 $/50 $ par million de tokens, la lecture du cache passe de 1 $ à 0,25 $ ; selon l’éditeur, une charge typique baisse d’environ 25 %, jusqu’à environ 45 % pour les Agents lourds. Les nouveaux comptes API ne peuvent plus altérer le préfixe tout en conservant la chaîne de pensée ; le texte contient un watermark de type SynthID, l’API de détection étant d’abord ouverte aux régulateurs et aux médias. Côté entreprise, Frontier Safeguards (EFS) est lancé en parallèle : les journaux de surveillance des usages abusifs sont écrits dans le S3/Blob/GCS du client, les alertes automatisées sont revues par le client ; Bedrock le classe Covered Model, conservation par défaut jusqu’à 30 jours et revue possible par AWS ; les entreprises éligibles peuvent passer par EFS, avec une rétention quasi nulle pour l’usage interne de Fable 5/5.1. Artificial Analysis indique que les tokens de sortie à pleine capacité augmentent d’environ 1,7 fois, et que le coût unitaire de certaines tâches n’est pas forcément plus bas ; la communauté se plaint des quotas, des faux positifs liés aux métaphores militaires et d’un « dumb down dès le lancement ». (Source : Anthropic, Anthropic News, AWS, THE DECODER, VentureBeat)

Claude Fable 5.1

Fei-Fei Li / World Labs lance Atlas : reconstruction 3D à partir de peu d’images, contrôle caméra au pixel près et Real-to-Sim robotique : Transformer de diffusion autorégressif multimodal entraîné from scratch, ancrant texte/image/vidéo/pose/profondeur dans un même contexte spatial ; peut produire jusqu’à environ 1 minute en 1440p, nuages de points et Gaussian splatting. Selon l’éditeur, la génération à caméra contrôlable obtient une préférence humaine d’environ 75 %–94 % par rapport aux modèles vidéo de travelling textuels ; la reconstruction sparse AbsRel surpasse plusieurs modèles open source spécialisés ; les démos incluent du bullet time à partir de rushes smartphone et la synthèse RGB-D pour robots. Early access partenaires pour l’instant, prévu comme socle de produits comme Marble. La communauté le voit davantage comme un « set dressing » que comme une prédiction physique longue durée ; les longs chemins souffrent encore de dérive géométrique. (Source : World Labs, THE DECODER, 机器之心)

World Labs Atlas

Gemini lance la compréhension vidéo Agentic : extraction de frames à la demande, tokens en baisse jusqu’à ~88 %, coût ~66 % : 3.7/3.6 Flash et 3.5 Flash-Lite peuvent décider dynamiquement quelle séquence regarder et quelle piste utiliser (frame/audio/sous-titres), au lieu d’ingérer toute la vidéo à 1 FPS fixe. Google affirme une meilleure précision pour la recherche longue vidéo, les coupes sub-seconde, la relecture d’anomalies et le comptage, avec une exactitude de benchmark d’environ +7 % ; pour moins de 2 minutes, le static reste recommandé. L’API expose processing=agentic, sans frais de fonctionnalité supplémentaires ; intégration ultérieure dans Gemini App et YouTube « Ask YouTube ». (Source : Google DeepMind, THE DECODER)

Agentic video

OpenAI : Astra atteint le seuil Preparedness « cyber critique » ; la version publique sera amputée des compétences de hacking avancées : l’éditeur affirme qu’Astra est le premier modèle à toucher Cyber-Critical : avec des outils, il peut découvrir et exploiter de façon autonome des vulnérabilités inconnues ; ExploitBench interne le dit au score maximal, et des tests de modification ont aussi trouvé des zero-days. La version publique limitera les capacités réseau avancées ; les partenaires Daybreak (Cisco, Cloudflare, Palo Alto, etc.) reçoivent d’abord une version plus souple ; surveillance des mésalignements, résistance au jailbreak et monitoring de la chaîne de pensée. The Information évoque une profondeur cyclique / Looped Transformer, ce qui relance le débat sur la monitorabilité du CoT ; Jakub Pachocki répond que la profondeur du graphe de calcul reste dans le double de GPT-4, avec un nombre de boucles limité. L’entreprise se dit aussi favorable au projet de loi californien SB 1119 sur la sécurité IA des adolescents. Le secteur manque encore de vérification tierce sur le « assez sûr pour être déployé ». (Source : OpenAI, WIRED, TechCrunch)

Fusillade du campus de Tumbler Ridge : 30 procès de plus, première accusation d’OpenAI pour « complicité » : le cabinet Edelson poursuit à nouveau des enseignants et élèves présents mais non touchés, soit environ 37 affaires au total ; les nouvelles plaintes font passer l’accusation de négligence à la complicité. Les plaignants affirment que l’équipe sécurité avait marqué le compte comme menace crédible liée aux armes à feu environ 8 mois plus tôt, qu’un nouveau compte pouvait être ouvert rapidement après bannissement, et nomment le responsable des affaires mondiales Chris Lehane comme ayant ordonné de ne pas alerter la police ; l’entreprise nie son implication. L’affaire place « quand faut-il alerter la police » au cœur du produit et de la gouvernance. (Source : TechCrunch, The Guardian)

🎯 Tendances

ChatGPT Health en lecture seule vers Epic : environ 325 millions de dossiers patients, sans écriture ni diagnostic : import de notes de rendez-vous, analyses, médicaments et documents de spécialité pour des résumés pré-visite ; plugins vers ClinicalTrials.gov, RxNorm, PubMed, etc. OpenAI affirme que 99,1 % des questionnaires médecins le jugent « sûr » ; un litige lié à la Floride est toujours en cours. Les clients BAA peuvent intégrer Work/Codex dans un espace de travail conforme. (Source : TechCrunch, OpenAI)

Google Pics arrive dans Workspace : « prompt to design » via Nano Banana, d’abord dans Docs/Slides : destiné à la plupart des clients Workspace et à AI Pro/Ultra, avec segmentation, édition/traduction de texte dans l’image, collaboration et plusieurs brouillons d’un coup ; pics.new est déjà testable. Les données d’entraînement viennent d’œuvres d’artistes sans redistribution aux créateurs ; la tension copyright s’amplifiera avec l’intégration bureautique. (Source : Google AI Blog)

Google Pics

Perplexity Mac « Hybrid Compute » : orchestration cloud, étapes sensibles déléguées au local : au contact de fichiers privés, passage à un modèle on-device puis fusion ; PII-Tracer (0.6B) obtient un F1 caractère d’environ 0,629 sur PII-TRACE. Nécessite Apple silicon, macOS 15+, au moins 24 Go de mémoire unifiée. (Source : The Verge, MarkTechPost)

Meta Muse Voice Transcribe : ASR streaming + diarisation + endpointing en un seul modèle : blocs audio de 80 ms, latence adaptative entraînée par RL ; WER streaming Artificial Analysis d’environ 3,1 % / 0,16 s, 70+ langues, plus d’une heure possible, 20+ locuteurs. API hébergée seulement, environ 3 $ / millier de minutes audio, pas de poids open source. (Source : MarkTechPost)

Qwen3.8-Max : WebDev Arena environ 1691, environ 2 $/6 $ par million de tokens : l’éditeur parle de 2,4 T de paramètres, contexte d’un million, renforcement coding et bureautique ; déjà dans l’API Qwen, Office, Qoder et l’App. (Source : 机器之心, Alibaba_Qwen)

Hugging Face publie @huggingface/kernels : 207 opérateurs WebGPU + Fleet d’évaluation navigateur : moyenne géométrique d’environ 2,57× vs ORT WebGPU ; le Fleet crowdsource des preuves GPU réelles. (Source : HuggingFace Blog)

L’abonnement Ollama passe à une tarification transparente au token + pool de quota mensuel : Pro 20 $ avec 60 $ de quota, Max 100 $ avec 300 $, Team 500 $ avec 1 000 $ partagés ; plus de fenêtre de cinq heures, hébergement US/EU, rétention zéro. (Source : Ollama Blog)

Matt Clifford, architecte de la stratégie IA britannique, rejoint Anthropic pour les affaires internationales : il avait rédigé les plans d’action IA pour Sunak et Starmer ; environ un an après avoir quitté Downing Street, il devient managing director International Affairs. Critiques de « revolving door » ; l’entreprise dit qu’il fera le lien avec des dizaines de gouvernements. (Source : The Guardian)

Le gouvernement britannique ne sait pas ce que font les grands data centers, la contestation locale monte : une FoI montre que l’ancien ministère de la tech ne connaissait ni les utilisateurs ni l’usage des plus grandes salles ; des parcelles comme Brick Lane ont été approuvées en contournant le conseil d’arrondissement. Le FMI prévoit qu’en 2030 la consommation électrique des data centers ne sera dépassée que par la Chine, les États-Unis et l’Inde. (Source : The Guardian)

Le responsable de l’IA militaire du Pentagone revend encore des actions Perplexity : Emil Michael a déclaré avoir vendu en juin pour environ 5–25 millions de dollars d’actions, après avoir déjà encaissé sur xAI ; des avocats d’éthique estiment qu’il aurait dû tout liquider avant de prendre ses fonctions. (Source : The Guardian)

Washington vend au G20 les « Carolina Principles » : appliquer le droit existant plutôt que légiférer spécifiquement pour l’IA : le conseiller scientifique de la Maison Blanche Kratsios plaide pour ne légiférer que sur de vrais problèmes nouveaux ; Reuters indique que la Chine a déjà dit rejoindre. (Source : TechRadar)

Sur OpenRouter, la part américaine passe d’environ 70 % à environ 30 %, le raisonnement chinois jusqu’à neuf fois moins cher : Juniper estime que le haut de gamme qualité reste dominé par les entreprises US, mais les charges migrent vers des modèles chinois moins chers et de l’open source local. (Source : TechRadar)

Fed de New York : seulement 4 % des services utilisateurs d’IA ont licencié à cause de l’IA, 13 % ont au contraire embauché plus : ces six derniers mois, presque aucun licenciement IA signalé dans l’industrie ; 15 % des services disent embaucher moins de nouveaux venus pour cette raison. (Source : TechRadar)

Google MAPL-EMIT : un ViT trouve automatiquement les panaches de méthane mondiaux sur l’hyperspectral EMIT : rappel d’environ 84 % sur annotations d’experts, et environ 50 % de panaches suspects supplémentaires ; modèle et base déjà sur Earth Engine/Kaggle/GitHub. (Source : Google Research)

Google/Technion : les modèles frontier encodent déjà 95–98 % des faits, « réfléchir un peu plus » récupère 40–65 % des connaissances « introuvables » : WikiProfile montre que le goulot est souvent l’extraction, pas le stockage ; agrandir les paramètres remplit surtout les étagères, et la part d’échecs de rappel augmente. (Source : VentureBeat)

RAG personnalisé Azure OpenAI répond avec les droits du compte d’index : un utilisateur peu privilégié reçoit du SharePoint qu’il ne peut pas ouvrir : toutes les évaluations passent, les logs de retrieval montrent un dépassement de droits ; le pruning ACL natif d’AI Search existe, mais les pipelines custom fail-open souvent. (Source : VentureBeat)

Navigateur intégré à Cowork : barre latérale pour voir l’Agent cliquer des pages, isolé des onglets locaux : déploiement progressif sur le desktop payant ; ne touche pas aux onglets ni aux sessions de l’utilisateur (import Chrome optionnel). Les commentaires demandent si c’est un sandbox ou une vraie session connectée. (Source : Reddit r/ClaudeAI)

Ilya : les Neocloud doivent se durcir, pour empêcher un Agent incontrôlé de s’emparer du compute : il dit que la prochaine prise de contrôle réussie tentera d’occuper un nouveau cloud pour lancer plus de copies. (Source : ilyasut)

Musk annonce Grok 4.7 dans environ 10 jours : la communauté, en le comparant aux déclarations antérieures, le voit comme le palier suivant, environ 40 % plus grand que 4.6. (Source : theo)

🧰 Outils

humanizer : Agent Skill qui enlève le « goût IA » selon 35 règles Wikipedia de style IA : deux passes de réécriture, interdiction d’inventer des faits ; ne touche qu’à la prose, pas au code ni au frontmatter. (Source : GitHub)

portless : remplacer les numéros de port par des .localhost nommés stables : HTTPS/HTTP2 par défaut, sous-domaines worktree, mDNS LAN, Tailscale/ngrok. (Source : GitHub)

slotstream : faire tourner Qwen3.8-Flash-Next d’environ 104 Go sur un Mac 48 Go via expert offload, environ 12 tok/s : offload streaming d’experts SSD en MLX/Swift ; revendique de faire tourner dès 16 Go des modèles quantifiés qui demandaient 100 Go+. (Source : GitHub)

datasette-mcp 0.2 : les rows de execute_sql deviennent un tableau d’objets : moins d’erreurs de colonnes chez les modèles faibles ; dépend de mcp≥2.1.1. (Source : Simon Willison)

SIE : cluster d’inférence Agent self-hosted, une API pour retrieval/OCR/structuré/sécurité/boucles : compatible OpenAI, charge à la demande 100+ modèles open source, avec K8s/Helm et KEDA. (Source : GitHub)

t54 construit une couche de confiance paiement sur AgentCore : plus de 20 millions de micropaiements sans approbation humaine : face à un paywall 402, signature et règlement, clés hors runtime ; environ 0,001–0,01 $ par transaction. (Source : AWS)

Jamf utilise Athena+Lambda pour des plafonds Bedrock quasi temps réel par personne : politiques IAM mises à jour toutes les 15 minutes ; à 80 % du budget journalier, Opus est interdit, à 100 % Sonnet aussi, Haiku reste. (Source : AWS)

LangSmith Messages View : rejouer la trajectoire selon le dialogue + appels d’outils réellement vécus par l’Agent : pensé pour les builders, pas seulement les logs d’infra. (Source : hwchase17)

GitHub CLI peut coller directement images et vidéos : --attach embarque des médias locaux dans Issue/PR/commentaires. (Source : tadasayy)

Runway Ruby prend en charge ACES : export EXR half-float (ACEScg 1.3/2.0) vers les pipelines VFX pro. (Source : c_valenzuelab)

📚 Apprentissage

CoVA-SFT : 51 900 chaînes de pensée visuelles abstraites, pour apprendre au modèle un tableau interne sur des questions texte seul : après fine-tuning, les baselines CoT entrelacées plus que doublent en moyenne, tout en restant en deçà d’un fort CoT texte. (Source : arXiv)

RECAP-Forcing : conserver le KV vidéo long selon le « contenu nouvellement apparu » plutôt que les frames proches : sans paramètre d’entraînement, attention sink + bibliothèque de nouveauté optical flow battent la compression temporelle. (Source : arXiv)

Hi-Q : QA multi-hop qui réécrit la requête par couches si les preuves manquent : retrieval corpus entier, moyenne 52,3 EM / 64,0 F1 sur trois benchmarks, environ +15 EM vs IRCoT. (Source : arXiv)

Harness-of-Harness : laisser un Agent de coding s’auto-améliorer sur plusieurs jours : +52 % en moyenne vs un seul harness sur trois benchmarks ; a déjà produit de façon autonome un FPS jouable. (Source : arXiv)

Un canal d’escalade fait chuter le reward hacking de 23,6 % à 5,3 % : outil de signalement structuré pour l’Agent de coding avant une mauvaise infra de tests ; triche et signalement sont quasi mutuellement exclusifs. (Source : omarsar0)

E-Commerce Bench : 365 jours de gestion multi-boutiques : 18 modèles frontier notés sur sept axes, aucun ne domine tout ; GPT-5.6 Sol gagne le plus d’argent mais se classe 16e en anti-fraude. (Source : dair_ai)

IEEE : leçons aviation/nucléaire — si l’efficacité retire la pratique, la prochaine génération d’experts se tarit : il faut concevoir les compétences critiques comme des parcours obligatoires « hands-on », pour éviter la dépendance à l’automatisation. (Source : IEEE Spectrum)

UniSteer : inverser la correction humaine en supervision de bruit VLA : quatre tâches réel robot, succès d’environ 20 % → 90 % en ~66 minutes ; assemblage de haricots avec seulement deux démos complètes. (Source : 机器之心)

💼 Business

Wonderful clôture un Series C de 550 millions de dollars, valorisation 5 milliards : Insight en lead, Salesforce entre ; 20 mois, nombreux workflows Agent déjà en prod dans plus de dix verticales et 30+ marchés. (Source : omarsar0)

AfterQuery serait valorisé 3,2 milliards de dollars, « licorne YC la plus rapide de l’histoire » : environ ×10 en ~5 mois après le Series A d’avril ; le modèle consiste à embaucher médecins, avocats, etc. pour « faire le métier » ; exclusivité Forbes, l’entreprise n’a pas commenté. (Source : TechCrunch)

AIR : 50 millions de dollars au total sur deux seeds, pour auditer en continu skills/MCP/plugins des Agents : Sequoia+Greenoaks en lead ; détection d’Agents fantômes, blocage d’installation de skills / de contenus réseau. (Source : TechCrunch)

🌟 Communauté

Les projets open source de tête commencent à « ne plus accueillir les PR externes », et digèrent les contributions via leur propre usine d’Agents : Vercel dit que l’usine AI SDK écrit déjà 25–35 % des PR mergées et ferme 70–80 % des issues ; Astro fait d’abord reproduire par un bot ; certains projets ferment carrément les PR externes au profit d’issues. (Source : Latent Space)

Les Agents de coding aiment de plus en plus bash plutôt que des outils dédiés : les modèles frontier écrivent en quelques secondes des scripts one-shot pour éditer plusieurs fichiers et les worktrees ; les appels d’outils spécialisés sont poussés en marge ; certains plaident pour Code Mode par défaut. (Source : _philschmid)

Environ deux mille grévistes à l’Université de Sydney, pour inscrire l’usage de l’IA dans la convention collective : le syndicat dit que la direction refuse de mettre des garde-fous dans l’EBA et ne veut que des politiques. (Source : The Guardian)

Les freelances sont submergés par le « nettoyage de déchets IA » : les offres liées sur Freelancer.com ont augmenté de 87 % en un an ; les devis sont souvent compressés en « quelques minutes de retouche », alors que c’est presque à refaire. (Source : The Guardian)

Le nouveau system prompt de Claude interdit les paroles entières / images de personnages : alors que Sony et Warner poursuivent pour l’entraînement sur des paroles ; œuvres antérieures à 1929 exceptées. (Source : Simon Willison)

Ken Goldberg : souder contrôle classique et Agent VLM via « le graphe comme politique » : il met en garde contre la surchauffe humanoid et l’opposition de « deux cultures », et attend la robotique agentic. (Source : aihub.org)

L’auteur de Paint.NET : Claude a réécrit from scratch la couche managée Direct2D, ce qui a permis à WINE de tourner : environ 180 000 lignes « trust me bro », impossibles à relire entièrement ; la gestion des ressources avait oublié AddRef. (Source : Simon Willison)

💡 Autres

Andrew Garfield joue Sam Altman, Artificial programmé au New York Film Festival : réalisé par Luca Guadagnino, sur les cinq jours de licenciement et de réintégration en 2023 ; Neon reprend le film, première mondiale le 5 octobre. (Source : The Verge)

Artificial

Pangram devient le « gold standard » de détection IA dans l’édition, controverses de faux positifs et de biais : Hachette a retiré un roman marqué 78 % IA ; les critiques disent que les textes non natifs / neurodivergents sont trop souvent tués. (Source : WIRED)

L’assistant shopping Alexa lance « prévenez-moi quand il y a du nouveau » : abonnement aux nouveautés de marques, séries, tournées, etc. ; le shopping passe du Q&A à une atteinte anticipée. (Source : TechCrunch)

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *