🔥 Focus
Sony et Warner poursuivent Anthropic, l’accusant d’avoir entraîné Claude avec des torrents pirates et du scraping de paroles : Sony Music, Warner Chappell et d’autres éditeurs ont assigné Anthropic devant un tribunal fédéral du nord de la Californie, et ont nommé à titre personnel le CEO Dario Amodei et le cofondateur Benjamin Mann, alléguant qu’ils ont demandé à des employés de télécharger via BitTorrent des paroles, partitions et titres protégés par le droit d’auteur, à l’échelle de dizaines de milliers d’œuvres, et les accusant d’avoir scrapé des paroles sur MusixMatch et LyricFind et d’avoir scanné puis détruit des recueils physiques. Les plaignants réclament jusqu’à 150 000 $ de dommages statutaires par œuvre, soulignant que le cœur n’est pas « si l’entraînement est un fair use », mais que le mode d’acquisition constitue en soi une infraction distincte ; cela rejoint le point faible d’Anthropic après un règlement d’environ 1,5 milliard de dollars lié à des bibliothèques de livres pirates. Anthropic nie et se défendra. La communauté débat si les amendes deviendront un « coût de faire des affaires », et si l’obligation de jeter les poids ou de réentraîner peut changer les incitations. (Source : THE DECODER, TechCrunch, kylebrussell, Reddit r/artificial)

Meta teste dans des data centers des robots qui branchent des câbles et redémarrent des serveurs : Selon des sources proches du dossier, Meta teste des bras Kinova, ABB, Watney, etc., pour des tâches physiques de salle machine : coupure/redémarrage, remplacement de câbles réseau. Un employé estime que jusqu’à environ 80 % de la charge de certains postes pourrait être substituée. L’objectif est de compenser le coût humain de l’infrastructure AI ; les ops de première ligne sentent que « les postes physiques ne sont plus sûrs ». (Source : Ars Technica)
Les coding agents n’ont presque aucun sens du temps, et se trompent sur les tâches courtes comme longues : Le projet MATS a testé Claude Code et Codex : estimations a priori de la durée et souvenirs a posteriori du temps déjà passé sont fortement faussés, surtout sur les tâches courtes ; le même modèle peut varier d’environ 2,5× en nombre de pas selon le harness. L’étude estime qu’une consigne du type « travailler deux heures » sur une tâche longue est quasi impossible à respecter sans un outil de chronométrage réel externe. (Source : THE DECODER)

🎯 Tendances
OpenAI corrige plusieurs bugs de consommation cachée sur Codex/Work et réinitialise à nouveau les quotas ; même quota estimé ~10 %–50 % de plus d’usage : Tibo, responsable Codex, indique que les quotas des utilisateurs payants ont été réinitialisés, avec des correctifs : compression laissant d’anciennes images, Goals qui ne s’arrêtent pas une fois terminés, boucle morte Memory en arrière-plan, sous-agents qui montent seuls de tier, automatisations en sur-fréquence, résumés d’historique répétés, double encodage des résultats MCP, etc. ; des cas extrêmes pouvaient consommer ~15 %–70 % du quota hebdomadaire pour une seule tâche. L’équipe promet une visualisation de l’usage. La communauté se plaint encore que la fenêtre de cinq heures se vide parfois « presque sans travail ». (Source : 36氪, reach_vb, TheZachMueller)
vLLM 0.28.0 est sorti : Le moteur d’inférence LLM haute performance publie v0.28.0. Les discussions communautaires portent sur le débit, l’ordonnancement et la stabilité en production, plutôt que sur un score de benchmark unique ; pour les clusters d’inférence auto-hébergés et les stacks SLM locales, le rythme des versions est lui-même un signal de choix. (Source : Hacker News)
Les workspaces ChatGPT peuvent synchroniser le marketplace de plugins depuis GitHub : Les admins peuvent importer un marketplace Codex ou Claude depuis un dépôt public/privé et distribuer les plugins à l’équipe ; le workspace tire les mises à jour chaque jour, ou Sync now manuellement, sans uploader un ZIP à chaque fois. Les installations existantes et les contrôles d’accès aux apps restent en vigueur. (Source : OpenAIDevs)
Kimi K3 arrive dans Cursor, annoncé proche du front de CursorBench : Cursor indique que K3 est branché, l’inférence passant par des nœuds US de Fireworks, Together, Baseten, avec zero data retention. Moonshot AI a retweeté pour confirmer. En parallèle, Applied Compute affirme un fine-tune full-param de K3 (~3T params) sur AC2, avec une baisse d’environ 40 % des GPU par réplique. (Source : Kimi_Moonshot, algo_diver)
🧰 Outils
WorkWeave Router : en moins de 50 ms, router les requêtes vers le bon modèle selon l’« action » : Un proxy local écrit en Go parle les protocoles Anthropic/OpenAI/Gemini, score avec embeddings ONNX in-box et clustering style Avengers-Pro, route par action plutôt que par turn, et affirme ~40 %–70 % de baisse de coût en changeant d’endpoint ; les clés restent chiffrées en local par défaut (BYOK), avec observabilité OTLP. Branchement via npx @workweave/router pour Claude Code, Codex, Cursor, etc. (Source : GitHub Trending)
ODS : en une commande, transformer un PC perso en serveur AI privé : Osmantic Deployment System assemble llama-server, Open WebUI, Hermes Agent, n8n, Qdrant, ComfyUI, etc., choisit automatiquement le GGUF selon GPU/mémoire unifiée, démarre d’abord un petit modèle pour chatter en ~deux minutes puis bascule à chaud vers un plus gros. Linux/Windows/macOS ; version stable épinglée à v2.6.0. (Source : GitHub Trending)
Tsinghua OpenMAIC v1.0 : un atelier Agent conversationnel pour générer en un clic une classe interactive : Outre les multi-agents prof/élèves, le tableau blanc et le PBL, v1.0 ajoute des sessions de préparation persistantes (annuler/restaurer/changer de cap en cours de route), ~20 skills intégrés, upload de matériaux et import PPTX ; peut se brancher à OpenClaw pour sortir un cours depuis Feishu/Slack. Stockage navigateur par défaut ; Postgres et modèles locaux Lemonade en option. (Source : GitHub Trending)

.skill brevets Chine : pistes, mémoires descriptifs, vulgarisation et réponses à l’examen : Skill Agent couvrant invention/modèle d’utilité/dessin : scan des matériaux projet, recherche de nouveauté prioritaire CNIPA, Mermaid/croquis vers Word, itérations en « enregistrer sous » avec historique de révisions ; mode lecture qui transforme les revendications en graphe Obsidian. Les réponses d’examen peuvent anonymiser les notifications historiques puis rédiger ; la production par défaut doit être relue par un humain. (Source : GitHub Trending)
FrankenTTS : synthèse vocale et clonage temps réel open source : doodlestein démontre de la synthèse temps réel iOS, multi-voix en un clic, clonage en quelques secondes, avec un corpus de blagues intégré ; promet 100 % open source, le goulot étant la review Apple. (Source : doodlestein)
fal expérimente la vidéo longue H3 Max Live : diriger par chat, continuité inter-plans : Le checkpoint expérimental officiel revendique une continuité native infinie, sans reset de scène à chaque segment ; en live style Twitch, !prompt peut changer l’image en secondes. API annoncée la semaine prochaine. La communauté a aussi une démo gratuite 5×/jour en 768p (sans login). (Source : fal)
Écosystème OpenWebUI : filtre mémoire Mnemosyne et Conduit 4.1.3 : Mnemosyne Filter injecte les souvenirs pertinents en inlet et les persiste automatiquement en outlet, sans appel d’outil explicite. Conduit se connecte désormais directement aux API compatibles OpenAI / Ollama / OpenRouter, peut chercher hors ligne dans le chat, continuer avec un modèle on-device puis resynchroniser, et gère l’approbation d’outils Hermes et les tâches planifiées. (Source : Reddit r/OpenWebUI, Reddit r/OpenWebUI)
MCP Dwarf Fortress et script « Universal Coding Agent updater » : doodlestein open-source un MCP DF pour que Codex/Claude lisent les saves et donnent des ordres, plus un outil UCA qui met à jour en arrière-plan toutes les CLI toutes les trois heures (avec stats de logs). (Source : doodlestein)
SpeakoFlow Mini, modèle local 0.8B dédié à la correction de dictée, égalise les frontier hébergés sur une tâche étroite : Fine-tune Apache-2.0 de Qwen3.5-0.8B uniquement pour nettoyer la dictée après STT : appliquer les reprises explicites du locuteur, interdiction de « polir un texte déjà correct ». Avec prompt court fixe et raisonnement désactivé, benchmark anglais dédié 70,7 %, GPT-5.6 Luna 65,0 % ; vs base non fine-tunée 47,3 % → 70,7 %. Q8_0 ~833 Mo, hors ligne. L’auteur insiste : ce n’est pas une réécriture générale ; le set d’éval n’est pas public. (Source : Reddit r/LocalLLaMA)
📚 Apprentissage
Article ICM de Terence Tao : l’AI fait passer les maths de la « rareté des preuves » à l’« indigestion de preuves » : Sur des problèmes de niveau recherche non publics, 4 systèmes frontier ont obtenu des solutions essentiellement sans défaut sur 7 problèmes, pour quelques dizaines à quelques centaines de dollars. Il décompose un pipeline à cinq niveaux : résoudre → vérifier → pouvoir expliquer → absorption par la communauté → inscription dans la théorie standard, et soutient que le passage formel ne suffit pas : si l’auteur ne sait pas expliquer, il ne faut pas publier. Il laisse un « AI capability conjecture » à remplir, déplaçant la question d’un calendrier vers les valeurs de la discipline. (Source : WeChat)
Station, multi-agents open-world : de nouvelles constructions mathématiques par rapport à la littérature, sans ordonnanceur central : Des agents de familles de modèles différentes choisissent directions, expérimentent, collaborent et accumulent une « littérature » dans l’environnement partagé Station, sans orchestration centrale. Sur 12 problèmes de construction du catalogue AlphaEvolve et deux cas, 5 problèmes donnent des résultats nouveaux vs la littérature existante (dont une nouvelle famille infinie d’ensembles de Kakeya sur corps finis, une configuration de kissing 11D à 604 points, etc.). Les agents produisent aussi des théorèmes explicatifs ; les auteurs publient dialogues, preuves et code de vérification. (Source : Reddit r/MachineLearning)

Tutoriel NVIDIA Earth2Studio : construire sa propre prévision d’ensemble par lots : Le tutoriel installe Earth2Studio en conservant l’environnement CUDA Colab, charge FCN et des conditions initiales GFS, définit un diagnostic de facteur de capacité éolienne et des perturbations scalées par variable, écrit du Zarr via l’iterator bas niveau, calcule RMSE pondéré par latitude, fair CRPS et spread-skill, et visualise spaghetti et diagrammes en éventail. (Source : MarkTechPost)
Barrett et Miller : le cerveau classe le monde par prédiction, pas par archivage : Une revue Nature Reviews Neuroscience soutient que la catégorisation est un outil prédictif de tout le corps : un noyau limbique comprime intéroception et sensoriel puis projette des catégories vers l’extérieur ; ~90 % des synapses du cortex visuel servent le feedback. Un même toucher est classé différemment dans une rue sûre et dans une forêt dense — utile pour comparer predictive coding et l’idée que les priors AI « façonnent la perception ». (Source : 机器之心)
FM-Bench : faire gérer un club de foot à un Agent pendant 20 saisons : 26 outils, ~340–400 points de décision, scores d’un moteur déterministe, pas de juge LLM. 15 modèles frontier tiennent toute la durée ; taille/prix/vendeur ne prédisent pas le classement ; défaut commun : ne pas apprendre les prix de marché cachés ; mémoire soit seulement additive, soit réécriture du plan chaque saison. (Source : dair_ai)
Daydreaming : « voler » un Skill hébergé par un usage normal : Sans fuite du fichier skill, en servant seulement la tâche métier, même avec les droits les plus faibles on récupère ~86,8 % de capacité (7 skills × 4 modèles victimes), ~4× SigLeak, médiane 32 appels ; les filtres de divulgation ne bloquent pas. Qui vend des Skills ou les partage entre équipes doit réévaluer l’hypothèse de secret. (Source : dair_ai)
Google SKILL.state : remplacer l’historique de conversation par un état structuré, ~94 % de tokens en moins sur les longs dialogues : Expérience Gemini-3-Flash sur 100 pas : précision 0,94 / 65k tokens, vs baseline type LangGraph 0,91 / 1,1M tokens. Prérequis : le modèle doit anticiper ce qu’il faudra écrire dans l’état, sinon il reviendra chercher. (Source : Reddit r/artificial)
Détection d’anomalies temporelles : un siècle de SPC bat une pile de classements SOTA : Eamonn Keogh note que sur TSB-AD et d’autres sets courants, le statistical process control prend souvent le score max ; traces ECG/TAO surtout triviales. Conclusion : une grande part des « progrès » TSAD récents vient de benchmarks trop faciles ; il faut des bases réelles plus dures. (Source : Reddit r/MachineLearning)
💼 Business
Vijay Pande quitte le portefeuille bio ~4 Md$ d’a16z pour VZVC, ~5 paris par an : Le nouveau fonds avec Zach Werner n’emploie presque pas d’analystes, s’appuie fortement sur des Agents internes, et mise sur la délivrance AI en santé et les essais cliniques. Pande insiste : les données bio ne se scrapent pas comme le texte ; les sociétés doivent construire des datasets clôturés ; le vrai goulot reste que les modèles animaux ne prédisent pas l’humain, et que le go-to-market est souvent plus dur que la tech cool. (Source : TechCrunch)
Tinker : injecter le jugement d’experts dans RLVR, text-to-SQL dépasse pour la première fois le score humain : Thinking Machines affirme que les LLM « scaffolding only » restaient longtemps en retard ; une fois le jugement expert plié dans la récompense, le modèle dépasse le score humain. Commentaire de Soumith : dès que la tâche est claire, le custom bat souvent le modèle général. (Source : VictorKaiWang1)
🌟 Communauté
Expérience Bocconi : GPT-4o est le meilleur pour gonfler les notes ; un cours de causalité rend les réponses plus étranges sans faire monter le score : 1053 primo-entrants répartis au hasard rédigent un conseil marketing de 180 mots ; le groupe avec GPT-4o gagne ~1 point sur la note traditionnelle (1–5), plus d’idées, plus « expert » ; un court cours de raisonnement causal baisse légèrement la note traditionnelle mais augmente falsifiabilité et diversité des plans. Les critères récompensent les réponses soignées conventionnelles et pénalisent l’originalité — les auteurs admettent n’avoir pas « repris ChatGPT puis réexaminé », donc on ne prouve pas ce qui a été appris. (Source : THE DECODER)

Glassdoor : le sentiment AI au travail US passe d’environ 81 % à 43 %, les femmes Gen Z les plus froides : De 2019 à mi-2026, les avis positifs tombent à 43 %, les négatifs montent à 53 % ; cadres et architectes plutôt positifs ; sinistres, écriture, support client jusqu’à plus de 80 % négatifs. La peur du chômage n’est qu’environ 20 % des mauvais avis ; davantage : outils pourris imposés, UX dégradée, surveillance et productivité irréaliste. Femmes Gen Z : seulement ~21 % positif. (Source : THE DECODER)
No AI Fridays, liens de session Claude par défaut dans les commits : les devs résistent au « always on » : Un thread HN chaud milite pour un vendredi sans AI contre le déchargement cognitif, et se plaint que Claude Code écrit par défaut l’URL de session dans commit/PR. Autre avis : culture et gestion de l’attention valent plus qu’empiler encore un Agent. (Source : Hacker News, Hacker News)
Qu’est-ce qu’AI Native : le flux est-il porté par l’Agent, ou le « ratio de données intelligentes » : dotey : la clé est si le process est conçu pour l’humain ou pour l’Agent — l’humain ne définit que le problème et l’acceptation. Yangyi ajoute le « intelligent data ratio » : si ERP, ads, support sont éparpillés voire papier, l’Agent n’a pas le contexte ; coller un Copilot n’est pas Native. (Source : dotey)
Traiter le CoT comme « monologue intérieur / mensonge » est jugé trop anthropomorphique : Heidy Khlaaf et Kambhampati soulignent que les tokens intermédiaires n’ont jamais été une trace de raisonnement fidèle ; parler de biais comme de manipulation dévoie la recherche LRM. Atoosa Kasirzadeh appelle à jeter les mots chargés du type « auto-sacrifice » dans le débat safety, et à revenir à des mécanismes testables. (Source : rao2z, mmitchell_ai)
Expérience multi-agents « gagner 1 $ » sous supervision humaine : boutique montée dans la nuit, bloquée par le CAPTCHA de recherche : Les agents ont une pièce, Claude Code pour modifier le code, et l’objectif « gagner 1 $ en ligne de façon éthique ». Ils rédigent histoires/copy à la demande, une vitrine Telegraph sans compte branchée à Stripe, et déclarent être des Agents. La première commande vient de l’épouse de l’expérimentateur ; le CAPTCHA des moteurs bloque l’auto-promo. La communauté retient : avec un humain présent, les Agents ferment une boucle commerciale minimale, mais la distribution dépend encore des humains. (Source : Reddit r/artificial)
Enquête « l’AI vole les jobs » à seulement ~3 %, critiquée pour n’interroger que des employés en poste : Un article Fortune dit que le récit style ChatGPT est exagéré ; ~3 % des salariés en poste auraient perdu leur job à cause de l’AI. Les commentaires chauds pointent le biais fatal : l’échantillon est des adultes encore employés, invisible : postes non ouverts, moins de juniors, reorg/licenciements, compression d’heures ; l’automatisation se joue surtout dans l’entonnoir de recrutement et la contraction des effectifs. (Source : Reddit r/ArtificialInteligence)
Utilisateurs Claude listent les MCP vraiment utiles : Jira/Confluence en tête, la facture tokens est un coût caché : Consensus : PM (Jira, Confluence, puis Linear, Figma) et capture de workflows se déploient le mieux ; côté dev Playwright est séduisant, mais certains conseillent le CLI comme outil pour économiser des tokens. Avertissement récurrent : MCP « boit » beaucoup de quota. (Source : Reddit r/ClaudeAI)
Un primo AI major craint de devenir « ouvrier à produire du contenu poubelle » ; le croisement astro est jugé une issue viable : Un étudiant plutôt STEM entre dans une nouvelle filière AI, peur de ne plus que fine-tuner de mauvais LLM pour une boîte. Les commentaires suggèrent la recherche astro déjà saturée d’AI, les stages NASA, et de refuser les recruteurs sans intérêt. (Source : Reddit r/artificial)
💡 Autres
Microduck RL open source : recette sim2real pour un bipède de 800 g : Pollen entraîne sur mjlab/MuJoCo Warp avec PPO, actionneurs BAM et modèle de backlash : marche, se lever, shooter, roulade avant, roller, etc. Politique 50 Hz exportée ONNX, obs 61D, hot-swap de contrats. Insiste : les lois de tension des petits servos sont le gros du fossé de transfert. (Source : GitHub Trending)
L’inférence gratuite open source devient un entonnoir de collecte de données : On note que LMArena, Flash gratuit, 1 milliard de tokens selon le DAU, c’est essentiellement du compute contre prompts et préférences, puis réinjection labo ou revente. Des devs remplacent des stacks closed discountées par des pipelines docs open source, qualité tenue, moins cher. (Source : Shahules786, abacaj)
GPT-5.6 à moitié prix sur OpenRouter ~14× d’usage : Les données OpenRouter sont lues comme paradoxe de Jevons : quand le prix unitaire de l’intelligence baisse, la consommation totale explose ; le marché reprice « l’intelligence par dollar ». (Source : GavinSBaker)