Sony y Warner demandan a Anthropic, acusándola de entrenar… | Diario de IA 2026-08-31

🔥 Enfoque

Sony y Warner demandan a Anthropic, acusándola de entrenar Claude con torrents piratas y scraping de letras : Sony Music, Warner Chappell y otros editores demandaron a Anthropic en un tribunal federal del norte de California, e incluyeron como demandados personales al CEO Dario Amodei y al cofundador Benjamin Mann, alegando que instruyeron a empleados a descargar por BT letras, partituras y pistas protegidas por copyright, a escala de decenas de miles de obras, y acusándolos de extraer letras de MusixMatch y LyricFind y de escanear y destruir cancioneros físicos. Los demandantes piden hasta 150.000 dólares de daños legales por obra y subrayan que el núcleo no es si el entrenamiento es fair use, sino que el propio modo de obtención constituye infracción independiente; ello coincide con el punto débil de Anthropic en el acuerdo de unos 1.500 millones de dólares por bibliotecas de libros piratas. Anthropic lo niega y se defenderá. La comunidad debate si las multas se volverán “coste de hacer negocios” y si forzar a descartar pesos o reentrenar puede cambiar los incentivos. (Fuente: THE DECODER, TechCrunch, kylebrussell, Reddit r/artificial)

索尼华纳起诉Anthropic

Meta prueba en centros de datos robots que enchufan cables y reinician servidores : Según fuentes informadas, Meta está usando brazos robóticos Kinova, ABB, Watney y otros para probar tareas físicas de sala de máquinas como cortes de energía y reinicios y cambio de cables de red; un empleado estima que hasta alrededor del 80% de la carga de algunos puestos podría sustituirse. El movimiento busca compensar el coste laboral de la infraestructura de IA y hace que operaciones de primera línea sientan que “los puestos físicos ya no son seguros”. (Fuente: Ars Technica)

Los coding Agent casi no tienen sentido del tiempo y sesgan tanto tareas cortas como largas : El proyecto MATS evaluó Claude Code y Codex: tanto la estimación previa de duración como el recuerdo posterior del tiempo usado están gravemente distorsionados, sobre todo en tareas cortas; el mismo modelo puede diferir unas 2,5 veces en número de pasos según el harness. El estudio sostiene que las tareas de largo plazo que piden “trabajar dos horas” casi no se pueden cumplir salvo con un reloj real externo. (Fuente: THE DECODER)

Agent没有时间感

🎯 Tendencias

OpenAI corrige varios bugs de consumo oculto en Codex/Work y vuelve a resetear cuotas; con la misma cuota se espera un 10%–50% más de uso : El responsable de Codex, Tibo, dijo que se han reseteado las cuotas de usuarios de pago y se han corregido residuos de compresión de imágenes antiguas, Goals que no se detienen al completar, bucles muertos de Memory en segundo plano, sub-Agent que suben de plan por su cuenta, automatización a sobrevelocidad, resúmenes históricos duplicados y doble codificación de resultados MCP; en casos extremos una sola tarea puede consumir alrededor del 15%–70% de la cuota semanal. El equipo prometió visualización de uso. La comunidad sigue quejándose de que en la ventana de cinco horas a veces “casi no se trabajó y ya se vació”. (Fuente: 36氪, reach_vb, TheZachMueller)

Se publica vLLM 0.28.0 : El motor de inferencia LLM de alto rendimiento lanza v0.28.0. El debate comunitario se centra en throughput, scheduling y estabilidad en despliegue de producción, no en récords de un solo benchmark; para clusters de inferencia propios y stacks SLM locales, el ritmo de versiones ya es en sí una señal de elección. (Fuente: Hacker News)

Los workspaces de ChatGPT pueden sincronizar el marketplace de plugins desde GitHub : Los administradores pueden importar marketplaces de Codex o Claude desde repositorios públicos/privados y asignar plugins al equipo; el workspace extrae actualizaciones a diario y también se puede Sync now a mano, sin subir ZIP cada vez. Las instalaciones existentes y el control de acceso a apps siguen vigentes. (Fuente: OpenAIDevs)

Kimi K3 llega a Cursor y afirma acercarse a la frontera de CursorBench : Cursor dice que K3 ya está integrado, con inferencia en nodos de EE. UU. de Fireworks, Together y Baseten, y con retención cero de datos. Moonshot lo reenvió confirmándolo. En la comunidad, Applied Compute afirma haber hecho fine-tuning de todos los parámetros de un K3 de casi 3T de parámetros en AC2, con una caída de unos 40% en GPU por réplica. (Fuente: Kimi_Moonshot, algo_diver)

🧰 Herramientas

WorkWeave Router: en 50ms dirige la petición al modelo adecuado según “acción” : Un proxy local escrito en Go habla a la vez los protocolos Anthropic/OpenAI/Gemini, puntúa con embeddings ONNX en caja y clustering estilo Avengers-Pro, enruta por action y no por turn, y afirma que cambiando el endpoint se puede bajar el coste unos 40%–70%; las claves quedan cifradas en el equipo por defecto (BYOK) y trae observabilidad OTLP. Se puede conectar con npx @workweave/router a Claude Code, Codex, Cursor, etc. (Fuente: GitHub Trending)

ODS convierte el PC personal en un servidor de IA privado con un comando : Osmantic Deployment System ensambla con un comando llama-server, Open WebUI, Hermes Agent, n8n, Qdrant, ComfyUI, etc., elige GGUF según GPU/memoria unificada, por defecto usa primero un modelo pequeño para chatear en dos minutos y en segundo plano cambia en caliente a uno grande. Soporta Linux/Windows/macOS; la versión estable está fijada en v2.6.0. (Fuente: GitHub Trending)

Tsinghua OpenMAIC v1.0: un banco de trabajo de Agent conversacional genera aulas interactivas con un clic : Además de los multi-Agent profesor/compañero, pizarra y PBL originales, v1.0 añade sesiones persistentes de preparación de clase que se pueden cancelar/restaurar/redirigir a mitad, unas 20 skills integradas, y subida de materiales e importación PPTX; se puede conectar OpenClaw para dar clase desde Feishu/Slack. Almacenamiento por defecto en el navegador; opcional Postgres y modelos locales Lemonade. (Fuente: GitHub Trending)

OpenMAIC

.skill de patentes de China: puntos de invención, divulgación, lectura divulgativa y respuesta a examen : La skill de Agent cubre invención/modelo de utilidad/diseño: escanea materiales del proyecto, búsqueda de novedad prioritaria en CNIPA, Mermaid/bocetos a Word, itera guardando copias y deja historial de revisiones; el modo de interpretación convierte las reivindicaciones en un grafo de Obsidian. La respuesta a examen puede desidentificar notificaciones históricas, guardarlas e redactar; la salida por defecto debe ser revisada por humanos. (Fuente: GitHub Trending)

FrankenTTS: síntesis y clonación de voz en tiempo real de código abierto : doodlestein demostró síntesis en tiempo real en iOS, múltiples timbres con un clic, clonación en segundos y corpus de bromas integrado; dice que será 100% open source; el cuello de botella es la revisión de Apple. (Fuente: doodlestein)

fal experimenta vídeo largo H3 Max Live: dirigir por chat, continuidad entre tomas : Oficialmente, el checkpoint experimental soporta continuidad nativa infinita y las escenas no se reinician en cada segmento; los usuarios pueden cambiar la imagen en segundos con !prompt en un live estilo Twitch. La API se dice que abrirá la semana que viene. En la comunidad hay a la vez un demo gratuito 5 veces/día a 768p (sin login). (Fuente: fal)

Ecosistema OpenWebUI: filtro de memoria Mnemosyne y Conduit 4.1.3 : Mnemosyne Filter inyecta memorias relevantes en el inlet y las guarda automáticamente en el outlet; el modelo no necesita llamar herramientas de forma explícita. Conduit ya puede conectar APIs compatibles con OpenAI/Ollama/OpenRouter, buscar chats offline, continuar con un modelo en el dispositivo y resincronizar, y soporta aprobación de herramientas Hermes y tareas programadas. (Fuente: Reddit r/OpenWebUI, Reddit r/OpenWebUI)

MCP de Dwarf Fortress y script de “coding Agent de actualización para todos” : doodlestein abrió el DF MCP para que Codex/Claude lean partidas y den órdenes, y la herramienta UCA que actualiza cada tres horas en segundo plano los CLI de cada casa (con estadísticas de logs). (Fuente: doodlestein)

SpeakoFlow Mini, modelo local de 0.8B, se especializa en corrección de dictado y empata modelos frontier alojados en una tarea estrecha : Modelo Apache-2.0 fine-tuneado sobre Qwen3.5-0.8B que solo limpia dictado tras transcripción de voz: ejecuta correcciones explícitas del hablante y prohíbe “pulir texto ya correcto”. Con prompt corto fijo y razonamiento apagado, el benchmark inglés dedicado da 70,7%, GPT-5.6 Luna 65,0%; respecto a la base sin fine-tune sube de 47,3% a 70,7%. Q8_0 ~833MB, usable offline. El autor insiste en que no es reescritura general; el conjunto de evaluación no se ha publicado. (Fuente: Reddit r/LocalLLaMA)

📚 Aprendizaje

Artículo de ICM de Terence Tao: la IA lleva las matemáticas de “escasez de pruebas” a “indigestión de pruebas” : En problemas de nivel de investigación no publicados, 4 sistemas de frontera obtuvieron soluciones básicamente sin fallos en 7 problemas, a un coste de solo decenas a cientos de dólares. Descompone un pipeline de cinco niveles: resolver → verificar → poder explicar → absorción comunitaria → escritura en la teoría estándar, y sostiene que pasar la formalización no basta: si el autor no puede explicarlo, no debería publicarse. Deja un hueco de “conjetura de capacidad de IA”, desplazando la cuestión del calendario a los valores de la disciplina. (Fuente: WeChat)

Station, multiagente de mundo abierto: nuevas construcciones matemáticas respecto a la literatura sin orquestación central : Agentes de distintas familias de modelos eligen dirección, experimentan, colaboran y acumulan “literatura” en el entorno compartido Station, sin orquestación central. En 12 problemas de construcción del catálogo AlphaEvolve y dos casos, 5 dieron resultados nuevos respecto a la literatura existente (incluida una nueva familia infinita de conjuntos Kakeya en cuerpos finitos, una configuración de besos de 604 puntos en 11 dimensiones, etc.). Los agentes también produjeron teoremas explicativos; los autores publicaron diálogos, pruebas y código de verificación. (Fuente: Reddit r/MachineLearning)

Station多智能体数学发现

Tutorial NVIDIA Earth2Studio: pronóstico meteorológico por conjuntos por lotes propio : El tutorial instala Earth2Studio manteniendo el entorno CUDA de Colab, carga FCN y condiciones iniciales GFS, personaliza un diagnóstico de factor de capacidad eólica y perturbaciones escaladas por variable, escribe Zarr con el iterator de bajo nivel, calcula RMSE ponderado por latitud, fair CRPS y spread-skill, y visualiza spaghetti y diagramas de abanico. (Fuente: MarkTechPost)

Barrett y Miller: el cerebro clasifica el mundo con predicción, no con archivo : Una revisión en Nature Reviews Neuroscience sostiene que clasificar es una herramienta predictiva de todo el cuerpo: el núcleo límbico comprime interocepción y sentidos y proyecta categorías hacia fuera; alrededor del 90% de las sinapsis de la corteza visual sirven al feedback. El mismo toque se clasifica distinto en una calle segura y en una selva densa: tiene valor comparativo para entender el coding predictivo y cómo la IA “los priors moldean la percepción”. (Fuente: 机器之心)

FM-Bench: hacer que un Agent gestione un club de fútbol 20 temporadas : 26 herramientas, unos 340–400 puntos de decisión; la puntuación la da un motor determinista, sin juez LLM. 15 modelos de frontera aguantan toda la duración; ni escala, ni precio ni fabricante predicen el ranking; el fallo común es no aprender el precio de mercado oculto, y la memoria o solo crece o reescribe el plan cada temporada. (Fuente: dair_ai)

Daydreaming: con el uso normal se puede “robar” un Skill alojado : No hace falta que la otra parte filtre el archivo de skill; basta servir la tarea propia; con los permisos más débiles aún se recupera alrededor del 86,8% de la capacidad (7 skills × 4 modelos víctima), unas 4 veces SigLeak, mediana de 32 llamadas; el filtrado de divulgación no lo para. Quienes venden Skills o los comparten entre equipos deben reevaluar las hipótesis de secreto. (Fuente: dair_ai)

Google SKILL.state: sustituir el historial de conversación por estado estructurado, ~94% menos tokens en sesiones largas : Experimento de 100 pasos con Gemini-3-Flash: precisión 0,94 / 65.000 tokens, frente a una línea base tipo LangGraph 0,91 / 1,1 millones de tokens. El supuesto es que el modelo pueda anticipar qué información futura hay que escribir en el estado; si no, seguirá recuperando hacia atrás. (Fuente: Reddit r/artificial)

Detección de anomalías temporales: un siglo de SPC gana un montón de rankings SOTA : Eamonn Keogh señala que en conjuntos habituales como TSB-AD, el control estadístico de procesos suele sacar nota perfecta; las trayectorias ECG/TAO son especialmente triviales. La conclusión es que gran parte del “progreso” reciente en TSAD se debe a que los problemas del ranking son demasiado fáciles; la comunidad necesita benchmarks reales más difíciles. (Fuente: Reddit r/MachineLearning)

💼 Negocios

Vijay Pande deja el portfolio bio de casi 4.000 millones de dólares de a16z y funda VZVC, que solo hace unas 5 apuestas al año : El nuevo fondo con Zach Werner casi no usa analistas, depende mucho de Agent internos y apuesta por entrega de IA sanitaria y ensayos clínicos. Pande insiste en que los datos biológicos no se pueden raspar como el texto; las empresas tienen que construir conjuntos amurallados; el cuello de botella real sigue siendo que los modelos animales no predicen al humano, y que el go-to-market suele ser más difícil que la tecnología cool. (Fuente: TechCrunch)

Tinker: escribe el juicio experto en RLVR; text-to-SQL supera por primera vez la marca humana : Thinking Machines dice que un LLM de puro andamiaje llevaba tiempo por detrás en esa tarea; al plegar el juicio experto en la recompensa, el modelo superó la puntuación humana. Soumith comenta: cuando la tarea está clara, lo a medida suele ganar al modelo general. (Fuente: VictorKaiWang1)

🌟 Comunidad

Experimento Bocconi: GPT-4o es el que más sube nota; un curso causal hace las respuestas más raras pero no sube la nota : 1053 estudiantes de nuevo ingreso, agrupados al azar, escribieron un consejo de marketing de 180 palabras; el grupo con GPT-4o subió unos 1 punto en la nota tradicional (1–5), con más ideas y más aspecto de experto; un curso corto de razonamiento causal bajó un poco la nota tradicional, pero aumentó la falsabilidad y la diversidad de planes. El criterio de puntuación premia respuestas pulidas y convencionales y penaliza lo original: los autores admiten que no “quitaron ChatGPT y volvieron a examinar”, así que no pueden probar qué se aprendió. (Fuente: THE DECODER)

学生作业与AI

Glassdoor: el sentimiento positivo hacia la IA en el trabajo en EE. UU. cae de ~81% a 43%; las mujeres de la Generación Z, las más frías : De 2019 a mediados de 2026, los comentarios positivos bajaron al 43% y los negativos subieron al 53%; ejecutivos y arquitectos tienden a lo positivo; reclamaciones, escritura y atención al cliente pueden superar el 80% de negativos. El miedo al desempleo es solo ~20% de las malas reseñas; más hay uso forzado de herramientas malas, peor experiencia, vigilancia y productividad irreal. Las mujeres Gen Z solo ~21% positivas. (Fuente: THE DECODER)

No AI Fridays, enlaces de sesión de Claude por defecto en los commits: los desarrolladores resisten el “siempre online” : Hilos calientes de HN, por un lado, proponen no usar IA los viernes contra la descarga cognitiva; por otro, se quejan de que Claude Code escribe por defecto la URL de sesión en commit/PR. Otra opinión: cultura y gestión de la atención suben más la productividad que apilar otro Agent. (Fuente: Hacker News, Hacker News)

Qué es AI Native: ¿el sujeto del proceso es el Agent, o el “ratio de datos inteligentes”? : dotey cree que la clave es si el proceso se diseñó para humanos o para Agent: el humano solo define el problema y la aceptación. Yangyi añade el “ratio de datos inteligentes”: si inventario, ads y soporte están dispersos o incluso en papel, el Agent no tiene contexto; pegar una capa Copilot sigue sin ser Native. (Fuente: dotey)

Tratar el CoT como “monólogo interior/mentira” se critica como antropomorfismo excesivo : Heidy Khlaaf y Kambhampati subrayan que los tokens intermedios nunca fueron un rastro fiel de razonamiento; llamar sesgo a manipulación desvía la investigación de LRM. Atoosa Kasirzadeh pide que el debate de seguridad suelte palabras cargadas como “autosacrificio” y vuelva a descripciones de mecanismos comprobables. (Fuente: rao2z, mmitchell_ai)

Experimento multiagente de “ganar 1 dólar” con supervisión humana: montan tienda de noche, se traban en CAPTCHA de búsqueda : El experimento da a los Agent una habitación, Claude Code para cambiar código y el objetivo de “ganar 1 dólar en línea de forma ética”. Los agentes redactan historias/copy bajo demanda, usan un escaparate Telegraph sin cuenta conectado a Stripe y declaran que son Agent. El primer pedido vino de la esposa del experimentador; el CAPTCHA de buscadores bloqueó la autopromoción. A la comunidad le importa: con alguien presente, el Agent puede montar un bucle comercial mínimo, pero la distribución sigue dependiendo de humanos. (Fuente: Reddit r/artificial)

Una encuesta de “la IA se lleva el trabajo” dice solo ~3% y se critica por muestrear solo a quienes siguen empleados : Un reportaje relacionado de Fortune dice que la narrativa tipo ChatGPT exagera; la encuesta muestra ~3% de empleados que perdieron el trabajo por IA. Los comentarios calientes señalan un sesgo fatal: la muestra son adultos que aún tienen trabajo, no se ven puestos no abiertos, menos juniors, recortes de reorganización y compresión de horas; la automatización ocurre más en el embudo de contratación y en la contracción de plantilla. (Fuente: Reddit r/ArtificialInteligence)

Usuarios de Claude listan MCP que de verdad ahorran: Jira/Confluence a la cabeza; la factura de tokens es el coste oculto : El consenso es que lo de gestión de proyectos (Jira, Confluence, luego Linear, Figma) y la captura de flujos es lo que más aterriza; en desarrollo Playwright gusta, pero hay quien sugiere usar CLI como herramienta para ahorrar tokens. Advertencia recurrente: MCP se bebe la cuota. (Fuente: Reddit r/ClaudeAI)

Los nuevos de la carrera de IA temen acabar como “obreros que producen basura”; el cruce con astronomía se señala como salida viable : Un estudiante STEM entra en una carrera de IA nueva y teme acabar solo entrenando LLM malos para empresas. Los comentarios sugieren investigación astronómica, que ya usa mucha IA, mirar prácticas de NASA y rechazar ofertas que no interesen. (Fuente: Reddit r/artificial)

💡 Otros

Microduck RL open source: receta sim2real de un bípedo de 800 g : Pollen entrena en mjlab/MuJoCo Warp con PPO, actuadores BAM y modelo de holgura tareas de caminar, levantarse, chutar, voltereta adelante y patines, política a 50Hz exportada a ONNX, observación de 61 dimensiones y contrato que permite hot-swap. Insisten en que la ley de voltaje de los servos pequeños es el grueso del abismo de transferencia. (Fuente: GitHub Trending)

La inferencia gratuita y open source se está convirtiendo en un embudo de captura de datos : Alguien señala que LMArena, Flash gratis y 10.000 millones de tokens por DAU son, en esencia, cambiar cómputo por prompts y preferencias, para alimentar el lab o revender. Los desarrolladores sustituyen soluciones cerradas ya devaluadas por pipelines de documentación open source, diciendo que la calidad no baja y sale más barato. (Fuente: Shahules786, abacaj)

GPT-5.6 a mitad de precio dispara ~14 veces el uso en OpenRouter : Los datos de OpenRouter se leen como paradoja de Jevons: al bajar el precio unitario de la inteligencia, el consumo total explota; el mercado está repreciando la “inteligencia por dólar”. (Fuente: GavinSBaker)

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *