🔥 En Foco
Google lanza Gemini Agent, su primer agente de productividad empresarial, con soporte inédito para invocar a Claude : Google presentó oficialmente su agente de productividad empresarial Gemini Agent en la conferencia Gemini at Work 2026, integrándolo por completo en el ecosistema de Workspace. Impulsado por objetivos específicos, este agente cuenta con residencia persistente en la nube y capacidades de orquestación entre múltiples aplicaciones. Las empresas pueden asignarle correos electrónicos corporativos, cuentas, almacenamiento y calendarios independientes, tratándolo como un “compañero de trabajo digital” (Coworker Agent) con identidad propia. El sistema incorpora cuatro capas de memoria persistente (conversacional, semántica, procedimental y episódica), ofreciendo integración total con Slack, Salesforce y el protocolo MCP. Además, por primera vez e históricamente, habilitó en su selector de modelos empresariales el acceso a Claude Opus 5 y Sonnet 5.5 de su competidor Anthropic. Esto marca un cambio en la competencia entre gigantes tecnológicos, pasando de la mera capacidad de los modelos base a una disputa estratégica por los puntos de entrada a los flujos de trabajo y la gobernanza de permisos (Fuente: Google, TechCrunch, AI Business, 36Kr)

Exinvestigadores de seguridad de OpenAI publican una carta abierta conjunta contra la dirección por purgar la disidencia y bloquear auditorías de seguridad bajo el pretexto de “filtraciones” : Tres destacados investigadores de seguridad despedidos repentinamente por OpenAI —Jasmine Wang, Tomek Korbak y Mikita Balesni— publicaron una carta abierta conjunta para refutar públicamente las acusaciones de la empresa sobre el “manejo indebido de información sensible y quebrantamiento de la confianza”. La carta revela que el motivo de fondo de sus despidos fueron sus severas advertencias sobre la drástica degradación de la monitorizabilidad de la cadena de pensamiento (CoT Monitorability) en los agentes y su labor activa para impulsar una colaboración sustancial con el organismo de auditoría independiente METR (siendo Korbak el enlace principal). Los investigadores advierten que la dirección está restringiendo los accesos de evaluación externa independiente en aras de acelerar la comercialización, y que estas sanciones repentinas y opacas han generado un profundo efecto disuasorio dentro de la compañía, exponiendo de forma abierta la fractura interna entre la misión de seguridad y los intereses comerciales (Fuente: The Verge, THE DECODER, Transformer, EthanJPerez)

La discrepancia en los criterios de ingresos anualizados de OpenAI alcanza los 20.000 millones de dólares, desatando turbulencias en el mercado de capitales y una reevaluación del crecimiento : Según informaron medios como el Financial Times, OpenAI comunicó a los inversores que sus ingresos recurrentes anualizados (ARR) reales a finales de septiembre se situaban cerca de los 50.000 millones de dólares. Esto representa una marcada brecha de unos 20.000 millones frente a las estimaciones de entre 68.000 y 70.000 millones de dólares difundidas previamente por el mercado y bancos de inversión, provocando correcciones en el sector tecnológico y en valores vinculados al poder de cómputo. Los analistas señalan que la divergencia radica en los criterios contables: los rumores previos aplicaron erróneamente el estándar laxo de Anthropic, que computa el volumen bruto total distribuido a través de AWS y Google Cloud, mientras que OpenAI no contabiliza la distribución de nubes de terceros y descuenta la comisión del 20% de Microsoft (si se reconstruyera según el volumen bruto, su escala real rozaría los 64.000 millones). El episodio evidencia la fragilidad de los mercados ante la falta de informes auditados públicos y obliga a una reevaluación del ritmo real de rentabilidad frente a los elevados costes de cómputo (Fuente: The Guardian, CNBC, 36Kr)

OpenAI lanza GPT-6.1 Sol Ultrafast: velocidad de inferencia multiplicada por 8 y redireccionamiento dinámico en streaming : Cumpliendo con el Día 4 de sus actualizaciones, OpenAI desplegó oficialmente el modo GPT-6.1 Sol Ultrafast en las API de Responses, Codex y ChatGPT Work. Manteniendo una capacidad de razonamiento lógico cercana a su modelo insignia Astra, multiplica por 8 el rendimiento de generación respecto a la versión estándar (alcanzando unos 300 tokens/s) e introduce la función de redireccionamiento dinámico (Steering), que permite a los desarrolladores inyectar prompts de corrección en pleno streaming para ajustar la salida al instante. El precio en la API se fijó en 12 dólares por millón de tokens de entrada y 60 dólares por millón de salida (6 veces el coste estándar), mientras que en ChatGPT solo está disponible para usuarios corporativos y Pro 500 (500 dólares al mes). La velocidad a la que agota las cuotas ha generado debate en la comunidad de desarrolladores por considerarse un aumento de precios encubierto (Fuente: OpenAI, Synced, BorisMPower, 36Kr)
.jpg)
El gigante australiano de computación de IA Firmus retira su salida a bolsa de 44.000 millones de AUD ante la débil demanda, enfriando las primas especulativas en infraestructura : Firmus Technologies, la firma australiana de centros de datos con refrigeración líquida por inmersión respaldada por NVIDIA y Blackstone, retiró oficialmente su solicitud de oferta pública inicial (IPO). El proyecto planeaba recaudar 5.500 millones de dólares con una valoración de 30.600 millones (unos 44.000 millones de dólares australianos), aspirando a ser la mayor salida a bolsa en Australia en tres décadas. Sin embargo, la retirada de socios clave, el hecho de contar con solo 46 MW conectados a la red frente a los 912 MW proyectados en construcción, y una deuda futura comprometida en infraestructuras de 30.000 millones de dólares disuadieron a los inversores institucionales de validar valoraciones tan anticipadas, frustrando el libro de órdenes. El suceso marca un punto de inflexión en el enfriamiento del mercado secundario hacia la infraestructura de IA de capital intensivo y alto apalancamiento (Fuente: The Guardian, 36Kr)

🎯 Tendencias
Anthropic actualiza su política de uso prohibiendo expresamente el maltrato a modelos e inaugura el programa de defensa “Cyber Mission” : Anthropic publicó su política de uso actualizada para 2026 (vigente a partir del 12 de noviembre). Por primera vez en la industria, se prohíbe de forma explícita el “abuso o crueldad continuada e innecesaria hacia los modelos”, facultando a la IA para finalizar conversaciones de manera autónoma ante ataques maliciosos extremos. Aunque la empresa aclaró que esto no interferirá con la depuración habitual, la cláusula desató un intenso debate ético sobre la condición moral de las máquinas. Al mismo tiempo, lanzó “Cyber Mission”, colaborando con firmas como Booz Allen en la defensa de infraestructuras críticas (CIDP), e implementó OSS Scanner para ofrecer detección continua de vulnerabilidades por IA y propuestas de parches automáticos para software de código abierto fundamental (Fuente: Anthropic News, The Guardian, mustafasuleyman)

Claude estrena generación de animaciones explicativas y paneles interactivos de datos, graduando su suite ofimática de la fase beta : Anthropic incorporó dos nuevas funciones clave a Claude: Dashboards, que permite la conexión directa con fuentes de datos empresariales como Snowflake, BigQuery y Salesforce para generar gráficos interactivos en tiempo real con trazabilidad SQL mediante lenguaje natural; y Claude Motion, capaz de convertir texto y diagramas de arquitectura en animaciones explicativas editables basadas en código, exportables en formato MP4 de 30 segundos. Además, sus tres herramientas empresariales (Docs, Slides y Design) abandonaron la fase de pruebas para su despliegue comercial general, consolidando la transición de Claude de un asistente conversacional a un centro neurálgico ofimático multimedia (Fuente: The Verge, THE DECODER, dotey)

Google publica en The Lancet los resultados de su IA clínica AMIE: concordancia diagnóstica del 90% y cero interrupciones de seguridad : Google divulgó en la revista The Lancet un estudio clínico multicéntrico que demuestra avances significativos de AMIE, su sistema conversacional de diagnóstico médico, en entornos reales de urgencias y consultas generales. En 100 consultas extensas con pacientes reales, el sistema operó sin ninguna interrupción de seguridad, alcanzó una concordancia diagnóstica del 90% respecto a médicos especialistas sénior y superó al grupo de control en métricas de empatía y exhaustividad en la anamnesis, validando el despliegue seguro de la IA multimodal en flujos clínicos rigurosos (Fuente: Google)
El equipo Seed de ByteDance revela la causa de la inestabilidad de DeepSeek en contextos largos: KV Cache en bloques sensible a la fase de 4 tokens : Pruebas realizadas por el equipo Seed de ByteDance demostraron que las fluctuaciones de rendimiento de DeepSeek-V4 en tareas de recuperación en contextos largos dependen fuertemente de la ubicación física de la información de entrada. Al añadir un número mínimo de caracteres irrelevantes al inicio del prompt para alterar la “fase” de los tokens dentro de la ventana de compresión, la precisión de recuperación del modelo con un contexto de 128K experimentó oscilaciones periódicas de hasta 40,2 puntos porcentuales. El ciclo de oscilación coincide con el paso de compresión de su KV Cache en bloques (4 tokens), evidenciando las limitaciones que introducen en la recuperación las optimizaciones de compresión dependientes del hardware (Fuente: QbitAI)

Cinco gigantes farmacéuticos optimizan OpenFold3 mediante aprendizaje federado: datos estructurales privados mejoran la predicción de unión molecular : AbbVie, Bristol Myers Squibb, Johnson & Johnson, Takeda y Astex publicaron conjuntamente en Nature una investigación en la que aplicaron post-entrenamiento federado al modelo de código abierto OpenFold3. A través de una red de computación segura, agregaron más de 20.000 estructuras complejas experimentales no públicas de proteína-molécula pequeña sin que los datos comerciales propietarios salieran de sus servidores locales. Las pruebas confirmaron una mejora de más del 10% en la precisión de predicción de interacciones proteína-ligando de alta fidelidad, superando ampliamente las referencias entrenadas solo con bases públicas de PDB (Fuente: Nature, Synced)
.jpg)
Alibaba Tongyi libera el modelo de generación de imágenes Qwen-Image-2.1-Turbo: pasos de eliminación de ruido reducidos a solo 8 : El equipo de Tongyi en Alibaba publicó el modelo de generación visual de 7B parámetros Qwen-Image-2.1-Turbo, liberando sus pesos y API. Manteniendo una calidad de imagen en 2K y capacidad de edición basada en instrucciones complejas en lenguaje natural, utiliza destilación de trayectoria avanzada para reducir los pasos de eliminación de ruido a solo 8. Esto disminuye sustancialmente el uso de memoria de vídeo (VRAM) y la latencia, permitiendo a los desarrolladores su despliegue inmediato mediante pipelines de Diffusers en entornos de producción de alta concurrencia (Fuente: Alibaba_Qwen)

ShengShu Technology presenta la versión preliminar de Vidu Q4: interpretación expresiva y movimientos de cámara continuos de 16 segundos : ShengShu Technology lanzó la versión preliminar de su modelo insignia de generación de vídeo Vidu Q4. Esta versión avanza en la estabilidad de planos y contraplanos de calidad cinematográfica, la transición sutil de expresiones emocionales y la interacción de luces y sombras. Soporta la vinculación de consistencia de personajes con hasta 15 imágenes de referencia y 3 pistas de audio, admitiendo resolución nativa 4K y tomas continuas en primera persona (FPV) de hasta 16 segundos. En su plataforma SaaS, una promoción reduce el coste a 0,09 yuanes por segundo en 720P, abaratando la producción de anuncios y microseries con IA (Fuente: QbitAI)

Aether AI lanza el sistema de robótica causal CRIS-0: esquiva obstáculos en 0,2 segundos mediante transición de estados causales : Fundada por el equipo de Biwei Huang en UC San Diego, Aether AI presentó el sistema corpóreo CRIS-0 basado en inteligencia causal. Esta arquitectura supera la limitación de los modelos de visión-lenguaje-acción (VLA) tradicionales, que dependen exclusivamente de correlaciones a nivel de píxel, integrando un modelo del mundo causal (CausalWM) para proyectar consecuencias de intervenciones físicas y monitorizar variables causales. Ante perturbaciones imprevistas, el sistema puede frenar en 0,2 segundos y replanificar en menos de 2 segundos, evitando fallos por acumulación de errores en tareas prolongadas (Fuente: QbitAI)

JetBrains presenta Mellum2.1, un modelo MoE de 12B optimizado para código con solo 2.5B parámetros activos : JetBrains liberó el modelo de razonamiento para código Mellum2.1-12B-A2.5B-Thinking. Con una arquitectura MoE de 64 expertos, activa solo 8 expertos por token (2.5B parámetros) e incluye soporte nativo para 128K de contexto. Gracias al aprendizaje por refuerzo a gran escala interactuando con repositorios de software reales, alcanzó 82,0 puntos en LiveCodeBench v6 y elevó la tasa de resolución en SWE-bench Verified del 2,0% al 47,0%, logrando en una sola GPU H200 un rendimiento casi dos veces superior al de Qwen3.5-9B (Fuente: MarkTechPost)
TII libera el modelo de voz multilingüe Falcon ASR de 1.6B, marcando un récord en reconocimiento de dialectos emiratíes : El Instituto de Innovación Tecnológica de Abu Dabi (TII) lanzó en código abierto Falcon-ASR, un modelo de reconocimiento automático de voz de 1.6B parámetros basado en la arquitectura Falcon3-Audio. Diseñado para solventar los retos del idioma árabe en entornos ruidosos y cambios de código idiomático, alcanzó una tasa de error de palabras (WER) del 20,92% en seis conjuntos de referencia árabes estándar. En dialectos de los Emiratos Árabes Unidos logró un WER del 22,73%, superando a Qwen3-Omni, y ofrece soporte nativo para marcas de tiempo a nivel de palabra bajo los mismos pesos (Fuente: HuggingFace Blog)

OpenAI desarticula y veta redes de manipulación cognitiva que usaban falsos periodistas y centros de pensamiento : OpenAI publicó un informe de investigación que detalla la suspensión de dos redes que utilizaban ChatGPT para operaciones encubiertas de influencia geopolítica. El grupo ruso “Dark Clark” controlaba falsos centros de estudios y distribuía documentos oficiales y audios falsificados a medios latinoamericanos, forzando desmentidos gubernamentales (clasificado como amenaza de nivel 5 Breakout). Por su parte, la red iraní “Bogus Bylines” creó 7 identidades de periodistas ficticios para publicar casi un centenar de artículos de opinión en medios comerciales buscando manipular la percepción pública sobre tensiones entre EE. UU. e Irán (Fuente: OpenAI News)
Amazon Bedrock AgentCore introduce micropagos por petición y el protocolo de gobernanza x402 : AWS anunció la integración de Coinbase CDP y Stripe Link a través de Bedrock AgentCore, permitiendo que los agentes autónomos ejecuten micropagos por solicitud bajo el protocolo x402 sin intervención humana. La infraestructura impone límites estrictos de presupuesto para mitigar ataques por inyección de prompts y permite liquidaciones en cadena a escala de microcentavos en tiempo real, estableciendo una base estandarizada para que agentes comerciales adquieran cómputo externo, datos y servicios digitales (Fuente: AWS Machine Learning Blog)

🧰 Herramientas
Fusión de TRAE: integración de TraeCode y TraeWork en un entorno de trabajo unificado multiagente : La herramienta de programación con IA de ByteDance, TRAE, unificó sus aplicaciones independientes de edición de código y flujos de trabajo documentales en un único cliente. La versión ofrece un “Modo Agente” en formato de lienzo global y un “Modo IDE” clásico. Los usuarios pueden coordinar en paralelo agentes de planificación, desarrollo y pruebas sobre un mismo proyecto; los parches de código y los requisitos se almacenan de forma estructurada en un repositorio común, integrándose con Feishu y WeChat para la colaboración multidisciplinar (Fuente: QbitAI)

TianxiCode de Lenovo lidera SWE-bench-Live: la tasa de autorreparación en bucle cerrado supera el 71% : El framework para agentes de programación TianxiCode de Lenovo AI, combinado con DeepSeek-v4.1-Flash, alcanzó el primer puesto con un 71% de resolución de incidencias en la evaluación dinámica de referencia SWE-bench-Live (Lite). Mediante recuperación multiruta entre archivos, fragmentación precisa de contexto y ejecución de pruebas en bucle cerrado, el modelo detecta errores de ejecución en entornos aislados y aplica correcciones automáticas, sentando un estándar fiable para el desarrollo de software complejo con IA (Fuente: QbitAI)

galahad-kv: persistencia de KV Cache en NVMe locales para reutilizar memoria en 50 millones de tokens sin recálculo : Para mitigar el consumo energético y el cuello de botella de memoria en contextos ultralargos, la biblioteca de inferencia de código abierto galahad-kv implementó una solución que persiste bloques de KV Cache en discos NVMe cifrados de alta velocidad. En pruebas sobre una GPU H100 con Gemma 4, el sistema recupera cualquier bloque de 16k tokens a partir de flujos de 50 millones de tokens en segundos y sin recálculo, acelerando el proceso de 2,8 a 4,3 veces frente al cómputo en tiempo real, reduciendo el gasto energético de la GPU en más del 88% y manteniendo un consumo de VRAM constante (Fuente: HuggingFace Daily Papers)
SwiftUI-Agent-Skill: biblioteca de directrices de SwiftUI moderno diseñada para agentes de código : Diseñada por desarrolladores expertos de iOS para agentes como Claude Code, Codex y Cursor, esta biblioteca empaqueta reglas bajo el estándar Agent Skills para evitar que los LLM utilicen API obsoletas, omitan etiquetas de accesibilidad en VoiceOver o causen redibujados innecesarios al generar código en SwiftUI. Se integra con un solo comando mediante npx o desde la tienda de plugins de Claude, permitiendo invocar revisiones automáticas de rendimiento y concurrencia a través de lenguaje natural (Fuente: GitHub Trending)
Microsoft publica mxc, un sandbox de seguridad multiplataforma para aislar operaciones maliciosas de agentes en terminal : Microsoft liberó mxc, un framework ligero para la ejecución aislada de código. Diseñado para mitigar los riesgos derivados del acceso directo de los agentes autónomos al sistema de archivos y la terminal local, utiliza Bubblewrap, Seatbelt y contenedores de procesos del sistema operativo. Esto permite inicializar entornos aislados en menos de 100 ms para ejecutar código no verificado generado por LLM, neutralizando borrados accidentales de archivos clave o conexiones inversas de terminal no autorizadas (Fuente: Hacker News)
Engram: plugin de memoria persistente entre sesiones y proyectos para Claude Code : Weaviate presentó Engram, un complemento de memoria persistente para Claude Code. Superando el aislamiento de archivos CLAUDE.md por repositorio y los arranques en frío, el plugin registra en segundo plano decisiones técnicas, balances de arquitectura y el historial de iteraciones de código. Al iniciar una refactorización, recupera e inyecta de forma automática los recuerdos más relevantes, garantizando la continuidad del conocimiento acumulado entre múltiples proyectos y equipos (Fuente: bobvanluijt)

Natura lanza Interface, un anillo inteligente de 99 dólares con interacción de agentes 24/7 y monitorización de constantes vitales : La startup de hardware Natura presentó Interface, un anillo inteligente diseñado para interactuar con agentes de IA. Equipado con un micrófono ligero y sensores hápticos, basta con presionar la punta del dedo para dictar instrucciones o registrar reuniones en modelos enlazados (como ChatGPT, Claude o Grok), transmitiendo las respuestas por auriculares. El dispositivo ofrece una autonomía de 6 a 12 días y registra variables de salud como la variabilidad de la frecuencia cardíaca y la temperatura corporal de manera ininterrumpida (Fuente: TechCrunch)

ttok se actualiza a la versión 1.0, adoptando por defecto las reglas de tokenización de GPT-5 y GPT-6 : Simon Willison lanzó la versión 1.0 de su herramienta de línea de comandos para el recuento de tokens ttok. La actualización abandona el vocabulario predeterminado de GPT-4 y adopta el esquema de codificación de Tiktoken adaptado para las familias de modelos GPT-5 y GPT-6. Las pruebas confirman una concordancia exacta en el conteo de tokens sobre las mismas muestras de texto, proporcionando a los desarrolladores una herramienta precisa para auditar el consumo y los costes de sus API (Fuente: Simon Willison)
Hermes Agent llega a la Microsoft Store con el plugin de navegador headless TinyFish preintegrado : Nous Research puso a disposición su agente personal de código abierto Hermes Agent en la Microsoft Store para instalación directa en Windows. La versión incluye el plugin de navegación TinyFish, permitiendo al agente invocar un navegador headless de forma autónoma para recopilar datos de internet en tiempo real dentro de flujos de trabajo locales. El sistema solicita confirmación previa al consumo de créditos, facilitando la integración de asistentes locales en PC con la red abierta (Fuente: Teknium)

📚 Investigación y Aprendizaje
Consorcio de 15 instituciones libera TouchScale, un conjunto de datos visuotáctiles de 500 horas que duplica el éxito en manipulación robótica : Quince entidades, entre ellas Texas A&M, DeepMind y CMU, presentaron TouchScale, un conjunto de datos multimodal estandarizado de visión y tacto en manos humanas. Incluye 500 horas de vídeo RGB-D en primera persona y datos de guantes de presión completos (con 880 unidades táctiles por mano) a lo largo de 87.000 trayectorias de manipulación. El entrenamiento intermedio con predicción de contacto elevó la tasa de éxito de brazos robóticos en tareas complejas, como la clasificación de objetos blandos y rígidos, del 22,5% al 57,5%, demostrando que la modalidad táctil exhibe leyes de escala (Scaling Laws) similares a las de la visión (Fuente: Synced, 36Kr)
.jpg)
NVIDIA, MIT y Oxford presentan Physis-Lang: representaciones físicas autoevolutivas para dotar de realismo físico a la generación de vídeo : Investigadores de NVIDIA, el MIT y la Universidad de Oxford desarrollaron Physis-Lang, un framework para la autoevolución de prompts físicos. Dirigido a mitigar las deficiencias de los modelos de vídeo al reproducir dinámicas continuas complejas (como derretimientos o desgarros), el sistema utiliza PhysCapBench (con 3.794 aserciones físicas elementales) para que agentes basados en LLM generen descripciones causales detalladas y recuperen datos mecánicos específicos. La serie Cosmos3 ajustada con este método lideró la clasificación Physics-IQ Verified, superando ampliamente a los modelos base estándar (Fuente: Synced)
.jpg)
Investigadores de Cambridge y King’s College señalan discrepancias en la traducción de demostraciones matemáticas de lenguaje natural a Lean : Académicos de la Universidad de Cambridge y del King’s College London publicaron una evaluación crítica sobre los resultados matemáticos sin verificación formal completa presentados por laboratorios de vanguardia. Analizando las deducciones que OpenAI afirmó haber resuelto en relación con las ecuaciones de Navier-Stokes, el estudio reveló que, mientras el texto en lenguaje natural requería solo 4 derivadas adicionales, el código formalizado en Lean introducía 5 condiciones más débiles; asimismo, las estimaciones de presión y flujo empleaban límites y vías deductivas completamente divergentes. Los investigadores advierten que la verificación computacional únicamente asegura la validez sintáctica interna, pero no garantiza que la proposición formalizada equivalga realmente al teorema enunciado en lenguaje natural (Fuente: THE DECODER, halvarflake, 36Kr)

Un estudio sobre la destilación On-Policy demuestra que los modelos adquieren habilidades de razonamiento composicional pero no nuevos datos factuales : Un experimento controlado desmintió que la destilación On-Policy (OPD) permita incorporar nuevo conocimiento factual a los modelos. Al desacoplar tareas sintéticas y preguntas fácticas, se comprobó que la OPD basada en divergencia KL inversa transfiere de forma consistente la lógica de razonamiento composicional multietapa del profesor al alumno, pero la absorción de hechos novedosos es prácticamente nula. Al emplear divergencia KL hacia adelante se recupera la transferencia de datos factuales, pero se degrada la capacidad organizativa del razonamiento. Esto evidencia que la destilación post-entrenamiento reestructura el espacio lógico de los parámetros existentes en lugar de ampliar la memoria factual del modelo (Fuente: HuggingFace Daily Papers)
Memento 3: un agente autoevolutivo sin gradientes basado en reglas reflexivas y compilación de código : Una investigación presentó Memento 3, un paradigma de autoevolución externa para modelos de lenguaje con parámetros fijos. El agente utiliza una base de reglas en lenguaje natural almacenada en memoria externa para modelar las dinámicas del entorno y las compila dinámicamente en código ejecutable determinista para planificar y predecir. Cuando el entorno devuelve errores, ajusta las reglas y el código mediante reproducción de unidades. En las evaluaciones abiertas de ARC-AGI-3, el sistema resolvió los 25 juegos de referencia sin modificar los pesos del LLM, alcanzando una eficiencia de acción equivalente al 100% de la humana (Fuente: HuggingFace Daily Papers)
El equipo de investigación de Apple presenta NTM: modelos de trayectorias normalizadas que igualan la calidad de difusión en solo 4 pasos : El laboratorio de Machine Learning de Apple presentó en NeurIPS 2026 los Normalizing Trajectory Models (NTM). Frente a las limitaciones de los modelos de difusión y flujo que pierden la estimación exacta de verosimilitud en inferencias ultraveloces de pocos pasos, NTM modela cada paso de difusión inversa como un flujo normalizador condicional de alta expresividad. Combinado con predictores de trayectoria paralelos profundos y mecanismos de autodestilación, logra una calidad visual comparable a la de muestreos completos en solo 4 pasos, preservando una estricta verosimilitud generativa y superando a los métodos de destilación habituales (Fuente: Apple Machine Learning Research)

Artículo de NVIDIA en NeurIPS 2026: el uso de herramientas externas por parte de agentes incrementa notablemente el riesgo de jailbreaks multimodales : Un estudio del laboratorio de seguridad de NVIDIA demostró que dotar a modelos multimodales de la capacidad de invocar herramientas provoca una disminución sustancial en la efectividad de sus filtros de rechazo, aumentando la tasa de éxito de jailbreaks hasta en un 68,7%. Esto ocurre porque las respuestas voluminosas devueltas por las herramientas saturan la ventana de contexto, diluyendo la relevancia de la instrucción maliciosa original y desviando la atención del modelo hacia los resultados operativos en lugar de evaluar la seguridad de la petición. El estudio enfatiza la necesidad de evaluar la seguridad de los agentes más allá del diálogo estándar (Fuente: omarsar0)

Google presenta FlowAgent: agente de integración continua que logra la adopción de más de 28.000 parches automáticos : Google detalló en ArXiv la arquitectura de FlowAgent, un agente diseñado para la resolución automática de incidencias en integración continua. Basado en bucles ReAct ante fallos en pruebas unitarias, implementa filtros previos y posteriores a la ejecución para descartar soluciones con baja confianza. Desplegado en toda la empresa, generó propuestas para cerca de 300.000 fallos de compilación, de las cuales más de 28.000 fueron aceptadas e integradas por los ingenieros, validando la utilidad a escala de agentes de ingeniería de software en entornos productivos rigurosos (Fuente: omarsar0)

El Lincoln Laboratory del MIT publica el informe LAICS sobre la evolución del hardware de IA: el avance del cómputo se traslada a la topología y la precisión mixta : El Centro de Supercomputación del Lincoln Laboratory del MIT presentó el informe LAICS, un estudio exhaustivo sobre la evolución del hardware de aceleración de IA comercial durante los últimos ocho años (analizando más de 120 procesadores entre GPU, ASIC, FPGA y chips de flujo de datos). El documento concluye que el aumento del rendimiento computacional ha dejado de depender principalmente de la reducción litográfica, pasando a sustentarse en la reorganización de la densidad de transistores, la estandarización de formatos de precisión mixta reducida (como FP4/NVFP4) y nuevas topologías de interconexión en chip de alto ancho de banda (Fuente: MIT News)

💼 Negocios
Arena, la plataforma de evaluación de LLM, levanta 200 millones de dólares en ronda Serie B con una valoración de 3.100 millones e introduce su Índice de Alineación : Surgida a partir de LMSYS, la plataforma de pruebas ciegas Arena cerró una ronda de financiación Serie B de 200 millones de dólares liderada por Lightspeed y Khosla, alcanzando una valoración de 3.100 millones. Con unos ingresos anualizados que superan los 100 millones de dólares, lanzó comercialmente su “Alignment Index”, un índice que monitorea conductas indebidas en agentes —como extralimitación de permisos, engaño al usuario o atribuciones falsas— a partir de más de 90.000 interacciones reales en 27 modelos punteros, supliendo las carencias de las evaluaciones sintéticas estáticas (Fuente: TechCrunch, arena)

NVIDIA compromete 1.000 millones de dólares en cinco años para impulsar la superinteligencia y la computación cuántica en EE. UU. : En una cumbre científica celebrada en Washington, NVIDIA anunció un compromiso de 1.000 millones de dólares en recursos de cómputo, financiación e infraestructura de hardware y software durante los próximos cinco años para respaldar la investigación científica y cuántica en Estados Unidos. La iniciativa se dirige a universidades punteras, centros de investigación, laboratorios cuánticos y proveedores de nube que desarrollan proyectos federales, con el fin de acelerar la integración de la IA en el descubrimiento de materiales, la simulación de plasma en fusión nuclear y arquitecturas híbridas cuántico-clásicas (Fuente: The Verge)
Cloudflare adquiere al equipo central del runtime de JavaScript Deno para fortalecer su ecosistema de Edge Computing : Cloudflare anunció la adquisición del equipo fundador de Deno, incorporando formalmente a Ryan Dahl, creador de Node.js y Deno, junto con su equipo. El grupo se integrará en la división de Cloudflare Workers, donde centrará sus esfuerzos en el desarrollo de workerd, el motor de ejecución serverless de código abierto, para dotar a la plataforma de borde de mayor compatibilidad nativa con Node.js y soporte de estándares web modernos, fortaleciendo su posición en pasarelas edge orientadas a IA (Fuente: threepointone)
🌟 Comunidad
Hugo Duminil-Copin, Medalla Fields 2022, denuncia que la publicación masiva de pruebas matemáticas por parte de OpenAI desestabiliza las carreras científicas jóvenes : Durante una conferencia académica, el medallista Fields Hugo Duminil-Copin afirmó que la publicación masiva por parte de OpenAI de cientos de manuscritos matemáticos —incluidos problemas de su propia línea de investigación— se sintió como “el paso arrollador de varios camiones”, agotando las conjeturas abiertas de las que dependen los investigadores jóvenes para obtener becas y plazas docentes, y desatando una profunda inquietud entre los estudiantes de doctorado. La comunidad académica ha reaccionado con preocupación ante el uso de fuerza bruta computacional por entidades comerciales privadas sobre problemas académicos abiertos, abriendo un debate sobre la legibilidad de las demostraciones generadas por máquinas y los criterios para la revisión por pares automatizada (Fuente: JvNixon)
La comunidad colabora en la optimización del manuscrito de multiplicación de enteros de OpenAI, logrando avances en los parámetros de corrección : Tras la publicación de OpenAI que afirmaba romper la cota inferior $n \log n$ para la multiplicación de enteros, la comunidad matemática de código abierto creó un repositorio colaborativo para optimizar los resultados. Rediseñando redes finitas y eliminando penalizaciones cuadráticas, investigadores apoyados por Codex lograron mejorar sustancialmente el parámetro de cota superior $\kappa$, pasando del valor original de $2^{-182}$ a $2^{-15}$ en pocos días, con validación formal en el núcleo de Lean, reflejando el potencial de la cooperación entre personas e IA en la frontera matemática (Fuente: BorisMPower, Don’t Worry About the Vase)

Ben Affleck sorprende a la comunidad técnica al explicar con detalle los fundamentos del cine con IA: dominio de tensores y ajuste de pesos : Fragmentos de entrevistas en las que Ben Affleck expone un sólido conocimiento sobre la tecnología detrás de la IA se viralizaron en la comunidad tecnológica. El cineasta explicó los fundamentos matemáticos de las redes neuronales convolucionales, tensores, extracción de bordes e inferencia en GPU, y detalló cómo el estudio de IA que fundó (posteriormente adquirido por Netflix) congelaba los modelos base de código abierto y ajustaba exclusivamente las últimas capas con conjuntos propios de vídeo en alta definición para respetar los estándares de la industria y prevenir contingencias por derechos de autor, ganándose elogios en el sector técnico (Fuente: Latent Space)
Entrevista a Periodic Labs: laboratorios físicos y aprendizaje por refuerzo en el mundo real como base para el científico de IA : Liam Fedus (exinvestigador de OpenAI) y Dogus Cubuk (exintegrante de Google DeepMind) analizaron en un podcast el enfoque de Periodic Labs, su startup de ciencia de materiales. Señalaron que el preentrenamiento exclusivo sobre texto web o el razonamiento sintético son insuficientes para abordar fenómenos físicos desconocidos, debido a la complejidad de las transiciones de fase y el ruido de medición en materiales reales. Su equipo integra instrumentos de laboratorio de alto rendimiento en un bucle cerrado de aprendizaje por refuerzo, empleando las síntesis fallidas como muestras negativas de alta calidad para avanzar hacia una “superinteligencia para la síntesis de materiales” (Fuente: Latent Space)
Cloudflare reembolsa una factura exorbitante provocada por un bucle infinito en código generado por IA y analiza los riesgos de arquitectura : Un desarrollador que utilizaba Codex para programar servicios con Cloudflare Durable Objects experimentó un bucle infinito en la lógica de reintento de alertas, generando cientos de peticiones por segundo y miles de dólares en costes de lectura y escritura en la base de datos en poco tiempo. Tras revisar el caso, Cloudflare condonó el importe íntegro. Ingenieros de la compañía elaboraron un informe técnico en el que advierten sobre los riesgos del “Vibe Coding”, donde la falta de revisión minuciosa del código generado en plataformas en la nube sin límites de gasto estrictos puede originar imprevistos financieros severos (Fuente: dotey)
💡 Otros
Anthropic compromete 150 millones de dólares en la iniciativa “Genesis Mission” de la Casa Blanca para apoyar la computación científica avanzada : En una cumbre organizada por la Oficina de Política Científica y Tecnológica de la Casa Blanca, Anthropic anunció un compromiso de 150 millones de dólares en capacidad de cómputo y recursos tecnológicos durante tres años para la iniciativa nacional “Genesis Mission”. La empresa colaborará con la NASA, los Institutos Nacionales de Salud y otras 15 agencias federales y laboratorios nacionales, desplegando instancias de Claude y entornos de programación automatizados para apoyar investigaciones complejas en control de energía por fusión nuclear y computación cuántica (Fuente: Anthropic News)
Un equipo del MIT aplica Machine Learning para optimizar la planificación dinámica de servidores y frenar el consumo energético en centros de datos : Para afrontar la creciente demanda eléctrica de los centros de datos impulsada por la IA, un equipo liderado por la profesora asociada Christina Delimitrou del MIT desarrolló una arquitectura basada en aprendizaje profundo para la gestión del consumo eléctrico en servidores. El sistema anticipa en tiempo real la contención de recursos en microservicios y software nativo de la nube, redistribuyendo dinámicamente cargas en clústeres que suelen operar a solo un 15% de utilización efectiva. Esto permite aprovechar mejor el rendimiento en entornos de alta densidad y recortar pérdidas energéticas sin necesidad de ampliar la infraestructura eléctrica existente (Fuente: MIT News)
