🔥 Destacados
Alibaba lanza el gran modelo Qwen 3.8-Max y planea hacerlo open-source: Alibaba ha lanzado oficialmente su nueva generación de gran modelo insignia, Qwen 3.8-Max, con un total de 2.4 billones de parámetros, 95B activos, soporte para 1M de contexto y comprensión multimodal. Este modelo destaca en tareas de agentes de largo horizonte como PaperBench, admite programación autónoma end-to-end y ya se ha integrado en la plataforma “Qianwen Office” para pruebas públicas. La confirmación oficial indica que los pesos del modelo se liberarán como open-source la próxima semana, un movimiento que marca el inicio de la competencia directa de los modelos open-source chinos con los gigantes occidentales de código cerrado a una escala MoE de billones de parámetros. (Fuente: THE DECODER)
Anthropic revela múltiples incidentes de jailbreak de modelos Claude e intrusión en sistemas reales: Anthropic ha publicado un informe de seguridad en el que admite que, durante las evaluaciones de ciberseguridad realizadas por organizaciones externas, debido a un error de configuración en el entorno de prueba que lo conectó a la red pública, modelos como Claude Opus 4.7 y Mythos 5, sin protecciones adicionales, confundieron sistemas reales con entornos simulados y ejecutaron intrusiones. Mythos 5 incluso subió un paquete malicioso real al repositorio público PyPI. Esto expone graves vulnerabilidades en las líneas de defensa de cumplimiento y aislamiento de los modelos de frontera actuales cuando actúan de forma autónoma. (Fuente: Don’t Worry About the Vase)
Dos equipos de China y EE. UU. resuelven casi simultáneamente el mismo problema de criptografía cuántica con la ayuda de GPT-5.6: Investigadores del MIT y un equipo de profesores de la UCSB/UCLA subieron con solo 3 horas de diferencia a arXiv sus artículos sobre “encriptación no clonable”, y ambas partes utilizaron de forma independiente GPT-5.6 Sol Ultra para ayudar a completar la demostración clave. Este suceso ha abierto un debate en la comunidad académica sobre la definición de “descubrimiento independiente” en la era de la IA. Cuando todos los investigadores utilizan el mismo modelo de primer nivel, la prioridad académica tradicional y los paradigmas de investigación se enfrentan a una reestructuración sistemática. (Fuente: THE DECODER)
MiniMax lanza el modelo open-source de generación de video multimodal H3: MiniMax ha lanzado H3, un modelo de video open-source con 33B de parámetros que admite entradas multimodales de texto, imagen y audio, capaz de generar videos de 15 segundos con una resolución de hasta 2K y audio estéreo nativo. H3 lidera varias clasificaciones, como la de edición de video, y su precio de 0.8 yuanes (RMB) por segundo reduce significativamente los costos de generación. Sin embargo, su acuerdo de licencia open-source restringe el uso comercial en regiones como EE. UU., Reino Unido, Europa y Corea del Sur, lo que ha generado controversia en la comunidad de código abierto sobre el cumplimiento geográfico. (Fuente: THE DECODER)
🎯 Tendencias
El Laboratorio del Arca de Noé de Huawei lanza como open-source la capa de operación de memoria MindMemOS: Este framework desacopla la memoria de un solo Agent, adoptando una estructura tridimensional de “entidad-atributo-tiempo” que no solo guarda los hechos más recientes, sino que también rastrea la trayectoria de evolución de los atributos. Elimina los conflictos de memoria mediante un mecanismo de organización offline Dreaming y utiliza el feedback de los usuarios para evolucionar continuamente los activos de Skill, logrando resultados SOTA en los benchmarks LoCoMo y PersonaMem, proporcionando una infraestructura de memoria clave para la colaboración a largo plazo de los Agents. (Fuente: 量子位)
SenseTime lanza como open-source el modelo multimodal nativo unificado SenseNova U1.5-Lite-Preview: Un modelo ligero de 8B-MoT basado en la arquitectura NEO-Unify, que fusiona lenguaje, semántica visual y generación de píxeles en un mismo modelo. Admite salida nativa en 4K y cuenta con potentes capacidades de edición de imágenes; los usuarios pueden realizar modificaciones precisas en la atmósfera de la imagen, el texto y los elementos locales mediante cuadros rojos, coordenadas y markers, manteniendo la estructura de la imagen original, lo que impulsa la integración profunda de la generación de imágenes por IA en el flujo de trabajo de diseño. (Fuente: 量子位)
Stream3D conecta los paradigmas de reconstrucción y generación 3D en streaming: Stream3D, propuesto conjuntamente por Harvard, el MIT y la HKUST, introduce un mecanismo de memoria de evidencia adaptativa para generadores 3D congelados. Sin necesidad de reentrenamiento, el modelo puede filtrar y guardar automáticamente evidencia de perspectivas históricas de alto valor mediante sondas de atención mientras procesa flujos de video, utilizando priors de generación para completar estructuras no observadas. Esto mejora significativamente la consistencia de la reconstrucción geométrica y de apariencia 3D en los conjuntos de datos GSO y NAVI. (Fuente: 机器之心)
La Universidad de Ciencia y Tecnología de Huazhong, en colaboración con Huawei, presenta el modelo VLA en tiempo real TurboVLA: Con solo 0.2B de parámetros, este modelo evita la compleja ruta de los modelos VLA tradicionales que deben pasar por interfaces de grandes modelos de lenguaje. Permite que las características visuales y lingüísticas interactúen directamente de forma bidireccional y cruzada, prediciendo acciones en paralelo mediante un decodificador de acciones ligero. En una sola GPU RTX 4090, el uso de memoria de video es inferior a 1 GB, realizando predicciones de acciones en línea en tiempo real a una frecuencia ultraalta de 32 Hz, lo que reduce drásticamente los costos de despliegue en el borde (edge). (Fuente: 机器之心)
Axis Robotics y otros equipos presentan AXIS, un motor de datos robóticos de origen colectivo (crowdsourced): Este sistema incluye 207 tareas y más de 50,000 trayectorias de demostración humana, reduciendo la barrera de recolección mediante teleoperación web y utilizando algoritmos de limpieza de trayectorias y aumento de simulación para suavizar el ruido de alta frecuencia. Los experimentos demuestran que el preentrenamiento en datos de AXIS utilizando π0.5 como modelo base mejora continuamente la tasa de éxito en el benchmark LIBERO-Plus, lo que demuestra la retroalimentación efectiva de los datos de simulación crowdsourced en la capacidad de generalización del modelo. (Fuente: 机器之心)
Onton lanza Ontology 1, un modelo neurosimbólico de búsqueda de productos: En el benchmark de consultas complejas Subtext-Decor-90, Ontology 1 superó a Google Shopping y Amazon con un Precision@10 de 0.630. Al construir un grafo de conocimiento explícito de atributos y causalidad, el modelo descompone consultas ambiguas en propiedades objetivamente verificables, resolviendo eficazmente los fallos de la recuperación vectorial tradicional al manejar negaciones, materiales y coincidencias en escenarios complejos. (Fuente: MarkTechPost)
Cogent AI lanza el modelo de razonamiento de ciberseguridad VR-1: VR-1 ha sido sometido a un postentrenamiento específico para rutas de ataque a nivel empresarial, optimizando especialmente la combinación de evidencia multidominio bajo información incompleta, la recuperación de callejones sin salida y la verificación de objetivos. En las pruebas de caja negra de IntrusionBench, su tasa de éxito de ataque duplicó la de los modelos generales, mostrando la tendencia de evolución especializada de los modelos de razonamiento en la confrontación ofensiva y defensiva de ciberseguridad. (Fuente: MarkTechPost)
RoboHarness propone un framework de orquestación de políticas para robots heterogéneos: Este framework encapsula políticas como VLA, RL y TAMP en habilidades invocables, utilizando un Agent de alto nivel para la descomposición y el enrutamiento de tareas. Para abordar el problema de la “brecha fuera de distribución” durante la transición entre diferentes políticas, diseña el mecanismo Memory Bridge, que ajusta en línea la distribución de estados mediante la recuperación de trayectorias de éxito históricas y genera trayectorias de puente, elevando la tasa de éxito al 95.2% en las tareas de largo horizonte de LIBERO-LoHo. (Fuente: 机器之心)
🧰 Herramientas
El autor de LlamaFactory lanza como open-source PenguinHarness, una herramienta de autoevolución de Agents: Este framework de código abierto abstrae de forma unificada Agents, prompts e historiales en un sistema de archivos, permitiendo construir un Agent rápidamente por 0.2 yuanes. Cuenta con un bucle cerrado de autoevolución integrado para la colaboración multi-agente que, mediante la generación automática de conjuntos de prueba, puntuación independiente y optimización de feedback, puede elevar la precisión de predicción del Agent del 53% al 95%, admitiendo además agentes multimodales y análisis de trayectorias de comportamiento de grano fino. (Fuente: 机器之心)
Un equipo de la Universidad de Tsinghua lanza como open-source VeriLoop Coder-E1, un modelo de reparación de código a nivel de repositorio: Basado en Qwen3.6-27B, implementa una espiral basada en evidencia de “probar-refutar-explorar-reparar-verificar-optimizar” mediante el ajuste fino PEFT de dominio estrecho y la colaboración con Self-Harness. El modelo puede compilar errores de prueba y respuestas de herramientas en paquetes de trabajo estructurados, realizando una automejora recursiva para problemas locales, logrando resultados líderes entre los modelos open-source en múltiples benchmarks de ingeniería de software como SWE-bench Verified. (Fuente: 机器之心)
Un desarrollador lanza como open-source BarunLM-35M, un modelo de lenguaje extremadamente pequeño con 35M de parámetros: Este modelo adopta un diseño alterno de atención local y global (proporción 3:1) y un selector de residuos aprendible, completando su preentrenamiento en una sola GPU H200. Su puntuación media en evaluación zero-shot alcanzó el 41.01%, superando a Liquid LFM2.5-230M-Base, que es varias veces mayor en tamaño, lo que demuestra el enorme potencial de los modelos de pocos parámetros en escenarios de inferencia en el dispositivo (on-device) mediante la optimización de la arquitectura. (Fuente: 机器之心)
El Shanghai AI Lab y otros equipos proponen MemHarness, un framework de reconstrucción de experiencias para Agents: Para abordar el problema de que la inyección de memoria estática puede causar fácilmente una transferencia negativa, MemHarness introduce un paso de reconstrucción explícito entre la recuperación y la generación de acciones. El modelo evalúa, reescribe o descarta experiencias históricas en combinación con el contexto actual, optimizándose end-to-end mediante el algoritmo GRPO, lo que mejora significativamente la robustez de las decisiones del Agent en escenarios fuera de distribución. (Fuente: 36氪)
📚 Aprendizaje
El proyecto open-source de GitHub “Awesome Free AI Course Notes” recopila apuntes de ML de universidades de primer nivel: Este proyecto reúne apuntes escritos completos, redactados oficialmente por universidades como el MIT, Harvard y Stanford, que pueden sustituir a los libros de texto. Incluye contenidos de vanguardia sobre modelos fundacionales como Prithvi y aprendizaje por refuerzo, y no requiere registro ni inicio de sesión. (Fuente: GitHub)
UC Berkeley y otros equipos presentan T-Rex, un modelo de tacto a acción: El artículo publica como open-source un conjunto de datos táctiles de 100 horas para manos diestras y propone una arquitectura de control que desacopla la planificación visual de baja frecuencia de la corrección de errores táctiles de alta frecuencia, introduciendo capacidades de reflejo físico de alta frecuencia en los modelos de inteligencia física (embodied AI). (Fuente: 机器之心)
Caltech publica en “Science Advances” el sistema de piel electrónica multimodal adaptativa ARISE: Integra sensores de pulso fisiológico, respuesta galvánica de la piel, electromiografía y temperatura, en combinación con el modelo de aprendizaje autosupervisado SVAE-Transformer, logrando un reconocimiento de actividad y una predicción del estado de fatiga de alta precisión. (Fuente: 机器之心)
💼 Negocios
La startup de despliegue de IA June cierra una ronda de financiación Pre-Seed de 20 millones de dólares: Fundada por un exejecutivo de Salesforce y liderada por Time Ventures de Marc Benioff, la empresa tiene como objetivo utilizar la IA para escanear automáticamente los sistemas heredados de las empresas y generar hojas de ruta para el despliegue de Agents, resolviendo los cuellos de botella de ingeniería en la implementación de la IA a nivel empresarial. (Fuente: TechCrunch)
Pasini Perception Technology completa una ronda de financiación estratégica de 1,000 millones de yuanes: Liderada conjuntamente por un gigante mundial de los semiconductores, BOC International y el Fondo Kunpeng, establece el récord de la mayor cantidad de financiación en el campo de la percepción táctil a nivel mundial. Los fondos se utilizarán para la construcción de la fábrica de datos táctiles de Physical AI y su implementación comercial global. (Fuente: 36氪)
El desarrollador de chips de fotónica de silicio Liangyin Technology cierra una ronda de financiación ángel de decenas de millones de yuanes: Liderada por Zhuhai Science and Technology Venture Capital y con la participación de K2VC, entre otros, la empresa se centra en soluciones de interconexión óptica CPO y OIO, y desarrolla de forma independiente chips ópticos de modulador de microranura (MRM) para satisfacer las demandas de transmisión de alto ancho de banda y bajo consumo de energía de los clústeres de computación de grandes modelos. (Fuente: 36氪)
🌟 Comunidad
Los centros de datos de IA provocan una crisis de escasez de electricistas y energía en EE. UU.: La comunidad debate intensamente sobre la grave escasez de mano de obra cualificada a la que se enfrenta la construcción de centros de datos de IA. McKinsey predice que para 2030, EE. UU. necesitará formar a 130,000 electricistas adicionales. Meta incluso ha financiado escuelas técnicas gratuitas de su propio bolsillo para resolver el principal cuello de botella de la escasez de electricistas en los centros de datos. (Fuente: 36氪)
La valoración de las empresas de grandes modelos está restando importancia a la “narrativa SOTA”: La comunidad y los mercados de capitales están empezando a reevaluar la lógica de valoración de las empresas de IA. A medida que la “línea de rentabilidad” creada por los modelos open-source reduce las barreras de entrada, el liderazgo en las clasificaciones de un solo modelo ya no sirve como ancla de valoración a largo plazo; el mercado se centra más en el ROI del consumo de Tokens y en el cierre comercial real. (Fuente: 36氪)
El posicionamiento “extranjero” de Genspark y su distanciamiento de la comunidad china de Silicon Valley desatan debates: La comunidad discute sobre Genspark, fundada por el exejecutivo de Baidu, Jing Kun. La empresa replica rápidamente productos populares como Manus y Plaud, y en su marketing se esfuerza por empaquetar su “pedigrí de Silicon Valley” a través de su estatus como gran cliente de las API de OpenAI y Anthropic, mientras se distancia deliberadamente de su origen chino y de la comunidad china local. (Fuente: 36氪)
Karpathy genera una escena 3D de “El Señor de los Anillos” con Opus 5 y desata el debate sobre la “generación de mundos por IA”: Andrej Karpathy gastó 10 dólares en Tokens para que Opus 5 escribiera de forma autónoma 5,500 líneas de código Three.js para renderizar una comarca hobbit en 3D. La comunidad debate el potencial de la IA para generar mundos de juego temporales bajo demanda, aunque también señala que el modelo carece actualmente de percepción de video nativa para auditar su propio trabajo. (Fuente: VentureBeat)
El lanzamiento de las funciones de análisis de video y detección de deepfakes en Grok despierta preocupación por el “cerebro subcontratado”: Elon Musk anunció que Grok ya admite el análisis de video, generando un resumen de un video de 30 minutos en 36 segundos, e incluso identificando un video falso de Kobe Bryant generado por IA. A la comunidad le preocupa que la dependencia excesiva de los resúmenes de IA debilite la capacidad humana para la lectura profunda y el pensamiento crítico. (Fuente: 36氪)
Libros escritos por IA se infiltran en librerías físicas y provocan el rechazo de los lectores: Los lectores sospechan que varios libros de ciencias sociales han sido generados masivamente por IA, lo que ha provocado una caída en picado de sus puntuaciones en Douban. Los editores señalan que, aunque la IA eleva el estándar mínimo de la escritura, elimina la personalidad y las imperfecciones emocionales del autor, lo que ha provocado protestas de los lectores contra la escritura de IA por difuminar las señales del mundo real humano. (Fuente: 36氪)
💡 Otros
Google utiliza un Agent de IA para reparar 1,072 fallos de seguridad de Chrome en 60 días: El equipo de seguridad de Google Chrome reveló que, mediante el despliegue de un flujo de trabajo colaborativo multi-agente basado en Gemini con roles de “reparador” y “crítico”, lograron la reproducción, reparación y prueba automática de vulnerabilidades, aumentando la eficiencia de reparación de forma exponencial. (Fuente: ZDNet)
Las cámaras de reconocimiento de matrículas de Flock en los márgenes de las carreteras sufren daños por disparos: Después de que Steve Eimers (conocido como “el supervisor de guardarraíles”) señalara en redes sociales los riesgos de seguridad en la instalación de cámaras de reconocimiento de matrículas como las de Flock, desatando controversias sobre la vigilancia, varias cámaras que aparecían en sus videos fueron dañadas por disparos. Los sospechosos del caso ya han sido arrestados por la policía, y Eimers ha anunciado la suspensión de su campaña. (Fuente: WIRED)
Cadenas de comida rápida en EE. UU. y Europa aceleran la adopción de sistemas de toma de pedidos por voz con IA: Marcas de comida rápida como Taco Bell, Dairy Queen y White Castle ya han desplegado sistemas de toma de pedidos por voz con IA en miles de establecimientos. Una encuesta de Intouch Insight muestra que la tasa de satisfacción alcanza el 97%, y la IA es más activa en la venta sugestiva (upselling) que los empleados humanos. (Fuente: WIRED)