🔥 Destacados
Claude supera el límite inferior de la hipótesis de Riemann : El modelo de investigación no publicado de Anthropic ha elevado el límite inferior de la proporción de ceros de la función zeta de Riemann del 41.6% al 67.2%, rompiendo un récord de 37 años en el campo de la teoría de números. El estudio fue realizado en colaboración por 60 sub-Agent, consumiendo 31 millones de Tokens. Dado que su capacidad de deducción y verificación autónoma se ha acercado al límite de los académicos humanos, esto marca que la AI ha pasado de “responder a lo conocido” a la etapa de investigación científica de “explorar lo desconocido”. (Fuente: TechCrunch)
Brad Lightcap, ejecutivo clave de OpenAI, deja la empresa : Brad Lightcap, un ejecutivo clave que trabajó en OpenAI durante 8 años y se desempeñó como CFO y COO, anunció su salida para fundar una nueva empresa, y Sam Altman le agradeció públicamente. Como arquitecto del sistema comercial de OpenAI, eligió renunciar en un momento crítico en el que la valoración de la empresa alcanzó los 852.000 millones de dólares y se preparaba para una IPO, lo que desató especulaciones externas sobre discrepancias en la comercialización de grandes modelos y una ola de salidas de ejecutivos. Al mismo tiempo, Chloé Bakalar, la única responsable de ética, también ha dejado la empresa discretamente. (Fuente: TechCrunch)
Manus anuncia su separación de Meta para reanudar operaciones independientes : Tras 8 meses de revisión de seguridad y debido a requisitos de cumplimiento regulatorio, Manus, la destacada empresa de Agent de propósito general adquirida por Meta por 2.000 millones de dólares, anunció su separación de Meta para reanudar sus operaciones independientes. Los datos de los usuarios se migrarán a Estados Unidos y Singapur, y se eliminarán algunos datos generados después de la adquisición. Los análisis sugieren que esto marca que la intervención geopolítica en las fusiones y adquisiciones transfronterizas de AI ha entrado en una fase sustancial, y Manus debe volver a demostrar su modelo de negocio en el competitivo sector de los Agent. (Fuente: QbitAI)
Junyang Lin, exdirector de Qwen, anuncia la fundación de Pragmatik Labs : Junyang Lin, exdirector de tecnología de Qwen en Alibaba, anunció la fundación de la empresa de AI Pragmatik Labs en Shanghái. La primera ronda de financiación fue liderada por Sequoia China y Gaorong Capital, con la participación de Tencent y el Fondo de la Industria del Futuro de Shanghái, alcanzando una valoración de 2.000 millones de dólares. La empresa se centrará en la investigación y desarrollo de la próxima generación de Agent que abarcan los mundos digital y físico. Esto demuestra que el talento de primer nivel en grandes modelos en China está acelerando su flujo hacia el sector de los Agent, explorando la transición de paradigma de la “inteligencia de modelos” a los “sistemas de acción”. (Fuente: 36Kr)
NVIDIA se asocia con gigantes de Wall Street para lanzar una financiación de potencia de cálculo de 500.000 millones de dólares : NVIDIA ha colaborado con seis gigantes de la gestión de activos, incluidos BlackRock y Blackstone, para establecer una plataforma de financiación independiente. Planean movilizar y apalancar con el tiempo más de 500.000 millones de dólares para la construcción de infraestructura de AI, con NVIDIA ofreciendo una garantía de valor residual de hasta el 25%. Jensen Huang afirmó que la potencia de cálculo se ha convertido en un activo de infraestructura invertible. Los análisis señalan que esto marca la llegada de la era de la financiarización de la potencia de cálculo, reduciendo la barrera financiera para la expansión de la AI a través de la deuda y la titulización. (Fuente: NVIDIA Blog)

🎯 Tendencias
Entra en funcionamiento la base Xinghe de Envision en Ulanqab : Envision Group anunció la puesta en marcha oficial de su base Xinghe, con una capacidad total planificada de 2 GW, que admite el paralelismo de millones de tarjetas y enciende el supermonolito de potencia de cálculo de AI más grande del mundo. A través de una alta proporción de conexión directa de electricidad verde y un sistema eléctrico de AI, el proyecto convierte la energía renovable fluctuante en una fuente estable de potencia de cálculo. Esto demuestra que la clave de la competencia por la potencia de cálculo se está inclinando hacia la electricidad y la eficiencia del sistema, y las empresas de energía renovable se están convirtiendo en la nueva fuerza principal en la construcción de infraestructura de AI. (Fuente: JiQizhixin)

El equipo de Tianmouc publica un marco de percepción visual autosupervisado inspirado en el cerebro : El equipo publicó un artículo de portada en Nature Sensors, proponiendo un marco de aprendizaje autosupervisado basado en primitivas visuales, y liberó como código abierto la cadena de herramientas de algoritmos TianMouCV. A través de módulos de atención y memoria entre vías, el marco construye de forma autosupervisada modelos internos en escenarios de degradación extrema sin etiquetas de verdad fundamental (ground truth), logrando una reconstrucción visual con alto rango dinámico y alineación espacio-temporal. Esto proporciona un soporte tecnológico subyacente para la percepción robusta de la conducción autónoma y la Embodied AI en el mundo abierto. (Fuente: JiQizhixin)
.jpg)
Independent Variable Robot lanza el modelo unificado del mundo WALL-B : En una prueba en vivo sin guion, la solución de pinzas de doble brazo de Independent Variable Robot alcanzó una eficiencia de clasificación de paquetes con formas irregulares de 1.816 piezas por hora, superando el récord de Figure AI y reduciendo los costos de hardware en un 70%. Esto se debe a su modelo unificado del mundo WALL-B de desarrollo propio, que logra la fusión de la percepción multimodal nativa y la predicción física. Esto demuestra que al mejorar la capacidad de generalización y predicción del cerebro del modelo, se puede reducir eficazmente el costo de acumulación de hardware en la Embodied AI. (Fuente: QbitAI)

El equipo Seed de ByteDance propone una ley de escalado de condiciones de texto para la generación de texto a imagen : La investigación descubrió que es la cantidad de información (GPG/ED) de los subtítulos (captions) de las imágenes de entrenamiento, y no la longitud de los tokens, lo que determina la pérdida de convergencia de los modelos de difusión. Basándose en esto, propusieron una solución de Prompt estructurado (SP). Al organizar variables a nivel global, de elementos y de relaciones en campos JSON, este método mejora significativamente el rendimiento del modelo en tareas de combinación compleja, razonamiento espacial y generación de conocimiento del mundo, abriendo una nueva variable de optimización para el entrenamiento de modelos de texto a imagen. (Fuente: JiQizhixin)
.jpg)
La Universidad Renmin de China y Ant Group lanzan LLaDA MoE v2 : El equipo conjunto caracterizó sistemáticamente por primera vez la ley de escalado de los modelos de lenguaje de difusión de mezcla de expertos (MoE) y entrenó el modelo 30B-A3B. Este modelo activa solo 3B de parámetros y utiliza aproximadamente el 65% de los tokens de preentrenamiento de un modelo autorregresivo del mismo tamaño para aproximarse a los niveles principales en pruebas de rendimiento de razonamiento y código. Esto demuestra la alta eficiencia de combinar la activación dispersa con el modelado de difusión en la distribución de datos y potencia de cálculo, impulsando a los modelos de lenguaje de difusión hacia una era guiada por leyes de escalado. (Fuente: JiQizhixin)
.jpg)
🧰 Herramientas
openJiuwen lanza la tecnología de “afinidad de potencia de cálculo” para Agent : La plataforma establece una sinergia semántica entre el marco de Agent y el motor de inferencia a través del mecanismo Agent Hint, actualizando la gestión de KV Cache de una eliminación pasiva por tiempo de espera a una programación activa del ciclo de vida. En pruebas de colaboración multi-agent, esta tecnología redujo la latencia del primer token en un 57.46% y el uso máximo de almacenamiento de inferencia en un 25.24%, proporcionando una solución a nivel de sistema para resolver el aumento drástico de la memoria de video y los cuellos de botella de latencia causados por los Agent de largo alcance. (Fuente: JiQizhixin)
.jpg)
La Universidad Jiaotong de Xi’an propone el método de regularización de modelos del mundo QQWorld : Para abordar los problemas de cola pesada y colapso en la distribución de variables latentes en los modelos del mundo de arquitectura de predicción de incrustación conjunta (JEPA), el equipo de investigación reemplazó la regularización original con el emparejamiento de cuantiles (QQ matching), proporcionando un gradiente continuo de corrección de errores en la cola de la distribución. En múltiples entornos de control, este método aumentó la tasa de éxito promedio de la planificación en 5.33 puntos porcentuales, con un código principal de menos de 10 líneas, proporcionando una herramienta matemática eficiente para la regularización del espacio latente en grandes modelos. (Fuente: JiQizhixin)
.jpg)
La Universidad China de Hong Kong y la Universidad Hang Seng proponen el sistema de gestión de recursos Libra : Para abordar el desequilibrio de la potencia de cálculo causado por la incertidumbre en la longitud de la trayectoria de los Agent y la deriva de políticas, Libra introduce una programación consciente de la causalidad y un cambio elástico de recursos, optimizando dinámicamente la potencia de cálculo de entrenamiento e inferencia como un sistema acoplado. En múltiples tipos de tareas complejas, Libra logró un aumento de rendimiento de hasta 3 veces y redujo el tiempo para alcanzar la recompensa objetivo a una fracción de 1/2.5, resolviendo eficazmente el problema de asignación incorrecta de recursos en el post-entrenamiento de aprendizaje por refuerzo. (Fuente: JiQizhixin)
.jpg)
Equipos de la Universidad de Beihang y la Universidad de Tsinghua, entre otros, lanzan un modelo VLA para conducción autónoma : Para abordar la desconexión entre el espacio de planificación y el espacio semántico en los modelos de conducción VLA autorregresivos, el equipo propuso la destilación visual de sentido común de tráfico (DVD) y las indicaciones guiadas por trayectoria de imagen 2D (2D-TGP), mapeando las trayectorias BEV al espacio de píxeles de la imagen para el aprendizaje, aprovechando al máximo la capacidad de lectura de imágenes del modelo base. El modelo obtuvo un 90.4 PDMS en la evaluación NAVSIM, mostrando una nueva ruta para el Scaling eficiente de los modelos VLA de conducción autónoma. (Fuente: JiQizhixin)
.jpg)
Microsoft lanza CARE-X, un gran modelo multimodal para radiología : Adoptando una arquitectura de doble inferencia, combina Findings/Impression generativos con cabezales de predicción auxiliar estructurados, e introduce mediciones asistidas por herramientas para alternar entre el razonamiento de múltiples pasos y el cálculo preciso. En la validación con datos clínicos reales de Narayana Health, el modelo mostró una alta sensibilidad hacia afecciones raras de la UCI y afecciones de agrandamiento de órganos confirmadas por CT, logrando una precisión del 94% en ReXVQA. (Fuente: Microsoft Research Blog)

📚 Aprendizaje
Harvard y Stanford, entre otros, lanzan un sistema de simulación de población virtual : El equipo construyó una base de datos de personalidad que contiene 1.290 dimensiones y utilizó grandes modelos para impulsar 8.300 millones de Agent virtuales. En entornos de simulación como preguntas y respuestas, chat y operaciones de aplicaciones, la tasa de cumplimiento del comportamiento de los Agent alcanzó el 91.5%. Este sistema proporciona una plataforma de simulación completamente nueva para la investigación de usuarios y pruebas de productos a gran escala y bajo costo, demostrando el enorme potencial de la simulación de socialización multi-agent. (Fuente: JiQizhixin)
.jpg)
WeClawArena: Sandbox de seguridad y colaboración multiusuario para Agent : Para escenarios de colaboración donde los datos de los espacios de trabajo personales de múltiples usuarios no están interconectados, el equipo lanzó un punto de referencia de evaluación que contiene 620 variantes de escenarios, que cubren la colaboración benigna y cuatro tipos de vectores de ataque. El sandbox puede realizar una auditoría completa de las trayectorias de ejecución, evaluando cuantitativamente los riesgos de seguridad entre usuarios, como la filtración de privacidad y la inyección maliciosa, proporcionando un punto de referencia de prueba para construir redes sociales seguras para Agent. (Fuente: HuggingFace Daily Papers)
La Universidad de Ciencia y Tecnología de Hong Kong y Tencent, entre otros, proponen un modelo de comprensión de video con múltiples imágenes de referencia : Para abordar el cuello de botella de la correspondencia inexacta entre la semántica del video y las imágenes cuando los modelos multimodales procesan múltiples imágenes de referencia, el equipo lanzó el modelo RefCaptioner y el conjunto de evaluación MRVBench. Al introducir el algoritmo HCD-GRPO, el modelo logra una selección de imágenes y una vinculación local de alta precisión al tiempo que genera descripciones estructuadas, mejorando significativamente la calidad de la reconstrucción de video grounded. (Fuente: JiQizhixin)
.jpg)
JiQizhixin y otros lanzan conjuntamente honores para estudiantes universitarios, de maestría y doctorado en AI : Se establecieron los premios especiales “Estrella Naciente del Año” y tres categorías: “Avance Académico”, “Pionero de Aplicación” y “Responsabilidad Social”, abiertos a solicitudes de estudiantes chinos matriculados en todo el mundo. La selección considera de manera integral dimensiones como el impacto académico, la innovación técnica y la viabilidad de la aplicación, con el objetivo de descubrir y financiar a jóvenes académicos con un desempeño sobresaliente en la AI y campos interdisciplinarios de vanguardia, acelerando la construcción del ecosistema de talento. (Fuente: JiQizhixin)
.jpg)
💼 Negocios
Illume Bio completa una ronda de financiación Serie B de 100 millones de dólares : Especializada en el diseño de anticuerpos generativos y fármacos de macromoléculas, la empresa construye un bucle cerrado de experimentos húmedos y secos a través de experimentos de microfluídica de ultra alto rendimiento y el modelo base AuraIDE. Su versión de código abierto de 700 millones de parámetros, OpenDDE, muestra un rendimiento excelente en la predicción de complejos de antígenos. La empresa ya cuenta con múltiples líneas de desarrollo en etapas preclínicas o de solicitud de IND, demostrando la viabilidad comercial de la AI en el diseño de fármacos de macromoléculas. (Fuente: JiQizhixin)
.jpg)
Daimon Robotics completa una ronda de financiación estratégica de cientos de millones de yuanes : Liderada por Ant Group, con la participación de accionistas existentes. Daimon se centra en el tacto embodied y la manipulación diestra, y ha lanzado el modelo del mundo anclado en el tacto Daimon-TWM. A través de un mecanismo de “planificación lenta y corrección rápida”, logra la corrección de acciones de servo de alta frecuencia, resolviendo los cuellos de botella de deslizamiento y control de fuerza de los robots en tareas de contacto complejas. Ya ha entrado en las cadenas de suministro de varias empresas líderes en automatización industrial y robótica. (Fuente: QbitAI)

MemoraX AI completa una financiación de cientos de millones de yuanes : Especializada en la investigación y desarrollo de infraestructura de memoria a largo plazo para AI, propone una ruta de memoria “endógena del modelo”. Su sistema central ha logrado resultados SOTA en evaluaciones de memoria de conversación ultralarga como LoCoMo-Refined, y ha alcanzado una cooperación estratégica con Huawei Cloud para integrar capacidades de memoria a largo plazo en escenarios comerciales reales como la salud médica y el hogar inteligente. (Fuente: 36Kr)
🌟 Comunidad
La comunidad debate acaloradamente sobre la imposición de marcas de agua de texto invisibles globales por parte de Anthropic : En respuesta a la Ley de AI de la Unión Europea, Claude integrará marcas de agua invisibles en sus salidas a través de todos los canales globales. A la comunidad le preocupa que esto degrade la calidad de escritura del modelo y que sea extremadamente fácil de eludir con herramientas de código abierto. Muchos usuarios están comenzando a considerar cambiar a modelos de código abierto o despliegues locales para mantener la independencia de la expresión del texto y la seguridad de la privacidad de los datos. (Fuente: Reddit r/artificial)
Desarrolladores se quejan de que la programación asistida por AI genera “deuda cognitiva” y ansiedad : La comunidad debate intensamente sobre cómo la dependencia excesiva de los Agent para la planificación de arquitectura y la generación de código hace que los equipos entreguen extremadamente rápido pero pierdan por completo el control sobre los detalles del sistema, pidiendo el establecimiento de un límite mínimo de comprensión “propiedad de los humanos”. A los desarrolladores les preocupa que, a largo plazo, esto degrade las capacidades individuales de diseño de sistemas y aumente los costos ocultos de mantenimiento y depuración de sistemas. (Fuente: Reddit r/artificial)
La voz del portavoz virtual de AI de Tmall, “Duan Yan”, es sospechosa de infracción de derechos de autor : Un actor de doblaje acusó a Tmall de utilizar AI para clonar su voz sin autorización en un anuncio del Festival Qixi, lo que expone el vacío legal en la autorización de derechos de autor de rostros y voces en la seguridad y el cumplimiento comercial de los personajes de AI. Esto ha provocado una discusión profunda en la industria sobre los límites del uso legítimo de avatares virtuales y tecnología de síntesis de voz, y también ha dado lugar a un nuevo mercado para la detección de infracciones de AI y la eliminación de marcas de agua. (Fuente: 36Kr)
💡 Otros
La 38.ª edición de los Premios de las Cien Flores establece por primera vez una sección de recomendación de imágenes AIGC : Con Jimeng AI como socio tecnológico exclusivo, se recopilaron más de 2.000 obras, demostrando el potencial de las herramientas de AI para reducir la barrera de creación para los jóvenes cineastas, acortar los ciclos de producción y disminuir los costos de efectos visuales. Múltiples obras ganadoras mostraron una profunda integración de la estética de estilo nacional chino (Guofeng) y la tecnología de AI, abriendo un nuevo camino de entrada para los creadores jóvenes. (Fuente: JiQizhixin)

WeChat Moments realiza pruebas beta de “Escritura asistida por AI” y “Comentarios por AI” : WeChat ha comenzado a introducir la AI generativa en sus escenarios sociales principales para ayudar a los usuarios a generar textos y comentarios interactivos, lo que marca el avance de esta aplicación social de nivel nacional hacia la integración de la AI. Aunque esta función reduce la barrera de expresión en términos de experiencia, también ha desatado controversias en las redes sociales sobre la pérdida de “autenticidad” y la plantillación de las relaciones interpersonales. (Fuente: 36Kr)
Se reporta que el asistente de AI de Google Health tiene “alucinaciones” frecuentes con datos de ejercicio : Muchos usuarios de Fitbit informaron que la aplicación rediseñada de Google Health confunde con frecuencia las actividades diarias con ejercicios como natación o carrera, lo que genera dudas sobre la confiabilidad de la AI en el ámbito de la salud. Esto demuestra que en escenarios de alta confiabilidad, como la salud médica, el problema de las alucinaciones de los asistentes de AI sigue siendo un obstáculo clave que restringe su implementación a gran escala. (Fuente: TechRadar)