Xinzhi Embodied y la Universidad de Fudan lanzan conjuntamente… | Diario de IA 2026-07-27

🔥 Enfoque

Xinzhi Embodied y la Universidad de Fudan lanzan conjuntamente la serie de modelos N0 y el conjunto de datos NeoData : Xinzhi Embodied y la Universidad de Fudan han lanzado conjuntamente la serie de modelos de inteligencia encarnada (embodied AI) N0 y el conjunto de datos NeoData. NeoData contiene más de 30,000 horas de datos de interacción visual-táctil, y el modelo de representación unificada NeoForce resuelve el desafío de la fusión de datos de diferentes sensores táctiles. N0-VTLA mejora la tasa de éxito de las operaciones al predecir la evolución táctil de los próximos 50 pasos, mientras que N0-TWAM introduce la predicción táctil en el modelo de mundo (world model), impulsando la evolución de la inteligencia encarnada de “guiada por visión” a “fusión viso-táctil”. (Fuente: QbitAI)

新智具身联合复旦发布N0系列模型与NeoData数据集

Induction Labs lanza el modelo Photon-1 : Induction Labs ha presentado el modelo Photon-1, un modelo de mezcla dispersa de expertos (MoE) de 106B-A5B. Su innovación radica en el preentrenamiento mediante videos sin anotaciones de acciones para aprender políticas implícitas. Photon-1 supera a Gemini 3.1 Flash-Lite en las pruebas de referencia de uso de computadoras, con un consumo de potencia de cómputo de preentrenamiento significativamente menor y una reducción de aproximadamente 3 veces en los costos de inferencia. Incluso habiendo aprendido únicamente de videos de escritorio, el modelo Photon-1 ajustado (fine-tuned) sigue mostrando un rendimiento excelente en las damas y en la simulación física de billar. (Fuente: MarkTechPost)

El equipo KwaiKAT lanza KAT-Coder-V2.5 : El equipo KwaiKAT de Kuaishou ha lanzado KAT-Coder-V2.5, un modelo de programación agéntico entrenado en repositorios de código ejecutables reales. El equipo construyó automáticamente más de 100,000 entornos de repositorios verificables a través de AutoBuilder, y utilizó un mecanismo de filtrado basado en procesos y el algoritmo asimétrico AFT-PPO para el aprendizaje por refuerzo. KAT-Coder-V2.5 lidera en PinchBench con una alta puntuación de 94.9, demostrando una vía para mejorar el rendimiento de los agentes de programación de largo alcance mediante la optimización de la infraestructura de sandbox y el diseño de algoritmos. (Fuente: MarkTechPost)

Se publica en código abierto MonkeyOCRv2, una base visual para documentos : Equipos de la Universidad de Ciencia y Tecnología de Huazhong y otras instituciones han publicado en código abierto MonkeyOCRv2, un modelo que introduce el objetivo de preentrenamiento “la reconstrucción como memoria visual del documento”. En experimentos controlados manteniendo congelado el modelo de lenguaje backend Qwen3-1.7B, MonkeyOCRv2 superó al grupo de control más fuerte por 13.2 puntos en 8 pruebas de referencia de comprensión de documentos. Al mismo tiempo, el equipo ha liberado el conjunto de datos MonkeyDoc v2, que contiene 113 millones de imágenes, proporcionando a la comunidad un campo de pruebas unificado para el preentrenamiento visual de documentos, impulsando la evolución de la IA de documentos desde la completación semántica hacia la fidelidad visual. (Fuente: Jiqizhixin)

MonkeyOCRv2文档视觉底座开源

Valkor, en colaboración con la Universidad de Zhejiang y otros, lanza en código abierto Loom, un marco de gestión de estados para agentes : Para abordar los puntos críticos de los agentes de programación de IA que suelen caer en “agujeros negros de depuración” y “amnesia parcial” durante tareas largas, Valkor, en colaboración con la Universidad de Zhejiang y el equipo de la UCL, ha lanzado el marco de código abierto Loom. Loom desglosa las tareas complejas de entrega de software en cadenas de estados estructuradas que se pueden reanudar en cualquier momento. Cuando una prueba falla, Loom la captura como un estado pendiente independiente del historial de chat, lo que permite a los desarrolladores cambiar de modelo o de agente sin problemas para continuar con la tarea, proporcionando una infraestructura de estado crucial para la programación de IA en entornos de producción serios. (Fuente: Jiqizhixin)

Valkor联合浙大等开源智能体状态管理框架Loom

🎯 Tendencias

Sakana AI lanza el modelo de enrutamiento de ciberseguridad Fugu-Cyber : Sakana AI ha lanzado Fugu-Cyber, su modelo de enrutamiento dedicado a la ciberseguridad en su orquestador Fugu. Este modelo logró una tasa de éxito del 86.9% en CyberGym y un resultado del 72.1% en CTI-REALM, compitiendo con modelos de vanguardia como GPT-5.5-Cyber. Fugu-Cyber, a través de los marcos TRINITY y Conductor, coordina dinámicamente subagentes de múltiples dominios de seguridad para realizar la verificación de vulnerabilidades y la generación de reglas de detección, adoptando un modelo de precios escalonados de pago por Token. (Fuente: MarkTechPost)

Open Dreamer publica en código abierto la implementación en JAX del modelo de mundo Dreamer 4 : El equipo de investigación independiente Reactor ha publicado en código abierto Open Dreamer, una reproducción del pipeline del modelo de mundo Dreamer 4 basada en JAX y Flax NNX. El modelo incluye un tokenizador de video Masked Autoencoder que no requiere pérdida adversarial, así como un modelo de dinámica de atención espacio-temporal de 1.6B de parámetros sin anotaciones de acciones. El equipo ha publicado la receta de entrenamiento completa y ha compartido detalles de ingeniería de estabilidad, como la optimización de la memoria de video en GPU B200 y la resolución de la deriva del optimizador Muon, ofreciendo una valiosa referencia para la reproducción de modelos de mundo. (Fuente: MarkTechPost)

InclusionAI lanza Ling-3.0-flash en OpenRouter : Ling-3.0-flash, un modelo MoE ligero centrado en la ejecución de flujos de trabajo de agentes, ya está disponible como API en OpenRouter. El modelo cuenta con un total de 124B de parámetros, 5.1B de parámetros activos, admite un contexto de 256K y tiene un TTFT inferior a 100 ms. Está posicionado como un nodo de ejecución rápida y bajo costo para trabajar en conjunto con planificadores grandes, optimizado para llamadas a herramientas de largo alcance y seguimiento de instrucciones, y ofrece un modo de inferencia híbrido conmutable. (Fuente: Reddit)

Ling-3.0-flash

Se lanza la versión Abliterated del modelo GLM-5.2 : La comunidad ha lanzado una versión “Abliterated” (sin rechazos de seguridad) y ajustada del modelo grande GLM-5.2. Este modelo elimina las direcciones de rechazo de seguridad y ha sido ajustado específicamente para tareas de agentes y confrontaciones de largo alcance, evitando que el modelo se retire sin motivo al manejar tareas técnicas o sensibles. Las evaluaciones muestran un rendimiento excelente en pruebas de referencia de seguridad y código como CyberGym y AgentHarm. Por defecto no retiene datos y las reglas son definidas completamente por el usuario a través de prompts del sistema. (Fuente: Reddit)

Abliterated版GLM-5.2模型

🧰 Herramientas

Llama.cpp fusiona soporte nativo para MCP : Un PR liderado por el desarrollador ngxson se ha fusionado con éxito en llama.cpp, permitiendo que su WebUI y herramientas de línea de comandos admitan de forma nativa el Model Context Protocol (MCP). Los usuarios ahora pueden configurar y llamar directamente a varios servidores MCP (como el asistente de código Serena) en clientes locales sin necesidad de intermediarios externos, logrando un desarrollo y depuración de agentes completamente local y sin dependencias, lo que reduce drásticamente la barrera de entrada para construir ecosistemas de agentes con modelos locales de código abierto. (Fuente: Reddit)

Se publica en código abierto Open Minis, un marco de agentes en el dispositivo : El desarrollador Ethan Wang ha anunciado el lanzamiento en código abierto de Open Minis, una aplicación de agentes de IA que puede ejecutarse localmente en dispositivos móviles. Es compatible con iOS y Android, e integra un Linux Shell local, automatización del navegador, habilidades (Skills) ampliables y memoria persistente. Al cargar la metainformación de las Skills en el prompt del sistema y combinarla con Prompt Caching, el modelo puede completar de manera coherente la selección y ejecución de herramientas en una sola ronda de conversación, proporcionando una referencia ligera para el desarrollo de agentes en el dispositivo. (Fuente: X)

Aethos_Memory resuelve el problema del olvido entre sesiones de los agentes : Para solucionar el problema de que los asistentes de codificación de IA no pueden compartir el contexto entre diferentes sesiones, un desarrollador ha publicado en código abierto la herramienta Aethos_Memory. Esta herramienta proporciona una capa de memoria persistente para los agentes, capaz de extraer y almacenar automáticamente decisiones clave, la arquitectura del repositorio de código y los registros de corrección de errores de las sesiones. Al iniciar una nueva sesión, el agente puede leer directamente la memoria estructurada, evitando la tediosa tarea de copiar y pegar manualmente el historial por parte del desarrollador. (Fuente: Reddit)

Aethos_Memory

Runway lanza la herramienta de enrutamiento de medios Media Router : Runway, la plataforma de generación de video, ha lanzado Media Router, la primera herramienta de enrutamiento optimizada por preferencias para medios generativos. Los equipos empresariales que ejecutan pipelines de producción con múltiples modelos de video, imagen y audio ya no necesitan seleccionar manualmente un modelo para cada solicitud; solo tienen que definir sus preferencias de costo, calidad o latencia una vez en el Router, y el sistema de enrutamiento distribuirá automáticamente las solicitudes de tokens, logrando el mejor equilibrio entre costo y rendimiento. (Fuente: X)

📚 Aprendizaje

Se lanza TileLang, una herramienta para diseñar y optimizar kernels de GPU : Este artículo presenta TileLang, una herramienta DSL para el diseño de kernels de GPU basada en TVM. El tutorial proporciona código Python completo que demuestra cómo diseñar kernels para suma de vectores, multiplicación de matrices en Tensor Core, Softmax fusionado, FlashAttention, entre otros. A través de los Tiles de memoria compartida y el particionado de registros de TileLang, el compilador puede manejar automáticamente el mapeo y la sincronización de hilos, y admite la búsqueda de la configuración de hardware óptima bajo un presupuesto de GPU fijo mediante @tilelang.autotune. (Fuente: MarkTechPost)

Se publica un tutorial sobre FAIRChem v2 y el potencial de simulación atómica de UMA : El tutorial detalla el uso del marco Meta FAIRChem v2 y los potenciales interatómicos de aprendizaje automático universal (MLIP) de UMA. El contenido abarca cómo obtener pesos de modelos con acceso restringido (gated) a través de Hugging Face y configurar calculadoras en ASE (Atomic Simulation Environment) para completar una serie de flujos de trabajo de química computacional, como la predicción de energía de punto único, optimización de geometría molecular, comparación de estados de espín, estimación de energía de reacción, relajación de red cristalina, ajuste de ecuaciones de estado y simulaciones de dinámica molecular. (Fuente: MarkTechPost)

Relative Representation resuelve la alineación del espacio vectorial de LLM heterogéneos : La comunidad ha compartido una técnica geométrica que utiliza el método de representación relativa (Relative Representation Method) y la ortogonalización simétrica de Lowdin para alinear los espacios de incrustación (embeddings) de diferentes LLM (como el uso mixto de Llama, Mistral y Phi). Este método no requiere ajuste fino; al introducir puntos de anclaje de referencia dentro de un dominio semántico específico y realizar una normalización Z-score por columnas, mapea vectores de diferentes dimensiones a un espacio común unificado, resolviendo los problemas de conos anisotrópicos y desajuste de dimensiones en el enrutamiento de múltiples agentes. (Fuente: Reddit)

Relative Representation

Derivación dibujada a mano y diagrama del proceso de cálculo de U-Net : El académico de visión por computadora Prof. Tom Yeh ha publicado un diagrama de cálculo dibujado a mano de la red U-Net. A través de 17 pasos, el tutorial muestra cómo una imagen con canales R, G y B se comprime mediante convolución y max-pooling hasta un Bottleneck de 2×4, y luego se restaura gradualmente a su tamaño original mediante convolución transpuesta y conexiones de salto (Skip Connection), mostrando los principios matemáticos de este esqueleto central del modelo de difusión a través de un flujo intuitivo de multiplicación de matrices. (Fuente: X)

💼 Negocios

Stripe planea adquirir OpenRouter por 10,000 millones de dólares : El gigante de los pagos Stripe está en negociaciones para una adquisición de gran envergadura de la plataforma de agregación de modelos de IA OpenRouter, con una valoración de hasta 10,000 millones de dólares, lo que representa un aumento de casi 8 veces en comparación con los 1,300 millones de hace dos meses. A medida que las empresas tienden a utilizar múltiples modelos para diversificar riesgos, el tráfico y el valor estratégico de OpenRouter se han vuelto muy destacados. Stripe, que ha estado “haciendo fortuna en silencio” en la era de la IA a través de una sola línea de código de pago, adquirió previamente Metronome, y esta adquisición extenderá su negocio desde los pagos hasta la infraestructura subyacente del ecosistema de IA. (Fuente: Jiqizhixin)

Stripe拟以100亿美元收购OpenRouter

Moushen Intelligent completa una ronda adicional de financiación Pre-A de casi 100 millones de yuanes : Moushen Intelligent, una empresa de cerebros de inteligencia encarnada en el dispositivo, ha anunciado la finalización de una ronda adicional de financiación Pre-A de casi 100 millones de yuanes, con una ronda Pre-A+ de casi 500 millones de yuanes también en proceso de cierre, multiplicando su valoración por más de 10 veces en medio año. Fundada por el profesor Chen Tao de la Universidad de Fudan y el ex científico de Intel Zhang Yimin, su modelo de acción de mundo integrado espacio-temporal STI-WM reduce la necesidad de datos de máquinas reales en un 90% al tokenizar las acciones, y ha logrado una adaptación en el dispositivo de costo ultrabajo en chips nacionales como HiSilicon y Horizon Robotics. (Fuente: 36kr)

眸深智能完成近亿元Pre-A轮追加融资

La empresa de robótica quirúrgica Vicarious Surgical entra en liquidación por quiebra : Vicarious Surgical, el unicornio de robótica quirúrgica que alguna vez contó con inversiones de Bill Gates y Jerry Yang, ha decidido cesar sus operaciones y proceder con la liquidación por quiebra tras la votación de sus accionistas, debido a un grave retraso en el desarrollo de I+D y a la ruptura de su cadena de financiación. La empresa había acumulado más de 2,000 millones de yuanes en financiación, pero su agresivo esquema de accionamiento desacoplado y el concepto de control por VR chocaron con obstáculos en la aprobación de la FDA y la producción en masa, lo que sirve de advertencia para el sector de la inteligencia encarnada, que actualmente tiene valoraciones elevadas pero dificultades para su implementación comercial. (Fuente: 36kr)

手术机器人公司Vicarious Surgical清算破产

🌟 Comunidad

Los asistentes de programación de IA provocan una reestructuración de los métodos de evaluación en la educación de ciencias de la computación : Una encuesta de la Association for Computing Machinery (ACM) a más de 700 educadores de ciencias de la computación en 49 países reveló que el 69% de los profesores cree que la IA ha cambiado las habilidades necesarias para el desarrollo de software, y el 64% ha cambiado el enfoque de la enseñanza de “escribir código desde cero” a la comprensión y depuración de código. Para hacer frente al plagio y a la dependencia excesiva de la IA, el 68% de los profesores ha ajustado sus métodos de evaluación, añadiendo exámenes presenciales a libro cerrado, defensas orales y sesiones de defensa de código, con el fin de redefinir la evaluación de las habilidades de programación en la era de la IA. (Fuente: THE DECODER)

AI编程助手引发CS教育界对考核方式的重构

La indexación por parte de Google de los enlaces de chat compartidos de Claude genera preocupaciones de privacidad : La comunidad ha descubierto que las conversaciones y Artifacts compartidos por los usuarios a través de la función “crear enlace público” de Claude están siendo indexados públicamente por motores de búsqueda como Google, e incluso han aparecido sitios web de terceros dedicados a rastrear estos enlaces. El contenido filtrado incluye claves privadas de criptomonedas, secretos corporativos e información médica personal privada. Los usuarios critican a Anthropic por no añadir la etiqueta meta noindex en las páginas compartidas, lo que consideran un error básico de diseño de seguridad, e instan a los usuarios a limpiar sus conversaciones compartidas en la configuración lo antes posible. (Fuente: Reddit)

Claude共享对话链接被Google索引

Silicon Valley desata una ola de talleres de alfabetización digital inversa “Avoiding AI” : A medida que los gigantes tecnológicos imponen la IA en todo tipo de dispositivos, los talleres presenciales “Avoiding AI” (Evitar la IA) organizados por bibliotecas en varias partes de EE. UU. se han vuelto virales en las redes sociales. Los bibliotecarios enseñan paso a paso a los ciudadanos cómo desactivar por completo las IA integradas en el sistema como Apple Intelligence y Gemini, y comparten extensiones de navegador para bloquear los resúmenes de IA en las búsquedas de Google. Los ciudadanos aprovechan esto para expresar su preocupación por el monopolio de las grandes tecnológicas, la invasión de la privacidad y el consumo de energía de los centros de datos, exigiendo soberanía tecnológica. (Fuente: TechCrunch)

Avoiding AI

El Secretario de Comercio Lutnick expresa su apoyo a la IA de código abierto para contrarrestar a China : La comunidad debate intensamente las declaraciones del Secretario de Comercio de EE. UU., Howard Lutnick, en la cena de corresponsales de la Casa Blanca, donde afirmó directamente que “esta Casa Blanca protegerá la IA de código abierto”. Anteriormente, la APEC firmó una declaración de apoyo a la IA de código abierto, y el gobierno de EE. UU. está discutiendo el uso de prohibiciones dirigidas a modelos específicos en lugar de bloqueos generalizados, para ayudar al ecosistema de código abierto estadounidense a alcanzar rápidamente la vanguardia del código cerrado mediante “bifurcaciones” (forks) y “ajustes finos” (fine-tuning) bajo limitaciones de potencia de cómputo, asegurando el dominio tecnológico de EE. UU. (Fuente: X)

Andrej Karpathy modifica su biografía personal, desatando especulaciones sobre su salida : El reconocido académico de IA Andrej Karpathy eliminó la palabra “Anthropic” de la biografía de su cuenta de redes sociales, lo que desató amplias especulaciones en la comunidad sobre su posible salida. Algunas filtraciones sugieren que decidió irse debido a que las restricciones de exportación impedían que su estatus de no ciudadano estadounidense accediera a los modelos más avanzados de la empresa, aunque otros internautas señalaron que el cambio en su biografía ocurrió hace varios días. Dado que Anthropic no firmó recientemente la carta abierta sobre el código abierto impulsada por Jensen Huang, sus estrategias comerciales y regulatorias conservadoras están enfrentando cierta reacción negativa en la comunidad. (Fuente: Jiqizhixin)

Andrej Karpathy修改个人简介引发离职猜测

DeepSeek suspende su segunda ronda de financiación tras la filtración de las minutas de una reunión con inversores : Una minuta de reunión sobre el intercambio entre el fundador de DeepSeek, Liang Wenfeng, y los inversores, que se volvió viral en las redes sociales, llevó a DeepSeek a notificar de urgencia a los inversores potenciales que suspendería temporalmente su segunda ronda de financiación. La transcripción filtrada incluye declaraciones sensibles de DeepSeek sobre la brecha de potencia de cómputo entre China y EE. UU., las estrategias de precios de Tokens y el modelo de negocio de código abierto. La comunidad ha iniciado debates sobre el ajuste fino y el despliegue del modelo de “fábrica de Tokens” de DeepSeek, que reduce los costos de inferencia a un tercio de los de sus homólogos occidentales mediante la optimización de ingeniería. (Fuente: Hacker News)

💡 Otros

ChatGPT ayuda a un usuario a descubrir que su MacBook estaba infectada con AtomicStealer : Un usuario de Mac, al intentar optimizar la memoria de ejecución de un modelo grande local, analizó los procesos del sistema a través de ChatGPT y descubrió inesperadamente dos archivos LaunchDaemon disfrazados de servicios del sistema que apuntaban a scripts ocultos en la Library. ChatGPT le advirtió de inmediato que se trataba de malware, ayudando al usuario a localizar el troyano de robo de información OSX.AtomicStealer, con el que se había infectado al instalar una biblioteca de código abierto de PDF contaminada, demostrando el papel inesperado de la IA en la protección de seguridad de terminales cotidianos. (Fuente: Reddit)

ChatGPT协助用户发现MacBook感染AtomicStealer

Decoy Font utiliza diferencias visuales para engañar a las IA multimodales : El estudio de diseño Mixfont ha lanzado “Decoy Font” (fuente señuelo). Esta fuente superpone caracteres de interferencia delineados con líneas finas sobre letras normales, de modo que las IA multimodales con capacidades visuales como ChatGPT y Claude solo pueden leer texto incorrecto (como “Sorry Robot”) durante el reconocimiento OCR, mientras que el ojo humano aún puede leer el texto real (como “Happy Human”) a cierta distancia, convirtiéndose en una nueva tecnología física de nivel de IA contra rastreadores (anti-scraping) y de ejemplos adversarios. (Fuente: Reddit)

Decoy Font利用视觉差异欺骗多模态AI

Una escuela secundaria de Nueva York planea introducir robots humanoides, desatando protestas de los profesores : Una escuela secundaria pública de Nueva York planea introducir robots humanoides en el edificio escolar para ayudar en la enseñanza, una medida que ha encontrado una fuerte oposición por parte del sindicato de profesores. Los docentes argumentan que, en un contexto de presupuestos educativos ajustados y pérdida de personal docente, los elevados costos de adquisición y mantenimiento de los robots humanoides representan una asignación incorrecta de recursos, y que los robots no pueden reemplazar el papel central de los profesores humanos en la comunicación emocional y la orientación personalizada, por lo que la tecnología en las escuelas debe mantener sus límites. (Fuente: Reddit)

纽约一高中拟引入人形机器人引发教师抗议

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *