El misterioso modelo Ox Alpha se lanza por sorpresa… | Diario de IA 2026-08-22

🔥 En Portada

El misterioso modelo Ox Alpha se lanza por sorpresa en OpenRouter y OpenCode : OpenRouter y OpenCode han lanzado por sorpresa un misterioso modelo en modo sigilo (stealth) con el nombre en clave “Ox Alpha”, que ofrece una ventana de contexto de 1 millón de Tokens y soporte nativo para entrada de texto, imágenes y video. Este modelo está diseñado específicamente para programación con Agents de largo ciclo, razonamiento complejo y entornos de producción reales, y ofrece una cuota de prueba gratuita diaria de 100 billones de Tokens. Múltiples pruebas reales de desarrolladores muestran que sus capacidades de programación y razonamiento superan a Fable 5 y GPT-5.6 Sol. Toda la comunidad especula ferozmente sobre su verdadera identidad, apuntando actualmente hacia GLM-5.4/5.5 de Zhipu o MiMo V3 de Xiaomi (Fuente: OpenRouter, 36Kr)

DeepSeek lanza oficialmente por sorpresa el modelo visual multimodal V4-Flash-Vision-Exp : La plataforma oficial de API de DeepSeek ha lanzado por sorpresa su primer modelo nativo de comprensión visual, DeepSeek-V4-Flash-Vision-Exp. Manteniendo las potentes capacidades de texto de V4-Flash, el rendimiento de su Agent multimodal se ha incrementado significativamente, acercándose a Opus 4.8. Las imágenes se convertirán a Tokens según su tamaño (límite de 384 tokens por imagen), con un precio idéntico al de V4-Flash (aproximadamente un yuan por mil imágenes), y se han abierto simultáneamente las adaptaciones de la Files API gratuita y Harness 0.1.1, reduciendo enormemente los costes de desarrollo y ejecución de Agents visuales (Fuente: DeepSeek, Jiqizhixin)

DeepSeek lanza oficialmente por sorpresa el modelo visual multimodal V4-Flash-Vision-Exp

Google presenta Gemini 3.7 Flash y bate múltiples benchmarks de Agents : Google ha lanzado oficialmente Gemini 3.7 Flash, cuyo precio de API se ha reducido un 50% en comparación con 3.6 Flash, logrando un salto sustancial en inteligencia a nivel algorítmico. En el benchmark de análisis de datos reales AA-AnalystAgent de Artificial Analysis, Gemini 3.7 Flash encabeza la clasificación, completando tareas de un 60% a un 90% más rápido que sus competidores; al mismo tiempo, logró una puntuación elevada de 84.6% en ARC-AGI-2 en la evaluación de verificación de ARC-AGI a un coste extremadamente bajo, demostrando una altísima relación calidad-precio y potencia en Agents visuales (Fuente: demishassabis, Google Research Blog)

Google presenta Gemini 3.7 Flash y bate múltiples benchmarks de Agents

OpenAI crea una fundación y pone en marcha el proyecto AI Futures : OpenAI ha establecido oficialmente la OpenAI Foundation y ha lanzado el proyecto AI Futures, destinado a transformar las capacidades de la AGI en un amplio beneficio público para la sociedad. La fundación se centra en las ciencias de la vida (como el diseño de proteínas y el descubrimiento de nuevos fármacos) y la resiliencia social de la IA (defensa contra amenazas biológicas y cibernéticas). En sus primeros cinco meses, ya ha desplegado cientos de millones de dólares y planea invertir miles de millones en el futuro, incluyendo una donación de 17.2 millones de dólares a SecureBio para construir un sistema de alerta temprana. Este paso marca la aceleración de los principales laboratorios de IA en la creación de infraestructura pública para prevenir el uso indebido de la tecnología y los riesgos sociales (Fuente: OpenAI News, woj_zaremba)

OpenAI crea una fundación y pone en marcha el proyecto AI Futures

🎯 Tendencias

NVIDIA presenta el Agent AVO y logra una puntuación perfecta del 100% en ARC-AGI-3 : El equipo de IA de NVIDIA ha presentado AVO, un Agent de programación general e inferencia interactiva. Sin ninguna instrucción explícita, regla o meta preestablecida, el Harness de AVO impulsado por Claude Opus 5 completó los 183 niveles de los 25 entornos del benchmark de inferencia interactiva ARC-AGI-3, logrando una puntuación perfecta del 100% y mejorando la eficiencia de ejecución de acciones en un 12% en comparación con sistemas similares (Fuente: ClementDelangue)

Alibaba publica como código abierto Qwen-UI-Agent, un modelo base para Agents : Alibaba ha lanzado Qwen-UI-Agent (disponible en versiones 27B / 35B-A3B / 4B), un modelo base de Agent de GUI para ejecución en dispositivos móviles, de escritorio y web, entrenado en entornos de más de 100 teléfonos móviles reales. El modelo unifica el espacio de acciones de clics en GUI y comandos de CLI, superando a GPT-5.6 Sol y Opus 4.8 en 5 benchmarks clave de GUI (Fuente: 36Kr)

Alibaba publica como código abierto Qwen-UI-Agent, un modelo base para Agents

Xiaohongshu lanza FireRedTTS3 de código abierto, un modelo unificado de generación y edición de voz : Xiaohongshu ha publicado su nueva generación del modelo de voz FireRedTTS3. Basado en la representación continua mejorada semánticamente RedAE pionera de la empresa, unifica la clonación zero-shot en 24 idiomas y 21 dialectos chinos, el diseño de voz con lenguaje natural y la edición de voz local precisa en un solo modelo, liderando de forma absoluta en cuatro benchmarks públicos como Seed-TTS-Eval (Fuente: Jiqizhixin)

Xiaohongshu lanza FireRedTTS3 de código abierto, un modelo unificado de generación y edición de voz

Replit lanza el Modo Gratuito (Free Mode) impulsado por GPT-5.6 Luna : Replit, en colaboración con OpenAI, ha lanzado el Free Mode impulsado por GPT-5.6 Luna, permitiendo a usuarios de todo el mundo experimentar de forma gratuita la programación interactiva con IA y el desarrollo de aplicaciones con Agents, reduciendo significativamente la barrera de entrada para crear software completo desde cero (Fuente: amasad)

Replit lanza el Modo Gratuito (Free Mode) impulsado por GPT-5.6 Luna

Meta presenta Muse Spark 1.2, un gran modelo nativo omnimodal : Meta ha lanzado oficialmente Muse Spark 1.2, dotado de potentes capacidades de generación de código visual, planificación robótica y comprensión de audio y video. En la evaluación de Design Arena, ha obtenido el primer lugar en Video-to-Website y los primeros puestos en la lista Image-to-HTML, mostrando un altísimo valor práctico omnimodal (Fuente: alexandr_wang)

Meta presenta Muse Spark 1.2, un gran modelo nativo omnimodal

OpenAI presenta una vista previa de la función de generación nativa con fondo transparente en GPT-Image-2 : OpenAI ha presentado la vista previa del parámetro background=transparent en la API de GPT-Image-2, permitiendo al modelo emitir directamente capas PNG transparentes con canal alfa durante la fase de generación. El rendimiento en texturas complejas como la transparencia del cristal o los detalles finos en los bordes supera con creces los recortes de posprocesamiento tradicionales (Fuente: THE DECODER)

Adobe Firefly integra Google Gemini Omni Flash y lanza herramientas de audio con IA : Adobe ha anunciado la integración del modelo de video multimodal Google Gemini Omni Flash en su plataforma creativa Firefly, al tiempo que ha lanzado oficialmente tres herramientas de generación de audio con IA comercialmente seguras: Generate Music, Generate Speech y Generate Sound Effects (Fuente: THE DECODER)

Google publica TIPS, un modelo de lenguaje visual con percepción espacial : Google ha lanzado en Hugging Face el modelo de lenguaje visual con percepción espacial TIPS (y TIPSv2) de código abierto, diseñado específicamente para tareas densas de comprensión visual como la segmentación de imágenes y la estimación de profundidad (Fuente: gabriberton)

Google publica TIPS, un modelo de lenguaje visual con percepción espacial

Runway lanza Ruby, un modelo de mejora de video HDR de 16 bits : Runway ha presentado el modelo de video Ruby, que admite la conversión de videos SDR a secuencias ProRes/EXR HDR de 16 bits, mejorando la profundidad de color y la calidad de imagen tanto de videos generados como de material subido (Fuente: c_valenzuelab)

NetEase Xiaomifeng explora comunidades interactivas de IA y el suministro UGC de próxima generación : NetEase Xiaomifeng integrará profundamente las capacidades de IA basadas en modelos de código abierto y propios en una comunidad de interés para jóvenes. Ha lanzado el asistente personal “Lobster” y juegos interactivos / contenido gráfico interactivo con IA, impulsando la transformación del contenido de la comunidad hacia un formato UGC interactivo, jugable y modificable (Fuente: 36Kr)

NetEase Xiaomifeng explora comunidades interactivas de IA y el suministro UGC de próxima generación

🧰 Herramientas

MiniMax lanza la plataforma de generación y creación de video MiniMax Design : MiniMax ha lanzado la plataforma MiniMax Design orientada a la producción de video comercial. Con los Agents como entrada principal, integra guion, storyboard, generación, doblaje y edición en un mismo lienzo, e introduce un mecanismo reutilizable de Skill, compitiendo directamente con los flujos de producción de video comercial de Adobe y Canva (Fuente: 36Kr)

MiniMax lanza la plataforma de generación y creación de video MiniMax Design

DP Technology presenta “Bohr Science Space”, un entorno colaborativo de investigación con IA para escritorio : DP Technology ha lanzado la aplicación de escritorio “Bohr Science Space”, con expertos en IA de disciplinas integradas como SciMaster, BioMaster y PharmMaster. Conecta todo el flujo de trabajo, desde la investigación bibliográfica, la deducción de hipótesis y el cálculo de datos hasta la redacción de artículos, ayudando a los investigadores a automatizar las tareas repetitivas y laboriosas (Fuente: QbitAI)

DP Technology presenta "Bohr Science Space", un entorno colaborativo de investigación con IA para escritorio

Lindy lanza una extensión de Chrome para la gestión inteligente de la bandeja de entrada : La plataforma de Agents de IA Lindy ha presentado una extensión para Chrome que se integra directamente en la bandeja de entrada de Gmail. Permite utilizar la base de memoria personal para generar automáticamente resúmenes nocturnos de correos, redactar respuestas y clasificar etiquetas de forma automática (Fuente: omarsar0)

ChatGPT y Codex integran el complemento de búsqueda ExaAI : OpenAI ha integrado el complemento ExaAI en ChatGPT Work y Codex, lo que permite a los Agents de IA realizar búsquedas directas en más de 100.000 millones de páginas web, artículos académicos y documentos empresariales en toda la red (Fuente: OpenAIDevs)

OpenHistory publica como código abierto una aplicación nativa de Mac para el seguimiento del flujo de trabajo : Un desarrollador ha publicado la aplicación OpenHistory de código abierto, que utiliza modelos locales en Mac para registrar automáticamente la trayectoria de trabajo y generar resúmenes, siendo compatible con el protocolo seguro MCP para colaborar con Agents locales (Fuente: zachtratar)

OpenBot lanza una alternativa de código abierto a Grok Bot compatible con múltiples Harness : El equipo de CopilotKit ha publicado como código abierto OpenBot, ofreciendo un producto alternativo a Grok Bot adaptable a cualquier Harness de Agent. Soporta UI generativa, control de computadoras, colaboración entre Agents y humanos, y retención privada de datos (Fuente: hwchase17)

📚 Aprendizaje e Investigación

Investigadores de Pleias proponen un verificador (Verifier) ultrapequeño de 0.63M de parámetros : Los investigadores han explorado el límite inferior de escala para los modelos verificadores. Con solo 2 minutos de preentrenamiento en una sola H100, un modelo ultrapequeño de 630.000 parámetros puede alcanzar el rendimiento de modelos de 7B en tareas de verificación específicas (Fuente: Dorialexander)

Investigadores de Pleias proponen un verificador (Verifier) ultrapequeño de 0.63M de parámetros

Spark-to-Paper: un sistema de código abierto de generación de artículos científicos de extremo a extremo : Un equipo de investigación ha presentado Spark-to-Paper, un sistema de generación de artículos científicos de código abierto basado en asistentes de programación. Contiene 13 habilidades combinables y puede, partiendo de una idea científica, ejecutar experimentos, generar gráficos vectoriales, verificar datos y producir directamente artículos en LaTeX compilable, logrando una tasa de detección de conclusiones falsas del 92% (Fuente: Jiqizhixin)

Spark-to-Paper: un sistema de código abierto de generación de artículos científicos de extremo a extremo

La Universidad de Zhejiang y Baidu proponen BEACON, un marco de aprendizaje por refuerzo para Agents de largo recorrido (ICML 2026) : La Universidad de Zhejiang y Baidu han propuesto BEACON, un marco de aprendizaje de políticas guiado por hitos. Al segmentar trayectorias en las fronteras de los hitos y combinar la estimación de ventajas a dos escalas, resuelve el problema de asignación errónea de crédito en tareas de Agents de largo recorrido. La tasa de éxito en tareas largas de ALFWorld aumentó del 53.5% con GRPO al 92.9% (Fuente: Jiqizhixin)

La Universidad de Zhejiang y Baidu proponen BEACON, un marco de aprendizaje por refuerzo para Agents de largo recorrido (ICML 2026)

Informe de evaluación de AutoResearch: La falta de un “bucle metacognitivo” en los Agents provoca fallos en el juicio científico : Instituciones como Stanford y Prentis AI diagnosticaron 800 trayectorias de investigación científica de Agents, descubriendo que el 92.1% de los fallos se debían a errores cognitivos y lógicos no relacionados con la ingeniería, y que el 82.5% de las trayectorias presentaban una brecha metacognitiva de “haber detectado el problema pero no haberlo corregido”, revelando el cuello de botella de la investigación científica automatizada al pasar de la mera ejecución técnica a la toma de decisiones profundas (Fuente: Jiqizhixin)

Informe de evaluación de AutoResearch: La falta de un "bucle metacognitivo" en los Agents provoca fallos en el juicio científico

Patronus AI publica FigmaTrace, un conjunto de datos de uso de ordenador en diseño de código abierto : Patronus AI ha publicado FigmaTrace, el primer conjunto de datos de uso de ordenador (Computer-use) orientado al diseño de UI/UX, que incluye más de 200 horas y más de 3.400 trayectorias de operaciones complejas de largo ciclo de diseñadores reales en Figma (Fuente: rebeccatqian)

El fundador de LangChain publica la serie de tutoriales Managed Deep Agents : Harrison Chase ha publicado una serie de videos y tutoriales sobre Managed Deep Agents, explicando de manera sistemática cómo construir, desplegar y gestionar Harnesses de Agents profundos y entornos de ejecución en producción (Fuente: hwchase17)

El fundador de LangChain publica la serie de tutoriales Managed Deep Agents

Google propone Pandora’s Router, una teoría de enrutamiento inteligente de modelos : El equipo de Google DeepMind ha formalizado el enrutamiento multimodelo como un problema de búsqueda de la “Caja de Pandora”, evaluando de forma integral los costes de cómputo y los beneficios de los expertos, manteniendo la calidad completa de la búsqueda al tiempo que reduce drásticamente las llamadas a estimadores de alto coste (Fuente: dair_ai)

Google propone Pandora's Router, una teoría de enrutamiento inteligente de modelos

💼 Negocios

GPT-5.6 Sol impulsa un aumento trimestral del 82% en el gasto empresarial de OpenAI en el tercer trimestre : Según los últimos datos y análisis de Ramp, impulsado por el sólido rendimiento del modelo GPT-5.6 Sol, el crecimiento trimestral del gasto empresarial en la API de OpenAI en lo que va del Q3 de 2026 alcanzó el 82%, superando el 76% de Anthropic y haciendo crecer los ingresos del tercer trimestre un 35% (Fuente: THE DECODER, GavinSBaker)

GPT-5.6 Sol impulsa un aumento trimestral del 82% en el gasto empresarial de OpenAI en el tercer trimestre

River AI obtiene 110 millones de dólares en una ronda de 1.100 millones de valoración con la participación de Cisco Investments : Cisco Investments ha anunciado su participación estratégica en la ronda de financiación de 1.100 millones de dólares de la startup de IA personal descentralizada River AI, impulsando conjuntamente una infraestructura de IA propiedad del usuario (Fuente: ibab)

Hark se alía con AT&T para lanzar dispositivos de hardware de consumo nativos de IA : La startup de hardware de IA Hark ha anunciado una alianza estratégica con el gigante estadounidense de las telecomunicaciones AT&T, que ha invertido en la empresa y proporcionará soporte de certificación de red y dispositivos. Ambas compañías lanzarán conjuntamente la próxima generación de terminales inteligentes personales nativos de IA (Fuente: adcock_brett)

Hark se alía con AT&T para lanzar dispositivos de hardware de consumo nativos de IA

🌟 Comunidad

Análisis de Pangram: Las barreras post-entrenamiento de RLHF provocan un “Mode Collapse”, haciendo que el texto de IA sea más fácil de detectar : La agencia de detección de IA Pangram señala que los modelos base sin ajustar poseen originalmente una diversidad lingüística comparable a la humana. Sin embargo, las reglas de comportamiento impuestas por el RLHF y las barreras de seguridad provocan un colapso de modo (Mode Collapse), haciendo que el modelo prefiera estructuras sintácticas fijas, lo que se ha convertido en la característica principal para detectar texto generado por IA con alta precisión (Fuente: THE DECODER)

Análisis de Pangram: Las barreras post-entrenamiento de RLHF provocan un "Mode Collapse", haciendo que el texto de IA sea más fácil de detectar

💡 Otros

Se lanza la versión estable de Bun 1.4, el entorno de ejecución de JavaScript (reescrito completamente en Rust) : Tras ser adquirida por Anthropic, Bun ha lanzado oficialmente la versión estable de Bun 1.4, reescrita completamente en Rust. Resuelve más de 2.900 issues y elimina fugas de memoria, incluyendo procesamiento de imágenes nativo, automatización de navegadores y despliegue HTTP/3, superando los 20 millones de descargas mensuales (Fuente: 36Kr)

Se lanza la versión estable de Bun 1.4, el entorno de ejecución de JavaScript (reescrito completamente en Rust)

RayNeo presenta las gafas ligeras de IA RayNeo iO : RayNeo (Thunderbird Innovation) ha presentado las gafas de IA RayNeo iO, rediseñando la óptica y la montura para reducir su peso a solo 34 g, ofreciendo dos días de autonomía y compatibilidad con lentes graduadas. Impulsadas por un motor de memoria para todo el día y modelos base como DeepSeek V4 Pro y Qwen 3.7 Max, ofrecen capacidades mejoradas de conocimiento activo, memoria y traducción en tiempo real (Fuente: QbitAI)

RayNeo presenta las gafas ligeras de IA RayNeo iO

La competencia en IA entre EE. UU. y China se intensifica con la delimitación de la alianza Pax Silica : Estados Unidos ha redactado un documento exigiendo a sus aliados tomar posición explícita en la carrera de IA entre EE. UU. y China. Los países que se unan a la Organización de Cooperación de IA de China (WAICO) serán excluidos de la alianza Pax Silica, lo que pone de relieve los riesgos políticos de la fragmentación de la infraestructura global y la cadena de suministro de IA (Fuente: THE DECODER)

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *