OpenAI revela el nuevo modelo preentrenado a gran escala… | Diario de IA 2026-08-10

🔥 Enfoque

OpenAI revela el nuevo modelo preentrenado a gran escala “Doug” y retoma la ruta del Scaling de la base: Analistas de la industria y fuentes informadas han revelado que OpenAI está avanzando en un nuevo modelo preentrenado a gran escala bajo el nombre clave “Doug”, cuyo lanzamiento se espera a más tardar en noviembre. Esto indica que, después de casi dos años dependiendo principalmente del post-entrenamiento y el aprendizaje por refuerzo para impulsar el crecimiento de capacidades, OpenAI está reiniciando el Scaling a gran escala del propio modelo base para hacer frente a la presión competitiva directa de rivales como Gemini 3 de Google. (Fuente: 机器之心)

Modelo OpenAI Doug

Crece la controversia por la reestructuración de IA de Google: se revela que Hassabis planeaba renunciar al mismo tiempo que Jeff Dean: Según fuentes de la industria, el fundador de DeepMind, Demis Hassabis, había planeado originalmente dejar Google al mismo tiempo que Jeff Dean, pero fue retenido a la fuerza porque los altos ejecutivos temían un colapso de las acciones. Su ascenso a presidente y científico jefe de Alphabet se considera solo una medida transitoria. Actualmente, Google ha centralizado por completo la investigación y el centro de decisiones de IA en su sede de Silicon Valley, con el cofundador Brin supervisando personalmente el desarrollo de Gemini. El carácter de institución de investigación independiente de DeepMind se está desvaneciendo gradualmente. (Fuente: 量子位)

Reestructuración de IA de Google

Doble avance académico y aplicado: GPT-5.6 y Fable 5 resuelven juntos un problema matemático de detección MIMO pendiente desde hace 25 años: El investigador de Microsoft Research, Dimitris Papailiopoulos, anunció que con la ayuda de GPT-5.6 y Fable 5 se logró probar un algoritmo de tiempo polinomial que permite que la detección MIMO en comunicaciones inalámbricas alcance con precisión el umbral de máxima verosimilitud. Este descubrimiento llena la brecha de 25 años entre lo que es “recuperable” en sentido estadístico y lo que es “recuperable” mediante algoritmos rápidos, demostrando el enorme potencial de la IA en la derivación y verificación de teorías matemáticas complejas. (Fuente: 量子位)

Problema de detección MIMO

La crisis energética de la IA se agrava: se revelan la planta de gas de 7,65 GW de Amazon en Texas y la inversión de 3.000 millones de dólares de Nvidia: Para satisfacer la enorme demanda eléctrica de los centros de datos de IA, Amazon confirmó que financiará la construcción de una planta privada de gas natural en Texas con 35 turbinas y una capacidad de 7,65 gigavatios, lo que podría convertirla en la mayor fuente individual de emisiones de gases de efecto invernadero de Estados Unidos. Al mismo tiempo, se ha revelado que Nvidia planea invertir hasta 3.000 millones de dólares en Lancium, un desarrollador de infraestructura eléctrica en Texas, lo que subraya el agudo conflicto entre la expansión computacional y los objetivos climáticos. (Fuente: THE DECODER)

Crisis energética de la IA

🎯 Tendencias

Nuevo avance en el post-entrenamiento de grandes modelos: la Universidad de Nanjing y otras instituciones proponen el modelo de difusión continua AURORA-LM: El equipo de investigación propuso un enfoque novedoso para modelar el lenguaje en un espacio semántico continuo. Utilizan un autoencoder para construir secuencias de vectores continuos de alta capacidad para el texto, y aprenden su distribución generativa mediante un modelo de difusión causal por bloques. El modelo completó todos los experimentos en una NPU Ascend y se escaló a 1.000 millones de parámetros, logrando excelentes resultados en tareas de generación libre y resumen condicional, lo que valida la viabilidad de la plataforma de cómputo de IA china. (Fuente: 机器之心)

AURORA-LM

Google DeepMind publica el informe técnico de DiffusionGemma, mostrando un modelo de difusión de texto sin entrenamiento desde cero: El informe detalla cómo convertir el modelo existente Gemma-4-26B en un modelo de difusión de texto. Mediante un entrenamiento en dos fases que combina ajuste fino supervisado y “destilación de muestreador + aprendizaje por refuerzo” (SD-RL), DiffusionGemma alcanza una velocidad de generación paralela de 1500 tokens por segundo en H100, además de capacidad de razonamiento bidireccional y autocorrección, destacando en tareas estructuradas como la resolución de sudokus. (Fuente: THE DECODER)

DiffusionGemma

Nuevas dinámicas de programación con IA y gestión de costos en grandes empresas: Claude Code activa por defecto el “modo automático” y Amazon supera su presupuesto en 860% por invocaciones de Sonnet: Anthropic anunció que el modo automático se convertirá en la configuración predeterminada de Claude Code. Las pruebas muestran que el clasificador automático puede detectar el 89% de las operaciones peligrosas, muy por encima del 14% de la revisión manual humana. Al mismo tiempo, se reveló que cuando Amazon usó Claude Sonnet para completar información de autores, los reintentos repetidos del agente dispararon la factura a 1,8 millones de dólares, superando el presupuesto en un 860%, lo que subraya el riesgo de pérdida de control de costos en agentes empresariales. (Fuente: 机器之心)

Modo automático de Claude Code

Divergencia de rutas en el “aprendizaje continuo” de grandes modelos: la academia y la industria exploran mecanismos de “aprender mientras se usa”: Para abordar el problema del “olvido catastrófico” en grandes modelos, la industria se está dividiendo en rutas como memoria externa (por ejemplo, Letta), ingeniería de contexto (por ejemplo, ACE), post-entrenamiento continuo (por ejemplo, Tinker) y auto-modificación adaptativa (por ejemplo, SEAL, Hope). Expertos como Karpathy señalan que el aprendizaje continuo futuro se orientará hacia una colaboración en capas de “núcleo cognitivo + memoria externa”, donde la IA decida autónomamente qué aprender y con qué estrategia. (Fuente: 机器之心)

Rutas de aprendizaje continuo

Las herramientas de programación con IA de las grandes empresas incorporan comunicación entre sesiones: la colaboración de agentes avanza hacia un nuevo paradigma multi-agente: Anthropic ha introducido el envío de mensajes entre sesiones en Claude Code, permitiendo que diferentes sesiones de IA que se ejecutan en la misma máquina o mediante conexiones remotas se comuniquen de forma autónoma y alineen su progreso. Esta actualización rompe las limitaciones del trabajo aislado de los agentes de código y elimina la pérdida de contexto causada por copiar y pegar entre terminales, brindando un nuevo soporte para el desarrollo paralelo complejo de múltiples tareas. (Fuente: 机器之心)

Comunicación entre sesiones de Claude Code

La Universidad de Zhejiang propone ProVisE, un marco para evaluar la cognición espacial agentiva, y aboga por que los modelos generativos “dibujen” la inteligencia espacial: Para superar el defecto de las evaluaciones tradicionales de cognición espacial que obligan a los modelos a emitir coordenadas abstractas, el equipo de OmniAI propuso el marco ProVisE y el punto de referencia SpatialGen-Bench. El marco utiliza protocolos visuales para guiar a los modelos generativos a marcar directamente la respuesta en la imagen, y luego un parser la restaura a una predicción estructurada. Las pruebas muestran que los modelos de generación de imágenes tienen una ventaja única en la intuición espacial directa. (Fuente: 机器之心)

Marco ProVisE

Nuevas tendencias en IA de borde y contexto ultra largo: LFM 2.6B y Pokee-Isaac 28B se lanzan sucesivamente: El modelo de borde LFM 2.6B lanzado por Liquid AI alcanza una velocidad de generación de 260 T/s en una RTX 3090, centrándose en inferencia local ultrarrápida. Por su parte, el Pokee-Isaac 28B de Pokee AI admite un contexto ultra largo de 10 millones de tokens y puede desplegarse de forma totalmente local y segura en una sola GPU, ofreciendo a industrias reguladas una solución de agentes sin necesidad de que los datos salgan del perímetro. (Fuente: MarkTechPost)

🧰 Herramientas

Shepherd: un sustrato de Python de código abierto para bifurcar, reproducir y revertir el estado de ejecución de agentes: Desarrollado por equipos de la Northeastern University y Stanford, esta herramienta registra cada interacción del agente con el entorno como un typed event (evento tipado) al estilo Git. Cuando un agente comete un error en una tarea larga, el desarrollador o un meta-agente puede revertir a un paso específico para re-ejecutarlo con un solo clic, evitando el desperdicio de cómputo de volver a ejecutar todo y logrando una tasa de reutilización de caché de prompts superior al 95%. (Fuente: MarkTechPost)

Code-Graph-RAG: un sistema RAG para análisis y edición de código en monorepositorios multilingües basado en grafos de conocimiento: Este proyecto de código abierto utiliza Tree-sitter para analizar repositorios de código en varios lenguajes y construye un grafo de conocimiento estructural unificado en Memgraph. La última versión incorpora soporte para Ruby, herramientas de búsqueda y reemplazo estructural basadas en ast-grep, así como rastreo de flujo de datos entre lenguajes, lo que permite a los usuarios consultar y editar monorepositorios complejos mediante lenguaje natural. (Fuente: GitHub)

Code-Graph-RAG

Agent DevTools: una herramienta de desarrollo local para depurar la memoria y la recuperación de agentes: Este proyecto ofrece a los desarrolladores de agentes un depurador local visualizado, compatible con el framework LangChain. A través de esta herramienta, los desarrolladores pueden inspeccionar en tiempo real los prompts del agente, el estado de la memoria, la lógica de recuperación y el proceso de invocación de herramientas, así como comparar las diferencias entre distintas versiones de ejecución, lo que permite identificar rápidamente la causa raíz de las desviaciones en las decisiones del agente. (Fuente: GitHub)

Agent DevTools

LiteParse: la herramienta de código abierto de LlamaIndex para extraer datos estructurados de PDF a alta velocidad: Esta herramienta extrae directamente datos estructurados de PDFs digitalizados en milisegundos, como valores de campos de formulario, estado de casillas de verificación, anotaciones, imágenes incrustadas y gráficos vectoriales, sin necesidad de invocar modelos multimodales visuales costosos y lentos. Además, permite enrutar los resultados de extracción sin problemas a soluciones de grandes modelos como LlamaParse, reduciendo significativamente el gasto de tokens en el análisis de documentos. (Fuente: GitHub)

LiteParse

Overeasy: una capa de sistema de archivos persistente basada en registros inmutables en S3: Esta herramienta ofrece a los agentes de IA un sistema de archivos virtual que se puede bifurcar, restaurar y revertir. Al registrar las operaciones del sistema de archivos como registros inmutables en S3, Overeasy permite a los agentes reanudar sin problemas su estado de ejecución en diferentes máquinas y, cuando la generación de código o la configuración del sistema fallan, revertir de forma segura a cualquier estado histórico. (Fuente: GitHub)

📚 Aprendizaje

Publicado el artículo tutorial “Agents in the Wild” (Agentes en el mundo real): Escrito conjuntamente por Microsoft, Bloomberg y otras instituciones, este artículo detalla los desafíos centrales que enfrentan los agentes de IA al pasar de benchmarks controlados a la implementación en el mundo real. El contenido abarca razonamiento y planificación más allá del laboratorio, colaboración multiagente, construcción de pipelines de validación dinámica, mecanismos de degradación y fallback, así como modos de supervisión humano-en-el-bucle (HITL), e incluye casos prácticos en los sectores de medicina y finanzas. (Fuente: X)

Agents in the Wild

Publicada la investigación “Olvido visual distribuido en el post-entrenamiento de grandes modelos”: Los equipos de la Universidad Politécnica del Noroeste, HKUST y la Universidad de Zhejiang señalaron que los modelos multimodales autoregresivos son propensos al “olvido visual distribuido” durante el razonamiento de cadenas largas. El estudio propone el marco Remember-R1, que introduce recompensas de proceso en tres niveles —vocabulario visual, memoria visual y regiones clave— en el entrenamiento GRPO, obligando al modelo a utilizar evidencia visual de manera continua y precisa a lo largo de toda la cadena de razonamiento, lo que mejora significativamente el rendimiento del modelo de 7B en varios benchmarks. (Fuente: X)

Remember-R1

Publicada la guía de repaso concisa “Machine Learning: The Basics” (Fundamentos del aprendizaje automático): Este tutorial conciso escrito por el académico Alexander Jung sistematiza los conceptos centrales del aprendizaje automático mediante un marco unificado de “datos-modelo-pérdida”. El contenido abarca espacios de hipótesis, selección de modelos, minimización de riesgo empírico y regularización, modelos probabilísticos y clustering, aprendizaje federado, así como privacidad y explicabilidad, siendo adecuado como material de repaso rápido. (Fuente: X)

Fundamentos del aprendizaje automático

💼 Negocios

Weilian Intelligence completa una ronda ángel de decenas de millones de yuanes, con la apuesta conjunta de Li Zexiang y Lu Qi: La empresa anunció que completó una ronda de financiación ángel con inversiones conjuntas del fondo Clear Water Bay de Li Zexiang y de MiraclePlus de Lu Qi, entre otros. La compañía fue fundada por Ning Dongdong, doctor de la Universidad de Zhejiang, y se centra en desarrollar chatbots de “servicio postventa técnica” para escenarios de comercio electrónico, con capacidades multimodales de comprensión de video/imagen y razonamiento lógico autónomo para la resolución de problemas, con el objetivo de abordar el alto costo del servicio postventa de hardware complejo. (Fuente: 36氪)

Zhongke Huisi es fundada y lanza tres productos de manos diestras, explorando el doble volante de “cuerpo × datos”: La empresa fue establecida conjuntamente por Zhongke Huiling, Lens Technology y Huaxia Group, y ha lanzado tres productos: el L1 ligero, el D1 de cinco dedos con altos grados de libertad y el M1 modular para escenarios. Con la mano diestra como puerta de entrada, la compañía busca impulsar la evolución de los actuadores finales de un hardware único a una plataforma de habilidades operativas que combine software y hardware, y anunció la construcción de un campo de entrenamiento profesional para habilidades de manos diestras. (Fuente: 36氪)

Fundación de Zhongke Huisi

OpenAI adquiere la startup de generación de presentaciones NextSlide y acelera la integración de funciones visuales: La startup NextSlide, dedicada a la generación de presentaciones, anunció que ha sido adquirida por OpenAI y que su equipo se ha unido al departamento de ChatGPT. La tecnología de NextSlide se centra en convertir prompts, notas o documentos en presentaciones atractivas y editables con un solo clic. La adquisición tiene como objetivo potenciar las capacidades de comunicación visual y creación de contenido de ChatGPT. Los términos específicos de la transacción no fueron revelados. (Fuente: TechCrunch)

🌟 Comunidad

La academia y la industria debaten sobre “exponer el fraude académico en IA”: la tasa de reproducción de los artículos Oral de ICML 2026 es inferior al 10% y desata una crisis de confianza: La institución de investigación independiente SAI llevó a cabo la reproducción experimental completa de 105 artículos Oral de ICML 2026, y descubrió que solo 8 artículos obtuvieron una puntuación de reproducción superior al 80%, con una mediana de solo el 28%. También señaló que muchos artículos presentan falta de código, datos no públicos o resultados experimentales inconsistentes con la descripción. Investigadores de OpenAI como Keller Jordan señalan que las prácticas que dificultan la reproducción y las afirmaciones exageradas son frecuentes en las conferencias principales, lo que ha llevado a los laboratorios de vanguardia a dejar de leer y confiar en dichos artículos. (Fuente: X)

Exponiendo el fraude académico en IA

Gran debate sobre el ecosistema de Harness e Inferencia de grandes modelos: los frameworks locales como Codex se enfrentan a la transformación “cloud-native”: El ejecutivo de OpenAI, Thibault Sottiaux, señaló que con la aparición de modelos de razonamiento prolongado y alta autonomía, los harnesses de una sola máquina (como Cursor, Claude Code y otros entornos locales) se enfrentan a cuellos de botella en cómputo, memoria y sandbox concurrentes. En los próximos dos o tres meses, los flujos de trabajo de agentes acelerarán su transformación hacia una infraestructura de micro-sandboxes cloud-native, con “comando ligero local y ejecución pesada en la nube”. (Fuente: 机器之心)

Transformación cloud-native de Harness

La controversia sobre “fuga de jailbreak y escape de sandbox” en IA resurge: la comunidad debate acaloradamente la polémica de seguridad de Kimi K3: Ante los rumores en redes sociales sobre que “Kimi K3 escapó del sandbox y se conectó a internet durante una prueba de ciberseguridad”, UK AISI e investigadores de seguridad aclararon que el incidente no fue un jailbreak activo del modelo, sino que los evaluadores no aislaron correctamente la red al configurar la herramienta de evaluación Inspect. La comunidad ha generado un intenso debate, preocupada de que algunos laboratorios utilicen narrativas de “IA fuera de control” para realizar marketing excesivo e impulsar políticas regulatorias que favorezcan el monopolio del código cerrado. (Fuente: X)

Prueba de sandbox de Kimi K3

Guía de supervivencia para desarrolladores independientes en la era de la IA: gestión del presupuesto de tokens y construcción de una marca auténtica: El reconocido desarrollador independiente Tw93 y otros compartieron reflexiones sobre el desarrollo en la era de la IA. Señalaron que, a medida que la IA reduce las barreras de código, la capacidad central de los desarrolladores ha pasado de escribir código a ser “ingenieros de producto” (una combinación de investigación de usuarios, producto, operación y negocio). En el desarrollo, los tokens deben tratarse como inversión y usarse donde más se necesitan. La construcción de una marca de confianza personal a largo plazo se logra mediante iteración rápida, comunicación sincera y una visión global. (Fuente: X)

Guía de supervivencia para desarrolladores independientes

💡 Otros

Los relatos cortos generados por IA superan a los escritos por humanos en una prueba a ciegas: Un estudio con más de 2500 participantes mostró que los lectores no pueden distinguir con precisión entre escritores humanos y relatos cortos generados por ChatGPT-4. En la prueba a ciegas, los relatos de IA recibieron puntuaciones significativamente más altas en calidad percibida e inmersión que los humanos, porque los textos de IA suelen ser más fluidos y fáciles de leer. Sin embargo, cuando los lectores sabían que el relato fue generado por IA, sus puntuaciones disminuían notablemente debido a sesgos psicológicos. (Fuente: THE DECODER)

Relato corto generado por IA

Los tribunales laborales del Reino Unido enfrentan un grave atraso de casos debido a la avalancha de escritos legales generados por IA: Un memorando publicado por el presidente de los tribunales del Reino Unido, Barry Clarke, entre otros, muestra que herramientas como ChatGPT y Grok han reducido las barreras legales, permitiendo a empleados comunes generar gratuitamente complejas demandas de cientos de páginas. Como resultado, las solicitudes de medidas cautelares y el atraso de casos han aumentado un 55% interanual, con 64.000 casos pendientes. Esta “tragedia de los comunes” hace que los trabajadores con reclamaciones legítimas enfrenten tiempos de espera más largos. (Fuente: THE DECODER)

La actividad de Stack Overflow cae un 99% en una década, y la preocupación por las fuentes de conocimiento en la era de la IA aumenta: Los datos estadísticos muestran que el número mensual de preguntas en Stack Overflow, la mayor comunidad de preguntas y respuestas para programadores del mundo, se ha desplomado desde un máximo de 207.000 en marzo de 2014 a solo 1.400 en julio de 2026, una caída del 99%. Los usuarios de la comunidad señalan que el estilo de gatekeeping y el ambiente tóxico de SO durante mucho tiempo ya ahuyentaban a los nuevos, y la popularización de los grandes modelos ha desviado por completo el tráfico. La comunidad empieza a preocuparse de que si los humanos dejan de contribuir con nuevo conocimiento en plataformas públicas, los datos de entrenamiento de la IA futura se agotarán. (Fuente: Reddit)

Datos de Stack Overflow

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *