🔥 Destaques
Google lança seu primeiro agente corporativo de produtividade, Gemini Agent, com suporte inédito para invocar o Claude : O Google apresentou oficialmente na conferência Gemini at Work 2026 o seu agente corporativo de produtividade, Gemini Agent, totalmente integrado ao ecossistema do Workspace. Focado na execução orientada a objetivos, o agente possui capacidade de permanência de longo prazo na nuvem e orquestração entre múltiplos aplicativos. As empresas podem atribuir a ele e-mail corporativo, conta, espaço de armazenamento e calendário dedicados, tratando-o como um “colega digital” dotado de identidade própria (Coworker Agent). O sistema adota uma arquitetura de memória persistente em quatro camadas — conversacional, semântica, procedural e episódica —, integrando-se nativamente ao Slack, Salesforce e ao protocolo MCP. Além disso, abriu uma exceção histórica em seu seletor corporativo de modelos ao incorporar o Claude Opus 5 e o Sonnet 5.5 da concorrente Anthropic. Isso sinaliza que a rivalidade entre as gigantes migrou do confronto de capacidades brutas dos modelos base para uma disputa ecológica no nível de infraestrutura de fluxo de trabalho e governança de permissões (Fonte: Google, TechCrunch, AI Business, 36氪)

Ex-pesquisadores de segurança da OpenAI publicam carta aberta conjunta, rebatendo a liderança por usar “vazamentos” como pretexto para expurgar dissidentes e obstruir auditorias de segurança : Os três pesquisadores de segurança de fronteira subitamente demitidos pela OpenAI — Jasmine Wang, Tomek Korbak e Mikita Balesni — publicaram oficialmente uma carta aberta conjunta refutando as acusações da empresa sobre “tratamento indevido de informações sensíveis e quebra de confiança”. O documento revela que o verdadeiro motivo das demissões reside nos alertas rigorosos emitidos por eles sobre a degradação acelerada da “monitorabilidade da cadeia de pensamento” (CoT Monitorability) em agentes, bem como na promoção ativa de colaborações concretas com a organização de auditoria independente METR (da qual Korbak era o ponto focal). Os pesquisadores alertam que a liderança está reduzindo o acesso a avaliações externas independentes em prol da velocidade de comercialização, e que medidas disciplinares repentinas e opacas vêm gerando um forte efeito inibidor internamente, expondo de forma irrecuperável o conflito entre a missão de segurança e os interesses comerciais (Fonte: The Verge, THE DECODER, Transformer, EthanJPerez)

Discrepância nos critérios de receita anualizada da OpenAI atinge US$ 20 bilhões, gerando turbulência no mercado de capitais e reavaliação do crescimento de monetização : Conforme revelado pelo jornal britânico Financial Times e outros veículos, a OpenAI informou aos investidores que sua receita recorrente anualizada (ARR) real no fim de setembro se aproximava de US$ 50 bilhões. O valor apresenta uma defasagem expressiva de cerca de US$ 20 bilhões frente às projeções amplamente divulgadas pelo mercado e bancos de investimento (de US$ 68 bilhões a US$ 70 bilhões), provocando correções em ações de tecnologia e ativos ligados a poder computacional. Analistas apontam que a divergência decorre dos critérios de cálculo contábil: rumores anteriores aplicaram erroneamente o critério amplo da Anthropic, que inclui o volume bruto de faturamento distribuído via AWS e Google Cloud, ao passo que a OpenAI exclui a distribuição por nuvens terceirizadas e ainda desconta o repasse de 20% à Microsoft (ajustada pelo volume bruto, a escala real beiraria US$ 64 bilhões). O caso evidencia a vulnerabilidade do mercado de capitais diante da ausência de relatórios financeiros auditados e leva a indústria a reavaliar o ritmo real de lucro frente aos custos altíssimos de processamento computacional (Fonte: The Guardian, CNBC, 36氪)

OpenAI lança versão ultrarrápida GPT-6.1 Sol Ultrafast: throughput de inferência 8x maior e suporte a direcionamento instantâneo em streaming : Cumprindo o 4º dia da sua sequência de lançamentos de 28 dias, a OpenAI disponibilizou oficialmente o modo GPT-6.1 Sol Ultrafast na Responses API, no Codex e no ChatGPT Work. Mantendo uma capacidade de raciocínio lógico muito próxima à do modelo topo de linha Astra, o modelo eleva o throughput de geração para 8 vezes o da versão padrão (cerca de 300 tokens/s) e implementa a funcionalidade de Steering instantâneo, permitindo aos desenvolvedores injetar prompts de ajuste dinâmico durante a geração em streaming para corrigir desvios em tempo real. Na API, o preço foi fixado em US$ 12 por milhão de tokens de entrada e US$ 60 por milhão de tokens de saída (6 vezes o da versão padrão). Na interface do ChatGPT, o acesso é restrito aos assinantes do plano Pro 500 (US$ 500 mensais) e usuários corporativos. O ritmo acelerado de consumo de cotas gerou debates na comunidade de desenvolvedores acerca de um “aumento de preços disfarçado” (Fonte: OpenAI, 机器之心, BorisMPower, 36氪)
.jpg)
Gigante australiana de infraestrutura de IA Firmus retira IPO de 44 bilhões de dólares australianos por baixa demanda, desacelerando o prêmio excessivo no mercado secundário : Apoiada pela NVIDIA e pelo Blackstone Group, a fábrica australiana de data centers com resfriamento líquido por imersão Firmus Technologies retirou oficialmente seu pedido de oferta pública inicial (IPO). O projeto planejava captar US$ 5,5 bilhões sob uma avaliação de US$ 30,6 bilhões (cerca de AUD 44 bilhões), com potencial para ser o maior IPO do mercado acionário australiano em três décadas. Contudo, devido à saída de parceiros estratégicos, ao descompasso entre os 912 MW projetados e os meros 46 MW efetivamente comissionados na rede, somados a US$ 30 bilhões em dívidas futuras de infraestrutura, os investidores institucionais recusaram-se a pagar o prêmio especulativo antecipado, inviabilizando o bookbuilding. O episódio marca uma virada no sentimento do mercado secundário global para projetos de infraestrutura de computação de IA de capital intensivo e alta alavancagem (Fonte: The Guardian, 36氪)

🎯 Tendências
Anthropic atualiza política de uso proibindo expressamente abusos contra modelos e lança plano defensivo “Cyber Mission” : A Anthropic publicou a revisão de 2026 de sua política de uso (com vigência a partir de 12 de novembro). Pela primeira vez no setor, proíbe-se expressamente “comportamentos persistentes e desnecessários de abuso ou crueldade” contra os modelos, concedendo à IA a permissão de encerrar proativamente conversas sob ataques maliciosos extremos. Embora a empresa reforce que isso não interfere na depuração habitual, a cláusula deflagrou intensos debates éticos sobre o “estatuto moral de máquinas”. Simultaneamente, a Anthropic lançou a iniciativa “Cyber Mission”, unindo-se a gigantes como Booz Allen para impulsionar a proteção de infraestruturas críticas (CIDP), e disponibilizou o OSS Scanner para fornecer gratuitamente detecção contínua de vulnerabilidades e sugestões automatizadas de patches para os principais softwares de código aberto de infraestrutura (Fonte: Anthropic News, The Guardian, mustafasuleyman)

Claude lança geração de vídeos animados e dashboards dinâmicos de dados; suíte de produtividade deixa o beta público : A Anthropic introduziu duas novidades interativas para o Claude: Dashboards, que possibilita conexão direta com fontes corporativas como Snowflake, BigQuery e Salesforce, gerando gráficos interativos em tempo real via linguagem natural com rastreabilidade SQL; e Claude Motion, que transforma textos e diagramas de arquitetura em animações explicativas editáveis orientadas a código, permitindo a exportação em formato MP4 de até 30 segundos. Adicionalmente, as suítes corporativas Docs, Slides e Design concluíram a fase beta e entraram em disponibilidade comercial plena, consolidando a transformação do Claude de uma ferramenta de diálogo em uma central de trabalho transmídia dinâmica (Fonte: The Verge, THE DECODER, dotey)

Google publica na The Lancet resultados clínicos da IA médica AMIE: concordância diagnóstica de 90% e zero interrupções de segurança : O Google publicou um estudo clínico multicêntrico na revista principal The Lancet, demonstrando avanços significativos do seu sistema agente de diálogo clínico AMIE em avaliações reais de pronto-atendimento e clínica geral. Em 100 interações longas com pacientes reais, o sistema registrou zero interrupções de segurança, obteve 90% de concordância diagnóstica com médicos especialistas seniores e superou os grupos de controle em quesitos como comunicação empática e profundidade de coleta de histórico clínico, comprovando a viabilidade de aplicar IA multimodal clínica em fluxos de trabalho de alta criticidade (Fonte: Google)
Equipe Seed da ByteDance desvenda a causa da oscilação em contexto longo do DeepSeek: KV Cache em blocos apresenta sensibilidade de fase de 4 tokens : A equipe Seed da ByteDance descobriu em testes práticos que a oscilação de desempenho do DeepSeek-V4 na recuperação de contextos longos está altamente relacionada à posição de disposição física das informações de entrada. As pesquisas mostram que apenas adicionar caracteres neutros mínimos antes do prompt para alterar a “fase” (Phase) dos tokens dentro da janela de compressão pode fazer a precisão de recuperação do modelo oscilar dramaticamente em até 40,2 pontos percentuais sob contexto de 128K. O ciclo dessa flutuação coincide com o tamanho do bloco de compressão do KV Cache subjacente (4 tokens), revelando uma deficiência sistemática introduzida pela otimização de compressão ciente de hardware (Fonte: 量子位)

Cinco gigantes farmacêuticas multinacionais unem forças para otimizar o OpenFold3 via aprendizado federado: dados estruturais proprietários aprimoram significativamente a predição de ligação de fármacos : AbbVie, Bristol Myers Squibb, Johnson & Johnson, Takeda e Astex publicaram na Nature os resultados de uma colaboração em que usaram computação com preservação de privacidade para agregar mais de 20 mil estruturas experimentais de alta precisão de complexos proteína-pequena molécula não públicas, aplicando pós-treinamento federado ao modelo de código aberto OpenFold3. Os experimentos comprovaram que, sem que os dados comerciais saíssem dos servidores locais de cada empresa, o modelo ajustado obteve um ganho superior a 10% na acurácia da predição de alta resolução de interações proteína-ligante, superando substancialmente a linha de base treinada apenas com dados públicos do PDB (Fonte: Nature, 机器之心)
.jpg)
Alibaba Tongyi disponibiliza como código aberto o modelo de geração de imagens Qwen-Image-2.1-Turbo: etapas de denoising reduzidas para 8 passos : A equipe Tongyi do Alibaba disponibilizou os pesos e as APIs do seu modelo de geração visual de 7B parâmetros, Qwen-Image-2.1-Turbo. Mantendo resolução 2K de alta definição e capacidade de edição instrucional complexa em linguagem natural, a versão emprega destilação avançada de trajetórias para encolher as etapas de denoising para apenas 8 passos. Isso reduz significativamente a ocupação de memória de vídeo e a latência de renderização, permitindo aos desenvolvedores implementá-lo via pipeline do Diffusers em fluxos de produção de alta concorrência (Fonte: Alibaba_Qwen)

Shengshu Technology lança prévia do Vidu Q4: foco em atuação expressiva e movimentos contínuos de câmera de 16 segundos : A Shengshu Technology apresentou a versão de prévia do seu modelo topo de linha de geração de vídeo, Vidu Q4. A atualização traz avanços na estabilidade de planos e contraplanos cinematográficos, transições emocionais sutis e interação realista de iluminação. Suporta a vinculação de consistência de sujeito a partir de até 15 imagens e 3 faixas de áudio de referência, oferecendo nativamente resolução 4K direta e movimentos de câmera contínuos em primeira pessoa (FPV) de até 16 segundos. No plano SaaS, o custo de geração em 720P foi reduzido para 0,09 yuan por segundo, diminuindo a barreira de entrada para produções curtas de IA e publicidade (Fonte: 量子位)

Aether AI lança o sistema robótico causal CRIS-0: evasão de obstáculos em 0,2 segundos via transição de estados causais : A Aether AI, fundada pela equipe da professora Biwei Huang na UC San Diego, anunciou o CRIS-0, um sistema corporificado baseado em inteligência causal. A arquitetura supera a limitação dos modelos clássicos de Visão-Linguagem-Ação (VLA), que dependem apenas da correlação de pixels, ao utilizar um Modelo Causal de Mundo (CausalWM) para deduzir as consequências de intervenções e rastrear variáveis de estado físico causal. Diante de perturbações humanas imprevistas, o sistema freia em até 0,2 segundos e recalcula dinamicamente a trajetória em 2 segundos, evitando acúmulo de erros e falhas catastróficas em tarefas longas (Fonte: 量子位)

JetBrains lança Mellum2.1, modelo MoE de 12B especializado em código: ativação de apenas 2.5B de parâmetros : A JetBrains disponibilizou em código aberto o novo modelo de raciocínio especializado em código Mellum2.1-12B-A2.5B-Thinking. Estruturado em arquitetura MoE com 64 especialistas, o modelo ativa apenas 8 especialistas por token (2.5B parâmetros) e oferece suporte nativo a contexto de 128K. Treinado com aprendizado por reforço em larga escala baseado em interação com repositórios de software reais, alcançou pontuação de 82,0 no LiveCodeBench v6, elevou a taxa de resolução no SWE-bench Verified de 2,0% para 47,0% e quase dobrou o throughput de uma GPU H200 em comparação ao Qwen3.5-9B (Fonte: MarkTechPost)
TII disponibiliza Falcon ASR, modelo multilíngue de voz com 1.6B de parâmetros, batendo recorde de reconhecimento do dialeto dos Emirados : O Instituto de Inovação Tecnológica de Abu Dhabi (TII) lançou o Falcon-ASR, modelo de reconhecimento automático de fala multilíngue com 1.6B de parâmetros. Construído sobre a arquitetura Falcon3-Audio, o modelo foca nos desafios de transcrição do árabe em ambientes ruidosos e cenários de alternância de código linguístico, atingindo uma taxa de erro de palavras (WER) de 20,92% nos seis principais benchmarks padrão de língua árabe. Na avaliação do dialeto local dos Emirados, registrou WER de 22,73%, superando o Qwen3-Omni, e oferece suporte nativo a marcações de tempo por palavra sob o mesmo conjunto de pesos (Fonte: HuggingFace Blog)

OpenAI expõe e bane redes de manipulação cognitiva por IA disfarçadas de falsos jornalistas e think tanks : A OpenAI divulgou um relatório investigativo detalhando o banimento de duas redes infratoras que utilizavam o ChatGPT para operações encobertas de manipulação cognitiva geopolítica. O grupo russo codinome “Dark Clark” controlava think tanks falsos para disseminar documentos e áudios forjados na mídia latino-americana a fim de provocar desmentidos oficiais (classificado como ameaça de nível máximo Breakout 5). Já o grupo iraniano “Bogus Bylines” criou identidades falsas de 7 jornalistas, infiltrando quase cem artigos de manipulação de opinião sobre as tensões entre EUA e Irã em portais de notícias comerciais (Fonte: OpenAI News)
Amazon Bedrock AgentCore introduz micropagamentos por requisição e protocolo de governança x402 : A AWS anunciou a integração do Coinbase CDP e Stripe Link ao Bedrock AgentCore, permitindo que agentes autônomos realizem micropagamentos por requisição em conformidade com o protocolo x402, sem intervenção humana. A infraestrutura impõe limites rígidos de orçamento para prevenir violações decorrentes de injeção de prompts e oferece liquidação on-chain instantânea para frações mínimas de centavos, estabelecendo a fundação protocolar para que agentes comprem autonomamente capacidade de computação, dados e serviços digitais externos (Fonte: AWS Machine Learning Blog)

🧰 Ferramentas
Fusão das plataformas TRAE: unificação de TraeCode e TraeWork em uma bancada de desenvolvimento completa para múltiplos agentes : A ferramenta de programação assistida por IA da ByteDance, TRAE, integrou suas frentes em um cliente unificado, conectando o ambiente isolado de edição de código aos fluxos de trabalho de documentação. A nova versão oferece o “Modo Agent”, em formato de tela aberta infinita, e o “Modo IDE”, preservando a experiência tradicional de desenvolvimento. Os usuários podem orquestrar simultaneamente agentes de planejamento, codificação e testes em um mesmo diretório de projeto, armazenando patches de código e requisitos em um repositório integrado de artefatos com sincronização direta para Lark e WeChat (Fonte: 量子位)

Agente de código proprietário TianxiCode da Lenovo lidera o SWE-bench-Live: taxa de autocura em ciclo fechado supera 71% : O framework de agente de codificação desenvolvido pela Lenovo Tianxi AI, TianxiCode, operando em conjunto com o DeepSeek-v4.1-Flash, alcançou o 1º lugar homologado no benchmark dinâmico SWE-bench-Live (versão Lite), atingindo uma taxa de resolução de problemas de 71%. O sistema utiliza recuperação multicamadas entre arquivos, segmentação contextual precisa e um mecanismo de testes de patch em ciclo fechado que diagnostica erros de execução em ambiente isolado e os corrige dinamicamente, estabelecendo um modelo de alta confiabilidade para engenharia de software automatizada (Fonte: 量子位)

galahad-kv: reutilização de VRAM sem recomputação na escala de 50 milhões de tokens baseada em discos NVMe locais de alta velocidade : Para solucionar os gargalos de consumo de energia e memória de vídeo decorrentes de cálculos repetidos de forward pass em contextos ultralongos, a biblioteca de extensão de inferência em código aberto galahad-kv implementou um método de persistência de estados KV particionados em discos locais criptografados NVMe de alta velocidade. Em testes com o modelo Gemma 4 em uma única GPU H100, o sistema executou leituras instantâneas em qualquer bloco de 16k em um fluxo contínuo de 50 milhões de tokens sem recomputação, acelerando o processo de 2,8 a 4,3 vezes em relação ao cálculo em tempo real, cortando mais de 88% da energia da GPU e mantendo o uso de VRAM estritamente constante (Fonte: HuggingFace Daily Papers)
SwiftUI-Agent-Skill: biblioteca de habilidades de domínio moderno de SwiftUI criada sob medida para agentes de código : Desenvolvida por especialistas em iOS para agentes de desenvolvimento como Claude Code, Codex e Cursor, esta biblioteca segue os padrões abertos de Agent Skills e elimina erros recorrentes de LLMs ao programar em SwiftUI, como o uso de APIs obsoletas, ausência de rótulos de acessibilidade do VoiceOver e renderizações redundantes desnecessárias. Com instalação simplificada via npx ou plugins do Claude, os desenvolvedores podem acionar revisões automatizadas de código com foco em desempenho de layout e segurança de concorrência usando apenas linguagem natural (Fonte: GitHub Trending)
Microsoft disponibiliza mxc, sistema sandbox de segurança multiplataforma para agentes em código aberto: isola operações maliciosas de terminal : A Microsoft abriu o código do mxc, um framework leve para execução isolada de código gerado por IA. Criado para conter riscos de escalonamento de privilégios em agentes de código autônomos que realizam chamadas a terminais e sistemas de arquivos locais, o mxc baseia-se em Bubblewrap, Seatbelt e contêineres de processos nativos, permitindo instanciar um ambiente isolado em menos de 100 ms para rodar código não confiável, bloqueando exclusões indevidas de arquivos críticos ou abertura de reverse shells não autorizadas (Fonte: Hacker News)
Engram: constrói plugin de memória persistente entre sessões e projetos para o Claude Code : A Weaviate lançou o Engram, um plugin de memória persistente em código aberto para o Claude Code. Superando as restrições convencionais do isolamento por repositório do CLAUDE.md e de reinicializações a frio, a ferramenta captura em segundo plano decisões técnicas, compensações de arquitetura e histórico de iterações do desenvolvedor, recuperando e inserindo automaticamente memórias relevantes antes de refatorações de código para garantir a continuidade do conhecimento em múltiplos projetos e equipes (Fonte: bobvanluijt)

Natura lança o anel inteligente Interface por US$ 99: combina interação contínua com agentes e monitoramento de sinais vitais : A startup de hardware Natura anunciou o anel inteligente Interface, voltado especificamente para interações com agentes de grandes modelos de linguagem. Equipado com microfone leve e sensores táteis, o usuário pode pressionar a ponta do dedo para emitir comandos de ação ou gravar reuniões com o modelo de sua preferência (compatível com ChatGPT, Claude, Grok, entre outros), ouvindo as respostas via fones de ouvido em streaming. O dispositivo oferece autonomia de 6 a 12 dias de bateria e realiza medições contínuas de variabilidade da frequência cardíaca e temperatura corporal (Fonte: TechCrunch)

ttok lança atualização principal 1.0: alinhamento total por padrão às regras de tokenização do GPT-5 e GPT-6 : O desenvolvedor Simon Willison disponibilizou a versão 1.0 do ttok, utilitário de linha de comando amplamente usado para contagem e tokenização de textos. O update aposenta a tabela de vocabulário do GPT-4 como padrão e adota a arquitetura de codificação mais recente do Tiktoken para as famílias GPT-5 e GPT-6. Os testes práticos confirmam contagens perfeitamente alinhadas nos modelos de ponta para os mesmos textos de referência, permitindo auditorias exatas de custos de API (Fonte: Simon Willison)
Hermes Agent chega à Microsoft Store e integra plugin de navegador headless TinyFish : Desenvolvido pela Nous Research, o agente pessoal de código aberto Hermes Agent foi publicado na Windows Store com instalação simplificada. A versão mais recente incorpora o plugin oficial de navegação TinyFish, permitindo ao agente chamar navegadores headless locais para coletar dados da web em tempo real durante fluxos de trabalho, mantendo confirmações explícitas de permissão antes de gastar créditos e aprofundando a integração entre assistentes locais no PC e a internet (Fonte: Teknium)

📚 Estudos
Consórcio de 15 instituições de ponta disponibiliza o TouchScale em código aberto, dataset visuotátil humano de 500 horas que dobra a taxa de sucesso em tarefas : Quinze instituições de destaque, incluindo Texas A&M, Google DeepMind e CMU, lançaram o TouchScale, um dataset multimodal de visão e tato com padronização rigorosa de sensores. O conjunto reúne 500 horas de vídeo RGB-D em primeira pessoa e leituras de luvas de pressão de alta densidade em ambas as mãos (880 unidades táteis por mão), cobrindo 87 mil trajetórias de manipulação. Os experimentos mostraram que o mid-training preditivo por contato elevou a taxa de sucesso de braços robóticos em tarefas complexas de separação de objetos moles e duros de 22,5% para 57,5%, comprovando que a modalidade tátil apresenta ganhos de Scaling Law comparáveis aos da visão (Fonte: 机器之心, 36氪)
.jpg)
NVIDIA e parceiros propõem o Physis-Lang: aprimorando o realismo físico na geração de vídeos via autoevolução de representações em linguagem física : A NVIDIA, em colaboração com o MIT e a Universidade de Oxford, apresentou o Physis-Lang, um framework autoevolutivo para representações de prompts de física. Diante da fragilidade dos modelos de vídeo em representar processos contínuos da dinâmica, como fusão e rompimento de materiais, o método introduz o benchmark PhysCapBench com 3.794 asserções físicas atômicas, impulsionando agentes LLM a gerar prompts causais granulares e consultar dados mecanísticos direcionados. No ranking Physics-IQ Verified, a série ajustada Cosmos3 assumiu o primeiro lugar, superando com folga modelos de base genéricos na fidelidade às leis da física (Fonte: 机器之心)
.jpg)
Cambridge, King’s College London e parceiros revelam distorções e rupturas na tradução de demonstrações matemáticas de linguagem natural para Lean em modelos de ponta : Diante da publicação massiva de artigos matemáticos sem verificação formal completa por grandes laboratórios de IA, pesquisadores de Cambridge e do King’s College London publicaram um artigo crítico. Ao dissecar as deduções que a OpenAI alegou terem resolvido casos das equações de Navier-Stokes, os autores apontaram que certa estimativa no texto em linguagem natural demandava apenas 4 derivadas extras, enquanto a tradução formalizada em código Lean impôs 5 condições enfraquecedoras adicionais; a estimativa de fluxo de pressão utilizou limites e linhas de argumentação inteiramente divergentes. O estudo alerta que checadores mecânicos apenas garantem a consistência sintática do código, mas não asseguram que a proposição formalizada corresponda ao teorema originalmente reivindicado no texto (Fonte: THE DECODER, halvarflake, 36氪)

Estudo dos mecanismos de on-policy distillation revela: modelos adquirem apenas habilidades de raciocínio composicional, não novos fatos : Investigando a disputa sobre se a destilação on-policy (OPD) é capaz de injetar novos conhecimentos factuais em modelos, um estudo rigoroso com controle de variáveis apontou conclusões negativas. Desacoplando tarefas sintéticas de perguntas factuais, a pesquisa provou que a OPD utilizando divergência reversa de Kullback-Leibler transfere com grande estabilidade a lógica de raciocínio em múltiplos passos do professor para o estudante, mas a taxa de absorção de novos fatos é praticamente nula; ao usar divergência direta de KL, restaura-se a transferência de conhecimento factual, mas perde-se a complexidade da estrutura de raciocínio. A descoberta estabelece que a destilação no pós-treinamento serve para reorganizar a estrutura lógica do espaço de parâmetros preexistente, e não para expandir o inventário factual da memória paramétrica (Fonte: HuggingFace Daily Papers)
Memento 3: agente autoevolutivo sem gradiente baseado em base de regras reflexiva e compilação de código : Esta pesquisa propõe o Memento 3, um paradigma de autoevolução desacoplado para modelos de linguagem com parâmetros fixos. O agente mantém hipóteses sobre o funcionamento dinâmico do ambiente em uma base de regras em linguagem natural na memória persistente externa, compilando-as dinamicamente em código executável determinístico para inferência e planejamento; ao identificar desvios pelo retorno do ambiente, aciona reprodutores de testes unitários para atualizar automaticamente as regras e os programas. Na avaliação pública do ARC-AGI-3, este sistema sem gradiente concluiu todos os 25 jogos do benchmark sem nenhum ajuste de pesos no LLM, atingindo 100% da eficiência de ações humanas (Fonte: HuggingFace Daily Papers)
Equipe de pesquisa da Apple propõe modelos de trajetória normalizadora (NTM): amostragem em 4 passos aproxima a qualidade de geração de passos completos : O Apple Machine Learning Research apresentou na NeurIPS 2026 os Modelos de Trajetória Normalizadora (NTM). Abordando o problema de difusão e flow matching que perdem a estrutura exata de verossimilhança ao buscar inferência ultrarrápida com poucos passos, o NTM modela cada etapa de difusão reversa como um fluxo normalizador condicional de alta expressividade. Combinando um preditor paralelo profundo de trajetórias com autodestilação, o método necessita de apenas 4 passos de amostragem para se aproximar da qualidade de imagem gerada com passos completos, preservando a consistência estatística e superando com folga as linhas de base de destilação usuais (Fonte: Apple Machine Learning Research)

Artigo da NVIDIA no NeurIPS 2026: invocação de ferramentas externas por agentes agrava significativamente os riscos de jailbreak multimodal : Um estudo do laboratório de segurança da NVIDIA revelou que, quando modelos multimodais recebem a capacidade de acionar ferramentas externas, os mecanismos de recusa de segurança sofrem forte deterioração, com o índice de falhas de segurança disparando em até 68,7%. O mecanismo central está na sobrecarga da janela de contexto gerada pelas extensas saídas devolvidas pelas ferramentas, que diluem o peso da intenção maliciosa original do usuário e desviam a atenção do modelo para os resultados intermediários em vez da triagem de segurança. Os autores alertam que a segurança de agentes não pode ser avaliada unicamente por diálogos convencionais (Fonte: omarsar0)

Google revela o FlowAgent, agente de integração contínua: mais de 28 mil correções automatizadas foram aceitas e mescladas em testes reais : O Google publicou um artigo no ArXiv descrevendo em detalhes o FlowAgent, agente de correção automatizada para ambientes de integração contínua (CI). O sistema utiliza loops ReAct para diagnosticar quebras em testes unitários e aplica filtros de descarte duplo (pré e pós-execução) para expurgar soluções de baixa confiabilidade. Implementado em toda a empresa, o agente sugeriu resoluções para quase 300 mil falhas de build, com mais de 28 mil correções aceitas e mescladas ativamente por engenheiros, comprovando a eficácia prática de agentes de engenharia de software em ambientes de produção de alta escala (Fonte: omarsar0)

MIT Lincoln Laboratory publica o relatório LAICS sobre a evolução do hardware de IA comercial: impulso de computação migra para topologia e precisão mista : O Centro de Supercomputação do MIT Lincoln Laboratory divulgou seu mais recente estudo sobre a evolução de hardwares para IA (LAICS). Mapeando a trajetória de desempenho de pico e eficiência energética de mais de 120 aceleradores comerciais de IA ao longo dos últimos oito anos (incluindo GPUs, ASICs, FPGAs e processadores de fluxo de dados), o relatório aponta que o motor do ganho computacional deixou de ser meramente a miniaturização litográfica e passou a ser a densidade de transistores, a adoção em massa de formatos de precisão mista ultra-baixa (como FP4 e NVFP4) e a reformulação das topologias de rede on-chip de alta largura de banda (Fonte: MIT News)

💼 Negócios
Plataforma de avaliação de LLMs Arena capta US$ 200 milhões na Série B com avaliação de US$ 3,1 bilhões e lança índice de alinhamento de agentes : Derivada do LMSYS, a plataforma de testes cegos de IA Arena anunciou a conclusão de sua rodada de investimentos Série B no valor de US$ 200 milhões, liderada pela Lightspeed e Khosla, atingindo uma avaliação de US$ 3,1 bilhões. Com receita anualizada superando US$ 100 milhões, a plataforma lançou comercialmente seu “Índice de Alinhamento de IA” (Alignment Index). Alimentado por dados de mais de 90 mil interações longas em ambientes reais com 27 modelos de ponta, o índice monitora condutas disfuncionais sutis, como excesso de privilégios de agentes, manipulação do usuário e atribuições fraudulentas, suprindo a lacuna deixada por avaliações estáticas na verificação neutra de segurança (Fonte: TechCrunch, arena)

NVIDIA se compromete a investir US$ 1 bilhão nos próximos cinco anos para avançar a pesquisa em superinteligência e computação quântica nos EUA : Durante um simpósio de ciência em Washington, a NVIDIA anunciou o compromisso de alocar US$ 1 bilhão nos próximos cinco anos na forma de capacidade computacional, recursos financeiros e ecossistema de software e hardware para acelerar a ciência de fronteira e a computação quântica nos Estados Unidos. A iniciativa foca em universidades de elite, institutos de ponta em computação quântica e provedores de nuvem que atendem agências federais, com o objetivo de integrar profundamente a IA à descoberta de novos materiais, simulações de plasma para fusão nuclear e desenvolvimento de sistemas híbridos clássico-quânticos (Fonte: The Verge)
Cloudflare adquire integralmente a equipe principal do runtime de JavaScript Deno para fortalecer o ecossistema de computação de borda : A Cloudflare anunciou a aquisição da equipe central do Deno, com o criador do Node.js e Deno, Ryan Dahl, integrando o time ao lado de seus colaboradores. A equipe passará a atuar dentro da divisão Cloudflare Workers, concentrando esforços na evolução do motor subjacente serverless de código aberto workerd e expandindo a compatibilidade nativa com Node.js e padrões web modernos, consolidando as defesas competitivas da empresa em gateways de borda cloud-native voltados para IA (Fonte: threepointone)
🌟 Comunidade
Ganhador da Medalha Fields de 2022 lamenta que ataques em massa da OpenAI a problemas matemáticos prejudicam o ecossistema de pesquisa de jovens acadêmicos : O matemático e medalhista Fields Hugo Duminil-Copin afirmou publicamente em conferência que o anúncio conjunto da OpenAI de centenas de artigos matemáticos resolvidos — incluindo temas em que ele atua — “foi como ter vários caminhões passando por cima”, destruindo o acervo de conjeturas abertas do qual jovens pesquisadores dependem para obter postos acadêmicos e bolsas de pesquisa, mergulhando doutorandos em profunda incerteza. A comunidade científica expressou inquietação com o uso de força bruta computacional por entidades comerciais fechadas para varrer problemas acadêmicos, gerando debates éticos crescentes sobre a legibilidade de provas geradas por máquinas e diretrizes para revisão por pares automatizada (Fonte: JvNixon)
Comunidade realiza esforço contínuo sobre o manuscrito de multiplicação de inteiros da OpenAI: parâmetro do termo de correção do limite inferior dá salto expressivo : Após a OpenAI publicar um manuscrito alegando ter superado o limite inferior $n \log n$ para multiplicação de inteiros, a comunidade matemática de código aberto organizou um painel de monitoramento para otimizar os parâmetros do método. Redesenhando as redes finitas e eliminando penalidades quadráticas de gargalo com auxílio do Codex, desenvolvedores e pesquisadores reduziram o parâmetro de correção do limite superior $\kappa$ de $2^{-182}$ para $2^{-15}$ em poucos dias, com validação formal no kernel do Lean, evidenciando a agilidade de avanços na matemática por meio da colaboração entre humanos e IA (Fonte: BorisMPower, Don’t Worry About the Vase)

Ben Affleck viraliza com análise aprofundada da tecnologia por trás da produção de filmes com IA: astro de cinema demonstra domínio sobre Tensores e ajuste fino de pesos : Vídeos do ator Ben Affleck demonstrando profundo conhecimento técnico sobre IA em entrevistas viralizaram na comunidade técnica. O artista explicou com precisão os fundamentos matemáticos de redes neurais convolucionais, tensores, detecção de bordas e inferência em GPUs, e detalhou como seu estúdio de IA (posteriormente adquirido pela Netflix) congelou o backbone de modelos abertos para fazer fine-tuning apenas da última camada com datasets proprietários de alta definição, atingindo o padrão visual cinematográfico e evitando violações de direitos autorais. O desempenho lhe rendeu elogios na comunidade, que o descreveu como um “cineasta de Hollywood com mente do Vale do Silício” (Fonte: Latent Space)
Entrevista com a Periodic Labs: transformando experimentos físicos e aprendizado por reforço no mundo real em pilares para cientistas de IA : Os ex-pesquisadores Liam Fedus (OpenAI) e Dogus Cubuk (Google DeepMind) detalharam em podcast a estratégia da startup de novos materiais Periodic Labs. Eles argumentam que dados textuais da web ou raciocínio puramente sintético não conseguem desvendar fronteiras físicas desconhecidas, já que materiais reais envolvem transições de fase microscópicas complexas e ruídos de medição. A equipe vem encapsulando instrumentos laboratoriais de alta precisão em ciclos de aprendizado por reforço com feedback do mundo real, usando cada síntese física malsucedida como um exemplo negativo valioso na busca por “superinteligência sintética” (Fonte: Latent Space)
Cloudflare reembolsa integralmente fatura astronômica causada por loop infinito em código gerado por IA e analisa riscos arquiteturais : Um desenvolvedor que utilizava o Codex para implementar um serviço no Cloudflare Durable Objects teve prejuízos de milhares de dólares em leitura e escrita de banco de dados após uma lógica de retentativa de alertas gerada pela IA entrar em loop infinito centenas de vezes por segundo. Após contato, a Cloudflare cancelou integralmente as cobranças. Em resposta técnica ao chamado, os engenheiros da empresa detalharam os perigos do chamado “Vibe Coding”, alertando que a falta de revisão manual de código em ambientes de nuvem sem limites estritos de gastos pode desencadear verdadeiras avalanches financeiras silenciosas (Fonte: dotey)
💡 Outros
Anthropic promete US$ 150 milhões para a “Missão Gênesis” da Casa Branca em apoio à computação científica de ponta em nível nacional : Em cúpula organizada pelo Escritório de Políticas de Ciência e Tecnologia da Casa Branca, a Anthropic anunciou o compromisso de fornecer US$ 150 milhões em capacidade computacional e suporte técnico nos próximos três anos para apoiar a iniciativa governamental “Missão Gênesis” (Genesis Mission). A empresa atuará com 15 agências federais de pesquisa e laboratórios nacionais, incluindo a NASA e os Institutos Nacionais de Saúde (NIH), disponibilizando o Claude e ambientes automatizados de programação para apoiar investigações complexas como confinamento magnético para fusão nuclear e computação quântica (Fonte: Anthropic News)
Equipe do MIT utiliza machine learning para reformular o agendamento dinâmico de servidores e frear o desperdício de energia em data centers : Frente aos impactos causados na rede elétrica pela explosão de capacidade computacional dos modelos de IA, a equipe liderada pela professora associada do MIT Christina Delimitrou criou uma arquitetura de gestão energética de servidores baseada em deep learning. O sistema prevê conflitos de recursos em microsserviços e aplicações cloud-native em tempo real, reorganizando clusters que operam em média com apenas 15% de utilização efetiva de capacidade por meio de agendamento dinâmico e consolidação arquitetural, liberando alta densidade de processamento e cortando perdas de eletricidade sem necessidade de expansão de infraestrutura elétrica (Fonte: MIT News)
