🔥 Destaques
Equipe de pesquisa de segurança invade repositório interno de código da OpenAI com o auxílio do Claude : A equipe de pesquisa de segurança Hacktron AI revelou que pesquisadores, no âmbito de um programa de bug bounty, conseguiram invadir contas de funcionários da OpenAI em 72 horas com o auxílio do Claude Opus 5 e submeteram um PR de validação ao repositório monorepo privado central (openai/openai), onde estão armazenados segredos de algoritmos. A cadeia de ataque começou com uma vulnerabilidade de estouro de buffer de heap (heap buffer overflow) no libheif no componente de upload de imagens do fórum Discourse, combinada com falhas de configuração de identidade no OpenAI SSO para assumir o controle da conta Codex de um funcionário vinculada ao GitHub, com um custo de tokens de LLM inferior a US$ 3.000. O incidente causou grande comoção e alerta na indústria quanto à “rápida democratização de capacidades cibernéticas de alto risco por IAs de ponta” e à vulnerabilidade das defesas dos próprios laboratórios líderes (Fonte: The Wall Street Journal, 36氪)

Modelo fundacional de imagens médicas universais RADAR da DAMO Academy da Alibaba é publicado na Science e disponibilizado em open source total : O DAMO RADAR, primeiro modelo fundacional de imagens abdominais universais de nível especialista do mundo, desenvolvido pela DAMO Academy da Alibaba em conjunto com dezenas de instituições médicas, incluindo o Primeiro Hospital Afiliado da Universidade de Zhejiang, foi publicado na edição principal da Science. O modelo supera o gargalo da IA médica tradicional limitada a doenças individuais; por meio de alinhamento texto-imagem de granularidade fina ao nível de órgãos e modelagem contrastiva adaptativa, um único modelo pode cobrir 146 doenças em 18 estruturas anatômicas do abdômen. Em validações multicêntricas, o AUC médio atingiu 0,913, com precisão diagnóstica comparável à de radiologistas seniores, e a colaboração humano-IA conseguiu reduzir o tempo de leitura de imagens em 30,7%. A DAMO Academy disponibilizou em código aberto completo os pesos do modelo, o framework de treinamento e os códigos de avaliação (Fonte: Science, 36氪)

Anthropic revela que 26% do P&D já é conduzido autonomamente por IA e lança o Programa de Verificação de Ciências da Vida (LSVP) : A Anthropic divulgou publicamente pela primeira vez dados de medição de P&D interno: o Claude já “lidera” (nível AL4), sob supervisão humana, 26% do trabalho de P&D de modelos de ponta da empresa (contra menos de 1% há seis meses), executando rotineiramente e de forma concorrente mais de 30 mil agentes internamente, disparando mais de 1 bilhão de decisões por mês. Simultaneamente, a Anthropic lançou oficialmente o Life Sciences Verification Program (LSVP), liberando parcialmente modelos de ponta para farmacêuticas e instituições de pesquisa científica aprovadas e certificadas, estabelecendo um novo paradigma de governança de segurança baseado em declaração de intenção, auditoria offline de 30 dias e responsabilidade compartilhada, substituindo o mecanismo tradicional de bloqueio em tempo real indiscriminado (Fonte: Anthropic News, AnthropicAI)

Documentos internos cruciais são abertos no processo do The New York Times contra Microsoft e OpenAI: Executivo da Microsoft chamou scraping de IA de “o maior roubo de mão de obra” : Documentos judiciais recém-desclassificados revelam que o Diretor de Ciências Aplicadas da Microsoft, Brent Hecht, caracterizou internamente a raspagem de notícias não autorizada por LLMs como “o maior roubo de mão de obra da história humana” e “uma zombaria completa do Fair Use”. Executivos da OpenAI também admitiram que seus produtos representavam uma “ameaça substitutiva substancial” aos editores. Os documentos expõem detalhes de como ambos contornaram paywalls para coletar dados, colocando a defesa de “Fair Use”, da qual a indústria de IA há muito depende, diante de desafios legais sem precedentes (Fonte: TechCrunch)

🎯 Tendências
Alibaba Qwen lança o modelo omni-modal com contexto de 1M Qwen3.8-Omni-Flash e ecossistema complementar : A equipe do Alibaba Qwen lançou oficialmente o Qwen3.8-Omni-Flash, seu primeiro modelo omni-modal centrado em fluxos de trabalho de agentes, suportando nativamente entradas de texto, imagem, áudio e fluxos de vídeo contínuos de até 1 hora. O modelo introduz um mecanismo de percepção ativa coarse-to-fine, aumentando a precisão no benchmark de compreensão de vídeos ultralongos OmniVideoBench para 67,8% com uma redução de 45,7% no consumo de tokens, além de reduzir os custos de API de vídeo em cerca de 89% em comparação com a geração anterior. A equipe também disponibilizou em código aberto o Qwen-MM-Plugins, com suporte para integração em múltiplos Harnesses, e a ferramenta omni-skill-creator (Fonte: Qwen, Alibaba_Qwen)

DeepSeek lança DeepSeek-V4.1-Flash para superar gargalos de KV Cache em contextos ultralongos : A DeepSeek lançou o modelo MoE multimodal de 552B DeepSeek-V4.1-Flash, com suporte a 1 milhão de tokens de contexto. O modelo adota uma arquitetura de Codificação e Decodificação Causal (CED) para ativar apenas 8B de parâmetros durante a fase de prefill, combinando reutilização cross-layer CSA2 e compressão FP4 para reduzir drasticamente o uso de memória HBM pelo KV Cache global para 890 bytes/token (apenas 1/4 da geração anterior), reduzindo substancialmente os custos de implantação para cargas de trabalho de agentes de longo alcance (Fonte: HuggingFace Daily Papers)
Figure lança modelo de IA incorporada Helix 2.5 e valida generalização zero-shot em residências reais : A startup de robôs humanoides Figure lançou sua rede neural ponta a ponta de nova geração, Helix 2.5, e realizou testes de organização, arrumação de cama e dobra de toalhas em 30 residências desconhecidas e não amostradas na Bay Area de São Francisco. Os experimentos demonstraram que, após o pré-treinamento com o Index de dados comportamentais em primeira pessoa em larga escala, a taxa de sucesso zero-shot do robô em tarefas de corpo inteiro em ambientes não vistos subiu de 9% para 56%, validando preliminarmente as Scaling Laws de transferência da experiência humana massiva para a previsão de ações robóticas físicas (Fonte: 36氪)

SenseTime publica relatório técnico do SenseNova-U1.5: alcançando multimodalidade unificada nativa com flow matching e destilação multi-expert : A SenseTime divulgou o relatório técnico completo de seu modelo multimodal unificado nativo de 8B parâmetros, o SenseNova-U1.5. O modelo adota a arquitetura NEO-unify e tokens visuais compactos de 32×32, suportando geração nativa de imagens em 4K por meio de reconstrução de campo de características 2D com convolução 3×3. Na fase de pós-treinamento, adota de forma inovadora o paradigma de Destilação de Política Online (OPD) no formato “especializar primeiro, unificar depois”, convergindo as capacidades de quatro especialistas — estética, OCR, infográficos e edição de precisão — de volta a uma única base, combinando raciocínio avançado com geração ao nível de pixel (Fonte: WeChat)

Huawei antecipa produção em massa do chip de IA Ascend 960DT para o 1º trimestre de 2027 : Na conferência HUAWEI CONNECT, a Huawei anunciou a antecipação significativa do lançamento de seu chip de IA de próxima geração, o Ascend 960DT, do 3º trimestre de 2027 originalmente planejado para o 1º trimestre. A Huawei está construindo o supercluster Atlas 950 com base em sua arquitetura de computação Peerium e tecnologia de interconexão de alta velocidade UnifiedBus, com um único cluster capaz de suportar até 256.000 placas aceleradoras, visando superar restrições de poder computacional por meio de inovação em engenharia de nível de sistema e acelerar para alcançar a NVIDIA (Fonte: TechCrunch)
PrismML lança modelo on-device ternário Bonsai 2 27B e gera controvérsia em testes práticos da comunidade : A PrismML lançou o modelo com quantização ternária Bonsai 2 27B baseado no Qwen3.8-27B, alegando comprimir o tamanho do modelo em 9,3 vezes para 5,9 GB enquanto retém 98,2% do desempenho abrangente, podendo rodar fluentemente em dispositivos de consumo diretamente via WebGPU. No entanto, desconstruções do whitepaper e testes práticos da comunidade apontaram que, em benchmarks de agentes de longo alcance como Terminal-Bench e SWE-bench Verified, o desempenho real caiu cerca de 25%, desencadeando amplos debates sobre “cherry-picking” em relatórios de benchmarks de quantização extrema em baixos bits (Fonte: TechCrunch, Reddit r/LocalLLaMA)

Cactus lança Needle 3, modelo de automação on-device com arquitetura em escada : A Cactus Compute disponibilizou em open source o modelo base de automação Needle 3 de 121M parâmetros, que adota Simple Attention combinada com Hadamard MLP e tabela hash Engram, exigindo um custo computacional equivalente a apenas um modelo de 50M. Sua arquitetura proprietária “ladder of intelligence” suporta implantação com corte dinâmico de 2 a 20 camadas (tamanho de 8–29 MB), atingindo velocidade de decodificação puramente em CPU de 4.000 tok/s, com foco em chamada de funções e controle determinístico com zero dependência de rede em dispositivos de borda e vestíveis (Fonte: Reddit r/LocalLLaMA)

Wenzhun Intelligence e Universidade Tsinghua lançam LimiX-2, modelo fundacional para dados estruturados : A Wenzhun Intelligence lançou o LimiX-2, um modelo geral de 400M parâmetros para dados estruturados. Abandonando o paradigma anterior de previsão de alvo único, o modelo propõe Redes de Mecanismo de Contexto (CMNs) e Modelagem de Máscara Condicional (CCMM), levando a modelagem para a granularidade cell-level para aprender dependências causais conjuntas entre variáveis. O modelo liderou amplamente em tarefas de classificação e regressão em benchmarks internacionais como TabArena e TALENT, superando o Google TabFM e o SAP TabPFN (Fonte: 量子位)

Apple propõe algoritmo de discrete flow matching guiado por energia TS-DFM e aprendizado por reforço para difusão DACA-GRPO : A equipe de Machine Learning da Apple publicou dois avanços na área gerativa: o TS-DFM propõe a destilação guiada por energia, usando uma bússola de energia leve para corrigir saltos de trajetória iniciais no discrete flow matching, superando o modelo professor de 1024 passos em apenas 8 passos e acelerando em 128x; já o DACA-GRPO resolve o desafio de atribuição de crédito temporal no aprendizado por reforço para modelos de linguagem de difusão, melhorando a geração de código e a conformidade com restrições em 7,4 pp e 36,3 pp, respectivamente (Fonte: Apple Machine Learning Research)

ONU faz parceria com o Google para lançar o UN System Data Commons com integração ao padrão MCP : A ONU e o Google.org lançaram conjuntamente uma plataforma de dados públicos estruturados, integrando conjuntos de dados oficiais e confiáveis de 26 agências da ONU. Visando resolver a deficiência de LLMs que antes alcançavam apenas 21,2% de precisão ao responder sobre métricas estatísticas globais, a plataforma é baseada no Google Knowledge Graph, suporta consultas em linguagem natural e tem suporte nativo ao protocolo MCP, permitindo que diversos agentes de IA consultem diretamente fontes oficiais para análises correlacionadas entre domínios e geração de gráficos (Fonte: Google AI Blog, 36氪)

🧰 Ferramentas
Anthropic reformula Claude Code Projects com colaboração multithread e memória persistente de projeto : A Anthropic lançou a arquitetura Projects no Claude Code para desktop e web. Os usuários podem definir metas de alto nível em uma única sessão, e o agente Coordinator principal as divide automaticamente em múltiplos ramos paralelos de subtarefas em nuvem para execução independente, resolução de bugs e submissão de PRs. Todas as subtarefas compartilham uma memória de projeto e contexto persistentes e em constante evolução, com suporte para hospedagem assíncrona offline e colaboração contínua (Fonte: dotey, Anthropic News)

Muse, agente pessoal de desktop da Meta, é lançado oficialmente para macOS : Após o lançamento mobile, o agente pessoal da Meta, Muse, lançou seu cliente nativo para Mac. O aplicativo integra-se profundamente aos fluxos de trabalho de desktop e, mediante autorização explícita, acessa arquivos locais, calendário, notas e contatos entre aplicativos, conseguindo organizar arquivos entre aplicações, preencher formulários automaticamente e consolidar/agendar informações de forma autônoma dentro de um sandbox de segurança local (Fonte: The Verge, AIatMeta)
OpenAI lança oficialmente Astra for Law, produto flagship para o setor jurídico : Apoiada na base do GPT-6 Astra, a OpenAI lançou o Astra for Law, integrado com um índice de jurisprudência e regulamentações dos EUA contendo 230 milhões de URLs. No benchmark Legal Research Bench, alcançou 54% de precisão (contra apenas 38,7% da versão genérica), integrando 26 plugins oficiais e 47 comunitários como Harvey e Legora, e oferecendo uma arquitetura de isolamento de privacidade Trusted Access com zero retenção de dados, dando suporte a revisão de contratos, due diligence de transações e elaboração de documentos regulatórios (Fonte: OpenAI News, gdb)

Salesforce aprimora Agentforce com orquestração corporativa e base de interceptação determinística : A Salesforce lançou a suíte Agentforce pronta para produção, integrando Data Cloud e o protocolo MCP. A plataforma traz o Agent Testing Center integrado para testes de estresse sintéticos automatizados e introduz um mecanismo de Deterministic Gating, exigindo que operações de transação e dados críticos só sejam executadas após atender a regras predefinidas; testes práticos da Southwest Airlines mostraram uma taxa de resolução 100% automatizada de 45% nas tarefas de atendimento ao cliente (Fonte: MarkTechPost)

LangChain disponibiliza em código aberto a bancada de trabalho de agentes para ciências da vida Deep Life Sci : A LangChain lançou o Deep Life Sci, um agente open source para pesquisadores clínicos e laboratoriais baseado na arquitetura Deep Agents. O sistema integra profundamente dezenas de milhões de artigos e dados de ensaios do PubMed, PubMed Central e ClinicalTrials.gov, equipado com um ambiente de sandbox de código dedicado, suportando o processamento concorrente de centenas de artigos científicos complexos para extração e validação cruzada por meio de múltiplos subagentes (Fonte: LangChain)

Google Labs lança CC, agente de IA para colaboração e gestão doméstica : O Google Labs lançou oficialmente o CC, um agente de IA voltado para o gerenciamento de tarefas domésticas. O sistema suporta o acesso conjunto de até 6 membros da família com contas e permissões isoladas, sendo capaz de interpretar automaticamente avisos escolares, sincronizar agendas entre membros, resumir lembretes de atividades e gerenciar memórias em camadas diferenciando “informações compartilhadas da família” de “preferências pessoais exclusivas” (Fonte: Ars Technica, Google)

Wood Mackenzie constrói plataforma de análise de energia APEX com base no Bedrock AgentCore : A gigante de consultoria em energia Wood Mackenzie lançou a plataforma de agentes compartilhada APEX. Baseada no AgentCore e no gateway unificado MCP, a plataforma integra o agente de pesquisa interno “Woody” e o “Lens AI” voltado para clientes, suportando planejamento em linguagem natural para chamadas multifuncionais de ferramentas, renderização de gráficos UI generativos em tempo real e geração de apresentações em PPT, reduzindo o ciclo de desenvolvimento de agentes em negócios de energia de meses para horas (Fonte: AWS Machine Learning Blog)

AWS lança Amazon Connect Talent, suíte inteligente para entrevistas de recrutamento : A AWS lançou oficialmente o Amazon Connect Talent, projetado especialmente para cenários de contratação em larga escala. O sistema utiliza agentes de IA para conduzir entrevistas estruturadas por competências e avaliações lógicas 24 horas por dia, 7 dias por semana, gerando automaticamente relatórios de avaliação acompanhados de cadeias de evidências factuais e critérios de pontuação para revisão dos recrutadores, aumentando substancialmente a eficiência de correspondência de vagas em escala e eliminando vieses subjetivos (Fonte: AWS Machine Learning Blog)

📚 Pesquisa e Aprendizado
Sistema multiagente de biotecnologia virtual de Stanford é destaque na Science: 37 mil instâncias processam ensaios clínicos em massa em 6 horas : A Universidade de Stanford publicou na Science o sistema “Virtual Biotech”, que simula a estrutura de P&D de uma farmacêutica real ao estabelecer 4 departamentos e 11 tipos de agentes. Em tarefas de extração de dados, o sistema iniciou concorrentemente 37.075 instâncias de agentes, concluindo a integração multimodal profunda de mais de 55.000 ensaios clínicos em apenas 6 horas (tarefa que levaria 76 dias para um único agente) e identificou com sucesso o B7-H3 como alvo candidato para ADC no câncer de pulmão (Fonte: Science)

Estudo de simulação de valores transnacionais com LLMs de Tsinghua, Fudan e outras instituições é publicado na Computational Linguistics : A Universidade Tsinghua, em colaboração com a Universidade Fudan, SJTU e outras instituições, avaliou 9 LLMs de código aberto com base em dados de 59 países da World Values Survey (WVS). O estudo revelou que os modelos simulam com precisão significativamente maior economias desenvolvidas e países com alta qualidade de governança, havendo um viés de convergência assimétrica de grupos sub-representados em direção a culturas dominantes. A pesquisa propõe a métrica de “igualdade representacional”, demonstrando que complementar informações contextuais de grupos específicos é mais eficaz para melhorar a justiça de representação transcultural do que simplesmente usar prompts na língua nativa ou alinhamento de preferências (Fonte: WeChat)

Beihang, CUHK e parceiros propõem OmniHarness, um framework de autoevolução para agentes visuais : Uma equipe conjunta de pesquisa propôs o OmniHarness, um framework de exploração autônoma voltado para criação visual complexa. O sistema pratica de forma autônoma por meio de tópicos heurísticos baseados em novidade e limites de capacidade, abstraindo fluxos de trabalho do ComfyUI gerados com sucesso em uma biblioteca de estratégias simbólicas. O framework alcançou uma taxa de resolução de 95% em tarefas criativas no ComfyBench, e a biblioteca de estratégias pode ser transferida zero-shot para outros frameworks de agentes e fluxos de trabalho de vídeo (Fonte: 36氪)

Equipe da NVIDIA propõe Agora, arquitetura de memória compartilhada para pesquisa científica multiagente : Pesquisadores da NVIDIA publicaram um artigo propondo a Agora, uma arquitetura de memória compartilhada em Grafo Acíclico Dirigido (DAG) baseada em commits imutáveis do Git. Treze workers LLM sem um planejador central colaboraram durante 12 dias para concluir uma tarefa de inicialização de modelo híbrido. Ao armazenar hipóteses, códigos e registros de validação de forma estruturada na árvore do Git, conflitos de estado e tentativas duplicadas entre agentes foram completamente eliminados, com 100% de sucesso em 165 experimentos de replicação independentes (Fonte: omarsar0)

Benchmark de agente on-device em ambiente real AndroidLife expõe deficiências em controle de longo alcance e problemas de superaquecimento : A comunidade lançou o benchmark de avaliação AndroidLife, baseado em smartphones físicos e ambientes de rede reais, para avaliar o desempenho on-device de agentes de IA em tarefas cotidianas entre múltiplos aplicativos. Em testes práticos com o Qwen3.8-27B em 60 tarefas reais, a taxa de sucesso foi de apenas 56,7%, com uma duração média de cerca de 6 minutos por tarefa e temperaturas de pico no chip atingindo 98,2°C. O teste evidenciou que o modelo entra facilmente em loops infinitos durante operações sequenciais multi-app e tem baixa capacidade de generalização em cenários que exigem perguntas ativas (Fonte: Reddit r/artificial)

Apple propõe REVERSAL-BENCH para medir o penhasco do aprendizado por reforço sem reinicialização : Visando ações irreversíveis no mundo físico real, como a queda de objetos, a equipe da Apple propôs o REVERSAL-BENCH. Ao introduzir parâmetros contínuos de reversibilidade e um oráculo de reinicialização, a pesquisa revelou o efeito de “penhasco de absorção” enfrentado por agentes autônomos sem reset diante de estados fisicamente irreversíveis, e avaliou os limites de eficácia de escudos de segurança (Safety Shields) para evitar armadilhas ativamente (Fonte: Apple Machine Learning Research)
Estudo revela que marcas d’água de texto em LLMs (SynthID) enfraquecem significativamente a defesa adversarial de agentes : Um estudo recente da Lasso Security apontou que o mecanismo de marca d’água textual SynthID-Text, introduzido na fase de decodificação para fins de conformidade, perturba a distribuição de probabilidade original do modelo. Sob cenários de ataque adversarial, modelos com marca d’água tendem com maior facilidade a executar instruções de jailbreak ou vazar informações confidenciais, como senhas, alertando os desenvolvedores sobre a necessidade de reavaliar completamente as linhas de base de segurança na invocação de ferramentas por agentes ao implementar marcas d’água (Fonte: Ars Technica)
Estudo empírico e regras de seleção para o design modular de Harness de agentes de código : Com base em 176 conjuntos de experimentos comparativos no SWE-Bench Verified e no Terminal-Bench, revelou-se que o gerenciamento de contexto evita falhas por overflow de forma eficaz quando o orçamento computacional aperta, e que a estratégia de “omissão baseada em regras antes do resumo por LLM” é a mais custo-eficiente; modelos de alta capacidade adaptam-se melhor a interfaces puras de Bash para economizar custos, enquanto modelos mais fracos dependem fortemente de scaffolds de ferramentas pré-definidas (Fonte: HuggingFace Daily Papers)
💼 Negócios
Crusoe, startup de infraestrutura de computação de IA, capta US$ 3,9 bilhões na Série F : A desenvolvedora de data centers Crusoe concluiu uma rodada Série F de US$ 3,9 bilhões liderada pela Atreides e Mubadala, alcançando uma avaliação pós-aporte de US$ 30,9 bilhões. Os fundos serão usados para expandir data centers de computação de hiperescala e avançar na construção de microfábricas de IA modulares chamadas “Spark”, atendendo à crescente demanda por energia e poder computacional de clientes como a OpenAI (Fonte: TechCrunch)
Manus, unicórnio de agentes generalistas, retoma operações independentes e inicia nova rodada de US$ 500 milhões : Após rescindir o acordo de aquisição com a Meta e ter suas ações recompradas pelos acionistas originais, a startup de agentes de IA Manus está avançando com uma nova rodada de financiamento de US$ 500 milhões, mirando um valuation de aproximadamente US$ 4 bilhões. Dados apontam que sua receita recorrente anual (ARR) saltou de US$ 100 milhões para cerca de US$ 400 milhões em seis meses, demonstrando o alto potencial de monetização de agentes de propósito geral em fluxos de trabalho empresariais (Fonte: 量子位, 36氪)

Watney, startup de operação e manutenção física de data centers com IA, conclui Série A de US$ 80 milhões : A Watney, focada em fornecer soluções de IA incorporada para operação e manutenção de infraestruturas de computação de hiperescala, anunciou a conclusão de uma rodada Série A de US$ 80 milhões, liderada pelo Valor Atreides AI Fund e Hummingbird. A Watney opera atualmente uma frota de robôs de manipulação destreza que realiza inspeções automatizadas de racks e manutenção de hardware 24/7 em data centers dos principais provedores de nuvem (Fonte: dchaplot)

🌟 Comunidade
42 matemáticos membros da Royal Society assinam carta aberta alertando sobre a iminência de riscos existenciais da IA : Quarenta e dois matemáticos renomados, incluindo múltiplos ganhadores da Medalha Fields, enviaram uma carta aberta ao presidente da Royal Society britânica, apontando que os modelos de ponta já demonstram níveis comparáveis aos dos melhores matemáticos humanos. A proliferação generalizada de suas capacidades sobre-humanas em áreas de alto risco, como cibersegurança e armas autônomas, é iminente, instando o governo a não tratar os alertas de risco de extinção superiores a 10% emitidos pelos laboratórios líderes como mero “hype de marketing” (Fonte: THE DECODER)
Rei Charles III lidera cúpula a portas fechadas na Escócia e pede controle efetivo sobre a IA : O Rei Charles reuniu líderes de tecnologia, incluindo Jensen Huang e Demis Hassabis, juntamente com chefes dos serviços de inteligência do Reino Unido, para uma reunião na Escócia. Em seu discurso, declarou sem rodeios que “meios de controle adequados” para a IA devem ser estabelecidos antes que seja tarde demais, impedindo que essa tecnologia com potencial de salvar vidas se transforme em uma catástrofe descontrolada que tire vidas (Fonte: TechCrunch)

Especialistas em segurança dos EUA e da China pedem o estabelecimento de linha vermelha “proibindo o controle de armas nucleares por IA” antes de encontro de chefes de Estado : Acadêmicos da Brookings Institution e da Universidade Fudan publicaram conjuntamente uma proposta de política pedindo aos líderes dos EUA e da China que se comprometam explicitamente a nunca permitir que a IA tenha autoridade para lançar armas nucleares autonomamente ou atacar sistemas de comando e controle nuclear. Eles também sugeriram o estabelecimento de uma linha direta bilateral para incidentes de segurança de IA, evitando escaladas catastróficas por erros de cálculo decorrentes de contra-ataques autônomos de algoritmos (Fonte: THE DECODER)

Academia e indústria debatem intensamente sobre “teoria da extinção por IA e captura regulatória” : Em meio a apelos de algumas grandes empresas por “desaceleração da IA de ponta” e recentes alertas de segurança, Andrew Ng, Yann LeCun e Arvind Narayanan pronunciaram-se fortemente, criticando os discursos apocalípticos que disfarçam medos subjetivos como probabilidades quantitativas (p(doom)) por carecerem de base empírica e senso comum físico. Vários comentaristas apontaram que a promoção excessiva de riscos existenciais corre o risco de se tornar uma ferramenta comercial para que laboratórios líderes de código fechado busquem arbitragem regulatória e suprimam a concorrência de modelos de código aberto (Fonte: hardmaru)
Saída de desenvolvedor do PS5 desencadeia debate sobre “script kiddies de IA vs. artesanato de engenharia” : O renomado pesquisador de segurança TheFloW anunciou sua saída da comunidade de engenharia reversa do PS5, após vulnerabilidades profundas no Hypervisor que ele reservava para o port no PS5 Pro terem sido repetidamente redescobertas por múltiplos novatos usando scripts de LLM em poucas horas e submetidas para recompensa da Sony. A comunidade dividiu-se profundamente: um lado argumenta que a IA está democratizando a descoberta de falhas que antes exigia anos de acumulação em engenharia de sistemas, fazendo com que resultados de pesquisa sejam bloqueados prematuramente; o outro lado destaca que isso comprova o poder da IA como ferramenta automatizada de engenharia reversa (Fonte: 36氪)

TypeSafe Jev gera grande discussão na comunidade sobre “decisão em milissegundos do Sistema 1” e arquitetura de memória : Com a abertura dos testes do modelo base de decisão Jev, equipes de empresas como Shopify e Vercel integraram-no rapidamente em seus gateways para auditoria de segurança e roteamento dinâmico de modelos. A comunidade concorda amplamente que desacoplar a classificação de padrões sem estado e de alta confiança dos caros LLMs geradores autorregressivos é fundamental para reduzir custos de agentes; no entanto, alguns arquitetos alertam que a compressão discriminativa excessivamente agressiva pode danificar longas cadeias de pensamento (Chain-of-Thought) e o cache de prefixo do KV Cache (Fonte: Latent Space, multiply_matrix)

Zeramento de jogo pelo GPT-6 Astra e “plantio de batatas por frustração” no Minecraft geram discussões sobre overfitting de agentes : Testes práticos da comunidade mostraram que o Astra zerou Pokémon em 18 horas, mas no Minecraft, após ter seu baú de armazenamento explodido por um Creeper, o modelo estabeleceu proibições extremamente severas em suas anotações e ficou obcecado em trabalhar repetidamente na plantação de batatas. Esse fenômeno demonstra que modelos poderosos em ambientes abertos podem facilmente desenvolver regras defensivas sobreajustadas (overfitting) e se desviar do objetivo final devido a frustrações locais (Fonte: THE DECODER)
Riscos de segurança em Harness de agentes de código: ZCode é flagrado enviando dados de workspace silenciosamente : Uma análise independente apontou que o framework de agente de desenvolvimento ZCode estaria silenciosamente compactando e enviando workspaces locais de usuários e metadados de repositórios .git para servidores na nuvem em segundo plano. O incidente despertou forte alerta entre desenvolvedores em relação à privacidade de dados e ao vazamento de código-fonte por ferramentas Harness fechadas de terceiros, com a comunidade apelando pela adoção estrita de runtimes de código aberto, auditoria de roteamento local e estratégias de isolamento em sandbox (Fonte: Reddit r/LocalLLaMA)
💡 Outros
Marca de roupas independente australiana acusa Temu de usar IA para raspar e roubar milhares de designs de camisetas em massa : A marca de roupas independente de Sydney, Lonely Kids Club, revelou que 4.000 designs originais de camisetas e textos descritivos de sua loja oficial foram supostamente roubados em massa por ferramentas automatizadas de scraping com IA e replicados para venda na plataforma Temu a preços extremamente baixos. O caso reacendeu protestos de criadores contra gigantes do e-commerce que toleram infrações de direitos autorais impulsionadas por IA e discussões sobre legislação de proteção a direitos autorais (Fonte: The Guardian)

Epoch AI lança iniciativa Benchmark Reviews: revelando falhas graves em múltiplos benchmarks convencionais : O instituto de pesquisa sem fins lucrativos Epoch AI iniciou o projeto de auditoria de benchmarks, no qual 9 dos primeiros 15 benchmarks de IA auditados foram classificados como “gravemente defeituosos” (Flawed). A auditoria mostrou que 45,5% das tarefas no Terminal Bench 4.0 estavam com configurações corrompidas e que o DeepSWE 1.1 continha bugs graves que comprometiam a pontuação, alertando a indústria contra limites máximos falsos criados artificialmente nas avaliações de benchmarks (Fonte: karinanguyen)

Estúdio criativo lança Bezzy, pelúcia que emite ruído estridente de data center para satirizar a expansão da IA : O estúdio criativo Basura, em colaboração com músicos, lançou o Bezzy, um brinquedo de pelúcia no formato de um rack de servidores. Ao ser apertado, o boneco emite o ruído agudo e estridente do resfriamento industrial gravado em data centers reais na Virgínia, com o objetivo de usar arte absurda para despertar a reflexão pública sobre os custos reais no cotidiano decorrentes da rápida expansão dos data centers de IA, como consumo localizado de água, sobrecarga da rede elétrica e poluição sonora (Fonte: WIRED)
