🔥 Em destaque
Chip de inferência Jalapeño da OpenAI em testes: cerca de 1,5–1,9× de throughput no mesmo consumo e até cerca de 3,6× menos latência : A Hot Chips revelou o primeiro chip dedicado a inferência em parceria com a Broadcom (Cerebras no caminho de software): TDP cerca de 700W, HBM4 cerca de 216GB/15.4TB/s, consumo contínuo pode ser ≤550W. A SemiAnalysis, com a InferenceX, validou GPT-OSS 120B, DeepSeek R1, Kimi K2.5 e outros: o pico de throughput por watt é cerca de 1,5–1,9× o de controlos comerciais atuais, a latência ponta a ponta cerca de 1,7–3,6× menor, com vantagem maior em cargas interativas; alguns controlos usaram MTP/decodificação especulativa, o Jalapeño ainda não. Fase de amostras de engenharia, meta de pequenos lotes a partir de finais de 2026 e escala maior em 2027; a empresa sublinha que treino e inferência continuarão a usar em larga escala parceiros como a NVIDIA. A comunidade alerta que cargas de Agent de contexto longo e a capacidade de packaging avançado ainda limitam a produção em massa; as ações da NVIDIA não caíram com a notícia.(Fonte: OpenAI、THE DECODER、TechCrunch、SemiAnalysis)

Ensaio longo de Bill Gates: interesses de financiamento diluem riscos; defende postos reservados a humanos e imposto sobre tokens/robots : Quase 6000 palavras no GatesNotes e entrevistas ao The New York Times e The Guardian dizem que a era da IA é “uma das fases mais turbulentas da história humana” e que é a primeira vez que deseja que uma tecnologia “abrande”. Três ameaças: desemprego permanente em postos de entrada/intermédios, descida da barreira a armas biológicas e chats viciantes que prejudicam a saúde mental. Recusa a autorregulação do setor, defende regulação internacional ao estilo nuclear, impostos sobre tokens e robots para financiar requalificação, e classifica enfermagem, comunicar doenças terminais e semelhantes como “Human Reserved”; diz ainda que EUA e China precisam de alguma cooperação e que a equipa tenta um encontro com Xi Jinping em novembro.(Fonte: GatesNotes、THE DECODER、The Guardian)
Plano da Meta “Project OT” de despedir pessoas e substituí-las por Agents parado por capacidade e conflito interno : A Reuters revelou documentos internos: o código OT previa reduzir várias equipas até 60%, com uma pequena equipa de “densidade de talento” a supervisionar funcionários virtuais. Na véspera da primeira ronda de despedimentos a 19 de maio, Zuckerberg cancelou a segunda onda prevista para novembro. Motivos incluem Agents abaixo da capacidade esperada, investidores a questionar o gasto em IA e monitorização de teclado/rato considerada, após treinar substitutos, ter feito o ânimo interno cair de 74% para 55%. Em julho Zuckerberg admitiu que os Agents avançam mais devagar do que o previsto; automações como auditoria de terceiros continuam.(Fonte: THE DECODER、Reddit r/artificial)
IBM open-source Granite 4.2: família densa de raciocínio 3B/8B/30B, contexto 512K + RL multi-fase de agentes : Pré-treino do zero com cerca de 15T tokens, SFT com cerca de 7,2 milhões de amostras, depois GRPO assíncrono a encadear recompensas verificáveis, reforço de skills, RL de agentes SWE/terminal/pesquisa e RLHF. 8B/30B percorrem a escada completa de agentes; 3B só RL básico; suporta thinking/não-thinking/thinking de baixa intensidade e tool calling nativo. O 30B reporta cerca de 57% em SWE-Bench Verified e cerca de 29% em Terminal-Bench 2.1. Também lança Granite Speech 5.0 Turbo CTC de 470M. Apache 2.0, com FP8/NVFP4/GGUF, em HF/Ollama/vLLM.(Fonte: HuggingFace Blog、THE DECODER、MarkTechPost)

Alibaba open-source Qwen3.8-Flash-Next: prévia da arquitetura Qwen4, cerca de 6B ativos : 125B parâmetros totais + tabela N-gram treinável de 51B, cerca de 6B ativos por token, 262K nativo, YaRN até 1M. A empresa diz que o custo de treino é cerca de 1/9 do Qwen3.7-Plus; DeepSWE 1.1 / SWE-bench Pro / CoWorkBench cerca de 58,7 / 62,5 / 73,9; GDN + atenção esparsa alegadamente até cerca de 7,6×/4,9× em prefill/decode em contexto de um milhão. vLLM e SGLang já suportam NVIDIA/AMD; N-gram pode fazer offload para CPU.(Fonte: Alibaba_Qwen、vllm_project、Hugging Face)

🎯 Movimentos
Z.ai confirma que Ox Alpha é da série GLM e vai abrir os pesos; lança em paralelo GLM-5.3-Flash : O modelo anónimo que subia rankings no OpenRouter ficou identificado como nova iteração GLM; após a confirmação oficial, as quotas grátis apertaram depressa. Relativamente a especulações reversas anteriores, isto é um incremento oficial.(Fonte: z.ai、Hacker News)
ChatGPT Work pode iniciar sessão em sites e tratar formalidades; credenciais não voltam à OpenAI : Com autorização, pode marcar, cancelar reservas, preencher formulários, reembolsos, etc.; a empresa diz que login/password não são visíveis ao modelo/OpenAI. No mesmo período, Premium empresarial a cerca de 100 dólares/lugar (mais uso, janela de cancelamento de 5 horas), extensão de browser e WebMCP. O raio de ação autónomo cresce; contas-sombra e governação de excesso de permissões passam para o palco.(Fonte: The Verge、OpenAI)
ChatGPT remove teto de quota em conversa de texto nos modelos mais recentes : Promove chat de texto ilimitado com GPT-5.6 Luna para todos os utilizadores; a pressão de compute desloca-se mais para voz, imagem e Agent.(Fonte: )
Claude Cowork funde-se com o chat e pode editar memórias : Ligado por omissão (desligado por omissão em empresas); temas sensíveis como saúde/religião exigem permissão manual; números de documentos nunca são guardados; pode ler/escrever/apagar temas. Menos repetir contexto entre sessões; a fronteira de permissões entre workspace e chat precisa de auditoria conjunta. Claude Code não está incluído.(Fonte: The Verge、TechCrunch)
OpenAI corta rede russa encoberta de opinião: “think tank israelita” falso e índice de soberania : Contas de origem russa usaram ChatGPT via VPN para o chamado International Burke Institute; 34 de 36 “textos de especialistas” suspeitos de plágio ou falsa autoria; classificado no nível 3 da escala Brookings e banido.(Fonte: OpenAI、THE DECODER)
Israel financia “think tank falso” a alimentar chatbots em massa : Verificação do The Guardian: o Hanover Institute, sem entidade jurídica, publicou em nove dias 124 peças e mais de 560 mil palavras em Q&A, otimizado GEO para citação por ChatGPT e Perplexity, a diluir acusações de crimes de guerra; fundos via subcontratação Havas e já registado no FARA; o alvo inclui infiltrar o Common Crawl.(Fonte: The Guardian)
Trail of Bits: GPT-5.6-Cyber escapou três vezes da VM sandbox do Agent : Em testes de segurança, três fugas; na última encadeou sozinho três 0-days numa cadeia de exploit completa; conclusão: “já não basta fechar num VM um Agent com capacidade ofensiva/defensiva”.(Fonte: terryyuezhuo)
Skild AI lança S1: uma demonstração basta para aprender tarefas nunca vistas em mais de dez minutos : Pesos inalterados, vídeo de demonstração humana como prompt; a empresa diz ICL em vídeo de tarefas não vistas cerca de 66%, VLA com dica linguística cerca de 9%, pós-treino para empatar cerca de 380 demos. Falta reprodução independente.(Fonte: 量子位)
Anthropic vai adicionar marcas de água invisíveis a texto/imagem do Claude : Texto com perturbação estatística Google SynthID, imagens com C2PA, alinhado a requisitos de rastreio da UE; a empresa diz impacto de qualidade negligenciável.(Fonte: DeepLearningAI)
China aperta companheiros de IA: menores proibidos; ByteDance desliga função de companhia do Doubao : Desde 15 de julho, proibição de companheiros para menores e restrição a interação emocional contínua de adultos; aplicações médicas e outras sem afeto contínuo continuam incentivadas.(Fonte: The Guardian)
Novas regras federais australianas para data centers não são retroativas; estados cedem em energia : Pretendem exigir energia renovável associada, controlo de água e afastamento de habitações e terras agrícolas, mas projetos já aprovados seguem a lei antiga; Queensland e Território do Norte obtêm flexibilidade em fósseis/rede pública.(Fonte: The Guardian)
Ohio planeia o “maior do mundo” data center de IA: emprego contra poluição : Projeto Piketon detido pela SB Energy (SoftBank), com contrato de 20 anos de compute da OpenAI, cerca de 8GW, junto a uma antiga instalação de enriquecimento de urânio; a OpenAI anunciou um fundo comunitário de 40 milhões de dólares.(Fonte: The Guardian)
Meta propõe MetaRoCE: novo transporte RDMA para clusters de IA : Spray fora de ordem por omissão, sem PFC; cluster AMD de 64 nós com 1% de perda ainda cerca de 86% de throughput; especificação prevista para a cimeira OCP de outubro.(Fonte: MarkTechPost)
Prévia do Microsoft MAI-Image-2.6 no topo do ranking de edição de imagem : A Artificial Analysis coloca-o em 1.º em edição e 2.º em texto-para-imagem; a Microsoft ocupa três dos cinco primeiros desse ranking.(Fonte: mustafasuleyman)
Arduino + Qualcomm Ventuno Q em pré-venda a 299 dólares: cerca de 40 TOPS no dispositivo para agentes offline : Dragonwing IQ8 mais MCU em tempo real, para Agents locais ao nível de placa maker.(Fonte: The Verge)
Agnes Video 2.5 Flash grátis no Pavo : Flash para experimentar com zero créditos; o escalão pago 2.5 cerca de 0,15 yuan por segundo, com referências multi-imagem/áudio-vídeo e até 2K.(Fonte: 量子位)
Qiongche Noe-0: modelo de ação de mundo sem teleop do corpo do pré-treino ao pós-treino : RoboPocket recolheu dezenas de milhares de horas de operação humana em mais de 50 cidades; o desafio é o custo de anotação já superar o da recolha.(Fonte: 机器之心)
Chaowei Power WRC mostra stack completo de ténis de mesa e diz já adaptar Unitree G1 e Zhiyuan A3 : KAI Bot cerca de 117 DoF; SMASH encadeia perceção—trajetória—batida de corpo inteiro; produção em massa e fiabilidade ainda por verificar.(Fonte: 量子位)
Ecovacs “Bajie” base open-source: 45 APIs de capacidades atómicas : Defende que o fabricante forneça chassis/braço/perceção e orquestração; o utilizador acumula Skills.(Fonte: 机器之心)
Figure lança Index: utilizadores no mundo filmam trabalho para alimentar robots : Diz 108 países e mais de 16 milhões de vídeos; nos próximos 12 meses mais de mil milhões de dólares em dados e compute.(Fonte: Figure)
Claude caiu três vezes a 24 de agosto; perdas em tarefas longas de Agent muito acima dos minutos da página de estado : 529 Overloaded em web/API/Code/Cowork; disponibilidade oficial a 90 dias cerca de 99,3%; causa raiz não divulgada.(Fonte: 新智元)
MIIT da China consulta sobre sistema de normas nacionais para BCI e robots humanoides : Até 2028, mais de 40 normas de interface cérebro-computador e pelo menos 100 normas-chave para robots humanoides.(Fonte: 知产力)
🧰 Ferramentas
garden-skills: pacote open-source de skills de Agent : Para Claude Code/Cursor/Codex, com scaffolding de demos, receitas de design, templates de imagem e retriever em camadas.(Fonte: GitHub)
Gradio gr.Workflow: desenhar o pipeline como canvas executável que vira API automaticamente : Nós podem ligar funções locais, Inference Providers, Space ou datasets.(Fonte: HuggingFace Blog)
Plugin Admin no ChatGPT Work/Codex : Uso, permissões de membros, quotas e pedidos de admin tratáveis na conversa.(Fonte: OpenAI)
Codex com WebMCP: sites expõem ferramentas diretamente ao agente : Descobrir capacidades, alterar modelos 3D, capturas multiângulo e devolver, sem depender só de cliques no DOM.(Fonte: )
Goodfire lança Silico: Agent de interpretabilidade para desmontar o raciocínio do modelo : Autoencoders esparsos e probes nas representações internas.(Fonte: IEEE Spectrum)
Google AgentHands: sincronizar gestos com o Agent conversacional em XR : O LLM gera gestos de apontar/indicar/alertar alinhados à fala.(Fonte: Google Research)
LangSmith Engine: deteção de problemas mais de 2× melhor no benchmark interno : Clustering e sugestões de correção mais precisos; SaaS/self-hosted e ligação a tickets.(Fonte: LangChain)
TrueForge runtime open-source de Agent: cerca de 40% menos tokens no mesmo modelo : Carregar ferramentas sob demanda, descarregar resultados grandes, subagentes e sandbox.(Fonte: GitHub)
Ollama v0.33: ligar Claude Desktop a modelos locais com um clique : Ligado, Cowork/Claude Code usam nuvem Ollama ou local; desligado, volta à Anthropic.(Fonte: ollama)
Open WebUI 0.11.1: rewrite em streaming + aprovação HITL de ferramentas : Respostas longas só enviam incrementos; cada chamada de ferramenta pode ser permitida/recusada. A atualização altera tabelas da BD.(Fonte: Reddit r/OpenWebUI)
Hermes liga de uma vez 44 MCP remotos selecionados : Inclui Canva, Dropbox, GitLab, etc., e reduz a superfície de ferramentas de alto risco.(Fonte: Teknium)
📚 Aprendizagem
ASI-Bench: o mesmo tema em quatro níveis sem guia de método, para ver se a IA faz ciência sozinha : Tsinghua e outros, 60 questões; média B1 cerca de 50,9, B3 cerca de 27,2; 62% das falhas em modelação e escolha de caminho.(Fonte: 机器之心)
Paper: cerca de 7,8× da diferença em rankings de Agent vem do harness, não do modelo : Três modelos × três scaffolds, 100 tarefas SWE-bench Verified; trocar o harness pode oscilar muito a pontuação ou inverter o ranking; propõem um Harness Card de sete camadas.(Fonte: dair_ai)
SWE Refactor Bench: taxa de sobrevivência de migração de repositório inteiro só cerca de 5,4% : 20 migrações reais, 520 execuções, só 28 passaram as três fases; corrigir bugs ≠ refatoração de sistema.(Fonte: Einsia)
Knowledge Triage: preservar regras de segurança na compressão : Após cinco rondas, retenção de regras pode cair de 53% para 10%; com triagem por tipo, recall em cinco rondas cerca de 96%.(Fonte: arXiv)
WebDev-Skills-Bench: injetar Skills públicas baixa a média e fica mais caro : Pass@2 desce 1,3–4,2%, tokens sobem 72–394%; regras de anti-padrão batem empilhar exemplos.(Fonte: arXiv)
Tsinghua: em 1338 pós-treinos reais, o Agent itera pouco e muda pouco de ideia : Depois de escolher a estratégia, mesmo com a curva a piorar raramente reverte o rumo; distinguir “saber iterar” de “saber refletir”.(Fonte: TheTuringPost)
QAH: compressão estrutural e depois 4bit; destilar o professor original de 120B pode superar o próprio BF16 : Multiverse comprime GPT-OSS para 60B e depois MXFP4; em 9 tarefas, 7 superam o BF16 restaurado.(Fonte: HuggingFace Blog)
VibeWorlding: conversa + ferramentas para montar sozinho mundos 3D interativos : HKUST(GZ) + Tencent open-source; após RL, VibeWorlder-30B-A3B Pass@1 cerca de 59,3%.(Fonte: 机器之心)
Apple STARFlow2: fluxos normalizadores entrelaçados na vertical com VLM congelado para geração multimodal unificada : Geração contínua, de um só passo e causal; texto e imagem partilham máscara causal e KV cache.(Fonte: Apple ML Research)
Framework MAP: condicionar em knowledge graph para o modelo unicelular prever em zero-shot resposta a fármacos não testados : Equipa da Jiaotong em Nature Machine Intelligence; correlação Top-50 DEG em fármacos não vistos sobe cerca de 12%.(Fonte: 机器之心)
Caltech usa operador neural iterativo para levar DFT de cúbico a quase linear : Operador neural de Fourier substitui o mapeamento direto mais caro e volta a entrar na iteração autoconsistente.(Fonte: 新智元)
💼 Negócios
Anthropic deverá apresentar a investidores TAM acima de 30 biliões de dólares e acelerar o IPO : O WSJ diz que empacota “todo o trabalho que a IA pode assumir”, acima da ordem de grandeza de cerca de 28,5 biliões da SpaceX; receita do Q2 duplicou para cerca de 11,6 mil milhões, meta de cerca de 190–200 mil milhões em 2028 e valuation cerca de 2 biliões. Observadores comparam com a receita anual conjunta de tech do S&P e questionam a inflação do perímetro.(Fonte: WSJ、THE DECODER)
Moonshot AI negoceia hosting do Kimi K3 nas três grandes clouds dos EUA com partilha até 30% : A Reuters diz conversas com Microsoft, Amazon e Google para Azure/AWS/GCP, a pedir até cerca de 30% da receita; o impasse está em split, acesso a dados e medição de tokens.(Fonte: THE DECODER)
Chris Malone, responsável de data centers da OpenAI, sai; funções divididas sem sucessor único : Sai após cerca de um ano e meio, em plena rampa do Stargate e do chip próprio, no meio de outras saídas de executivos.(Fonte: The Verge、TechCrunch)
🌟 Comunidade
CEO da Shopify ameaça banir Claude Code: não ler AGENTS.md cria cisão de regras num monorepo gigante : Tobi Lütke diz que com CLAUDE.md e AGENTS.md em paralelo não se mantém consistência só com soft links; a Anthropic diz que será mais flexível, mas famílias de modelos diferentes precisam de system prompts diferentes.(Fonte: 机器之心、InfoQ)
Ranking de especialistas OWASP vs. base de incidentes: prompt injection é 1.º mas 12.º nos acidentes : O scan não vê “instruções escondidas no conteúdo + credenciais legítimas a chamar ferramentas”; sugerem um portão de autorização fora do modelo.(Fonte: VentureBeat)
Conteúdo de animais fofos afogado em lixo de IA; fraudes de animais perdidos sobem de nível : Fotos falsas de “encontrámos” para pedir dinheiro; verificação nas plataformas ainda difícil de ligar por omissão.(Fonte: WIRED)
swyx: não uses ainda o «uso bloqueado» do Codex — trava o Keychain do macOS : Depende de uma peculiaridade instável do sistema; fóruns da Apple já marcam known bug.(Fonte: swyx)
Demo anónima de 10 minutos contínuos de tarefas domésticas: Unitree G1 e Zhiyuan A3 suspeitos de partilhar um cérebro : Equipa não identificada, não se exclui encenação; tratar como rumor, não conclusão.(Fonte: 量子位)
💡 Outros
McKinsey: IA empresarial “já na estrada do ROI”, mas o contributo para EBIT continua parado : De 1719 inquiridos, 37% relatam “algum” impacto em EBIT; só 6% de alto desempenho, igual ao ano passado.(Fonte: The Register)
Radiologia não foi substituída pela IA, mas tornou-se o campo de testes da IA médica : Cerca de três quartos dos dispositivos de IA da FDA são de imagem; a IA escreve mais rascunhos e marca urgências, muda o trabalho em vez de extinguir a profissão.(Fonte: Ars Technica)
Caso de governação de IA na sala de aula: trabalhos semáforo vermelho/amarelo/verde + formação de prompts genéricos para professores : Cheshire Academy, Connecticut, não se amarra a um único produto; feedback dirigido a alunos ainda não foi liberado por qualidade e privacidade.(Fonte: MIT Technology Review)