🔥 Destaques
Xinzhi Embodied lança série de modelos N0 e conjunto de dados NeoData em parceria com a Universidade de Fudan : A Xinzhi Embodied e a Universidade de Fudan lançaram conjuntamente a série de modelos de inteligência incorporada (embodied AI) N0 e o conjunto de dados NeoData. O NeoData contém mais de 30.000 horas de dados de interação visual-tátil, e o modelo de representação unificada NeoForce resolve o desafio de fusão de dados de diferentes sensores táteis. O N0-VTLA melhora a taxa de sucesso das operações ao prever a evolução tátil dos próximos 50 passos, enquanto o N0-TWAM introduz a previsão tátil no modelo de mundo (world model), impulsionando a evolução da inteligência incorporada de “orientada por visão” para a “fusão visão-tátil”. (Fonte: Liangziwei)

Induction Labs lança modelo Photon-1 : A Induction Labs lançou o modelo Photon-1, um modelo de mistura esparsa de especialistas (MoE) de 106B-A5B. Sua inovação reside no pré-treinamento por meio de vídeos sem anotação de ações para aprender políticas implícitas. O Photon-1 superou o Gemini 3.1 Flash-Lite em benchmarks de uso de computador, com uma redução significativa no consumo de poder computacional de pré-treinamento e uma redução de cerca de 3 vezes nos custos de inferência. Mesmo tendo aprendido apenas com vídeos de desktop, o Photon-1 ajustado (fine-tuned) ainda apresentou excelente desempenho em damas e simulações físicas de bilhar. (Fonte: MarkTechPost)
Equipe KwaiKAT lança KAT-Coder-V2.5 : A equipe KwaiKAT da Kuaishou lançou o KAT-Coder-V2.5, um modelo de programação de agentes treinado em repositórios de código executáveis reais. A equipe construiu automaticamente mais de 100.000 ambientes de repositórios verificáveis via AutoBuilder e utilizou um mecanismo de filtragem baseado em processos e o algoritmo assimétrico AFT-PPO para aprendizado por reforço. O KAT-Coder-V2.5 lidera no PinchBench com uma pontuação alta de 94,9, demonstrando o caminho para melhorar o desempenho de agentes de programação de longo prazo através da otimização da infraestrutura de sandbox e do design de algoritmos. (Fonte: MarkTechPost)
Base visual de documentos MonkeyOCRv2 é disponibilizada em código aberto : Equipes da Universidade de Ciência e Tecnologia de Huazhong e outras instituições disponibilizaram em código aberto o MonkeyOCRv2, modelo que introduz o objetivo de pré-treinamento de “reconstrução como memória visual de documentos”. Em experimentos controlados mantendo o modelo de linguagem de backend Qwen3-1.7B congelado, o MonkeyOCRv2 superou o grupo de controle mais forte em 13,2 pontos em 8 benchmarks de compreensão de documentos. Ao mesmo tempo, a equipe disponibilizó em código aberto o conjunto de dados MonkeyDoc v2, contendo 113 milhões de imagens, fornecendo à comunidade um campo de testes unificado para pré-treinamento visual de documentos e impulsionando a evolução da IA de documentos do preenchimento semântico para a fidelidade visual. (Fonte: JiQizhixin)
.jpg)
Valkor, em parceria com a Universidade de Zhejiang e outros, lança o Loom, um framework de código aberto para gerenciamento de estado de agentes : Visando resolver os pontos problemáticos em que agentes de programação de IA facilmente caem em “buracos negros de depuração” e “amnésia local” em tarefas longas, a Valkor, em parceria com a Universidade de Zhejiang e a equipe da UCL, lançou o framework de código aberto Loom. O Loom divide tarefas complexas de entrega de software em cadeias de estados estruturadas que podem ser restauradas a qualquer momento. Quando um teste falha, o Loom o captura como um estado de tarefa pendente (to-do) independente do histórico do chat, permitindo que os desenvolvedores alternem perfeitamente entre modelos ou agentes para continuar a tarefa, fornecendo uma infraestrutura de estado crucial para a programação de IA em ambientes de produção sérios. (Fonte: JiQizhixin)
.jpg)
🎯 Tendências
Sakana AI lança modelo de roteamento de segurança cibernética Fugu-Cyber : A Sakana AI lançou o Fugu-Cyber, um modelo de roteamento dedicado à segurança cibernética em seu orquestrador Fugu. O modelo alcançou uma taxa de sucesso de 86,9% no CyberGym e 72,1% no CTI-REALM, competindo com modelos de ponta como o GPT-5.5-Cyber. Através dos frameworks TRINITY e Conductor, o Fugu-Cyber coordena dinamicamente subagentes de múltiplos domínios de segurança para validação de vulnerabilidades e geração de regras de detecção, adotando um modelo de precificação em camadas baseado em pagamento por Token. (Fonte: MarkTechPost)
Open Dreamer disponibiliza em código aberto a implementação em JAX do modelo de mundo Dreamer 4 : A equipe de pesquisa independente Reactor disponibilizou em código aberto o Open Dreamer, uma reprodução do pipeline do modelo de mundo Dreamer 4 baseada em JAX e Flax NNX. O modelo inclui um tokenizador de vídeo Masked Autoencoder que dispensa perdas adversariais, além de um modelo de dinâmica de atenção espaço-temporal de 1,6B de parâmetros sem anotação de ações. A equipe publicou a receita completa de treinamento e compartilhou detalhes de engenharia de estabilidade, como a otimização de memória de vídeo em GPUs B200 e a resolução de desvios do otimizador Muon, servindo como uma referência valiosa para a reprodução de modelos de mundo. (Fonte: MarkTechPost)
InclusionAI lança Ling-3.0-flash no OpenRouter : O Ling-3.0-flash, um modelo MoE leve focado na execução de fluxos de trabalho de agentes, foi lançado como API no OpenRouter. O modelo possui um total de 124B de parâmetros, com 5,1B de parâmetros ativos, suporta contexto de 256K e tem um TTFT inferior a 100ms. Posicionado como um nó de execução rápida e de baixo custo para trabalhar em conjunto com grandes planejadores, o modelo foi otimizado para chamadas de ferramentas de longo alcance e acompanhamento de instruções, oferecendo um modo de inferência híbrido alternável. (Fonte: Reddit)

Lançada versão Abliterated do modelo GLM-5.2 : A comunidade lançou o grande modelo GLM-5.2 que passou por processo de “desrecusa” (Abliterated) e ajuste fino. O modelo removeu as direções de recusa de segurança e passou por ajustes finos direcionados para tarefas adversariais de longo alcance e de agentes, evitando que o modelo desista sem motivo ao lidar com tarefas técnicas ou sensíveis. Avaliações mostram que ele apresenta excelente desempenho em benchmarks de segurança e código como CyberGym e AgentHarm, não retendo dados por padrão, com regras totalmente definidas pelo usuário por meio de prompts do sistema. (Fonte: Reddit)

🧰 Ferramentas
Llama.cpp mescla suporte nativo ao MCP : O PR liderado pelo desenvolvedor ngxson foi mesclado com sucesso ao llama.cpp, permitindo que sua WebUI e ferramentas de linha de comando suportem nativamente o Model Context Protocol (MCP). Os usuários agora podem configurar e chamar vários servidores MCP (como o assistente de código Serena) diretamente em clientes locais, sem a necessidade de intermediários externos. Isso possibilita o desenvolvimento e a depuração de agentes de forma totalmente local e sem dependências, reduzindo significativamente a barreira para a construção de ecossistemas de agentes com modelos de código aberto locais. (Fonte: Reddit)
Framework de agentes no dispositivo Open Minis é disponibilizado em código aberto : O desenvolvedor Ethan Wang anunciou a abertura do código do Open Minis, um aplicativo de agentes de IA que roda localmente em dispositivos móveis. Ele suporta sistemas iOS e Android, integrando Linux Shell local, automação de navegador, habilidades (Skills) expansíveis e memória persistente. Ao carregar as meta-informações das Skills nos prompts do sistema e combiná-las com Prompt Caching, o modelo consegue selecionar e executar ferramentas de forma coerente em uma única rodada de conversa, fornecendo uma referência leve para o desenvolvimento de agentes no dispositivo. (Fonte: X)
Aethos_Memory resolve o problema de esquecimento de agentes entre sessões : Visando resolver a dor de cabeça dos assistentes de codificação de IA que não conseguem compartilhar contexto entre diferentes sessões, desenvolvedores disponibilizaram em código aberto a ferramenta Aethos_Memory. A ferramenta fornece uma camada de memória persistente para os agentes, capaz de extrair e armazenar automaticamente decisões importantes, arquitetura de bases de código e registros de correção de bugs das sessões. Ao iniciar uma nova sessão, o agente pode ler diretamente a memória estruturada, evitando a tarefa tediosa de copiar e colar históricos manualmente. (Fonte: Reddit)

Runway lança ferramenta de roteamento de mídia Media Router : A plataforma de geração de vídeo Runway lançou o Media Router, a primeira ferramenta de roteamento otimizada por preferências para mídia generativa. Equipes corporativas que executam pipelines de produção contendo múltiplos modelos de vídeo, imagem e áudio não precisam mais selecionar manualmente um modelo para cada solicitação. Basta definir as preferências de custo, qualidade ou latência uma vez no Router, e o sistema de roteamento distribuirá automaticamente as solicitações de Token, alcançando o equilíbrio ideal entre custo e desempenho. (Fonte: X)
📚 Aprendizado
Lançada a ferramenta TileLang para design e otimização de kernels de GPU : Este artigo apresenta a TileLang, uma ferramenta DSL baseada em TVM para design de kernels de GPU. O tutorial fornece código Python completo, demonstrando como projetar kernels como adição de vetores, multiplicação de matrizes Tensor Core, Softmax fundido, FlashAttention, entre outros. Através do compartilhamento de memória Tile e do particionamento de registradores da TileLang, o compilador pode processar automaticamente o mapeamento e a sincronização de threads, além de suportar a busca pela configuração de hardware ideal sob um orçamento fixo de GPU via @tilelang.autotune. (Fonte: MarkTechPost)
Publicado tutorial sobre FAIRChem v2 e potencial de simulação atomística UMA : O tutorial detalha o uso do framework FAIRChem v2 da Meta e do potencial interatômico de aprendizado de máquina universal (MLIP) UMA. O conteúdo abrange como obter pesos de modelos restritos (gated) via Hugging Face e configurar calculadoras no ASE (Atomic Simulation Environment), realizando fluxos de trabalho de química computacional como previsão de energia de ponto único, otimização de geometria molecular, comparação de estados de spin, estimativa de energia de reação, relaxamento de rede cristalina, ajuste de equações de estado e simulações de dinâmica molecular. (Fonte: MarkTechPost)
Relative Representation resolve o alinhamento de espaços vetoriais de LLMs heterogêneos : A comunidade compartilhou uma técnica geométrica que utiliza o método de representação relativa (Relative Representation Method) e a ortogonalização simétrica de Lowdin para alinhar diferentes espaços de incorporação (embedding) de LLMs (como o uso misto de Llama, Mistral e Phi). O método dispensa o ajuste fino; ao introduzir âncoras de referência dentro de um domínio semântico específico e realizar a padronização Z-score por coluna, ele mapeia vetores de diferentes dimensões para um espaço comum unificado, resolvendo os problemas de cones anisotrópicos e incompatibilidade dimensional no roteamento de múltiplos agentes. (Fonte: Reddit)

Esquema desenhado à mão da derivação e do processo de cálculo da U-Net : O acadêmico de visão computacional Prof. Tom Yeh publicou um diagrama de cálculo desenhado à mão da rede U-Net. O tutorial demonstra, em 17 etapas, como uma imagem contendo três canais R, G e B é comprimida através de convolução e max pooling até um Bottleneck de 2×4, e depois restaurada gradualmente ao tamanho original através de convolução transposta e conexões de salto (Skip Connection), exibindo os princípios matemáticos dessa estrutura central de modelos de difusão por meio de um fluxo intuitivo de multiplicação de matrizes. (Fonte: X)
💼 Negócios
Stripe planeja adquirir a OpenRouter por US$ 10 bilhões : A gigante de pagamentos Stripe está em negociações de aquisição de peso com a OpenRouter, uma plataforma agregadora de modelos de IA, com uma avaliação que chega a US$ 10 bilhões, um salto de quase 8 vezes em relação aos 1,3 bilhão de dois meses atrás. À medida que as empresas tendem a usar múltiplos modelos para mitigar riscos, o tráfego e o valor estratégico da OpenRouter tornam-se evidentes. A Stripe, que tem lucrado silenciosamente na era da IA com uma única linha de código de pagamento e já havia adquirido a Metronome, estenderá seus negócios de pagamentos para a infraestrutura básica do ecossistema de IA com esta aquisição. (Fonte: JiQizhixin)
.jpg)
Moushen Intelligent conclui rodada adicional de financiamento Pre-A de quase 100 milhões de yuans : A empresa de cérebros incorporados no dispositivo “Moushen Intelligent” anunciou a conclusão de uma rodada adicional de financiamento Pre-A de quase 100 milhões de yuans, com a rodada Pre-A+ de quase 500 milhões de yuans também em fase de liquidação, aumentando sua avaliação em mais de 10 vezes em meio ano. Fundada pelo professor Chen Tao da Universidade de Fudan e pelo ex-cientista da Intel Zhang Yimin, seu modelo de ação de mundo integrado espaço-temporal STI-WM reduz a necessidade de dados de máquinas reais em 90% ao tokenizar ações, alcançando adaptação no dispositivo de custo ultra-baixo em chips domésticos como HiSilicon e Horizon Robotics. (Fonte: 36kr)

Empresa de robótica cirúrgica Vicarious Surgical entra em liquidação e falência : A Vicarious Surgical, unicórnio de robôs cirúrgicos que já recebeu investimentos de Bill Gates, Jerry Yang e outros, teve suas operações encerradas e liquidação de falência aprovada por votação dos acionistas devido a graves atrasos no desenvolvimento e quebra da cadeia de financiamento. A empresa acumulou mais de 2 bilhões de yuans em financiamento, mas sua solução agressiva de acionamento desacoplado e o conceito de controle por VR falharam na aprovação da FDA e na produção em massa, servindo como um alerta para o setor de inteligência incorporada, que atualmente possui avaliações elevadas, mas enfrenta dificuldades na viabilização comercial. (Fonte: 36kr)

🌟 Comunidade
Assistentes de programação de IA provocam reestruturação dos métodos de avaliação na educação de CS : Uma pesquisa da Association for Computing Machinery (ACM) com mais de 700 educadores de ciência da computação em 49 países revelou que 69% dos professores acreditam que a IA mudou as habilidades necessárias para o desenvolvimento de software, e 64% mudaram o foco do ensino de “escrever código do zero” para a compreensão e depuração de código. Para lidar com a cola e a dependência excessiva geradas pela IA, 68% dos professores ajustaram seus métodos de avaliação, adicionando exames presenciais sem consulta, defesas orais e etapas de defesa de código para redefinir a avaliação de habilidades de programação na era da IA. (Fonte: THE DECODER)

Links de conversas compartilhadas do Claude indexados pelo Google geram preocupações com privacidade : A comunidade descobriu que conversas e Artifacts compartilhados por usuários através da opção “criar link público” no Claude estão sendo indexados publicamente por mecanismos de busca como o Google, surgindo inclusive sites de terceiros dedicados a raspar esses links. Os vazamentos incluem chaves privadas de criptomoedas, segredos corporativos e privacidade médica pessoal. Os usuários criticam a Anthropic por não adicionar a meta tag noindex nas páginas de compartilhamento, o que consideram um erro básico de design de segurança, e pedem que os usuários limpem suas conversas compartilhadas nas configurações o quanto antes. (Fonte: Reddit)

Vale do Silício vê febre de workshops de alfabetização digital reversa “Avoiding AI” : À medida que as gigantes da tecnologia forçam a IA em todos os tipos de dispositivos, os workshops presenciais “Avoiding AI” (Evitando a IA) iniciados por bibliotecas em várias partes dos EUA viralizaram nas redes sociais. Bibliotecários ensinam passo a passo os cidadãos a desativarem completamente IAs integradas ao sistema, como Apple Intelligence e Gemini, e compartilham extensões de navegador para bloquear os resumos de IA da pesquisa do Google. Os cidadãos aproveitam a oportunidade para expressar preocupações com o monopólio das Big Techs, invasão de privacidade e consumo de energia dos data centers, clamando por autonomia tecnológica. (Fonte: TechCrunch)

Secretário de Comércio Lutnick manifesta apoio à IA de código aberto para conter a China : A comunidade debateu calorosamente as declarações do Secretário de Comércio dos EUA, Howard Lutnick, no jantar de correspondentes da Casa Branca, onde ele afirmou diretamente que “esta Casa Branca protegerá a IA de código aberto”. Anteriormente, a APEC assinou uma declaração de apoio à IA de código aberto, e o governo dos EUA está discutindo a substituição de bloqueios generalizados por proibições direcionadas a modelos específicos, ajudando o ecossistema de código aberto dos EUA a alcançar rapidamente a fronteira do código fechado por meio de “forks” e “ajustes finos” sob restrições de poder computacional, garantindo a liderança tecnológica do país. (Fonte: X)
Andrej Karpathy altera biografia pessoal e levanta especulações sobre demissão : O renomado pesquisador de IA Andrej Karpathy removeu a palavra “Anthropic” da biografia de sua conta em rede social, gerando ampla especulação na comunidade sobre sua possível saída. Alguns boatos sugerem que ele decidiu sair porque sua cidadania não americana o impedia de acessar os modelos mais avançados da empresa devido a restrições de exportação, embora outros internautas apontem que a alteração na biografia já ocorreu há vários dias. Como a Anthropic não assinou recentemente a carta aberta sobre código aberto promovida por Jensen Huang, suas estratégias comerciais e regulatórias conservadoras vêm enfrentando certa reação negativa da comunidade. (Fonte: JiQizhixin)
.jpg)
DeepSeek suspende segunda rodada de financiamento após vazamento de ata de reunião com investidores : Uma ata de reunião amplamente divulgada nas redes sociais sobre a conversa do fundador da DeepSeek, Liang Wenfeng, com investidores levou a DeepSeek a notificar urgentemente potenciais investidores sobre a suspensão temporária de sua segunda rodada de financiamento. A transcrição vazada envolve declarações sensíveis da DeepSeek sobre a lacuna de poder computacional entre a China e os EUA, estratégias de preços de Tokens e modelos de negócios de código aberto. A comunidade iniciou discussões sobre ajustes finos e implantação do modelo de “fábrica de Tokens” da DeepSeek, que reduz os custos de inferência a um terço dos concorrentes ocidentais por meio de otimização de engenharia. (Fonte: Hacker News)
💡 Outros
ChatGPT ajuda usuário a descobrir infecção por AtomicStealer no MacBook : Um usuário de Mac, ao tentar otimizar a memória de execução de um grande modelo local, usou o ChatGPT para analisar os processos do sistema e descobriu acidentalmente dois arquivos LaunchDaemon disfarçados de serviços do sistema que apontavam para scripts ocultos na Library. O ChatGPT imediatamente alertou que se tratava de malware, ajudando o usuário a localizar o cavalo de Troia de roubo de informações OSX.AtomicStealer, contraído após a instalação de uma biblioteca PDF de código aberto contaminada, demonstrando o papel inesperado da IA na proteção de segurança de dispositivos cotidianos. (Fonte: Reddit)

Decoy Font usa diferenças visuais para enganar IAs multimodais : O estúdio de design Mixfont lançou a “Decoy Font” (fonte de isca). Ao sobrepor caracteres de interferência desenhados com linhas finas sobre letras normais, a fonte faz com que IAs multimodais com capacidades visuais, como ChatGPT e Claude, leiam apenas textos incorretos (como “Sorry Robot”) durante o reconhecimento OCR, enquanto o olho humano, a uma certa distância, ainda consegue ler o texto real normalmente (como “Happy Human”), tornando-se uma nova tecnologia de nível físico contra raspagem de dados e exemplos adversariais para IA. (Fonte: Reddit)

Plano de escola de ensino médio de Nova York de introduzir robôs humanoides gera protestos de professores : Uma escola pública de ensino médio em Nova York planeja introduzir robôs humanoides no prédio escolar para auxiliar no ensino, medida que enfrentou forte oposição do sindicato dos professores. Os educadores argumentam que, em um cenário de orçamentos educacionais apertados e perda de professores, os altos custos de aquisição e manutenção de robôs humanoides representam uma alocação incorreta de recursos, e que os robôs não podem substituir o papel central dos professores humanos na comunicação emocional e orientação personalizada, defendendo que a entrada da tecnologia nas escolas deve manter limites claros. (Fonte: Reddit)
