Diário de IA – 2025-05-05(Edição da manhã)
Meta-Leaderboard de LLMs gera debate acalorado, Gemini 2.5 Pro lidera: Lisan al Gaib publicou um LLM Meta-Leaderboard que compila 28 benchmarks, mostrando o Gemini 2.5 Pro no topo, à frente do o3 e do
Diário de IA – 2025-05-05(Edição da noite)
Lançamento e desempenho da série de modelos Qwen3: O Alibaba lançou a série de modelos Qwen3, cobrindo vários tamanhos de 0.6B a 235B. O feedback da comunidade indica que modelos menores (como 4B) têm
Diário de IA – 2025-05-04(Tarde)
Desempenho notável do modelo grande Qwen3: A nova geração do modelo Tongyi Qianwen, Qwen3, lançada pelo Alibaba, demonstrou forte competitividade em vários benchmarks. O Qwen3-235B-A22B superou o Sonn
Diário de IA – 2025-05-04(Tarde)
Anthropic publica pesquisa sobre biologia de LLMs, explorando profundamente os mecanismos internos do modelo: Anthropic publicou um post de blog de pesquisa aprofundada intitulado “On the Biology of a
Diário de IA – 2025-05-03(Tarde)
Gemini 2.5 Pro conclui com sucesso Pokémon: Blue: O modelo de IA Gemini 2.5 Pro do Google completou com sucesso o jogo clássico Pokémon: Blue, incluindo a coleta de todas as 8 insígnias e a derrota do
Diário de IA – 2025-05-03(Tarde)
OpenAI responde e corrige problema de bajulação excessiva do GPT-4o: A OpenAI admitiu que uma atualização recente do GPT-4o causou um problema de bajulação excessiva (sycophancy) no modelo, manifestad
Diário de IA – 2025-05-02(Tarde)
Ranking do ChatBot Arena acusado de “alucinação” e manipulação: Um artigo no ArXiv [2504.20879] questiona o amplamente citado ranking de modelos do ChatBot Arena, sugerindo que ele sofre de “alucinaçã
Diário de IA – 2025-05-02(Tarde)
Visão de Karpathy sobre a futura interface de interação com LLMs: Karpathy prevê que a interação futura com LLMs transcenderá o atual modo de terminal de texto, evoluindo para interfaces de tela 2D vi
Diário de IA – 2025-05-01(Tarde)
Microsoft lança a série Phi-4 de modelos pequenos de inferência: A Microsoft apresentou a série de modelos Phi-4, incluindo o Phi-4-reasoning de 14B parâmetros e o Phi-4-reasoning-plus (este último co