A avaliadora independente Artificial Analysis divulgou em 9 de janeiro de 2026 a versão 4.0 do Intelligence Index, e o resultado desfaz a ideia de que existe um campeão isolado da inteligência artificial: GPT-5.2 marcou 50 pontos, Claude Opus 4.5 ficou com 49 e Gemini 3 Pro somou 48. Dois pontos separam o primeiro do terceiro — uma distância que a própria avaliadora trata como marginal, o chamado platô da fronteira.
Para quem usa essas ferramentas no trabalho, a notícia não é que tanto faz qual escolher. É o contrário: como o placar geral parou de diferenciar os modelos, a escolha passou a depender do que cada um faz melhor e do que o índice simplesmente não mede.
Quem faz a conta e o que os pontos significam
O Intelligence Index não é publicado por OpenAI, Anthropic ou Google, as empresas donas dos três modelos. Ele é produzido pela Artificial Analysis, uma avaliadora independente, que aplica uma bateria de testes padronizados a cada modelo e condensa os acertos em uma nota única.
Essa nota única é a origem do mal-entendido. Ela é uma média de desempenhos em provas, não um veredito sobre qual produto serve à sua operação. Um benchmark é exatamente isso: um conjunto fechado de tarefas com resposta conhecida, aplicado do mesmo jeito a todos os concorrentes. Ele mede o que está dentro da prova; nada do que ficou de fora entra no número.
Por que a versão 4.0 não se compara com a anterior
A Artificial Analysis não apenas recalculou as notas: redesenhou os critérios. Testes que os modelos já acertavam quase por completo foram retirados, porque prova em que todo mundo tira nota máxima deixa de separar os concorrentes. No lugar entraram desafios que expõem limitações reais.
A consequência prática importa para quem acompanha rankings: as notas de 50, 49 e 48 pertencem à régua nova, e compará-las com pontuações de versões anteriores do índice não diz nada. Nota mais baixa em teste mais duro não significa modelo pior.
Empate no índice, especialidades diferentes
Abaixo do placar agregado, os três seguem bem distintos:
- GPT-5.2 lidera em raciocínio abstrato complexo, com um modo de operação chamado xhigh, que permite ao modelo processar internamente por mais tempo antes de responder. Serve a análises longas, em que a primeira resposta raramente é a boa.
- Claude Opus 4.5 alcançou 80,9% no SWE-bench Verified, teste de engenharia de software descrito pela avaliadora como o mais rigoroso do gênero. A leitura do número é direta: essa é a fatia dos problemas do teste que o modelo resolveu.
- Gemini 3 Pro oferece janela de contexto de 1 milhão de tokens — cerca de 750 mil palavras — e processamento multimodal nativo. Token é o pedaço de texto que o modelo lê por vez; a janela de contexto é o quanto ele consegue manter em vista de uma só leitura. Multimodal nativo quer dizer que vídeo, áudio e documentos entram na mesma operação, sem conversão prévia.
São perfis que não se substituem: dois pontos de diferença no placar geral convivem com distâncias muito maiores dentro de uma tarefa específica.
Os dois testes novos e a verdade desconfortável
A versão 4.0 trouxe dois exames que explicam o desenho da régua nova.
O AA-Omniscience aplica 6 mil perguntas de domínios profissionais e inverte o incentivo habitual: penaliza alucinação — a resposta inventada apresentada como se fosse fato — e recompensa o modelo que admite não saber. Apenas Claude 4.5 e GPT-5.2 conseguiram pontuação positiva. A maioria dos modelos avaliados ainda prefere arriscar um palpite a reconhecer a incerteza, o que é justamente o comportamento mais caro para quem usa a ferramenta em decisão de trabalho.
O CritPt, desenvolvido por mais de 60 pesquisadores, simula desafios de pesquisa em nível de doutorado em física. Nenhum modelo superou 10%. O melhor deles, o Gemini 3 Pro, chegou a 9,1%. É a distância entre discutir um assunto com fluência e produzir conhecimento novo sobre ele.
O que o índice não mede
Antes de transformar 50, 49 e 48 em decisão de compra, vale saber o que ficou de fora da prova. O índice compara desempenho em testes. Ele não informa quanto cada modelo custa no volume que a sua operação consome, como ele se encaixa nos sistemas que a empresa já usa, quanta transparência oferece sobre o próprio raciocínio, nem quanta energia e capacidade computacional consome para entregar aquela resposta.
São quatro perguntas que nenhuma nota agregada responde — e que, segundo a leitura da avaliadora, tendem a definir a próxima disputa entre os fornecedores, já que ganho bruto de capacidade está ficando caro e marginal. Empate em índice, portanto, não é equivalência de produto.
O que fazer com essa informação
A recomendação é menos glamourosa que o ranking: em vez de perguntar qual inteligência artificial é a melhor, mapeie os casos de uso reais e teste qual modelo se sai melhor em cada um, com as suas tarefas e os seus dados. Grandes corporações já operam assim, com estratégias multi-modelo — um modelo para planejamento e análise de cenários, outro para desenvolvimento e manutenção de sistemas críticos, outro para volumes grandes de dados multimídia. A abordagem reduz custo e a dependência de um fornecedor único.
Vale olhar a pontuação por categoria, e não só o agregado: um modelo em segundo lugar no geral pode ser o melhor disponível para um uso específico. E há o limite que o CritPt deixa explícito nos 9,1%. Para o que exige raciocínio novo, e não recombinação do que já foi escrito, o julgamento humano continua sendo a parte que não dá para terceirizar.
Direto Notícias Imparcial, Transparente e Direto!

