Dados · 5 de outubro de 2026
Opus 5.5, Fable 5.1, GPT-6 e Grok: preços e velocidade de modelos de IA
Em 1º de setembro Anthropic lançou Claude Fable 5.1, e em 3 de setembro OpenAI apresentou GPT-6 Astra. Em seguida, outras empresas divulgaram seus modelos. Para entender esse fluxo, é preciso analisar as métricas de desempenho e custo. Os dados são de três tipos e não podem ser confundidos. A seguir, descreve-se o que cada fonte mede, onde há divergências e como transformar esses números em custo efetivo de execução, e não apenas em preço por token.
Primeiro, separar os números divulgados pelos fabricantes dos resultados de avaliações independentes. As tabelas das próprias empresas tendem a favorecer seus produtos. A escolha dos testes, o nível de raciocínio, a configuração da interface de entrada e verificação de respostas são ajustados para otimizar os resultados. Por exemplo, o Terminal-Bench 4.0 mostra 37,6 % para Grok 4.7 na xAI e 33 % na Artificial Analysis, indicando que comparações diretas nas tabelas corporativas são pouco confiáveis.
Avaliações independentes, como as da Artificial Analysis, aplicam as mesmas condições a todos os modelos. Seu índice consolidado combina dez testes em um único número, além de medições de velocidade de saída, tempo até o primeiro token, tokens gerados e preço da tarefa. Contudo, esse índice tem limitações, pois representa uma média que pode mascarar diferenças específicas da aplicação.
O terceiro tipo de comparação envolve análises diretas de veículos especializados e blogueiros, que executam um pequeno conjunto de tarefas (de duas a três) em diferentes modelos e medem tempo, custo em dólares e qualidade do resultado. Essa abordagem reflete melhor a prática real, mas a amostra costuma ser mínima, como um único teste de Tetris, o que impede generalizações estatísticas.
Um ponto crítico é a proliferação de resumos publicados em poucos minutos. Diferenças de até 15 pontos no índice da Artificial Analysis para um mesmo modelo podem aparecer, e preços anunciados, como o de GPT-6.1 Sol, podem não constar nos catálogos. Para evitar equívocos, recomenda‑se consultar fontes primárias: anúncios oficiais, tabelas de preços e páginas de modelos na plataforma de avaliação.
Em relação ao nível de raciocínio, as avaliações variam de low a max. Uma mesma modelo pode obter resultados muito diferentes dependendo da etapa selecionada. Por exemplo, o Opus 5.5 passa de 16 pontos no índice entre os níveis low e max, e o custo da tarefa pode ser 11 vezes maior no nível máximo. Assim, comparações justas devem ser feitas apenas no nível mais alto medido.
Segundo, transformar o preço listado em custo efetivo da tarefa. O preço listado refere‑se ao custo por palavra, enquanto o pagamento ocorre pelo resultado final da tarefa. O número de palavras necessárias varia bastante entre os modelos, e tokens de pensamento são cobrados à parte. A Artificial Analysis calcula o custo médio da tarefa em um nível de raciocínio específico, o que gera resultados inesperados.
O modelo mais caro em termos de custo por tarefa é o Sonnet 5.5, com US$ 7,67 no nível máximo. O Fable 5.1 registra US$ 7,63, e o Opus 5.5 chega a US$ 5,98. Em contrapartida, o preço por token do Sonnet é metade do Opus e um quarto do Fable. Isso se deve ao volume de tokens gerados: o Sonnet produz cerca de 420 milhões de tokens de saída por execução, enquanto a mediana da classe é de 81 milhões. O Opus gera 260 milhões e o Fable, 190 milhões.
O GPT-6 Astra tem custo de US$ 3,26 por tarefa quando o token é caro, sendo metade do Opus. O GPT-6.1 Sol tem 67 milhões de tokens por execução, índice de 52 pontos e custo de US$ 0,72 por tarefa, apresentando o melhor relacionamento qualidade‑preço entre os modelos acima de 50 pontos. O Grok 4.7 é cerca de cinco vezes mais barato que o Astra em termos de preço listado, mas sua tarefa custa US$ 3,74 devido ao maior número de tokens de saída (81 mil contra 36 mil do Grok 4.6).
Nas faixas de menor custo, o GPT-6 Luna oferece 38 pontos por US$ 0,07, o DeepSeek V4.1 Flash entrega 39 pontos por US$ 0,27 e o DeepSeek V4 Pro fornece 36 pontos por US$ 0,67. O modelo premium da DeepSeek costuma ser mais caro que o Flash, porém entrega desempenho inferior, o que o torna menos atraente após o recente aumento de preço.
Terceiro, validar o índice com testes de referência do setor. Em 3 de outubro, os melhores resultados da Artificial Analysis foram: Claude Opus 5.5-58 pontos (primeiro entre 224 modelos), Claude Sonnet 5.5-56 pontos, Claude Fable 5.1-53 pontos, GPT-6 Astra, 53 pontos, GPT-6.1 Sol, 52 pontos, Grok 4.7-46 pontos, DeepSeek V4.1 Flash, 39 pontos, GPT-6 Luna, 38 pontos e DeepSeek V4 Pro, 36 pontos. Os cinco primeiros lugares são dominados por duas empresas norte‑americanas, com diferença de apenas seis pontos entre elas. Essa proximidade supera a diferença observada entre os níveis low e medium de um mesmo modelo.
Quando se analisam métricas de agentes em ambientes de terminal (Terminal‑Bench 4.0), os resultados são: Sonnet 5.5-70,6 %, Opus 5.5-66,4 %, GPT-6 Astra, 57,9 %, Fable 5.1-55,8 %, Grok 4.7-37,6 % e Grok 4.6-20,3 %. Os resultados de GPT‑6.1 Sol, Luna e DeepSeek ainda não foram divulgados. Em OSWorld, o Opus 5.5 atinge 81,8 % e o Sonnet 5.5, 80,1 %. No AutomationBench, dados da OpenAI mostram que o GPT‑6.1 Sol supera o Opus 5.5 em 2,2 pontos percentuais. No benchmark científico Terminal‑Bench, o Astra lidera; no Harvey, o Grok 4.7 alcança 19,6 % contra 6,7 % do Fable 5.1.
Cada modelo possui nichos específicos, e os relatórios coincidem nas conclusões: tarefas extensas de programação favorecem o Claude, enquanto o melhor custo‑benefício entre os modelos acima de 50 pontos está com o GPT‑6.1 Sol. O Grok 4.7 mostra crescimento, mas ainda não alcança os líderes. O DeepSeek se destaca entre os modelos de código aberto, embora seus resultados independentes sejam inferiores aos relatórios internos da própria empresa.
Para evitar divergências, recomenda‑se calcular o custo da tarefa a partir do consumo de tokens, verificar sempre o nível de raciocínio utilizado e confirmar os valores em fontes primárias. Limitações persistem: o índice consolidado pode suavizar diferenças de nicho, comparações diretas dependem de pequenas amostras e, em alguns casos, medições em níveis específicos ainda não estão disponíveis.
Em conclusão, a escolha de um modelo deve priorizar o preço efetivo da tarefa resolvida, o nível de raciocínio empregado e a verificação de dados originais, garantindo decisões informadas em um cenário de rápida evolução na inteligência artificial.