stamatios
← Voltar ao feed
Régua com espaçamentos irregulares mede bloco minúsculo ao lado de torre gigante, escala log distorce custo dos modelos de IA
IA & Modelos

Gráfico de inteligência x custo dos LLMs esconde abismo de preços

resumo de ~3 min

O gráfico da ArtificialAnalysis e suas distorções

Guido Imperiale, engenheiro de software da OpenTeams e mantenedor do Dask, critica o gráfico de inteligência versus custo da ArtificialAnalysis (AA), site que mede a inteligência de LLMs por meio de um Índice de Inteligência - a média de benchmarks selecionados - e também registra quanto custou rodar esses benchmarks em cada modelo, o que serve como indicador relativo do custo de uso. Um dos gráficos principais mostra a fronteira de Pareto: o modelo mais barato capaz de atingir cada nível de inteligência. O autor reconhece a utilidade dessa fronteira, já que usar um modelo caro e superinteligente em tarefas banais é desperdício de dinheiro, mas diz se irritar progressivamente com o gráfico por três razões.

A primeira é a escala logarítmica no eixo de custo. Ela é a única forma de distinguir um modelo de $0,015 por tarefa de outro de $0,032 no mesmo gráfico que contém um modelo de $3,69 - quase 250 vezes mais caro -, mas o efeito é que o espectador deixa de perceber a imensidão da diferença de preço entre modelos baratos e pesados, e também não nota quão inconsequentes são as diferenças entre os baratos.

A segunda é o uso do preço oficial das APIs dos próprios desenvolvedores. Para modelos de pesos abertos, isso pode ser muito mais caro do que alugar o mesmo modelo via provedores terceiros - o OpenRouter facilita trocar de provedor e obter sempre a oferta mais barata. A terceira é que modelos locais, que cabem em hardware de consumo, aparecem no gráfico com preços de datacenter, desproporcionalmente caros para a inteligência oferecida e que nenhum usuário real escolheria comprar assim.

Os gráficos alternativos

O autor produziu seus próprios gráficos, usando os escores de inteligência e custo da AA, com benchmarks no esforço máximo de raciocínio salvo indicação. Como referência de leitura: uma diferença de um ponto dificilmente é perceptível, enquanto cinco pontos é substancial. Ele observa que um escore de 50, o mínimo do primeiro gráfico, é aproximadamente o que o modelo mais inteligente do mundo entregava em fevereiro de 2026 (Opus 4.6).

Entre as mudanças: escala linear no eixo de custo, porque "o dinheiro das pessoas não é logarítmico"; preços via OpenRouter para Kimi K3, Qwen3.8 Max, DeepSeek V4 Flash 0731, GLM-5.3, GLM-5.3-Flash e Hy3 (excluindo provedores lentos, não confiáveis ou sem Zero Data Retention); extrapolação de pontos para GLM-5.3-Flash em esforço alto de raciocínio; substituição do preço de datacenter pelo custo local para modelos com menos de 35 bilhões de parâmetros; e inclusão do Ornith-1.5-35B-A3B, cujo escore vem de benchmarks auto-relatados pelos autores e deve ser visto com ceticismo.

Custo local e hardware

Para modelos marcados com ⚡, o custo por tarefa foi estimado via eletricidade: velocidade de decodificação medida em hardware local (majoritariamente uma RTX 3090 usada, de ~$1.400), diferença entre consumo de energia em pico e ocioso, eletricidade a $0,2049/kWh (média residencial dos EUA, maio de 2026) e acréscimo de 15% para tokens de entrada sem cache e esperas por chamadas de ferramentas. O hardware é precificado a zero, sob a premissa de que um PC com RTX 3090 ou um Strix Halo de 64 GB são máquinas desejáveis para jogos e trabalho. Acima de 64 GB de RAM, porém, omitir o hardware deixa de ser defensável: um Strix Halo de 128 GB custa $3.600 e não serve para quase nada além de modelos de ~120 bilhões de parâmetros. A tabela de hardware sobe até 2 TB de RAM ($320.000 com duas TensTorrent Galaxy Blackhole) para rodar Kimi K3.

Conclusão

Há uma diferença imensa de custo entre os modelos de ponta da Anthropic e da OpenAI - caros demais até para grandes corporações - e os modelos chineses, que podem custar o equivalente a uma assinatura de celular. O ganho de inteligência por dinheiro obe­dece retornos decrescentes: Fable 5.1 (escore 66, $3,69 por tarefa) pode ser apreciado por um engenheiro de elite frente ao GLM-5.3 (60, $0,49), mas a maioria terá dificuldade. O GLM-5.3-Flash (55, $0,023 - 160 vezes mais barato que Fable) falha em tarefas sofisticadas como desenvolver um projeto de código inteiro sozinho, mas basta para 90% do que as pessoas precisam. Já o Qwen3.8-27B (52, $0,015 de eletricidade) roda no computador que um entusiasta de jogos já possui.