
Ferramentas de compressão de tokens podem aumentar custos de IA
Tese e método
Um estudo da PointFive sobre 2.908 sessões pagas do Claude Code conclui que reduzir a quantidade de tokens não necessariamente reduz o custo. Nas ferramentas testadas, quanto mais agressiva foi a compressão, maior foi a despesa por tarefa concluída. A pesquisa comparou o Claude Code sem alterações com três ferramentas, em 103 tarefas, sete repositórios e três modelos. Os custos foram calculados a partir das cobranças do provedor, e o plano de medição foi definido antes da execução para evitar a seleção de resultados favoráveis.
O RTK, de código aberto, removeu apenas 1,3% dos tokens e foi o único a não encarecer os agentes: registrou economia de 2,9% por tarefa concluída, mas sem significância estatística. O RTK-ML, versão experimental da PointFive, removeu 38,4% do texto e elevou o custo em 6,8%. Já o Headroom, ferramenta de terceiros cuja redução não pôde ser medida por operar na fronteira da API, aumentou a despesa em 46,4% e foi o pior resultado em todos os modelos testados; no Opus 4.8, ficou 67% acima da linha de base.
Por que a conta aumenta
Segundo a decomposição apresentada, 74,7% do custo vêm das instruções do framework e das definições de ferramentas, reenviadas a cada turno, enquanto 19,4% correspondem ao raciocínio oculto do modelo. Apenas 6% são potencialmente acessíveis às ferramentas de compressão: saídas de ferramentas (3,3%), argumentos de chamadas (1,4%), arquivos recuperados (0,8%) e prompts e conversas (0,5%). Assim, 94% do custo estaria fora do alcance desses otimizadores, e o teto prático estimado para a compressão atual seria de aproximadamente 5%.
A pesquisa afirma que remover contexto pode alterar o comportamento do agente. Ao perder informações, ele pode fazer mais turnos para reencontrá-las; como o histórico inteiro é reenviado a cada turno, a economia inicial pode ser anulada. A quantidade de texto removido teve correlação próxima de zero e instável com o custo final, indicando que a contagem de tokens, isoladamente, não prevê a despesa por tarefa concluída.
Efeitos sobre o desempenho
Em tarefas médias de engenharia, os testes não observaram degradação de qualidade com as ferramentas. Em um teste de estresse com 40 desafios de depuração do benchmark SWE, porém, a taxa de aplicação correta de patches caiu de 27 para 15 quando houve compressão. O estudo explica que certas alterações exigem reproduzir trechos de código exatamente; se a compressão modifica essas âncoras, o agente pode não conseguir aplicar o patch.
A PointFive ressalva que a pesquisa foi produzida pela própria empresa, que testou seu compressor aberto e sua versão experimental e usa os resultados no desenvolvimento de um produto de otimização de tokens. Também afirma que os cenários representam tarefas reais de engenharia simuladas e que outros usos podem apresentar resultados diferentes. Em contextos de pesquisa intensiva, a parcela acessível poderia superar 6%, elevando o potencial de economia de cerca de 5% para perto de 30%.
A conclusão é que fornecedores devem ser avaliados pelo custo cobrado por tarefa bem-sucedida, e não apenas pela proporção de tokens removidos. A PointFive recomenda verificar mudanças no comportamento do agente, tratamento de conteúdo que precisa permanecer literal, dados brutos por execução e recursos de governança, como políticas, orçamentos e visibilidade por equipe.