stamatios
← Voltar ao feed
Custo de tokens caiu 95%, mas gasto corporativo com LLMs dobrou
IA & Modelos

Custo de tokens caiu 95%, mas gasto corporativo com LLMs dobrou

resumo de ~3 min

O paradoxo: tokens mais baratos, contas maiores

O preço por token caiu mais de 95% em três anos - de $30 por milhão de tokens de entrada no GPT-4 (março de 2023) para menos de $0,50 por qualidade equivalente hoje. Ainda assim, o gasto corporativo com LLMs mais que dobrou em seis meses, passando de $3,5 bilhões no final de 2024 para $8,4 bilhões em meados de 2025 (dados da Menlo Research). A explicação é o efeito Jevons: quando o custo unitário cai, o volume de uso sobe muito mais rápido.

Google é o exemplo mais claro: passou de 9,7 trilhões de tokens processados por mês para mais de 3,2 quatrilhões em dois anos - um salto de ~330x.

Por que margens de IA são menores que SaaS

No SaaS tradicional, o custo marginal de servir mais um usuário é quase zero, o que sustenta margens brutas de 80-90%. Em produtos de IA, cada chamada consome tokens - um custo variável que cresce linearmente com o uso. A Bessemer estima margens brutas de produtos AI-native entre 50% e 60%; a ICONIQ, em pesquisa com ~300 empresas, encontrou média de 52% (contra 41% dois anos antes). A tendência é de melhora à medida que o preço dos tokens cai, mas o modelo de cobrança por assento (per-seat) não consegue cobrir custos variáveis por chamada.

Quatro hábitos que inflam a conta

  1. Enviar tarefas triviais ao modelo principal, que pode custar até 50x mais que um modelo menor capaz de resolver o mesmo.
  2. Agentes sem limite de orçamento - um sistema com quatro agentes ficou em loop por 11 dias e queimou $47.000 antes de ser detectado.
  3. Contexto inflado, reenviado a cada passo, fazendo o custo crescer quadraticamente.
  4. Ausência de cache - com cache ativado, entradas repetidas podem custar até 90% menos.

Como proteger margens

  • Visibilidade: etiquetar cada chamada por equipe e feature, tratando tokens como COGS real.
  • Roteamento inteligente: direcionar cada chamada ao menor modelo adequado corta de 40% a 85% do gasto (a Coinbase quase reduziu pela metade sua conta assim).
  • Cache agressivo.
  • Limites rígidos (hard caps) que param agentes, não apenas alertas.
  • Reduzir contexto: limitar histórico, resumir turnos antigos.
  • Reprecificar pelo resultado: transferir o custo variável ao cliente. Salesforce Agentforce cobra por ação; Intercom Fin cobra $0,99 por resolução; GitHub Copilot migrou para créditos por uso.