stamatios
← Voltar ao feed
Suporta self-host de inferência de IA? Depende do volume e dos dados
IA & Modelos · Dev & Engenharia

Suporta self-host de inferência de IA? Depende do volume e dos dados

resumo de ~3 min

As três formas de rodar um modelo

O artigo apresenta três opções para servir inferência de IA:

  • API hospedada (OpenAI, Anthropic etc.): você paga por token, não gerencia infraestrutura e tem acesso aos modelos mais avançados. É a opção mais barata abaixo de ~1 milhão de tokens/dia.
  • Deploy gerenciado: um provedor roda GPUs dentro da sua própria tenancy na nuvem. Os dados ficam sob seu controle, mas você não precisa contratar equipe de MLOps. Um H100 dedicado custa cerca de US$ 4/hora.
  • Self-hosting completo: seus pesos, suas GPUs, seu motor de serving. Nada sai da sua rede, mas você assume todos os custos de hardware, energia e pessoal.

O ponto de virada: volume e soberania de dados

A decisão segue uma ordem de veto:

  1. Soberania: se os dados não podem sair da rede por exigência legal, a API está fora de questão.
  2. Pessoas: sem equipe de MLOps, o deploy gerenciado é a alternativa; com equipe, o self-hosting completo se torna viável.
  3. Volume: acima de ~2 milhões de tokens/dia, hardware próprio começa a compensar. Abaixo de 1 milhão, a API ganha em custo. Acima de 10 milhões/dia, o hardware se paga em 6 a 12 meses.
  4. Acesso ao modelo: modelos frontier (GPT-5, Claude Opus) são fechados e só via API. Qualquer workload que exija esse nível de raciocínio precisa sair para fora.

O custo oculto: pessoas

Um engenheiro de MLOps custa em média ~US$ 160 mil/ano, muito mais que o hardware que ele mantém. Esse é o item de orçamento que a maioria dos times esquece ao calcular o custo total de self-hosting.

A arquitetura híbrida como resposta prática

A maioria dos times acaba em um modelo híbrido: modelos locais cuidam do trabalho sensível e de alto volume (classificação, extração de dados, processamento de documentos), enquanto a API frontier é acionada apenas para tarefas pontuais que exigem raciocínio avançado. Times que adotam esse padrão relatam economia de 40% a 70% em relação ao uso exclusivo de API.

Limites do self-hosting

  • Um modelo de 70B parâmetros precisa de 35-40 GB de VRAM a 4-bit; se não couber na GPU, a geração cai 10 a 100 vezes ao ir para CPU.
  • Uma GPU high-end consome 450-575W sob carga (~US$ 50-65/mês por placa).
  • Um setup de serving ingênuo atende poucos usuários; motores como vLLM são necessários para batching em produção.
  • Se o workload pode ser atendido por um modelo leve e barato via API (ex: gpt-5.4-nano), o self-hosting nunca se paga.

Conclusão do autor

Self-hosting é comprar controle, e controle tem custo. A decisão deve ser tomada com base em volume e soberania de dados, deixando a matemática de tokens dar a palavra final.