
Ramp Router: roteador de LLMs com Thompson sampling economiza 30%
O problema: roteamento estático desperdiça dinheiro
A Ramp opera um gateway interno de LLMs que processa trilhões de tokens por dia, servindo tanto produtos internos quanto externos. A observação inicial veio do CTO da empresa, Rahul, ao notar que o tier "flex" da OpenAI nem sempre apresentava latência maior que o tier padrão - contrariando a suposição anterior. Um cliente (Mercana) confirmou que fora do horário comercial os tiers eram equivalentes, mas durante o expediente (9h-17h) o flex degradava rapidamente. Como os padrões não eram óbvios nem estáveis, qualquer estratégia de roteamento precisaria ser dinâmica e adaptativa.
A abordagem: Thompson Sampling com priors conjugados
A Ramp codificou três prioridades em uma única estratégia de roteamento: confiabilidade acima de tudo, latência como componente de confiabilidade (dependendo do caso de uso), e preferência de modelo declarada pelo caller como ordem de prioridade. O sistema parte da ordem de preferência do caller e a reordena com base em dois sinais. Primeiro, uma EWMA (média móvel exponencialmente ponderada) da taxa de falhas genuínas do provedor - rate limiting, erros de servidor - que rebaixa modelos problemáticos. Segundo, uma distribuição de latência em tempo real aprendida via Thompson Sampling, usando um prior Normal-Inverse-Gama (NIG) sobre a média e variância da log-latência, com estatísticas suficientes armazenadas em Redis e atualizadas a cada observação.
No momento do roteamento, o sistema amostra da posterior, calcula a probabilidade de um resultado ruim (falha direta ou latência acima do deadline do caller), combina isso com o custo relativo do modelo e ordena a lista. O primeiro da lista é tentado; se falhar, faz fallback para o próximo.
Resultados: 25-30% de economia sem degradação
O primeiro caso de uso foi um reranker de LLM com deadline apertado de 6 segundos. A lista de preferência original (Gemini 3.1 Flash Lite Standard e GPT 5.4 Nano Standard) foi expandida para incluir variantes flex e priority. Durante um período de rate limiting no Gemini, o sistema automaticamente reroteou para GPT 5.4 Nano - e, curiosamente, escolheu o tier flex em vez do standard, porque as latências eram quase idênticas e ambas ficavam bem abaixo do timeout, tornando a opção de metade do preço a decisão ótima. Um experimento em tráfego maior confirmou 26,3% de economia de custo com diferença de taxa de erro de -0,09 pontos percentuais (ou seja, leve melhora).
Expansão para streaming
A Ramp implementou uma versão equivalente para streaming e a aplicou ao Ramp Inspect, seu caso de uso de streaming mais volumoso, alcançando 30% de economia. A empresa planeja continuar experimentando formas de gerenciar gastos com IA aproveitando o gateway como canal único de otimização.