stamatios
← Voltar ao feed
Ramp Router: roteador de LLMs com Thompson sampling economiza 30%
IA & Modelos · Startups & Deals

Ramp Router: roteador de LLMs com Thompson sampling economiza 30%

resumo de ~3 min

O problema: roteamento estático desperdiça dinheiro

A Ramp opera um gateway interno de LLMs que processa trilhões de tokens por dia, servindo tanto produtos internos quanto externos. A observação inicial veio do CTO da empresa, Rahul, ao notar que o tier "flex" da OpenAI nem sempre apresentava latência maior que o tier padrão - contrariando a suposição anterior. Um cliente (Mercana) confirmou que fora do horário comercial os tiers eram equivalentes, mas durante o expediente (9h-17h) o flex degradava rapidamente. Como os padrões não eram óbvios nem estáveis, qualquer estratégia de roteamento precisaria ser dinâmica e adaptativa.

A abordagem: Thompson Sampling com priors conjugados

A Ramp codificou três prioridades em uma única estratégia de roteamento: confiabilidade acima de tudo, latência como componente de confiabilidade (dependendo do caso de uso), e preferência de modelo declarada pelo caller como ordem de prioridade. O sistema parte da ordem de preferência do caller e a reordena com base em dois sinais. Primeiro, uma EWMA (média móvel exponencialmente ponderada) da taxa de falhas genuínas do provedor - rate limiting, erros de servidor - que rebaixa modelos problemáticos. Segundo, uma distribuição de latência em tempo real aprendida via Thompson Sampling, usando um prior Normal-Inverse-Gama (NIG) sobre a média e variância da log-latência, com estatísticas suficientes armazenadas em Redis e atualizadas a cada observação.

No momento do roteamento, o sistema amostra da posterior, calcula a probabilidade de um resultado ruim (falha direta ou latência acima do deadline do caller), combina isso com o custo relativo do modelo e ordena a lista. O primeiro da lista é tentado; se falhar, faz fallback para o próximo.

Resultados: 25-30% de economia sem degradação

O primeiro caso de uso foi um reranker de LLM com deadline apertado de 6 segundos. A lista de preferência original (Gemini 3.1 Flash Lite Standard e GPT 5.4 Nano Standard) foi expandida para incluir variantes flex e priority. Durante um período de rate limiting no Gemini, o sistema automaticamente reroteou para GPT 5.4 Nano - e, curiosamente, escolheu o tier flex em vez do standard, porque as latências eram quase idênticas e ambas ficavam bem abaixo do timeout, tornando a opção de metade do preço a decisão ótima. Um experimento em tráfego maior confirmou 26,3% de economia de custo com diferença de taxa de erro de -0,09 pontos percentuais (ou seja, leve melhora).

Expansão para streaming

A Ramp implementou uma versão equivalente para streaming e a aplicou ao Ramp Inspect, seu caso de uso de streaming mais volumoso, alcançando 30% de economia. A empresa planeja continuar experimentando formas de gerenciar gastos com IA aproveitando o gateway como canal único de otimização.