
Google lança roteamento unificado de modelos de IA
O Google Cloud API Gateway agora oferece roteamento unificado de modelos de IA em Public Preview. A funcionalidade permite que desenvolvedores enviem requisições no formato OpenAI para um único endpoint e tenham o tráfego direcionado dinamicamente para diferentes modelos - Gemini, Claude ou OpenAI GPT-OSS - sem precisar gerenciar proxies ou hardcodar endpoints.
Como funciona
A configuração é feita diretamente na especificação OpenAPI 3.x usando o bloco de extensão x-google-api-management. Nele, o desenvolvedor define:
- Backends: endereços dos modelos na Vertex AI (por exemplo,
gemini-3.5-flash-lite,claude-opus-4-7,gpt-oss-120b). - Routers: regras que mapeiam nomes virtuais de modelos para os backends correspondentes, com um modelo padrão e regras de fallback ou substituição.
Uma limitação importante: todos os backends de um mesmo router precisam compartilhar o mesmo host (por exemplo, aiplatform.googleapis.com). O roteamento seleciona modelos e paths diferentes dentro desse host, mas não roteia entre hosts distintos.
Fluxo de uso
- Configurar as regras de roteamento na spec OpenAPI.
- Fazer deploy do gateway com a configuração atualizada.
- Enviar requisições padrão no formato OpenAI (
POST /v1/chat/...). O gateway intercepta, transcodifica o payload para o schema nativo do backend e encaminha.
Integração com Agent Platform
O API Gateway pode ser usado de forma isolada (para rate limiting e rastreamento de tokens) ou combinado com o Gemini Enterprise Agent Platform. Nesse cenário, o tráfego de saída do agente passa pelo Agent Gateway para governança de segurança e depois pelo API Gateway para o roteamento dinâmico aos LLMs hospedados no Google.
A funcionalidade está disponível em Public Preview e visa eliminar a necessidade de proxies open-source ou lógica customizada de roteamento entre modelos.