stamatios
← Voltar ao feed
Google lança roteamento unificado de modelos de IA
IA & Modelos · Dev & Engenharia

Google lança roteamento unificado de modelos de IA

resumo de ~3 min

O Google Cloud API Gateway agora oferece roteamento unificado de modelos de IA em Public Preview. A funcionalidade permite que desenvolvedores enviem requisições no formato OpenAI para um único endpoint e tenham o tráfego direcionado dinamicamente para diferentes modelos - Gemini, Claude ou OpenAI GPT-OSS - sem precisar gerenciar proxies ou hardcodar endpoints.

Como funciona

A configuração é feita diretamente na especificação OpenAPI 3.x usando o bloco de extensão x-google-api-management. Nele, o desenvolvedor define:

  • Backends: endereços dos modelos na Vertex AI (por exemplo, gemini-3.5-flash-lite, claude-opus-4-7, gpt-oss-120b).
  • Routers: regras que mapeiam nomes virtuais de modelos para os backends correspondentes, com um modelo padrão e regras de fallback ou substituição.

Uma limitação importante: todos os backends de um mesmo router precisam compartilhar o mesmo host (por exemplo, aiplatform.googleapis.com). O roteamento seleciona modelos e paths diferentes dentro desse host, mas não roteia entre hosts distintos.

Fluxo de uso

  1. Configurar as regras de roteamento na spec OpenAPI.
  2. Fazer deploy do gateway com a configuração atualizada.
  3. Enviar requisições padrão no formato OpenAI (POST /v1/chat/...). O gateway intercepta, transcodifica o payload para o schema nativo do backend e encaminha.

Integração com Agent Platform

O API Gateway pode ser usado de forma isolada (para rate limiting e rastreamento de tokens) ou combinado com o Gemini Enterprise Agent Platform. Nesse cenário, o tráfego de saída do agente passa pelo Agent Gateway para governança de segurança e depois pelo API Gateway para o roteamento dinâmico aos LLMs hospedados no Google.

A funcionalidade está disponível em Public Preview e visa eliminar a necessidade de proxies open-source ou lógica customizada de roteamento entre modelos.