stamatios
← Voltar ao feed
Google lança Gemini Distillation Service para modelos menores
IA & Modelos · Big Tech

Google lança Gemini Distillation Service para modelos menores

resumo de ~3 min

O que é o Gemini Distillation Service

O Google lançou, em acesso antecipado, o Gemini Distillation Service - um serviço que permite treinar um modelo "estudante" menor e mais eficiente usando as saídas e os padrões de raciocínio de um modelo "professor" maior. A proposta é preencher a lacuna entre modelos de fronteira (caros e lentos) e modelos menores (rápidos e baratos), transferindo capacidade de raciocínio profundo para modelos de nível Flash.

Diferença em relação ao ajuste supervisionado (SFT)

Ao contrário do SFT padrão, que usa apenas a saída de texto final como alvo, a destilação aproveita dois elementos do modelo professor:

  • Respostas do professor: a saída textual final.
  • Pensamentos brutos: os caminhos de raciocínio internos gerados pelo modelo professor.

Isso permite que o estudante aprenda não só o que responder, mas como raciocinar.

Modelos compatíveis (acesso antecipado)

  • Professor: gemini-3.1-pro
  • Estudante: gemini-2.5-flash

Casos de uso recomendados

  • Alto volume com SLAs de latência rigorosos: quando o app precisa do raciocínio de um modelo Pro, mas com custo e latência de Flash.
  • Falta de dados rotulados: quando há muitos prompts de usuários, mas não há recursos para gerar respostas de verdade absoluta manualmente (o que inviabiliza o SFT).
  • Tarefas de raciocínio complexas: lógica multi-etapas, resumo de documentos técnicos, codificação complexa.
  • Lacunas de desempenho significativas: quando o professor supera substancialmente o estudante na tarefa específica.

Requisitos e configuração

  • O serviço está em acesso antecipado, destinado apenas a testes e desenvolvimento (não usar em produção).
  • É necessário solicitar acesso via representante de vendas do Google.
  • Os jobs devem rodar na região us-central1.
  • O papel IAM necessário é roles/aiplatform.admin.

Preparação do conjunto de dados

Um diferencial importante: o serviço usa conjuntos de dados somente de prompts (sem respostas esperadas), pois o professor gera as saídas de destino durante o processo.

  • Formato: JSON Lines (JSONL) em bucket do Cloud Storage.
  • Mínimo recomendado: 1.000 exemplos.
  • Suporta instruções de sistema opcionais e prompts de várias etapas (com alternância entre papéis "user" e "model").

Hiperparâmetros principais

  • candidateCount (professor): número de variações de resposta geradas. Intervalo [1, 5], padrão 4.
  • epochCount (estudante): número de iterações sobre o dataset. Intervalo [1, 100], padrão 4.
  • learningRateMultiplier: modifica a taxa de aprendizado base. Intervalo [0.25, 4], padrão 1.

Como iniciar

Durante o acesso antecipado, os jobs são submetidos via API REST da Agent Platform (endpoint em us-central1-aiplatform.googleapis.com). É possível criar um novo job de destilação ou realizar ajuste contínuo sobre um checkpoint já destilado.