
Google lança Gemini Distillation Service para modelos menores
O que é o Gemini Distillation Service
O Google lançou, em acesso antecipado, o Gemini Distillation Service - um serviço que permite treinar um modelo "estudante" menor e mais eficiente usando as saídas e os padrões de raciocínio de um modelo "professor" maior. A proposta é preencher a lacuna entre modelos de fronteira (caros e lentos) e modelos menores (rápidos e baratos), transferindo capacidade de raciocínio profundo para modelos de nível Flash.
Diferença em relação ao ajuste supervisionado (SFT)
Ao contrário do SFT padrão, que usa apenas a saída de texto final como alvo, a destilação aproveita dois elementos do modelo professor:
- Respostas do professor: a saída textual final.
- Pensamentos brutos: os caminhos de raciocínio internos gerados pelo modelo professor.
Isso permite que o estudante aprenda não só o que responder, mas como raciocinar.
Modelos compatíveis (acesso antecipado)
- Professor: gemini-3.1-pro
- Estudante: gemini-2.5-flash
Casos de uso recomendados
- Alto volume com SLAs de latência rigorosos: quando o app precisa do raciocínio de um modelo Pro, mas com custo e latência de Flash.
- Falta de dados rotulados: quando há muitos prompts de usuários, mas não há recursos para gerar respostas de verdade absoluta manualmente (o que inviabiliza o SFT).
- Tarefas de raciocínio complexas: lógica multi-etapas, resumo de documentos técnicos, codificação complexa.
- Lacunas de desempenho significativas: quando o professor supera substancialmente o estudante na tarefa específica.
Requisitos e configuração
- O serviço está em acesso antecipado, destinado apenas a testes e desenvolvimento (não usar em produção).
- É necessário solicitar acesso via representante de vendas do Google.
- Os jobs devem rodar na região
us-central1. - O papel IAM necessário é
roles/aiplatform.admin.
Preparação do conjunto de dados
Um diferencial importante: o serviço usa conjuntos de dados somente de prompts (sem respostas esperadas), pois o professor gera as saídas de destino durante o processo.
- Formato: JSON Lines (JSONL) em bucket do Cloud Storage.
- Mínimo recomendado: 1.000 exemplos.
- Suporta instruções de sistema opcionais e prompts de várias etapas (com alternância entre papéis "user" e "model").
Hiperparâmetros principais
- candidateCount (professor): número de variações de resposta geradas. Intervalo [1, 5], padrão 4.
- epochCount (estudante): número de iterações sobre o dataset. Intervalo [1, 100], padrão 4.
- learningRateMultiplier: modifica a taxa de aprendizado base. Intervalo [0.25, 4], padrão 1.
Como iniciar
Durante o acesso antecipado, os jobs são submetidos via API REST da Agent Platform (endpoint em us-central1-aiplatform.googleapis.com). É possível criar um novo job de destilação ou realizar ajuste contínuo sobre um checkpoint já destilado.