stamatios
← Voltar ao feed
Microfone transforma ondas sonoras emaranhadas em linhas organizadas, metáfora do Gemini 3.5 Transcribe
IA & Modelos

Gemini 3.5 Transcribe chega para transcrição de voz em tempo real

resumo de ~3 min

O que foi lançado

O Google apresentou o Gemini 3.5 Transcribe, um modelo de conversão de fala em texto voltado a interações de voz e transcrição em tempo real. A empresa afirma que ele transforma áudio bruto em texto preciso, revisado e formatado, lidando com ruído de fundo, jargões, hesitações e autocorreções melhor que modelos convencionais. O modelo já é usado em recursos de voz do aplicativo Gemini e do Android, incluindo o Rambler, e agora está disponível para desenvolvedores pelo Gemini API, no Google AI Studio, e pela Gemini Enterprise Agent Platform.

APIs e capacidades

O modelo é oferecido em duas APIs. A Live API, com gemini-3.5-transcribe-live, realiza transmissão bidirecional contínua com latência inferior a um segundo para aplicações interativas. A Interactions API, com gemini-3.5-transcribe, processa áudios pré-gravados, como reuniões e registros de chamadas, com identificação de falantes e marcações de tempo por palavra.

Entre os recursos estão a remoção automática de palavras de preenchimento, a correção de frases - como trocar “terça-feira” por “quarta-feira” durante a fala - e a formatação do texto. O modelo também pode usar vocabulário personalizado para reconhecer jargões e grafias específicas, detectar e transcrever automaticamente mais de 85 idiomas e lidar com sotaques e dialetos regionais. Em áudios pré-gravados, atribui falas e marcações de tempo a até três pessoas; o suporte a mais de três falantes ainda é experimental. Por meio de chamadas de função, pode encaminhar tarefas como geração de imagens e análise de arquivos a outros modelos Gemini, recurso atualmente disponível no aplicativo Gemini para macOS.

Desempenho e integração

Segundo medições da Artificial Analysis citadas pelo Google, o Gemini 3.5 Transcribe alcança taxa média de erro de palavras de 4,0% em uso por transmissão e 2,6% em uso sem transmissão. No benchmark FLEURS, apresentou 5,50% de erro em transmissão e 5,04% em uso sem transmissão em um conjunto de idiomas e localidades. Em comparação com o Chirp 3, seu modelo anterior de transcrição, o tempo até a transcrição final teria melhorado 70%, além de haver ganhos de precisão, suporte multilíngue e recursos.

O Google também integrou o modelo a produtos próprios. No Gboard para Android, o Rambler converte fala em texto formatado e permite corrigir erros, editar por voz e mudar o estilo da escrita. No Google Antigravity, o modelo pode usar, com autorização, o contexto da tela e o histórico de conversas para transcrever nomes de arquivos, documentos e outros elementos. No Google AI Studio, permite criar aplicativos por voz; no Gemini para macOS, pode operar sobre arquivos, textos e imagens usando comandos de voz. O recurso de falar para preencher campos de texto chegará futuramente ao Chrome.

Disponibilidade

O modelo está em prévia pública no Gemini API, no Google AI Studio e no Google Antigravity, e também na Gemini Enterprise Agent Platform. Para consumidores, está disponível em inglês no Gemini para macOS e no Rambler para Android em países e idiomas selecionados; a chegada ao Chrome está prevista para o futuro. Plataformas como Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel e Vision Agents já usam a Gemini Live API para criar interfaces de voz, enquanto vivo, Intellitek Health e Lingopal relataram avaliações positivas sobre latência, precisão e suporte a idiomas.