
Clonagem de voz roda em notebook com modelo open source de 120M
O modelo
A Halo Research apresentou a família Sopro V2 e liberou o sopro-v2-turbo, um modelo aberto de síntese de fala com clonagem de voz, 120 milhões de parâmetros, suporte a inglês, alemão, francês e português europeu. O modelo foi projetado para funcionar localmente em CPU de notebook ou no navegador, sem depender de um servidor. A empresa afirma que ele é, até onde sabe, o primeiro modelo aberto de TTS voltado nativamente ao português europeu.
No Apple M3, o Sopro V2 Turbo gera áudio offline com fator de tempo real (RTF) de 0,24 e começa a transmitir em cerca de 300 milissegundos, com RTF de 0,21. Em uma única H100, alcança RTF offline de 0,07 e cerca de 200 milissegundos até o primeiro áudio em transmissão. Os números foram obtidos em fluxo único, com PyTorch e configurações padrão, sem processamento em lote. Há também uma demonstração ONNX inteiramente no navegador; em celulares, a quantização pode reduzir um pouco os resultados, e aparelhos com pouca memória podem travar.
Desenvolvimento e arquitetura
O projeto começou como uma iniciativa pessoal em dezembro de 2025, depois que a equipe da Halo NeuroAI encontrou dificuldades para obter pronúncia europeia do português em provedores de clonagem de voz. Segundo a publicação, soluções anteriores apresentavam pronúncia inadequada, latência elevada, preocupações de privacidade ou custo. A primeira versão do Sopro era somente em inglês, instável e inconsistente entre vozes. O treinamento da V1 custou US$ 250; posteriormente, FCCN-FCT viabilizou computação nos supercomputadores Deucalion e MareNostrum 5.
Na V2, a equipe substituiu o tokenizador de texto de 128 mil entradas por um SentencePiece de 8.192 tokens, trocou a base convolucional por um decodificador Transformer e eliminou a necessidade de transcrever o áudio de referência durante a inferência. O cabeçote acústico passou a usar espectrogramas mel contínuos e fluxo correspondente, enquanto o tokenizador de fala foi alinhado a reconhecimento automático de fala para inglês, francês, alemão e português, partindo do codificador Whisper large-v3. Um vocoder Vocos recebeu versões offline e causal para transmissão.
O treinamento teve quatro fases: pré-treinamento de um professor de 0,5 bilhão de parâmetros, ajuste de preferências com DPO, destilação para o modelo de 120 milhões e reflow. A equipe testou GRPO, mas relata que o método desestabilizou o modelo. O reflow reduziu de 32 para dois os passos do solucionador acústico, com alegada paridade próxima em qualidade, similaridade e inteligibilidade.
Avaliações e limites
Nos testes Seed-TTS em inglês, o Turbo obteve WER de 1,65 com dois passos e 1,51 em transmissão, contra 1,77 do Sopro V2 de 32 passos; a similaridade foi de 0,651 e 0,644, respectivamente. No protocolo do LibriSpeech, registrou WER de 1,85 e similaridade de 0,645. No conjunto multilíngue MiniMax, apresentou resultados competitivos em inglês, francês, alemão e português, embora a comparação em português favoreça sistemas voltados ao português brasileiro, enquanto o Sopro busca a variante europeia. A pronúncia europeia também pode elevar o WER por causa da redução de vogais não acentuadas.
O modelo não inclui marca-d'água, pois a equipe considera que ela seria facilmente removida em um fluxo aberto e poderia criar falsa sensação de segurança. A publicação pede que o sistema não seja usado para personificar pessoas. Abreviações, números, símbolos e textos mistos podem ser pronunciados incorretamente; o código de treinamento não deve ser liberado em breve. A Halo Research planeja ampliar os idiomas, adicionar controle de emoção e continuar aprimorando a família.