stamatios
← Voltar ao feed
Novelo de ondas sonoras penteado em linhas organizadas, modelo S1-mini limpando transcrições de voz.
IA & Modelos · Produto & Design

Superwhisper lança S1-mini para limpar transcrições de voz

resumo de ~3 min

O que é o S1-mini

A Superwhisper lançou o S1-mini, um modelo de linguagem de 0,6 bilhão de parâmetros voltado a uma tarefa específica: transformar a saída bruta de sistemas de reconhecimento automático de fala em texto escrito mais limpo. Ajustado a partir do Qwen3-0.6B, o modelo remove palavras de preenchimento, resolve falsos começos e autocorreções preservando a versão final dita pelo falante, aplica pontuação e capitalização e converte números, datas, horários, valores monetários e endereços de e-mail falados para a forma escrita.

O S1-mini não é um modelo de conversa nem segue instruções gerais. Ele recebe um prompt de sistema, uma linha de controle e uma transcrição bruta - geralmente em minúsculas e sem pontuação - e devolve somente o texto revisado, sem preâmbulo ou explicação. A linha de controle define três eixos: estilo (casual, semi-casual, semi-formal ou formal), estrutura (prose ou lists) e contexto (general ou email). Esses parâmetros controlam o registro, a possibilidade de transformar enumerações em listas e a organização de mensagens de e-mail.

Desempenho e execução

Em um conjunto de teste separado com 7.519 casos em inglês, incluindo transcrições reais de reconhecimento de fala e testes sintéticos com números, autocorreções, listas, e-mails e entradas adversariais, o modelo alcançou 94,8% de precisão em tokens. A avaliação foi feita com a versão GGUF quantizada Q4_K_M; a documentação afirma que os pesos BF16 devem ter desempenho pelo menos equivalente.

A versão quantizada ocupa 462 MiB e foi descrita como adequada para execução na CPU de um laptop. O modelo aceita entradas de até aproximadamente 1.000 tokens, e a recomendação é dividir transcrições longas em limites de frase. Há versões GGUF para llama.cpp, Ollama e LM Studio, além de opções de execução com Transformers, vLLM, SGLang e Docker. A Superwhisper também disponibiliza o modelo para integração em aplicativos de ditado, ferramentas de atas de reunião, legendas ao vivo e editores controlados por voz.

A documentação destaca que o S1-mini é uma etapa posterior ao reconhecimento de fala, e não um sistema completo: o fluxo esperado é áudio, ASR, S1-mini e texto limpo. O uso deve ser determinístico, com decodificação gananciosa ou temperatura 0. O parâmetro enable_thinking=False é obrigatório, porque o modelo foi treinado sem rastros de raciocínio; deixá-lo ativado pode produzir uma saída vazia. Entradas compostas apenas por ruído ou palavras de preenchimento também retornam uma string vazia, considerada um resultado válido.

Licença e limitações

O lançamento cobre apenas inglês. O S1-mini usa Apache 2.0 com uma cláusula adicional de nomenclatura: o nome “S1-mini” by “Superwhisper”, com essa capitalização, deve ser preservado onde o modelo for usado. A licença exige ainda a manutenção do texto da licença e dos avisos de atribuição, além da indicação de alterações relevantes em redistribuições modificadas. A documentação recomenda revisar os termos antes de incorporar ou redistribuir os pesos em produtos comerciais.