stamatios
← Voltar ao feed
Fish Audio lança S2.1 Pro com suporte para 83 idiomas
IA & Modelos · Produto & Design

Fish Audio lança S2.1 Pro com suporte para 83 idiomas

resumo de ~3 min

Fish Audio S2.1 Pro

A Fish Audio lançou o S2.1 Pro, seu modelo de texto-para-fala (TTS) voltado para produção em tempo real. O modelo apresenta latência de aproximadamente 90 milissegundos para o primeiro áudio, o que permite conversas naturais com turnos de fala sem atrasos perceptíveis.

Capacidades principais

  • 83 idiomas suportados com uma única identidade de voz que se mantém consistente entre eles.
  • Direção de entrega via tags em colchetes inseridas diretamente no texto - é possível instruir sussurros, risadas nervosas ou outros estilos sem depender de um menu fixo de emoções predefinidas.
  • Diálogo multi-falante e clonagem de voz a partir de amostras curtas (10 a 30 segundos), capturando tom e estilo de fala sem necessidade de fine-tuning adicional.

Posicionamento e acesso

O S2.1 Pro é apresentado como uma evolução do S2-Pro anterior em qualidade, latência e throughput, com garantias de produção para equipes que operam em escala. O modelo se integra a fluxos de agentes via MCP e suporte a agent-skills, mirando desenvolvedores que conectam fala a agentes de voz, sistemas telefônicos e pipelines de áudio de longa duração.

Há um tier gratuito que roda o mesmo modelo sem custo para desenvolvimento e testes, sob limites de uso justo, sem teto rígido de utilização.

Contexto da empresa

A Fish Audio constrói modelos de fala para criadores, desenvolvedores e empresas. Sua linha open-source Fish Speech ultrapassou 20.000 estrelas no GitHub. A empresa evoluiu da geração OpenAudio S1 para a família S2, que foi lançada com pesos abertos no início do ano. Os modelos S2 foram treinados em grandes datasets multilíngues de áudio e, segundo benchmarks da própria empresa, alcançaram baixas taxas de erro de palavra em comparação com outros sistemas avaliados.