stamatios
← Voltar ao feed
Microsoft testa modelo de voz MAI Realtime full-duplex
IA & Modelos · Big Tech

Microsoft testa modelo de voz MAI Realtime full-duplex

resumo de ~3 min

MAI Realtime: o modelo de voz full-duplex da Microsoft

A Microsoft está testando internamente seu primeiro modelo de voz em tempo real nativo, chamado MAI Realtime, descoberto como uma entrada oculta de acesso antecipado no MAI Playground da empresa. O sistema é bidirecional e full-duplex - ou seja, escuta e fala simultaneamente, sem alternância de turnos -, colocando-o em comparação direta com o GPT Live 1 da OpenAI e o Sesame.

Vozes e idiomas

Duas vozes estão disponíveis até o momento: Victoria e Grant, ambas descritas como notavelmente mais naturais do que o modo de voz atual do Copilot. O modelo suporta 18 idiomas, incluindo inglês, alemão, espanhol, francês, italiano, português, japonês, coreano, chinês, holandês, hindi, indonésio, árabe, russo, turco, vietnamita e tailandês. O idioma pode ser fixado manualmente ou detectado automaticamente, com troca de idioma no meio da conversa sem perda de contexto.

Arquitetura de turn-taking

O sistema oferece duas configurações de turn-taking:

  • Switchboard mode: baseado em um endpointer MAI-Ears com tokens de controle inline.
  • Setup determinístico: combina endpointing baseado em silêncio com um endpointer semântico Whisper.

Na prática, a diferença entre os dois modos é sutil. Interrupções são tratadas de forma limpa e a latência de resposta é baixa. O modelo não canta nem produz sons não verbais, mantendo-se como um sistema puramente conversacional.

Painel de debug

Um painel de debug expõe métricas de latência em tempo real, "pensamentos" do modelo e etapas de processamento. O compartilhamento de amostras deve ser liberado quando o acesso for ampliado.

Contexto estratégico

Até agora, todos os modelos de fala da Microsoft eram unidirecionais: MAI-Voice-2 (e sua variante Flash) para síntese e MAI-Transcribe-1.5 para reconhecimento. A camada speech-to-speech na API Voice Live do Azure Speech ainda depende do modelo GPT-Realtime da OpenAI. Um modelo full-duplex proprietário eliminaria essa dependência para a equipe de superinteligência de Mustafa Suleyman, que já lançou sete modelos internos na Build 2026 e vem substituindo componentes da OpenAI no Copilot, Teams e Bing.

O destino provável para desenvolvedores é o Microsoft Foundry, com o Copilot como superfície de consumo mais óbvia, embora nenhum cronograma tenha sido definido.