stamatios
← Voltar ao feed
OpenAI revela arquitetura de voz GPT-Live em tempo real
IA & Modelos

OpenAI revela arquitetura de voz GPT-Live em tempo real

resumo de ~3 min

O problema dos sistemas de turnos

Sistemas anteriores de voz com IA dependiam de detectores de turno - pequenos modelos que tentavam adivinhar quando o usuário terminou de falar. Se o detector agisse cedo demais, cortava o usuário; se tarde demais, a resposta parecia lenta. O GPT-Live elimina essa abordagem.

Arquitetura full-duplex e streaming contínuo

O GPT-Live é um modelo de voz full-duplex: ele ouve e fala simultaneamente, sem precisar de um detector separado. O áudio flui continuamente para dentro e para fora do modelo, enquanto raciocínio mais profundo e uso de ferramentas acontecem em um caminho assíncrono, sem interromper a conversa.

Quando a tarefa exige mais capacidade (como busca ou raciocínio complexo), o sistema delega para modelos de fronteira como o GPT-5.5, que processa em segundo plano enquanto o modelo de voz mantém o diálogo ativo.

Caminho de mídia separado da lógica de aplicação

Uma decisão central foi separar o fluxo de mídia da lógica de negócio. O áudio percorre um caminho rápido dedicado; delegação, ferramentas e outras operações ficam atrás de um limite RPC assíncrono. Uma chamada lenta de ferramenta atrasa apenas o próprio resultado, nunca o fluxo de áudio.

O frontend de mídia e a lógica de inferência foram reescritos em Go (substituindo Python asyncio), com o p95 do novo sistema igualando o p50 do anterior. O transporte usa WebRTC, que lida com perda de pacotes, drift de clock e mudanças de conexão.

Inferência com estado e handoff entre instâncias

Sessões de voz podem durar muito tempo, e o contexto cresce continuamente. Para lidar com isso, o sistema implementou um mecanismo de handoff: uma nova instância do modelo é preparada em paralelo com a atual, pré-carregada com o contexto da sessão, e a troca ocorre sem interrupção de mídia. A compactação de contexto (quando o limite é atingido) segue a mesma lógica - acontece fora do caminho ativo.

Delegação rápida ao modelo de fronteira

Para que a delegação ao GPT-5.5 pareça natural, o sistema pré-cria a sessão de inferência do modelo de fronteira no início da conversa e a mantém aquecida com afinidade de sessão e cache de prompt. Esforço de raciocínio, limites de saída e schemas de ferramentas também são ajustados para reduzir latência.

WARP: de seis round trips a um

O protocolo padrão do WebRTC exige múltiplos handshakes de rede. A OpenAI desenvolveu o WARP (WebRTC Abridged Roundtrip Protocol), que reduz a inicialização de mídia e dados de seis round trips para apenas um, combinando melhorias como piggyback do DTLS sobre ICE, DTLS 1.3 e pré-negociação de canais de dados. O WARP está sendo proposto como especificação aberta no IETF.

Além disso, o Instant Connect pré-negocia os parâmetros SDP sem reservar capacidade no servidor, permitindo que o cliente inicie uma sessão com um único pacote UDP.

Testes silenciosos em produção

Antes do lançamento, o GPT-Live foi testado em modo sombra: uma fração crescente das sessões reais do ChatGPT Voice era roteada para o novo sistema em modo somente leitura, sem afetar o que o usuário ouvia. Os testes revelaram que capacidade não se resume a throughput de GPU - handlers de stream, filas e caminhos de rede também precisam escalar. A geografia também se mostrou crítica, e a equipe passou a validar rollouts junto com capacidade regional.

Plataforma futura

A arquitetura já sustenta o ChatGPT Voice (incluindo controle de computador e coordenação de agentes no app desktop) e servirá de base para a futura GPT-Live API, com suporte a mais dispositivos, apps e modalidades.