stamatios
← Voltar ao feed
OpenAI constrói arquitetura full-duplex para voz no GPT-Live
IA & Modelos · Produto & Design

OpenAI constrói arquitetura full-duplex para voz no GPT-Live

resumo de ~3 min

Do turn-taking ao streaming contínuo

O GPT-Live, sistema de voz de terceira geração da OpenAI, elimina o detector de turno (turn detector) do caminho de áudio. Em vez de depender de um modelo pequeno para decidir quando o usuário parou de falar, o modelo de voz opera em full-duplex: ouve e fala simultaneamente. Isso remove a latência intrínseca da abordagem anterior, em que o LLM só começava a processar após a decisão do detector.

Quando raciocínio mais profundo ou uso de ferramentas é necessário, o GPT-Live delega a modelos frontier (como o GPT-5.5) de forma assíncrona, sem interromper o fluxo da conversa.

Arquitetura de mídia dedicada

A equipe separou o fluxo de mídia da lógica de aplicação. O áudio trafega entre cliente e modelo por um caminho rápido e dedicado; delegação, tool use e outras operações passam por um boundary RPC assíncrono. Uma chamada de ferramenta lenta pode atrasar seu próprio resultado, mas nunca trava o fluxo de áudio.

O frontend de mídia e a lógica de inferência foram reescritos em Go (substituindo Python asyncio), com melhora significativa na entrega de frames: o p95 do novo sistema equivale ao p50 do anterior. O transporte usa WebRTC, que lida com perda de pacotes, clock drift e mudanças de conexão.

Inferência stateful e compactação de contexto

Sessões de voz podem durar muito tempo, e o contexto cresce continuamente. Para lidar com isso, a equipe construiu um mecanismo de handoff entre instâncias de modelo: uma nova instância é aquecida em paralelo, pré-carregada com o contexto atual, e a troca ocorre sem interrupção de mídia.

A compactação de contexto (quando o limite é atingido) também é tratada como transição gerenciada: a instância original continua conversando enquanto o sistema prepara uma substituta com o contexto compactado.

Delegação rápida o suficiente para parecer natural

Para que a delegação ao modelo frontier não pareça lenta, a equipe pré-cria a sessão de inferência do modelo frontier no início da conversa, mantém afinidade de sessão e usa prompt caching. Esforço de raciocínio, limites de output e round-trips de ferramentas também são ajustados para reduzir latência.

Derivando turnos discretos a partir de fala contínua

Sistemas ao redor (UI, analytics, segurança) ainda operam em turnos discretos. O servidor de aplicação usa transcrições parciais e sinais de timing para inferir quem está falando e construir uma fila de mensagens. Mantém duas visões: uma especulativa (para a UI) e uma autoritativa (para logging).

Protocolo WARP: de 6 round-trips para 1

O WebRTC padrão exige múltiplos handshakes de rede. A equipe desenvolveu o WARP (WebRTC Abridged Roundtrip Protocol), que reduz o startup de mídia e dados de seis round-trips para um, combinando melhorias como piggyback do DTLS sobre ICE, DTLS 1.3 e pré-negociação de SCTP e data channels. As especificações são abertas e estão sendo avançadas no IETF (TSVWG), com suporte já adicionado ao libwebrtc e ao Pion.

Além disso, criaram o Instant Connect, que pré-negocia parâmetros SDP fora do caminho crítico. Com WARP + Instant Connect, o cliente pode iniciar uma sessão com um único pacote UDP.

Teste silencioso em produção

Antes do lançamento, o GPT-Live foi testado em modo shadow com tráfego real de produção. Lições: capacidade não se resume a throughput de GPU (componentes CPU-side saturaram antes do previsto); geografia importa (rotear para capacidade distante adiciona latência); sessões longas expõem pressão de memória e races no shutdown. O teste forçou melhorias em observabilidade, telemetria granular e controles de rollout.

Plataforma futura

A arquitetura já suporta o ChatGPT Voice em expansão para coordenação agêntica e servirá de base para o futuro GPT-Live API, permitindo experiências de voz em mais dispositivos e modalidades sem sacrificar a sensação de conversa ao vivo.