stamatios
← Voltar ao feed
Motor de wafer acelera a geração de texto do GPT-5.6 Sol Ultrafast ao lado de um cronômetro derretendo.
IA & Modelos · Hardware & Chips

OpenAI lança Ultrafast: GPT-5.6 Sol a 750 tokens por segundo com Cerebras

resumo de ~3 min

Ultrafast: GPT-5.6 Sol a 750 tokens por segundo

A OpenAI abriu um preview limitado do Ultrafast, um novo tier de serviço da API que executa o GPT-5.6 Sol com velocidade até 14 vezes maior que o processamento padrão. Alimentado pela infraestrutura da Cerebras, o modo pode gerar até 750 tokens de saída por segundo. O acesso inicial é restrito a um grupo seleto de clientes, com expansão prevista conforme a capacidade aumentar. A empresa ainda não anunciou preços nem data de disponibilidade geral.

O serviço foi desenhado para produtos e fluxos de trabalho em que atrasos podem tornar uma resposta inútil. Segundo a OpenAI, alcançar velocidade em tempo real costumava exigir que as equipes escolhessem modelos menores ou especializados. O Ultrafast propõe colocar o modelo mais inteligente da empresa em configurações de baixa latência, buscando entregar mais trabalho útil por segundo sem esse trade-off.

Os alvos imediatos incluem resposta a incidentes, finanças, segurança, suporte ao cliente, voz, comércio e pesquisa. Equipes poderiam analisar logs, alterações de código, transações ou sinais de mercado enquanto os eventos acontecem. Sistemas de voz e suporte resolveriam solicitações em várias etapas sem interromper a conversa, e ferramentas de comércio verificariam estoque, personalizariam recomendações e corrigiriam problemas de checkout antes que o comprador desistisse.

Uso interno e primeiros testes

A OpenAI já utiliza o tier internamente. Durante incidentes, desenvolvedores o aplicam em logs, traces, conversas de equipe, verificações de acompanhamento e preparação ou validação de correções, mantendo engenheiros responsáveis por decisões e deploy. Equipes de pesquisa usam o modo em ferramentas conectadas para buscar fontes de conhecimento, consultar dados e organizar descobertas. Alguns ciclos de experimentação que antes levavam uma noite inteira agora suportam várias iterações dentro de um único dia de trabalho.

Testes iniciais incluem Jane Street, Podium, Basis e Rogo. O feedback aponta sessões de codificação mais focadas, chamadas de voz complexas mais rápidas, aplicações de baixa latência construídas em torno de um modelo de fronteira e pesquisa financeira com sensação mais próxima de uma troca ao vivo.

Em demonstração publicada pela Cerebras, o mesmo prompt para construir um dashboard estilo terminal financeiro levou 1 minuto e 50 segundos no Ultrafast, contra 12 minutos e 20 segundos no modo padrão, com resultado semelhante.