stamatios
← Voltar ao feed
GPT-5.6 une inteligência de fronteira com eficiência
IA & Modelos · Agentes

GPT-5.6 une inteligência de fronteira com eficiência

resumo de ~3 min

GPT-5.6: eficiência em toda a stack

A OpenAI publicou em 29 de julho de 2026 um post técnico detalhando como a família GPT-5.6 equilibra capacidade e custo. O modelo flagship, GPT-5.6 Sol (com raciocínio máximo), supera o Claude Fable 5 no Artificial Analysis Coding Agent Index custando menos da metade. O Terra iguala o GPT-5.5 em benchmarks de inteligência por metade do preço, e o Luna é o mais rápido e barato, com custo 80% menor que o Sol.

As otimizações se distribuem em três camadas: modelos, inferência e o harness agêntico (usado pelo Codex e ChatGPT Work).

Otimizações de inferência

O objetivo central é servir mais tokens com o mesmo hardware, mantendo latência e confiabilidade. As melhorias incluem:

  • Load balancing: roteamento global por geografia, capacidade e tipo de acelerador; distribuição intra-cluster por carga, comprimento de contexto e disponibilidade de cache. O GPT-5.6 Sol em Codex analisou tráfego de produção e identificou fontes de desequilíbrio antes ignoradas.
  • Otimização de kernels: o GPT-5.6 Sol reescreveu autonomamente kernels de produção em Triton e Gluon (linguagens de programação GPU open-source mantidas pela OpenAI), reduzindo custos de serving em 20%. A ferramenta open-source FpSan (Floating-Point Sanitizer) valida a corretude dos kernels gerados.
  • Speculative decoding: um modelo draft menor propõe tokens que o modelo principal verifica em paralelo. O GPT-5.6 Sol projetou e executou centenas de experimentos na arquitetura do draft model, aumentando a eficiência de geração de tokens em mais de 15%.
  • Otimização de KV cache e configuração: análise de workloads de produção para hiper-otimizar batching, sharding e gerenciamento de cache por cenário.

Harness agêntico

O harness é uma camada de orquestração em Rust que conecta modelos, ferramentas e o ambiente do usuário. Três estratégias principais:

  • Evitar context bloat: descoberta diferida de integrações, ferramentas MCP e plugins (só aparecem quando necessário); saída de ferramentas limitada a 10.000 tokens por padrão.
  • Preservar prefixos exatos para prompt caching: todo histórico visível ao modelo é append-only; ferramentas são apresentadas em ordem determinística; configurações de runtime são aplicadas na execução, não embutidas nas definições. Isso contribui para altas taxas de cache hit.
  • Redução de trabalho repetido: em um único turno, o Codex pode fazer 30 requisições ao modelo; cada segundo extra por requisição se acumula. O harness minimiza esse custo repetido.

Papel do GPT-5.6 Sol nas próprias otimizações

Um ponto recorrente é que o GPT-5.6 Sol, operando dentro do Codex, foi instrumental em descobrir e implementar várias dessas melhorias - desde análise de tráfego até reescrita de kernels e tuning de speculative decoding. A OpenAI vê isso como indicativo de que o ritmo de otimizações deve acelerar.