
GPT-5.6 Sol triplica pontuação no ARC-AGI-3 com dois ajustes
O problema
GPT-5.6 Sol, modelo que já resolveu problemas abertos em matemática e venceu jogos como Pokémon FireRed, obteve apenas 7,8% no benchmark ARC-AGI-3 - um conjunto de jogos de puzzle 2D que testa a capacidade de agentes aprenderem regras sem instruções explícitas. GPT-5.5 mal conseguia jogar, com 0,4%.
A causa
A equipe da OpenAI investigou e descobriu que o baixo desempenho não refletia uma limitação intrínseca do modelo, mas sim duas configurações do harness oficial do benchmark:
Descarte de raciocínio privado: após cada ação, todo o raciocínio interno do modelo era eliminado. A cada turno, o GPT-5.6 Sol precisava reinterpretar o jogo do zero, sem acesso a planos, insights ou pensamentos anteriores.
Truncamento rolante: quando o contexto ultrapassava 175 mil caracteres, as mensagens mais antigas eram descartadas. O modelo perdia não só o raciocínio, mas também a memória das próprias ações passadas.
A solução
A OpenAI reimplementou o harness usando a Responses API com duas configurações já utilizadas em produção no ChatGPT e no Codex:
- Retenção de raciocínio (retained reasoning): o raciocínio privado é mantido no histórico da conversa entre turnos.
- Compaction: em vez de truncar mensagens antigas, o contexto é resumido, preservando o que o modelo aprendeu.
Resultados
Com o harness oficial, GPT-5.6 Sol marcou 13,3% na métrica RHAE (Relative Human Action Efficiency). Com retenção de raciocínio e compaction, a pontuação subiu para 38,3% - aproximadamente 3x mais - com 6x menos tokens de saída. Como referência, testers humanos tiveram média estimada de 48%.
No leaderboard público do jogo, nenhum modelo frontier resolve nenhum nível além do primeiro com o harness oficial. Com o harness otimizado, GPT-5.6 Sol resolve todos os seis níveis.
Recomendações
A OpenAI recomenda que desenvolvedores de API usem a Responses API (não a legacy Chat Completions), retenham raciocínio e ativem compaction. Para comparações entre modelos, sugerem confiar em evals que usem essas configurações, por refletirem melhor o uso real em produção.
O post também serve como alerta mais amplo: benchmarks raramente medem modelos isoladamente - medem também escolhas menos visíveis de configuração de API, design de harness e prompting.