stamatios
← Voltar ao feed
GPT-5.6 Sol triplica pontuação no ARC-AGI-3 com dois ajustes
IA & Modelos

GPT-5.6 Sol triplica pontuação no ARC-AGI-3 com dois ajustes

resumo de ~3 min

O problema

GPT-5.6 Sol, modelo que já resolveu problemas abertos em matemática e venceu jogos como Pokémon FireRed, obteve apenas 7,8% no benchmark ARC-AGI-3 - um conjunto de jogos de puzzle 2D que testa a capacidade de agentes aprenderem regras sem instruções explícitas. GPT-5.5 mal conseguia jogar, com 0,4%.

A causa

A equipe da OpenAI investigou e descobriu que o baixo desempenho não refletia uma limitação intrínseca do modelo, mas sim duas configurações do harness oficial do benchmark:

  1. Descarte de raciocínio privado: após cada ação, todo o raciocínio interno do modelo era eliminado. A cada turno, o GPT-5.6 Sol precisava reinterpretar o jogo do zero, sem acesso a planos, insights ou pensamentos anteriores.

  2. Truncamento rolante: quando o contexto ultrapassava 175 mil caracteres, as mensagens mais antigas eram descartadas. O modelo perdia não só o raciocínio, mas também a memória das próprias ações passadas.

A solução

A OpenAI reimplementou o harness usando a Responses API com duas configurações já utilizadas em produção no ChatGPT e no Codex:

  • Retenção de raciocínio (retained reasoning): o raciocínio privado é mantido no histórico da conversa entre turnos.
  • Compaction: em vez de truncar mensagens antigas, o contexto é resumido, preservando o que o modelo aprendeu.

Resultados

Com o harness oficial, GPT-5.6 Sol marcou 13,3% na métrica RHAE (Relative Human Action Efficiency). Com retenção de raciocínio e compaction, a pontuação subiu para 38,3% - aproximadamente 3x mais - com 6x menos tokens de saída. Como referência, testers humanos tiveram média estimada de 48%.

No leaderboard público do jogo, nenhum modelo frontier resolve nenhum nível além do primeiro com o harness oficial. Com o harness otimizado, GPT-5.6 Sol resolve todos os seis níveis.

Recomendações

A OpenAI recomenda que desenvolvedores de API usem a Responses API (não a legacy Chat Completions), retenham raciocínio e ativem compaction. Para comparações entre modelos, sugerem confiar em evals que usem essas configurações, por refletirem melhor o uso real em produção.

O post também serve como alerta mais amplo: benchmarks raramente medem modelos isoladamente - medem também escolhas menos visíveis de configuração de API, design de harness e prompting.