stamatios
← Voltar ao feed
Olho robótico com lente de câmera escaneando mesa cheia de objetos, representando a capacidade de visão do GPT-5.6 Sol
IA & Modelos · Dev & Engenharia

GPT-5.6 Sol da OpenAI se destaca em visão mas enfrenta limites de custo

resumo de ~3 min

Avaliação de visão no GPT-5.6

A Roboflow testou os modelos GPT-5.6 Sol, Terra e Luna, anunciados pela OpenAI na semana anterior, usando seu próximo benchmark de VLM, com tarefas de detecção, contagem, OCR e extração de dados. A OpenAI destacou na apresentação recursos de uso de computador, agentes de interface e visualizações 3D, capacidades que dependem de entendimento visual mais forte. Segundo a avaliação, Sol é claramente o melhor modelo de visão já lançado pela OpenAI, com avanço especialmente visível em detecção e contagem de objetos, áreas em que GPT-5.5 ficava muito atrás dos VLMs mais fortes. Terra e Luna não alcançam Sol, mas mostram progresso relevante sobre GPT-5.5.

Detecção e contagem

Em detecção, GPT-5.5 havia marcado 13,8 mAP@50 no benchmark, enquanto Sol chegou a 46,2; Terra e Luna ficaram em 44,7 e 43,3. Sol lidou bem com layout de documentos - títulos, parágrafos, tabelas, imagens e assinaturas - e com cenas densas, como comprimidos e ovos, casos difíceis para VLMs porque a resposta textual cresce com o número de objetos e aumenta o risco de omissões, duplicatas ou erros de coordenadas. A Roboflow recomenda pedir coordenadas absolutas XYXY em pixels para GPT-5.6; usar o formato errado reduziu o desempenho em cerca de 15 pontos de mAP. Também houve casos de caixas em locais aparentemente aleatórios, sem sobreposição com objetos reais. A OpenAI confirmou que Sol fica menos estável em imagens próximas de 2.000 por 2.000 pixels ou maiores, sobretudo com esforço de raciocínio baixo; aumentar esse esforço melhora a estabilidade, mas eleva uso de tokens, latência e custo. Redimensionar ou recortar imagens grandes é o contorno mais prático.

Em contagem, Sol marcou 73,0%, acima dos 64,9% de GPT-5.5; Terra e Luna ficaram em 67,6% e 66,2%. Sol contou suportes metálicos muito sobrepostos e contou furos de bala apenas dentro de zonas de pontuação selecionadas. Já blister packs foram mais difíceis por reflexos e diferenças visuais pequenas entre slots cheios e vazios, e um exemplo com doces anormais gerou contagem errada, sem clareza se houve erro de contagem ou de compreensão da categoria.

OCR, extração e trade-offs

OCR ficou próximo de GPT-5.5: Sol teve similaridade média de 90,7%, ante 91,2% do anterior; Terra e Luna atingiram 88,8% e 88,4%. A diferença foi maior em extração de texto, na qual Sol marcou 82,5% contra 87,6% de GPT-5.5; Luna e Terra ficaram em 81,4% e 79,4%. Sol foi bem em notas manuscritas, texto em cenas complexas, como pneu sujo e placar de transmissão de hóquei, mas falhou ao ler data de validade pequena, vertical e com reflexos em blister pack.

Os ganhos vêm com maior uso de tokens. Sol levou cerca de 10 segundos por imagem, Terra aproximadamente 6 e Luna pouco mais de 5. Em custo, Sol ficou em torno de 2,5 centavos de dólar por imagem, o segundo mais caro depois de Claude Fable 5; Terra custou cerca de 1 centavo e Luna menos de 0,5 centavo. Gemini 3.5 Flash, a 0,8 centavo por imagem, permanece mais barato e lidera detecção e contagem no benchmark, sendo opção forte para cargas intensivas. A conclusão é que a OpenAI se aproximou dos VLMs líderes, mas limites de custo, latência e instabilidade persistem.