
Fable 5 supera GPT-5.6 em teste de US$ 2 mil e 2 bi de tokens
O experimento
Rami Maalouf, da Expo, gastou mais de 2 bilhões de tokens e US$ 2.000 para comparar três modelos de IA na criação de apps mobile: Fable 5 (via Claude Code), GPT-5.6 Sol e GPT-5.5 (ambos via Codex, este último como controle). Cada modelo recebeu o mesmo prompt, o mesmo template e as mesmas regras, e precisou entregar três apps completos em Expo/React Native sem que o autor tocasse no código. O processo incluiu ideação, desenvolvimento, testes autônomos, validação e debugging, com uma condição fixa: validar cada funcionalidade no simulador iOS antes de avançar.
App 1: rastreador de calorias com IA
Inspirado no design do Cal AI, os três modelos tiveram resultados próximos, mas o Fable 5 venceu por consistência visual (sombras, bordas e componentes mais coesos). O GPT-5.6 Sol se destacou por mostrar detalhes de uso do orçamento diário de calorias, algo que nem o Fable 5 nem o app original exibiam. Já o GPT-5.5 deixou no app uma página "explore" genérica do template padrão do Expo.
- Custo: Fable 5 US$ 276,95; GPT-5.6 US$ 170,16; GPT-5.5 US$ 157,23
- Tempo ativo: Fable 5 3h45; GPT-5.6 5h17; GPT-5.5 5h20
- Saúde do código (0-100): Fable 5 88; GPT-5.6 79; GPT-5.5 79
- O backend usou apenas uma API route do Expo com cerca de 80 linhas, integrada ao OpenAI Agents SDK.
App 2: clone do ChatGPT
O GPT-5.5 não funcionou - nenhuma resposta da IA - enquanto Fable 5 e GPT-5.6 funcionaram, incluindo streaming. O Fable 5 também entregou UI superior, usando botões e sidebar nativos, ausentes nos outros dois.
- Custo: Fable 5 US$ 160,82; GPT-5.6 US$ 125,50; GPT-5.5 US$ 128,29
- Tempo ativo: Fable 5 2h; GPT-5.6 3h24; GPT-5.5 4h26
- Linhas de código: Fable 5 2.000; GPT-5.6 3.500; GPT-5.5 3.600
- Saúde do código: Fable 5 85; GPT-5.6 78; GPT-5.5 77
App 3: reescrita completa de SwiftUI para Expo
O teste mais difícil foi reescrever o Twilight, app de rastreamento de sono em SwiftUI, para Expo/React Native, incluindo Live Activities. O resultado surpreendeu o autor: o Fable 5 reproduziu gráficos, cores, tema e componentes praticamente idênticos ao app original, usando slider nativo e bottom sheet real. Ele chegou a corrigir um bug que existia no app Swift original. As Live Activities funcionaram nos três modelos, com Fable 5 mais fiel ao visual esperado.
- Custo: Fable 5 US$ 558,83; GPT-5.6 US$ 254,50; GPT-5.5 US$ 160,65
- Tempo ativo: Fable 5 3h25; GPT-5.6 13h34; GPT-5.5 5h48
- Custo por hora: Fable 5 US$ 163/h; GPT-5.6 US$ 19/h; GPT-5.5 US$ 28/h
- Saúde do código: Fable 5 88; GPT-5.6 86; GPT-5.5 76
Para onde foram 2 bilhões de tokens
Grande parte do consumo veio do Argent e dos servidores MCP usados pelos modelos para validar cada funcionalidade no simulador. Cada screenshot e cada toque enviavam metadados ao contexto. Multiplicado por 17 tarefas por app, por modelo, em vários loops de correção, o volume disparou. Por isso, o autor recomenda usar subagentes para testes e validação, queimando tokens em contextos separados em vez de poluir o contexto principal.
Veredito
- Fable 5 é o melhor na maioria dos casos: mais rápido, com menos linhas de código, melhor UI e melhor qualidade de código, embora mais caro. É indicado para empreendedores, apps completos, PRs maiores e trabalho como "parceiro técnico".
- GPT-5.6 Sol é persistente: pode rodar por horas até resolver um problema, sendo ideal para automação, problemas bem definidos e tarefas técnicas rápidas. Também custa bem menos por hora.
- GPT-5.5 ficou atrás em todos os testes, com mais dívida técnica e decisões de UI piores.
O autor conclui que o cenário ideal é usar ambos conforme o tipo de tarefa, e não escolher um único modelo.