
Um prompt, 11 modelos: resultados e custos muito diferentes
A Netlify anunciou uma parceria com a OpenRouter para ampliar o acesso a modelos de IA em sua plataforma. Com isso, projetos hospedados na Netlify passam a poder usar qualquer modelo disponível na OpenRouter por meio do AI Gateway, e o recurso Agent Runners ganha novos modelos de código aberto, como Kimi K3, GLM 5.2 e DeepSeek V4, além de opções já existentes como Claude, OpenAI Codex e Gemini CLI. A empresa também incluiu o agente open-source OpenCode como alternativa para operar esses modelos.
Teste com 11 modelos
Para ajudar desenvolvedores a escolher entre tantas opções, a Netlify executou o mesmo prompt em 11 modelos diferentes e comparou resultados visuais e consumo de créditos. O primeiro caso foi a criação de uma página estática para uma cafeteria local, com horário de funcionamento, endereço, cardápio curto e uma foto. Cada modelo rodou três vezes.
A diferença de custo foi grande. Claude Opus 5 teve média de 519 créditos, puxada por uma execução de 1.055 créditos. Claude Sonnet 5 ficou em 143, GPT 5.6 Sol em modo de baixo esforço ficou em 141, Gemini 3.6 Flash em 103 e Kimi K3 em 102. Modelos mais baratos tiveram médias bem menores: Gemini 3.1 Pro com 53, GPT 5.6 Terra com 39, DeepSeek V4 Pro com 37, GLM 5.2 com 27, Kimi K2.7 Code com 19 e DeepSeek V4 Flash com apenas 2,4 créditos em média.
Resultados qualitativos
Claude Opus 5 produziu páginas mais detalhadas, com elementos gráficos elaborados e dark mode funcionando de fábrica, mas com custo mais alto e maior tendência a gastar créditos além do esperado. Claude Sonnet 5 entregou resultados corretos, porém mais simples.
GPT 5.6 Sol em modo de baixo esforço teve melhor intuição de design básico que o modelo intermediário da Anthropic nesse cenário. GPT 5.6 Terra, mais barato, apresentou linguagem visual diferente, com páginas mais simples e alguns pequenos defeitos, mas ainda aproveitável. Gemini 3.6 Flash entregou resultado mais moderno que Gemini 3.1 Pro, embora com mais repetição de conteúdo.
Entre os modelos abertos, Kimi K3 não se destacou nessa tarefa específica de design simples, apesar de ser voltado a tarefas agênticas de longo prazo. Kimi K2.7 Code, GLM 5.2 e DeepSeek V4 Pro tiveram resultados mais básicos. O DeepSeek V4 Flash foi o mais barato de todos, com resultados mistos, mas surpreendentemente próximos de modelos fechados intermediários em uma das execuções.
Conclusão parcial
A Netlify ressalta que o teste avaliou principalmente design e texto gerados, não capacidade de usar recursos de plataforma, validar o próprio trabalho ou iterar com feedback. Para projetos mais complexos, esses fatores pesam mais. Ainda assim, a comparação mostra que modelos muito mais baratos podem ser suficientes para projetos simples ou para uma abordagem iterativa, enquanto modelos de ponta custam mais, mas oferecem acabamento e autonomia maiores.