
Por Stamatios Stamou Jr·Adversarial coding: uma IA planeja, outra fura o plano
Para mim os modelos já não têm tantos diferenciais. Estamos chegando num momento de comoditização das LLMs. Existe muita equivalência entre elas e muito pouca diferença no resultado final.
Isso não quer dizer que tanto faz. Você continua tendo que escolher a IA certa para a tarefa, e eu volto nisso mais para frente. Quer dizer outra coisa: se a diferença entre os modelos encolheu, o diferencial deixou de estar em qual você usa e passou a estar em como você usa.
Adversarial coding
Hoje o que mais faço é adversarial coding. Nem sei se isso existe, mas é assim que eu chamo.
Funciona assim: uma IA faz um plano, digamos o Claude, e eu submeto esse plano ao Codex. É impressionante como você acha coisas que a primeira IA deveria ter visto e não viu.
E acontece nos dois sentidos. Você vai se surpreender com o tanto que Claude e Codex furam.
Por que duas
Se você tem uma IA só para código, já sai perdendo na partida. Tem que ter pelo menos duas, uma revisando a outra.
Nenhuma é perfeita sozinha. Duas já te dão visões diferentes sobre o mesmo ponto.
Custa mais? Custa. É mais de uma assinatura e é um passo a mais antes de começar. Mas plano errado custa mais caro depois, quando já virou código.
Aqui eu levei isso longe. No token plan eu assino Claude, Codex, MiniMax, Gemini, Kimi, Grok e Qwen. Para API uso Neuralwatt, OpenRouter, Deepseek, Claude, OpenAI, Qwen, Mistral, Kimi e Gemini. Não é para todo mundo, e não estou dizendo que você precisa disso. Mas duas já resolvem boa parte.
Passei a ser agnóstico para código. Dependendo da situação uso um ou outro, sem apego. Para conteúdo não é o mesmo caso.
Onde a commodity acaba
Em código elas se equivalem bastante. Em texto, não. A distância entre a melhor e a pior escrevendo é muito maior do que a distância entre elas programando.
Por isso eu sou agnóstico de um lado e chato do outro. Para código, uso o que estiver melhor no dia. Para texto de verdade, tem uma ordem e eu não abro mão dela.
Como eu escolho hoje
Tarefas banais, sem raciocínio: Luna e Deepseek Flash. Coisa mecânica, não preciso de mais que isso.
Tarefas com um pouco mais de raciocínio, com vários pontos de contato: Sonnet e GPT Terra.
Discutir um projeto ou ideias: GPT Sol, Claude Opus e Kimi K3, sempre com reasoning e effort no alto. É aqui que a conversa vale alguma coisa.
Escrita banal: QwenMax ou MiniMax M3. É o que uso em textos como este, do Em 3 min.
Texto que precisa passar como humano: Kimi K3 ou Claude Opus.
Conteúdo de alto nível: só Kimi K3, Claude Opus e GPT Sol, nesta ordem. Para conteúdo do dia a dia eu abro o leque sem muita exigência.
E o Grok entrou nessa lista por velocidade. Estou bem feliz com ele, coloca Codex e Claude no chinelo para código. Para conteúdo é ruim.
No fim
Não tem resposta certa. Cada um faz do jeito que achar melhor, e o que funciona para mim pode não servir para você.
Mas eu tenho uma certeza absoluta: se você usa uma IA só por comodidade, você não sabe o que está perdendo.
Stamatios