
Anthropic lança Claude Opus 5, mais barato e potente
Lançamento e posicionamento
A Anthropic lançou em 24 de julho de 2026 o Claude Opus 5, descrito como um modelo que se aproxima da inteligência de fronteira do Claude Fable 5 pela metade do custo. Ele é o novo modelo padrão no Claude Max e o mais forte disponível no Claude Pro. O preço permanece o mesmo do antecessor Opus 4.8: US$ 5 por milhão de tokens de entrada e US$ 25 por milhão de tokens de saída.
Desempenho em benchmarks
Opus 5 é o novo estado da arte em avaliações de codificação e trabalho de conhecimento, como Frontier-Bench e GDPval-AA, embora fique atrás do Mythos 5 em tarefas de cibersegurança. Destaques específicos:
- Frontier-Bench v0.1: supera todos os outros modelos e mais que dobra o desempenho do Opus 4.8 a um custo menor por tarefa.
- CursorBench 3.2: no esforço máximo, fica a 0,5% do pico do Fable 5, mas com metade do custo por tarefa.
- ARC-AGI 3: pontuação três vezes maior que o segundo melhor modelo.
- Zapier AutomationBench: taxa de aprovação cerca de 1,5× maior que o próximo melhor modelo para o mesmo custo.
- OSWorld 2.0: supera o melhor resultado do Fable 5 com pouco mais de um terço do custo.
Em ciências da vida, Opus 5 melhora em todas as avaliações internas, com ganhos notáveis em química orgânica (+10,2 pontos percentuais sobre Opus 4.8) e tarefas relacionadas a proteínas (+7,7 pp).
Agência e verificação de trabalho
O modelo se destaca por verificar seu próprio trabalho e iterar até obter sucesso. Exemplos citados pela Anthropic incluem: criar uma pipeline de visão computacional própria para reconstruir um modelo 3D a partir de pixels brutos (tarefa que nenhum modelo concorrente resolveu em cinco tentativas); encontrar a causa raiz de um bug em um gerenciador de pacotes open-source que o patch da comunidade havia perdido; e construir um feed de dados de mercado para uma nova exchange em uma única sessão, incluindo um harness de teste próprio.
Depoimentos de early-access
Executivos e engenheiros de empresas como Cursor, Zapier, Lovable, Box, JetBrains e AWS relataram ganhos em debugging, análise financeira, trabalho jurídico, pesquisa genômica e construção de aplicações full-stack. Scott Wu (CEO da Cursor) afirmou que o Opus 5 se aproxima do desempenho do Fable a metade do custo, com força particular em debugging difícil e análise de causa raiz.
Alinhamento e segurança
Opus 5 é descrito como o modelo mais alinhado da Anthropic até o momento, com as menores taxas de comportamento enganoso e a menor suscetibilidade a ser induzido ao mau uso. Em cibersegurança, embora se aproxime do Mythos 5 na identificação de vulnerabilidades, fica substancialmente atrás na exploração delas. A Anthropic não treinou o modelo em tarefas de cibersegurança ofensiva. Classificadores de segurança bloqueiam scanning binário, pentesting e geração de exploits, mas permitem identificação de vulnerabilidades em código-fonte. Requisições bloqueadas fazem fallback automático para Opus 4.8.
Novidades adicionais
Junto ao lançamento, a Anthropic disponibilizou em beta: mudanças de ferramentas no meio de uma conversa sem invalidar o cache de prompt, e fallbacks automáticos na API para requisições sinalizadas pelos classificadores de segurança.