stamatios
← Voltar ao feed
Anthropic lança Claude Opus 5, mais barato e potente
IA & Modelos · Big Tech

Anthropic lança Claude Opus 5, mais barato e potente

resumo de ~3 min

Lançamento e posicionamento

A Anthropic lançou em 24 de julho de 2026 o Claude Opus 5, descrito como um modelo que se aproxima da inteligência de fronteira do Claude Fable 5 pela metade do custo. Ele é o novo modelo padrão no Claude Max e o mais forte disponível no Claude Pro. O preço permanece o mesmo do antecessor Opus 4.8: US$ 5 por milhão de tokens de entrada e US$ 25 por milhão de tokens de saída.

Desempenho em benchmarks

Opus 5 é o novo estado da arte em avaliações de codificação e trabalho de conhecimento, como Frontier-Bench e GDPval-AA, embora fique atrás do Mythos 5 em tarefas de cibersegurança. Destaques específicos:

  • Frontier-Bench v0.1: supera todos os outros modelos e mais que dobra o desempenho do Opus 4.8 a um custo menor por tarefa.
  • CursorBench 3.2: no esforço máximo, fica a 0,5% do pico do Fable 5, mas com metade do custo por tarefa.
  • ARC-AGI 3: pontuação três vezes maior que o segundo melhor modelo.
  • Zapier AutomationBench: taxa de aprovação cerca de 1,5× maior que o próximo melhor modelo para o mesmo custo.
  • OSWorld 2.0: supera o melhor resultado do Fable 5 com pouco mais de um terço do custo.

Em ciências da vida, Opus 5 melhora em todas as avaliações internas, com ganhos notáveis em química orgânica (+10,2 pontos percentuais sobre Opus 4.8) e tarefas relacionadas a proteínas (+7,7 pp).

Agência e verificação de trabalho

O modelo se destaca por verificar seu próprio trabalho e iterar até obter sucesso. Exemplos citados pela Anthropic incluem: criar uma pipeline de visão computacional própria para reconstruir um modelo 3D a partir de pixels brutos (tarefa que nenhum modelo concorrente resolveu em cinco tentativas); encontrar a causa raiz de um bug em um gerenciador de pacotes open-source que o patch da comunidade havia perdido; e construir um feed de dados de mercado para uma nova exchange em uma única sessão, incluindo um harness de teste próprio.

Depoimentos de early-access

Executivos e engenheiros de empresas como Cursor, Zapier, Lovable, Box, JetBrains e AWS relataram ganhos em debugging, análise financeira, trabalho jurídico, pesquisa genômica e construção de aplicações full-stack. Scott Wu (CEO da Cursor) afirmou que o Opus 5 se aproxima do desempenho do Fable a metade do custo, com força particular em debugging difícil e análise de causa raiz.

Alinhamento e segurança

Opus 5 é descrito como o modelo mais alinhado da Anthropic até o momento, com as menores taxas de comportamento enganoso e a menor suscetibilidade a ser induzido ao mau uso. Em cibersegurança, embora se aproxime do Mythos 5 na identificação de vulnerabilidades, fica substancialmente atrás na exploração delas. A Anthropic não treinou o modelo em tarefas de cibersegurança ofensiva. Classificadores de segurança bloqueiam scanning binário, pentesting e geração de exploits, mas permitem identificação de vulnerabilidades em código-fonte. Requisições bloqueadas fazem fallback automático para Opus 4.8.

Novidades adicionais

Junto ao lançamento, a Anthropic disponibilizou em beta: mudanças de ferramentas no meio de uma conversa sem invalidar o cache de prompt, e fallbacks automáticos na API para requisições sinalizadas pelos classificadores de segurança.