stamatios
← Voltar ao feed
Roboide trabalha em mesa com foguete de brinquedo e laptop, alusão ao Grok 4.6 da SpaceXAI e ao Grok Bot
IA & Modelos · Agentes

SpaceXAI lança Grok 4.6 e empata com GPT-5.6 Sol no topo dos rankings

resumo de ~3 min

A SpaceXAI (antiga xAI, agora sob a SpaceX) lançou o Grok 4.6, modelo de fronteira focado em agentes de longa duração, programação e trabalho de conhecimento. No Artificial Analysis Intelligence Index, o modelo marcou 61 pontos, superando o Kimi K3 e empatando com o GPT-5.6 Sol Max como o terceiro melhor do mundo, atrás apenas de Claude Opus 5 e Fable 5. Em relação ao antecessor Grok 4.5, houve ganhos expressivos em benchmarks de código, terminal e agentes: 69,9% no CursorBench v3.2, 65,9% no DeepSWE v1.1 e 57,5% no APEX-Agents. Ainda assim, concorrentes mantêm liderança em alguns testes, como o Terminal-Bench, onde GPT-5.6 Sol Max e Fable 5 ficaram acima de 34% contra 26% do Grok 4.6.

Preço e contexto

O preço de API começa em US$ 2 por milhão de tokens de entrada e US$ 6 por saída para prompts com menos de 200 mil tokens. Acima desse limite, as tarifas dobram para US$ 4 e US$ 12, afetando o custo total em cenários de contexto longo. Mesmo assim, a SpaceXAI posiciona o modelo como mais barato que rivais como Claude Opus 5 e GPT-5.6 Sol, com custo por tarefa estimado em US$ 0,84 pela Artificial Analysis - embora esse número o torne menos econômico que Grok 4.5, GPT-5.6 Luna, GLM-5.2 e Muse Spark 1.2. A empresa também destaca menor consumo médio de tokens e menos turnos para concluir tarefas no AA-Briefcase.

Disponibilidade e controvérsias

O Grok 4.6 já está disponível no Grok Build, no Cursor, na OpenRouter, na Vercel e na Cloudflare, com suporte a 500 mil tokens de contexto, entrada de texto e imagem, function calling e saídas estruturadas. O lançamento, porém, ocorre em meio ao histórico controverso da marca Grok, incluindo episódios de respostas antissemitas, elogios exagerados a Elon Musk e investigações regulatórias no Reino Unido e na União Europeia sobre geração de imagens ilegais. Para adoção empresarial, isso pode pesar tanto quanto os benchmarks.