stamatios
← Voltar ao feed
Rack de servidores com placa aceleradora em forma de raio, metáfora do chip Groq 3 LPX da NVIDIA para inferência de IA
Hardware & Chips

NVIDIA coloca acelerador de inferência Groq 3 LPX em produção total

resumo de ~3 min

O anúncio

Durante a Hot Chips 2026, a NVIDIA anunciou que o acelerador de inferência Groq 3 LPX entrou em produção total. A empresa apresentou o chip como uma extensão da plataforma Vera Rubin, voltada a cargas de trabalho de inteligência artificial agêntica que exigem respostas rápidas e previsíveis. O anúncio ocorre depois das comunicações sobre a produção em massa das CPUs Vera e dos servidores Vera Rubin, que, segundo a fonte, fazem parte da execução do roteiro de IA da NVIDIA.

A justificativa para o novo acelerador está no modo como agentes de IA operam: eles podem gerar grandes volumes de tokens ao longo de centenas ou milhares de etapas de inferência. Nesse contexto, a velocidade de geração influencia diretamente a responsividade do sistema, a interação com agentes e a eficiência da infraestrutura usada pelas chamadas “fábricas de IA”.

Desempenho e arquitetura

Em uma demonstração da NVIDIA, a plataforma Vera Rubin NVL72 combinada ao Groq 3 LPX alcançou 3.400 tokens por segundo no Artificial Analysis ao executar o modelo aberto Gemma 4 31B, com uma janela de contexto de 100 mil tokens. A empresa classificou o resultado como o desempenho mais rápido já registrado para esse modelo.

A divisão de funções é central para a proposta: as GPUs Rubin processam contextos de grande escala, enquanto o LPX acelera a etapa de decodificação, que é sensível à latência. Segundo a NVIDIA, essa combinação produz geração de tokens mais rápida e previsível, o que pode melhorar o raciocínio responsivo, a fluidez das interações com agentes e o aproveitamento da infraestrutura.

A NVIDIA afirma também que o Groq 3 LPX permite executar tarefas agênticas, como programação, em minutos em vez de horas e oferece um ganho de quatro vezes nos tempos de resposta em comparação com a plataforma alternativa mais próxima. Essas são alegações de desempenho apresentadas pela própria empresa, e o texto não detalha a configuração usada para essa comparação.

Provedores de nuvem e conclusão

Provedores de nuvem voltados à IA avaliam o Groq 3 LPX para atender à demanda crescente por infraestrutura de treinamento, raciocínio e inferência em escala. A Nebius planeja utilizar o acelerador em sua Nebius Token Factory. Seu diretor de tecnologia, Danila Shtan, afirmou que a empresa pretende levá-lo à produção como a primeira nuvem de IA a oferecer o recurso por meio desse serviço, mantendo a mesma API usada pelos desenvolvedores e sem exigir migração para uma nova pilha.

Para Jensen Huang, fundador e CEO da NVIDIA, a inferência é o motor de crescimento da IA. Ele disse que a Vera Rubin amplia a visão da empresa com configurações de fábricas de IA otimizadas para a era dos agentes e que o LPX busca elevar o desempenho, a eficiência e a capacidade de resposta. A conclusão apresentada é que Groq 3 LPX e Vera Rubin foram concebidos em conjunto para priorizar responsividade, capacidade de processamento e eficiência em sistemas agênticos.