
AMD e Cerebras anunciam solução conjunta de inferência IA
Parceria AMD e Cerebras para inferência de IA
AMD e Cerebras anunciaram em 23 de julho de 2026 uma parceria técnica para criar uma solução de inferência de IA com latência ultrabaixa e alto throughput. A solução combina o AMD Helios (solução rack-scale com GPUs Instinct) com o Cerebras Wafer-Scale Engine em um fluxo de trabalho de inferência desagregado.
Como funciona
A abordagem separa as duas etapas principais da inferência:
- AMD Helios atua como motor de alto throughput, processando prompts e janelas de contexto grandes.
- Cerebras Wafer-Scale Engine acelera a geração de tokens (decode), que é intensiva em largura de banda de memória, com latência ultrabaixa.
Juntas, as duas tecnologias devem entregar até 5x mais tokens por segundo por watt (T/s/W), segundo modelagem interna da AMD Performance Labs e da Cerebras, comparando a solução conjunta com uma configuração Cerebras WSE isolada no modelo Kimi 2.6 1T.
Contexto de mercado
A justificativa é que workloads de inferência têm requisitos cada vez mais diversos: aplicações de alto volume priorizam throughput máximo, enquanto copilots em tempo real, agentes autônomos e workflows agênticos exigem tempos de resposta mais rápidos. Isso demanda infraestrutura heterogênea que combine diferentes tecnologias de computação para cada tipo de carga.
Disponibilidade
A Cerebras planeja implantar sistemas AMD Helios em seus data centers. A solução conjunta deve estar disponível inicialmente via Cerebras Cloud no segundo semestre de 2026.
Declarações
Lisa Su (CEO da AMD) afirmou que a inferência de IA está se tornando uma das maiores oportunidades de infraestrutura em IA e que a parceria estende a liderança da AMD para aplicações sensíveis a latência, criando uma plataforma para IA agêntica em tempo real. Andrew Feldman (CEO da Cerebras) destacou que a demanda por inferência ultrarrápida cresce em ritmo sem precedentes e que a parceria com a AMD permite levar esse desempenho a mais clientes.