stamatios
← Voltar ao feed
AMD domina paralelismo em nível de memória contra Intel
Hardware & Chips

AMD domina paralelismo em nível de memória contra Intel

resumo de ~3 min

Quando um programa acessa memória que não está em cache, o processador precisa ir até a RAM - uma viagem que custa cerca de 100 nanossegundos, ou ~300 ciclos em um core de 3 GHz. A latência de memória não melhorou na última década: o Broadwell (2016) respondia em 100 ns, e o Turin (2025), com DDR5-6400, leva 140 ns. Piorou.

A boa notícia é que um core moderno não precisa ficar parado. Ele pode emitir múltiplas requisições de memória antes que a primeira retorne. O número de requisições simultâneas que um único core consegue manter em voo é chamado de paralelismo em nível de memória (MLP) - um dos números mais importantes para performance de software e um dos menos divulgados.

Metodologia

Daniel Lemire usa o benchmark testingmlp, baseado em pointer chasing: um array de 1 GiB com um ciclo aleatório cobrindo todos os elementos. Seguir o ciclo é inerentemente serial, medindo latência pura. Depois, múltiplos "lanes" (perseguições independentes) são executados simultaneamente. Quando adicionar um lane para de ajudar, encontra-se o limite de MLP.

Resultados

Os testes foram feitos na AWS. A evolução ao longo do tempo:

  • Intel: foi de 10 para 30 requisições concorrentes. Broadwell e Cascade Lake ficavam em 10. Ice Lake dobrou para 20. Granite Rapids chegou a 30. Todo o ganho veio nas duas últimas gerações.
  • AMD: começou à frente e disparou. Naples (2018) já tinha 15, quando Intel estava em 10. Milan chegou a 22. Turin (Zen 5) atingiu 58 cache lines concorrentes de um único core.
  • Graviton (AWS): foi de 6 (Graviton 1) para 19 (Graviton 5). A evolução estagnou nas últimas gerações, mas o Graviton 5 é o único chip da lista que reduziu a latência de acesso aleatório em relação ao predecessor (96 ns).

Comparativo direto

Instância Processador Latência Pico de BW Concorrência
m8i.large (2025) Xeon 6975P, Granite Rapids 133 ns 13,3 GiB/s 30
m8a.large (2025) EPYC 9R45, Zen 5 (Turin) 142 ns 24,5 GiB/s 58
m9g.large (2026) Graviton 5, Neoverse V3 96 ns 12,0 GiB/s 19

Em bandwidth e MLP, AMD vence com folga: o core Zen 5 sustenta 58 fetches concorrentes e 24,5 GiB/s de throughput de acesso aleatório - aproximadamente o dobro da Intel. Apple Silicon faz ainda melhor, mas é outra categoria.