
AMD domina paralelismo em nível de memória contra Intel
Quando um programa acessa memória que não está em cache, o processador precisa ir até a RAM - uma viagem que custa cerca de 100 nanossegundos, ou ~300 ciclos em um core de 3 GHz. A latência de memória não melhorou na última década: o Broadwell (2016) respondia em 100 ns, e o Turin (2025), com DDR5-6400, leva 140 ns. Piorou.
A boa notícia é que um core moderno não precisa ficar parado. Ele pode emitir múltiplas requisições de memória antes que a primeira retorne. O número de requisições simultâneas que um único core consegue manter em voo é chamado de paralelismo em nível de memória (MLP) - um dos números mais importantes para performance de software e um dos menos divulgados.
Metodologia
Daniel Lemire usa o benchmark testingmlp, baseado em pointer chasing: um array de 1 GiB com um ciclo aleatório cobrindo todos os elementos. Seguir o ciclo é inerentemente serial, medindo latência pura. Depois, múltiplos "lanes" (perseguições independentes) são executados simultaneamente. Quando adicionar um lane para de ajudar, encontra-se o limite de MLP.
Resultados
Os testes foram feitos na AWS. A evolução ao longo do tempo:
- Intel: foi de 10 para 30 requisições concorrentes. Broadwell e Cascade Lake ficavam em 10. Ice Lake dobrou para 20. Granite Rapids chegou a 30. Todo o ganho veio nas duas últimas gerações.
- AMD: começou à frente e disparou. Naples (2018) já tinha 15, quando Intel estava em 10. Milan chegou a 22. Turin (Zen 5) atingiu 58 cache lines concorrentes de um único core.
- Graviton (AWS): foi de 6 (Graviton 1) para 19 (Graviton 5). A evolução estagnou nas últimas gerações, mas o Graviton 5 é o único chip da lista que reduziu a latência de acesso aleatório em relação ao predecessor (96 ns).
Comparativo direto
| Instância | Processador | Latência | Pico de BW | Concorrência |
|---|---|---|---|---|
| m8i.large (2025) | Xeon 6975P, Granite Rapids | 133 ns | 13,3 GiB/s | 30 |
| m8a.large (2025) | EPYC 9R45, Zen 5 (Turin) | 142 ns | 24,5 GiB/s | 58 |
| m9g.large (2026) | Graviton 5, Neoverse V3 | 96 ns | 12,0 GiB/s | 19 |
Em bandwidth e MLP, AMD vence com folga: o core Zen 5 sustenta 58 fetches concorrentes e 24,5 GiB/s de throughput de acesso aleatório - aproximadamente o dobro da Intel. Apple Silicon faz ainda melhor, mas é outra categoria.