
Guia de Macs para rodar LLMs locais prioriza memória unificada
{ "resumo": "## A memória unificada decide tudo\n\nUm guia de compra de Macs para rodar LLMs locais em 2026 argumenta que a escolha deve seguir esta ordem: memória unificada primeiro, banda de memória depois, e o nome do chip em último lugar. A memória determina quais modelos conseguem carregar (é um teto fixo, soldado, impossível de atualizar depois), enquanto a banda de memória - medida em GB/s - define a velocidade de geração de tokens. A própria pesquisa da Apple afirma que a geração de tokens subsequentes é limitada pela banda de memória, não pela capacidade de computação.\n\n## Quanta memória cada faixa exige\n\nCom quantização de 4 bits como padrão prático: 16GB roda modelos 7–14B; 64GB permite 70B densos com contexto real ou MoE de 100–120B (a faixa "séria" principal); 128GB cobre 70B em Q8 e modelos de ~180B; 256GB chega a modelos densos de 200B, Qwen3-235B e Llama-405B; 512GB roda o DeepSeek-V3/R1 671B completo em Q4. O guia destaca que o salto para 70B com folga acontece nos 64GB e que modelos MoE de fronteira exigem 256–512GB.\n\n## A linha de produtos em setembro de 2026\n\nO Mac mini M4 Pro de 64GB a US$ 1.599 é apontado como o melhor custo-benefício, com 273 GB/s. Para 70B confortável, o novo Mac Studio M5 Max de 128GB (US$ 2.499, envio em 22 de setembro) substitui o M4 Max em saída de linha. Para modelos MoE de fronteira, o Mac Studio M5 Ultra com 512GB e 1,2 TB/s (US$ 5.499, configuração de 512GB no fim de outubro) assume o posto do M3 Ultra, que teve o preço elevado e as opções de 512GB retiradas. A faixa de entrada de 32GB é considerada teto baixo demais se LLMs locais forem o objetivo da compra.\n\n## Onde os Macs brilham e onde fracassam\n\nOs Macs se destacam em duas frentes que uma GPU dedicada não iguala a preço e consumo razoáveis: rodar modelos MoE esparsos inteiros na memória (o DeepSeek 671B ativa apenas 37B de parâmetros por token, e donos de M3 Ultra de 512GB relatam 6 a 18 tokens/s) e inferência silenciosa e de baixo consumo - abaixo de 200 watts contra os quilowatts de um rig multi-GPU.\n\nAs fraquezas derivam do mesmo ponto: compute modesto comparado à NVIDIA. Modelos densos gigantes ficam lentos mesmo carregando (Llama 3.1 405B em Q6 a apenas 1,25 tok/s em um M3 Ultra de 512GB). E o processamento de prompts longos (prefill) é o verdadeiro ponto fraco: essa fase é limitada por computação, e um M2 Ultra processa prompts cerca de 5 a 8 vezes mais devagar que uma RTX 4090, enquanto a diferença em geração é de 1,3 a 2,5 vezes. Um dono registrou quase 15 minutos para ingerir um prompt de 8.000 tokens no DeepSeek V3 671B. Quem trabalha com documentos longos, codebases grandes ou RAG pesado deve reconsiderar.\n\n## Software e o truque do macOS\n\nNo software, MLX, da Apple, tornou-se o padrão mais rápido na maioria dos casos - cerca de 1,4 a 1,8 vez mais rápido que o llama.cpp em modelos densos e até 3 vezes em MoE - a ponto de o Ollama ter adicionado backend MLX em março de 2026. O llama.cpp ainda vence em contexto muito longo (acima de ~30K tokens), compatibilidade via ecossistema GGUF e simplicidade. A recomendação é instalar ambos. No hardware, os novos Neural Accelerators por núcleo do M5 dão ao MLX até ~4x mais velocidade até o primeiro token em relação ao M4, pois atacam justamente o prefill.\n\nAlém disso, o macOS limita por padrão a memória do GPU a cerca de 70–75% da RAM instalada; o comando sysctl iogpu.wired_limit_mb eleva esse teto, não persiste entre reinicializações e não conta com suporte oficial da Apple.\n\n## Comprar agora ou esperar?\n\nO anúncio dos Mac Studio M5 Max e M5 Ultra em 25 de agosto de 2026 define a resposta: para quem quer um Studio, vale esperar os substitutos, mais rápidos pelo mesmo dinheiro; para quem quer uma máquina de 64GB (Mac mini M4 Pro), a recomendação é comprar agora; os notebooks M5 já são a geração atual, sem motivo para esperar. A conclusão: um Mac oferece capacidade e silêncio, não velocidade bruta - é a melhor máquina de consumo para modelos esparsos grandes que não caberiam em outro lugar, e a escolha errada quando o gargalo é o processamento de prompts longos.", "hook": "Qual Mac carrega um DeepSeek 671B em casa - e por que ele pode levar 15 minutos só para ler seu prompt? Um guia de 2026 argumenta que a memória unificada importa mais que o nome do chip, mas revela o detalhe do macOS que nenhum folheto menciona: o GPU não recebe toda a RAM por padrão.", "entities": ["Apple", "Mac Studio", "Mac mini", "MacBook Pro", "DeepSeek", "MLX", "llama.cpp"], "themes": ["dispositivos-e-consumer-tech", "open-weights-e-modelos-locais", "chips-e-compute"], "story_key": "mac-local-llm-guia-memoria",\n "reasoning": {\n "story_key": "A tese canônica é o guia de compra de Macs para LLMs locais guiado pela memória unificada.",\n "themes": {\n "dispositivos-e-consumer-tech": "O guia compara Macs consumíveis (Mac mini, MacBook Pro, Mac Studio) para uso pessoal.",\n "open-weights-e-modelos-locais": "O assunto central é inferência local de modelos abertos (DeepSeek, Qwen, Llama) em hardware próprio.",\n "chips-e-compute": "Há discussão substancial de chips M5/M4, banda de memória e compute versus NVIDIA."\n },\n "entities": {\n "Apple": "Fabricante do hardware e do MLX, sujeito central do guia.",\n "Mac Studio": "Máquina destacada como plataforma para modelos de fronteira.",\n "Mac mini": "Apontado como melhor custo-benefício (M4 Pro, 64GB).",\n "MacBook Pro": "Opção portátil discutida por faixa de memória.",\n "DeepSeek": "Modelo de referência para MoE de 671B nos exemplos de capacidade.",\n "MLX": "Framework da Apple recomendado como padrão mais rápido.",\n "llama.cpp": "Runtime comparado ao MLX com casos de uso remanescentes."\n },\n "excluded": {\n "Thomas Newkirk": "Autor, excluído por regra.",\n "Vetted Consumer": "Veículo publicador, excluído por regra.",\n "RTX 4090": "Menção secundária de comparação de desempenho.",\n "Ollama": "Menção secundária de ecossistema de software."\n }\n }\n}\n