stamatios
← Voltar ao feed
Corredor pequeno entrega bastão a gigante em revezamento, metáfora do speculative decoding acelerando LLMs
IA & Modelos · Dev & Engenharia

Como deixar LLMs até 3x mais rápidas com speculative decoding

resumo de ~3 min

Por que a geração é lenta

A geração autoregressiva produz um token por vez: o modelo lê o contexto, calcula a distribuição de probabilidades, escolhe o próximo token e repete o ciclo. Uma resposta de 500 tokens, portanto, exige 500 passagens sequenciais pelo modelo. O KV cache reduz o trabalho de atenção para tokens já processados, mas não elimina a necessidade de uma passagem por token.

Em modelos grandes, o gargalo costuma ser a movimentação de dados, não a aritmética. Um modelo de 70 bilhões de parâmetros em precisão de 16 bits precisa transferir aproximadamente 140 GB de pesos da memória da GPU a cada token. Durante o processamento do prompt, a utilização computacional pode ficar entre 90% e 95%; na geração, cai para algo entre 20% e 40%, porque os mesmos pesos são aplicados a apenas um token por vez. Por isso, maior largura de banda de memória pode melhorar mais a velocidade de geração do que mais capacidade bruta de cálculo.

Como funciona a decodificação especulativa

A decodificação especulativa usa essa capacidade ociosa com dois modelos. Um modelo pequeno, chamado modelo rascunho, gera serialmente de três a cinco tokens candidatos, normalmente usando entre 10 e 20 vezes menos parâmetros que o modelo grande, chamado modelo-alvo. Em seguida, o modelo-alvo avalia todos os candidatos em uma única passagem.

Transformers calculam previsões para várias posições em paralelo. A máscara causal garante que cada posição só use os tokens anteriores a ela, preservando a mesma condição que existiria na geração sequencial. O modelo-alvo compara os candidatos da esquerda para a direita, mantém o prefixo coincidente e descarta os tokens a partir do primeiro erro. Na posição do erro, sua própria previsão já foi calculada e pode ser usada diretamente. Assim, mesmo se todos os candidatos falharem, a passagem ainda fornece um token que o método convencional produziria.

Com decodificação gulosa, um candidato é aceito quando coincide com a escolha de maior probabilidade do modelo-alvo. Em amostragem, a decisão compara as probabilidades dos dois modelos e, quando necessário, escolhe uma substituição a partir de uma distribuição ajustada. Segundo o texto, essa regra mantém as mesmas propriedades estatísticas do modelo-alvo usado sozinho, embora a amostragem ainda possa produzir redações diferentes e limitações de precisão numérica possam alterar resultados em casos quase empatados.

Quando há ganho

O benefício depende da taxa de aceitação, isto é, da fração de candidatos mantida pelo modelo-alvo, e do comprimento médio aceito por passagem. Código, sumarização, extração e respostas com geração aumentada por recuperação tendem a favorecer taxas altas por reutilizarem padrões do contexto. Escrita criativa e conversas abertas tendem a favorecer taxas menores. Temperaturas mais altas também aumentam as divergências; abaixo de aproximadamente 50% de aceitação, o trabalho adicional pode superar a economia.

O texto cita taxas de 80% a 90% para o segundo token previsto no atendimento de produção do DeepSeek-V3, associadas a aproximadamente 1,8 vez mais vazão. As fontes de rascunho podem ser um modelo menor, cabeças extras de previsão no modelo-alvo, uma versão mais barata do mesmo modelo ou uma busca por sequências já presentes no prompt e na saída.

Limites operacionais

Os ganhos dependem da carga do servidor. Uma avaliação registrou até 1,96 vez mais velocidade em um modelo de 70 bilhões de parâmetros com lote 1, mas apenas 1,21 vez com lote 128; sob concorrência alta, a técnica pode ficar abaixo da vazão convencional. Sistemas como o vLLM podem reduzir o comprimento do rascunho ou desativar a especulação acima de determinado tamanho de lote. O tempo até o primeiro token permanece aproximadamente igual, portanto prompts longos com respostas curtas ganham pouco. A técnica reorganiza o processamento do modelo-alvo, em vez de reduzir o trabalho que ele executa.