stamatios
← Voltar ao feed
DeepSeek V4 Flash supera o V4 Pro com menos parâmetros ativos
IA & Modelos · Open Source

DeepSeek V4 Flash supera o V4 Pro com menos parâmetros ativos

resumo de ~3 min

DeepSeek-V4-Flash-0731

A DeepSeek lançou oficialmente o modelo DeepSeek-V4-Flash-0731, que substitui a versão preview e traz capacidades agenticas substancialmente aprimoradas. O modelo possui a mesma estrutura do DeepSeek-V4-Flash-DSpark, incluindo um módulo de decodificação especulativa (DSpark) integrado ao checkpoint.

Desempenho superior com menos parâmetros ativos

O V4-Flash-0731 supera o DeepSeek-V4-Pro (Preview) em todos os benchmarks listados, apesar de ter uma contagem de parâmetros ativos consideravelmente menor. Ele também se mostra amplamente competitivo com os modelos proprietários mais fortes disponíveis.

Destaques nos benchmarks:

Benchmark V4-Flash-0731 V4-Pro (Preview) Opus-4.8
Terminal Bench 2.1 82,7 72,1 85,0
NL2Repo 54,2 38,5 69,7
Cybergym 76,7 52,7 83,1
DeepSWE 54,4 12,8 58,0
Toolathlon-Verified 70,3 55,9 76,2
Agents' Last Exam 25,2 16,5 25,7
AutomationBench Public 25,1 12,8 27,2

Especificações técnicas

  • Tamanho total: 304B parâmetros (BF16, com suporte a FP8)
  • Licença: MIT
  • Contexto: até 1 milhão de tokens (conforme o título do paper)
  • Níveis de raciocínio: o parâmetro reasoning_effort suporta três níveis - low, high e max - que controlam quanto o modelo "pensa" antes de responder
  • Chat template: não usa Jinja; a DeepSeek fornece scripts Python próprios para codificação/decodificação no formato compatível com OpenAI

Como executar

  • vLLM: basta adicionar a flag --speculative-config com method: dspark. A DeepSeek recomenda um nó com 4×GB300.
  • SGLang: usar --speculative-algorithm DSPARK sem definir um draft model separado.
  • Local: instruções na pasta inference do repositório, com conversão de pesos e demos interativas.
  • Parâmetros de amostragem recomendados: temperature = 1.0, top_p = 0.95 para cenários agenticos e top_p = 1.0 caso contrário. Para níveis de raciocínio high e max, output máximo de 384K tokens.

O modelo já está disponível no Hugging Face com mais de 236 mil downloads no último mês e possui 62 quantizações e 8 fine-tunes da comunidade.