
DeepSeek V4 Flash supera o V4 Pro com menos parâmetros ativos
resumo de ~3 min
DeepSeek-V4-Flash-0731
A DeepSeek lançou oficialmente o modelo DeepSeek-V4-Flash-0731, que substitui a versão preview e traz capacidades agenticas substancialmente aprimoradas. O modelo possui a mesma estrutura do DeepSeek-V4-Flash-DSpark, incluindo um módulo de decodificação especulativa (DSpark) integrado ao checkpoint.
Desempenho superior com menos parâmetros ativos
O V4-Flash-0731 supera o DeepSeek-V4-Pro (Preview) em todos os benchmarks listados, apesar de ter uma contagem de parâmetros ativos consideravelmente menor. Ele também se mostra amplamente competitivo com os modelos proprietários mais fortes disponíveis.
Destaques nos benchmarks:
| Benchmark | V4-Flash-0731 | V4-Pro (Preview) | Opus-4.8 |
|---|---|---|---|
| Terminal Bench 2.1 | 82,7 | 72,1 | 85,0 |
| NL2Repo | 54,2 | 38,5 | 69,7 |
| Cybergym | 76,7 | 52,7 | 83,1 |
| DeepSWE | 54,4 | 12,8 | 58,0 |
| Toolathlon-Verified | 70,3 | 55,9 | 76,2 |
| Agents' Last Exam | 25,2 | 16,5 | 25,7 |
| AutomationBench Public | 25,1 | 12,8 | 27,2 |
Especificações técnicas
- Tamanho total: 304B parâmetros (BF16, com suporte a FP8)
- Licença: MIT
- Contexto: até 1 milhão de tokens (conforme o título do paper)
- Níveis de raciocínio: o parâmetro
reasoning_effortsuporta três níveis -low,highemax- que controlam quanto o modelo "pensa" antes de responder - Chat template: não usa Jinja; a DeepSeek fornece scripts Python próprios para codificação/decodificação no formato compatível com OpenAI
Como executar
- vLLM: basta adicionar a flag
--speculative-configcommethod: dspark. A DeepSeek recomenda um nó com 4×GB300. - SGLang: usar
--speculative-algorithm DSPARKsem definir um draft model separado. - Local: instruções na pasta
inferencedo repositório, com conversão de pesos e demos interativas. - Parâmetros de amostragem recomendados:
temperature = 1.0,top_p = 0.95para cenários agenticos etop_p = 1.0caso contrário. Para níveis de raciocíniohighemax, output máximo de 384K tokens.
O modelo já está disponível no Hugging Face com mais de 236 mil downloads no último mês e possui 62 quantizações e 8 fine-tunes da comunidade.