stamatios
← Voltar ao feed
Esculturas idênticas em mármore e espuma lado a lado, quantização do modelo DeepSeek-V4-Pro em formato NVFP4
Open Source · IA & Modelos

DeepSeek-V4-Pro chega em versão quantizada NVFP4 para uso comercial

resumo de ~3 min

O que foi lançado

A NVIDIA publicou no Hugging Face a versão quantizada NVFP4 do DeepSeek-V4-Pro-0813, modelo da DeepSeek AI, sob licença MIT e liberado para uso comercial e não comercial. O checkpoint base não é propriedade da NVIDIA: foi desenvolvido pela DeepSeek, e a NVIDIA fez a quantização com a ferramenta Model Optimizer (nvidia-modelopt v0.46.0).

Arquitetura e características

O DeepSeek-V4-Pro-0813 é um modelo autorregressivo Mixture-of-Experts baseado em Transformer, com atenção híbrida (Compressed Sparse Attention e Heavily Compressed Attention) e Manifold-Constrained Hyper-Connections. Possui 1,65 trilhão de parâmetros totais, dos quais 49 bilhões são ativados por inferência. Suporta contexto de até 1 milhão de tokens, conversas de múltiplos turnos com system prompts, saída em JSON estruturado, chamada de funções e níveis de reasoning effort (low, high, max). A versão oficial inclui o módulo de speculative decoding DSpark da DeepSeek.

A quantização NVFP4 aplicou-se apenas aos pesos e ativações dos operadores lineares dentro dos blocos transformer do MoE; as cabeças DSpark foram preservadas sem quantização. A NVIDIA ressalva que o speculative decoding não foi exercido na validação desta versão, recomendando habilitá-lo somente após verificação no checkpoint NVFP4.

Uso previsto e execução

O modelo é indicado para raciocínio avançado, aplicações de IA agentic, uso de ferramentas e problemas complexos em matemática, engenharia de software e assistentes empresariais. A execução validada usa o runtime SGLang em GPUs NVIDIA Blackwell B200, preferencialmente em Linux, com script de deployment via sglang.launch_server incluindo parsers de tool call e reasoning específicos do DeepSeek v4.

Calibração e avaliação

A calibração usou os datasets cnn_dailymail (cerca de 300 mil notícias em inglês) e Nemotron-Post-Training-Dataset-v2, ambos coletados e rotulados automaticamente. O dataset de treino do modelo base teve coleta, rotulagem e propriedades não divulgadas. A avaliação comparou FP8 e NVFP4 em seis benchmarks: GPQA Diamond, AA-LCR, τ²-Bench Telecom, SciCode, IFBench e Terminal-Bench Hard, medidos no SGLang com temperatura 1.0, top_p 1.0 e reasoning effort máximo. Resultados NVFP4: 88,42 (GPQA Diamond), 69,33 (AA-LCR), 98,25 (τ²-Bench Telecom), 53,75 (SciCode), 75,68 (IFBench) e 50,69 (Terminal-Bench Hard), contra 88,51, 68,67, 96,49, 53,45, 76,53 e 51,39 no FP8. A precisão difere por benchmark e sem tendência uniforme; alguns testes foram de execução única e outros agregados em múltiplas execuções.

Limitações e considerações

O card lista limitações: os dados de treino contêm linguagem tóxica e vieses sociais, que o modelo pode amplificar, e ele pode gerar respostas imprecisas, incompletas ou socialmente indesejáveis mesmo com prompts neutros. No plano ético, a NVIDIA afirma que IA confiável é responsabilidade compartilhada e que usuários são responsáveis pelas entradas, saídas e pela integração segura, incluindo guardrails antes do deployment. A NVIDIA recomenda ainda testes iterativos no estilo V-model, em nível unitário e de sistema, antes de qualquer deployment.