Model · DeepSeek AI · 2026· config.json 已核实
DeepSeek-V4-Pro(1.60T)显存要求 · 本地部署需要什么显卡
原生上下文 1,048,576 tokens · MLA · MoE 384 选 6 · 每 token 激活 49B
推理显存需求(llama.cpp 口径,batch = 1,含 KV/缓冲/开销)
| 量化档 | 权重体积 | 4K 上下文 | 32K 上下文 | 128K 上下文 | 1M 上下文 |
|---|---|---|---|---|---|
| FP8 (E4M3)原生 | 1489.0 GiB | 1491.1 GiB | 1500.0 GiB | 1530.4 GiB | 1814.5 GiB |
| FP16 / BF16 | 2978.0 GiB | 2980.1 GiB | 2989.0 GiB | 3019.4 GiB | 3303.5 GiB |
| GGUF Q8_0 | 1582.1 GiB | 1584.2 GiB | 1593.0 GiB | 1623.5 GiB | 1907.5 GiB |
| GGUF Q4_K_M | 902.7 GiB | 904.8 GiB | 913.7 GiB | 944.1 GiB | 1228.2 GiB |
| GGUF Q2_K | 489.5 GiB | 491.6 GiB | 500.5 GiB | 530.9 GiB | 815.0 GiB |
显存需求 = 权重 + KV cache + 计算/输入缓冲 + 框架开销(≈0.8 GB)。权重与 KV 为精确公式, 典型误差 ±3%;≥24 GB 显存可从 4-bit 档起步。
微调显存估算(4096 上下文 × batch 1,梯度检查点开)
| 全参微调(AdamW 混合精度) | 23828.2 GiB |
| LoRA(r=16,7 模块) | 2984.7 GiB |
| QLoRA(NF4,r=16) | 774.8 GiB |
微调框架与部署引擎推荐
微调:LLaMA-Factory · 知识蒸馏(R1 → Qwen/Llama 小模型)
部署:SGLang(官方推荐,MLA + DP Attention) · vLLM · TensorRT-LLM · llama.cpp
硬件参考:V3/R1 671B:2 节点 × 8 GPU(H100/A100);R1-Distill-7B:单卡 16GB+
R1 系列使用建议:温度 0.5–0.7(推荐 0.6),避免 system prompt,强制以 <think> 开头