跳到主内容
显存罗盘VRAM Compass
Model · DeepSeek AI · 2026· config.json 已核实

DeepSeek-V4-Flash290.9B)显存要求 · 本地部署需要什么显卡

原生上下文 1,048,576 tokens · MLA · MoE 256 选 6 · 每 token 激活 13B

推理显存需求(llama.cpp 口径,batch = 1,含 KV/缓冲/开销)

量化档权重体积4K 上下文32K 上下文128K 上下文1M 上下文
FP8 (E4M3)原生270.9 GiB272.4 GiB277.2 GiB293.8 GiB448.1 GiB
FP16 / BF16541.8 GiB543.3 GiB548.1 GiB564.7 GiB719.0 GiB
GGUF Q8_0287.9 GiB289.3 GiB294.2 GiB310.7 GiB465.0 GiB
GGUF Q4_K_M164.2 GiB165.7 GiB170.5 GiB187.1 GiB341.4 GiB
GGUF Q2_K89.1 GiB90.5 GiB95.4 GiB111.9 GiB266.2 GiB

显存需求 = 权重 + KV cache + 计算/输入缓冲 + 框架开销(≈0.8 GB)。权重与 KV 为精确公式, 典型误差 ±3%;≥24 GB 显存可从 4-bit 档起步。

微调显存估算(4096 上下文 × batch 1,梯度检查点开)

全参微调(AdamW 混合精度)4337.0 GiB
LoRA(r=16,7 模块)545.1 GiB
QLoRA(NF4,r=16)143.0 GiB

微调框架与部署引擎推荐

微调:LLaMA-Factory · 知识蒸馏(R1 → Qwen/Llama 小模型)

部署:SGLang(官方推荐,MLA + DP Attention) · vLLM · TensorRT-LLM · llama.cpp

硬件参考:V3/R1 671B:2 节点 × 8 GPU(H100/A100);R1-Distill-7B:单卡 16GB+

R1 系列使用建议:温度 0.5–0.7(推荐 0.6),避免 system prompt,强制以 <think> 开头