跳到主内容
显存罗盘VRAM Compass
Model · Mistral AI · 2023· config.json 已核实

Mixtral 8x7B46.7B)显存要求 · 本地部署需要什么显卡

原生上下文 32,768 tokens · GQA · MoE 8 选 2 · 每 token 激活 12.9B

推理显存需求(llama.cpp 口径,batch = 1,含 KV/缓冲/开销)

量化档权重体积4K 上下文32K 上下文
FP16 / BF1687.0 GiB88.5 GiB93.8 GiB
GGUF Q8_046.2 GiB47.7 GiB53.0 GiB
GGUF Q4_K_M26.4 GiB27.9 GiB33.1 GiB
GGUF Q2_K14.3 GiB15.8 GiB21.1 GiB

显存需求 = 权重 + KV cache + 计算/输入缓冲 + 框架开销(≈0.8 GB)。权重与 KV 为精确公式, 典型误差 ±3%;≥24 GB 显存可从 4-bit 档起步。

微调显存估算(4096 上下文 × batch 1,梯度检查点开)

全参微调(AdamW 混合精度)697.8 GiB
LoRA(r=16,7 模块)89.6 GiB
QLoRA(NF4,r=16)25.1 GiB

微调框架与部署引擎推荐

微调:Mistral 微调 API(云端) · Hugging Face PEFT · Unsloth

部署:mistral-inference(官方) · vLLM · SGLang · llama.cpp

硬件参考:Mistral 7B BF16:16GB+;Mixtral 8x7B:48GB+