跳到主内容
显存罗盘VRAM Compass
Model · Meta · 2025· config.json 已核实

Llama 4 Scout108.6B)显存要求 · 本地部署需要什么显卡

原生上下文 1,048,576 tokens · GQA · MoE 16 选 1 · 每 token 激活 17B

推理显存需求(llama.cpp 口径,batch = 1,含 KV/缓冲/开销)

量化档权重体积4K 上下文32K 上下文128K 上下文1M 上下文
FP16 / BF16202.3 GiB204.1 GiB211.6 GiB237.1 GiB475.1 GiB
GGUF Q8_0107.5 GiB109.3 GiB116.7 GiB142.2 GiB380.2 GiB
GGUF Q4_K_M61.3 GiB63.2 GiB70.6 GiB96.1 GiB334.1 GiB
GGUF Q2_K33.3 GiB35.1 GiB42.5 GiB68.0 GiB306.0 GiB

显存需求 = 权重 + KV cache + 计算/输入缓冲 + 框架开销(≈0.8 GB)。权重与 KV 为精确公式, 典型误差 ±3%;≥24 GB 显存可从 4-bit 档起步。

微调显存估算(4096 上下文 × batch 1,梯度检查点开)

全参微调(AdamW 混合精度)1621.1 GiB
LoRA(r=16,7 模块)206.4 GiB
QLoRA(NF4,r=16)56.3 GiB

微调框架与部署引擎推荐

微调:torchtune(Meta 官方) · LLaMA-Factory · Unsloth(2× 提速省 70% 显存) · Axolotl

部署:vLLM · SGLang · llama.cpp · Ollama

硬件参考:8B LoRA:消费级 16GB+;Llama-4-Scout FP8:单台 H100 DGX