Model · Meta · 2025· config.json 已核实
Llama 4 Scout(108.6B)显存要求 · 本地部署需要什么显卡
原生上下文 1,048,576 tokens · GQA · MoE 16 选 1 · 每 token 激活 17B
推理显存需求(llama.cpp 口径,batch = 1,含 KV/缓冲/开销)
| 量化档 | 权重体积 | 4K 上下文 | 32K 上下文 | 128K 上下文 | 1M 上下文 |
|---|---|---|---|---|---|
| FP16 / BF16 | 202.3 GiB | 204.1 GiB | 211.6 GiB | 237.1 GiB | 475.1 GiB |
| GGUF Q8_0 | 107.5 GiB | 109.3 GiB | 116.7 GiB | 142.2 GiB | 380.2 GiB |
| GGUF Q4_K_M | 61.3 GiB | 63.2 GiB | 70.6 GiB | 96.1 GiB | 334.1 GiB |
| GGUF Q2_K | 33.3 GiB | 35.1 GiB | 42.5 GiB | 68.0 GiB | 306.0 GiB |
显存需求 = 权重 + KV cache + 计算/输入缓冲 + 框架开销(≈0.8 GB)。权重与 KV 为精确公式, 典型误差 ±3%;≥24 GB 显存可从 4-bit 档起步。
微调显存估算(4096 上下文 × batch 1,梯度检查点开)
| 全参微调(AdamW 混合精度) | 1621.1 GiB |
| LoRA(r=16,7 模块) | 206.4 GiB |
| QLoRA(NF4,r=16) | 56.3 GiB |
微调框架与部署引擎推荐
微调:torchtune(Meta 官方) · LLaMA-Factory · Unsloth(2× 提速省 70% 显存) · Axolotl
部署:vLLM · SGLang · llama.cpp · Ollama
硬件参考:8B LoRA:消费级 16GB+;Llama-4-Scout FP8:单台 H100 DGX