跳到主内容
显存罗盘VRAM Compass
Model · Google DeepMind · 2026· config.json 已核实

Gemma 4 26B-A4B25.81B)显存要求 · 本地部署需要什么显卡

原生上下文 262,144 tokens · SWA-HYBRID · MoE 128 选 8 · 每 token 激活 3.8B

推理显存需求(llama.cpp 口径,batch = 1,含 KV/缓冲/开销)

量化档权重体积4K 上下文32K 上下文128K 上下文256K 上下文
FP16 / BF1648.1 GiB49.3 GiB51.3 GiB58.0 GiB67.0 GiB
GGUF Q8_025.5 GiB26.8 GiB28.7 GiB35.5 GiB44.5 GiB
GGUF Q4_K_M14.6 GiB15.8 GiB17.8 GiB24.5 GiB33.5 GiB
GGUF Q2_K7.9 GiB9.1 GiB11.1 GiB17.9 GiB26.9 GiB

显存需求 = 权重 + KV cache + 计算/输入缓冲 + 框架开销(≈0.8 GB)。权重与 KV 为精确公式, 典型误差 ±3%;≥24 GB 显存可从 4-bit 档起步。

微调显存估算(4096 上下文 × batch 1,梯度检查点开)

全参微调(AdamW 混合精度)386.2 GiB
LoRA(r=16,7 模块)50.1 GiB
QLoRA(NF4,r=16)14.4 GiB

微调框架与部署引擎推荐

微调:Tunix(Google 官方 JAX) · Gemma Library · QLoRA / Unsloth

部署:Ollama · LM Studio · llama.cpp · LiteRT-LM(边缘)

硬件参考:Gemma 1B:可在手机运行;27B:24GB+ 显存