跳到主内容
显存罗盘VRAM Compass
Model · Z.ai (智谱) · 2026· config.json 已核实

GLM-5753.9B)显存要求 · 本地部署需要什么显卡

原生上下文 202,752 tokens · MLA · MoE 256 选 8 · 每 token 激活 42B

推理显存需求(llama.cpp 口径,batch = 1,含 KV/缓冲/开销)

量化档权重体积4K 上下文32K 上下文128K 上下文198K 上下文
FP16 / BF161404.2 GiB1405.9 GiB1411.8 GiB1432.0 GiB1446.8 GiB
GGUF Q8_0746.0 GiB747.6 GiB753.5 GiB773.8 GiB788.5 GiB
GGUF Q4_K_M425.7 GiB427.3 GiB433.2 GiB453.4 GiB468.2 GiB
GGUF Q2_K230.8 GiB232.5 GiB238.4 GiB258.6 GiB273.3 GiB

显存需求 = 权重 + KV cache + 计算/输入缓冲 + 框架开销(≈0.8 GB)。权重与 KV 为精确公式, 典型误差 ±3%;≥24 GB 显存可从 4-bit 档起步。

微调显存估算(4096 上下文 × batch 1,梯度检查点开)

全参微调(AdamW 混合精度)11238.6 GiB
LoRA(r=16,7 模块)1411.5 GiB
QLoRA(NF4,r=16)369.4 GiB

微调框架与部署引擎推荐

微调:官方仓库 finetune/ 目录 · LLaMA-Factory

部署:vLLM · llama.cpp · Transformers

硬件参考:GLM-4-32B:约 64GB BF16,多卡 GPU