Model · Z.ai (智谱) · 2026· config.json 已核实
GLM-5(753.9B)显存要求 · 本地部署需要什么显卡
原生上下文 202,752 tokens · MLA · MoE 256 选 8 · 每 token 激活 42B
推理显存需求(llama.cpp 口径,batch = 1,含 KV/缓冲/开销)
| 量化档 | 权重体积 | 4K 上下文 | 32K 上下文 | 128K 上下文 | 198K 上下文 |
|---|---|---|---|---|---|
| FP16 / BF16 | 1404.2 GiB | 1405.9 GiB | 1411.8 GiB | 1432.0 GiB | 1446.8 GiB |
| GGUF Q8_0 | 746.0 GiB | 747.6 GiB | 753.5 GiB | 773.8 GiB | 788.5 GiB |
| GGUF Q4_K_M | 425.7 GiB | 427.3 GiB | 433.2 GiB | 453.4 GiB | 468.2 GiB |
| GGUF Q2_K | 230.8 GiB | 232.5 GiB | 238.4 GiB | 258.6 GiB | 273.3 GiB |
显存需求 = 权重 + KV cache + 计算/输入缓冲 + 框架开销(≈0.8 GB)。权重与 KV 为精确公式, 典型误差 ±3%;≥24 GB 显存可从 4-bit 档起步。
微调显存估算(4096 上下文 × batch 1,梯度检查点开)
| 全参微调(AdamW 混合精度) | 11238.6 GiB |
| LoRA(r=16,7 模块) | 1411.5 GiB |
| QLoRA(NF4,r=16) | 369.4 GiB |
微调框架与部署引擎推荐
微调:官方仓库 finetune/ 目录 · LLaMA-Factory
部署:vLLM · llama.cpp · Transformers
硬件参考:GLM-4-32B:约 64GB BF16,多卡 GPU