跳到主内容
显存罗盘VRAM Compass
Model · Alibaba Qwen · 2026· config.json 已核实

Qwen3.5-27B27.78B)显存要求 · 本地部署需要什么显卡

原生上下文 262,144 tokens · LINEAR-HYBRID

推理显存需求(llama.cpp 口径,batch = 1,含 KV/缓冲/开销)

量化档权重体积4K 上下文32K 上下文128K 上下文256K 上下文
FP16 / BF1651.7 GiB53.0 GiB56.1 GiB66.6 GiB80.6 GiB
GGUF Q8_027.5 GiB28.8 GiB31.8 GiB42.3 GiB56.3 GiB
GGUF Q4_K_M15.7 GiB17.0 GiB20.0 GiB30.5 GiB44.5 GiB
GGUF Q2_K8.5 GiB9.8 GiB12.8 GiB23.3 GiB37.3 GiB

显存需求 = 权重 + KV cache + 计算/输入缓冲 + 框架开销(≈0.8 GB)。权重与 KV 为精确公式, 典型误差 ±3%;≥24 GB 显存可从 4-bit 档起步。

微调显存估算(4096 上下文 × batch 1,梯度检查点开)

全参微调(AdamW 混合精度)417.4 GiB
LoRA(r=16,7 模块)56.8 GiB
QLoRA(NF4,r=16)18.4 GiB

微调框架与部署引擎推荐

微调:LLaMA-Factory(中文生态最佳,支持 DoRA/GaLore) · ModelScope · DashScope 云端微调

部署:vLLM (≥0.5.3) · SGLang · Ollama · MLX

硬件参考:Qwen3-30B-A3B:每 token 仅激活 3.3B,消费卡友好;72B BF16:至少 2×A100/H100