跳到主内容
显存罗盘VRAM Compass
Model · Moonshot AI · 2026· config.json 已核实

Kimi K32.78T)显存要求 · 本地部署需要什么显卡

原生上下文 1,048,576 tokens · LINEAR-HYBRID · MoE 896 选 16 · 每 token 激活 104B

推理显存需求(llama.cpp 口径,batch = 1,含 KV/缓冲/开销)

量化档权重体积4K 上下文32K 上下文128K 上下文1M 上下文
INT8 (GPTQ/AWQ W8)原生2589.0 GiB2590.8 GiB2596.7 GiB2617.3 GiB2808.9 GiB
FP16 / BF165178.0 GiB5179.7 GiB5185.7 GiB5206.3 GiB5397.9 GiB
GGUF Q8_02750.8 GiB2752.6 GiB2758.6 GiB2779.1 GiB2970.7 GiB
GGUF Q4_K_M1569.6 GiB1571.3 GiB1577.3 GiB1597.9 GiB1789.5 GiB
GGUF Q2_K851.1 GiB852.9 GiB858.9 GiB879.4 GiB1071.0 GiB

显存需求 = 权重 + KV cache + 计算/输入缓冲 + 框架开销(≈0.8 GB)。权重与 KV 为精确公式, 典型误差 ±3%;≥24 GB 显存可从 4-bit 档起步。

微调显存估算(4096 上下文 × batch 1,梯度检查点开)

全参微调(AdamW 混合精度)41429.8 GiB
LoRA(r=16,7 模块)5187.6 GiB
QLoRA(NF4,r=16)1345.3 GiB

微调框架与部署引擎推荐

微调:LLaMA-Factory(社区支持)

部署:vLLM · SGLang · llama.cpp

硬件参考:官方以 FP8/INT8 量化发布(K2 FP8 / K3 INT8);T 级参数需多节点