跳到主内容
显存罗盘VRAM Compass
Model · Moonshot AI · 2025· config.json 已核实

Kimi K2 Instruct1.03T)显存要求 · 本地部署需要什么显卡

原生上下文 131,072 tokens · MLA · MoE 384 选 8 · 每 token 激活 32B

推理显存需求(llama.cpp 口径,batch = 1,含 KV/缓冲/开销)

量化档权重体积4K 上下文32K 上下文128K 上下文
FP8 (E4M3)原生955.9 GiB957.5 GiB962.8 GiB981.3 GiB
FP16 / BF161911.8 GiB1913.4 GiB1918.8 GiB1937.2 GiB
GGUF Q8_01015.7 GiB1017.2 GiB1022.6 GiB1041.0 GiB
GGUF Q4_K_M579.5 GiB581.1 GiB586.5 GiB604.9 GiB
GGUF Q2_K314.3 GiB315.8 GiB321.2 GiB339.6 GiB

显存需求 = 权重 + KV cache + 计算/输入缓冲 + 框架开销(≈0.8 GB)。权重与 KV 为精确公式, 典型误差 ±3%;≥24 GB 显存可从 4-bit 档起步。

微调显存估算(4096 上下文 × batch 1,梯度检查点开)

全参微调(AdamW 混合精度)15298.8 GiB
LoRA(r=16,7 模块)1918.5 GiB
QLoRA(NF4,r=16)499.8 GiB

微调框架与部署引擎推荐

微调:LLaMA-Factory(社区支持)

部署:vLLM · SGLang · llama.cpp

硬件参考:官方以 FP8/INT8 量化发布(K2 FP8 / K3 INT8);T 级参数需多节点