Model · Moonshot AI · 2026· config.json 已核实
Kimi K3(2.78T)显存要求 · 本地部署需要什么显卡
原生上下文 1,048,576 tokens · LINEAR-HYBRID · MoE 896 选 16 · 每 token 激活 104B
推理显存需求(llama.cpp 口径,batch = 1,含 KV/缓冲/开销)
| 量化档 | 权重体积 | 4K 上下文 | 32K 上下文 | 128K 上下文 | 1M 上下文 |
|---|---|---|---|---|---|
| INT8 (GPTQ/AWQ W8)原生 | 2589.0 GiB | 2590.8 GiB | 2596.7 GiB | 2617.3 GiB | 2808.9 GiB |
| FP16 / BF16 | 5178.0 GiB | 5179.7 GiB | 5185.7 GiB | 5206.3 GiB | 5397.9 GiB |
| GGUF Q8_0 | 2750.8 GiB | 2752.6 GiB | 2758.6 GiB | 2779.1 GiB | 2970.7 GiB |
| GGUF Q4_K_M | 1569.6 GiB | 1571.3 GiB | 1577.3 GiB | 1597.9 GiB | 1789.5 GiB |
| GGUF Q2_K | 851.1 GiB | 852.9 GiB | 858.9 GiB | 879.4 GiB | 1071.0 GiB |
显存需求 = 权重 + KV cache + 计算/输入缓冲 + 框架开销(≈0.8 GB)。权重与 KV 为精确公式, 典型误差 ±3%;≥24 GB 显存可从 4-bit 档起步。
微调显存估算(4096 上下文 × batch 1,梯度检查点开)
| 全参微调(AdamW 混合精度) | 41429.8 GiB |
| LoRA(r=16,7 模块) | 5187.6 GiB |
| QLoRA(NF4,r=16) | 1345.3 GiB |
微调框架与部署引擎推荐
微调:LLaMA-Factory(社区支持)
部署:vLLM · SGLang · llama.cpp
硬件参考:官方以 FP8/INT8 量化发布(K2 FP8 / K3 INT8);T 级参数需多节点