跳到主内容
显存罗盘VRAM Compass
Model · MiniMax · 2026· config.json 已核实

MiniMax-M3427B)显存要求 · 本地部署需要什么显卡

原生上下文 1,048,576 tokens · GQA · MoE 128 选 4 · 每 token 激活 23B

推理显存需求(llama.cpp 口径,batch = 1,含 KV/缓冲/开销)

量化档权重体积4K 上下文32K 上下文128K 上下文1M 上下文
FP16 / BF16795.3 GiB797.1 GiB803.9 GiB827.1 GiB1044.1 GiB
GGUF Q8_0422.5 GiB424.3 GiB431.1 GiB454.3 GiB671.3 GiB
GGUF Q4_K_M241.1 GiB242.9 GiB249.6 GiB272.9 GiB489.9 GiB
GGUF Q2_K130.7 GiB132.5 GiB139.3 GiB162.5 GiB379.5 GiB

显存需求 = 权重 + KV cache + 计算/输入缓冲 + 框架开销(≈0.8 GB)。权重与 KV 为精确公式, 典型误差 ±3%;≥24 GB 显存可从 4-bit 档起步。

微调显存估算(4096 上下文 × batch 1,梯度检查点开)

全参微调(AdamW 混合精度)6366.5 GiB
LoRA(r=16,7 模块)801.1 GiB
QLoRA(NF4,r=16)210.9 GiB

微调框架与部署引擎推荐

微调:LLaMA-Factory(社区支持)

部署:vLLM · SGLang

硬件参考:M3:427B 总参 / 23B 激活,原生 1M 上下文