跳到主内容
显存罗盘VRAM Compass
Model · OpenAI · 2025· config.json 已核实

gpt-oss-120b116.83B)显存要求 · 本地部署需要什么显卡

原生上下文 131,072 tokens · SWA-HYBRID · MoE 128 选 4 · 每 token 激活 5.1B

推理显存需求(llama.cpp 口径,batch = 1,含 KV/缓冲/开销)

量化档权重体积4K 上下文32K 上下文128K 上下文
MXFP4(gpt-oss 原生)原生57.8 GiB59.2 GiB63.7 GiB79.1 GiB
GGUF Q8_0115.6 GiB117.0 GiB121.5 GiB136.9 GiB
GGUF Q4_K_M66.0 GiB67.4 GiB71.9 GiB87.3 GiB
GGUF Q2_K35.8 GiB37.2 GiB41.7 GiB57.1 GiB

显存需求 = 权重 + KV cache + 计算/输入缓冲 + 框架开销(≈0.8 GB)。权重与 KV 为精确公式, 典型误差 ±3%;≥24 GB 显存可从 4-bit 档起步。

微调显存估算(4096 上下文 × batch 1,梯度检查点开)

全参微调(AdamW 混合精度)1742.6 GiB
LoRA(r=16,7 模块)219.9 GiB
QLoRA(NF4,r=16)58.4 GiB

微调框架与部署引擎推荐

微调:官方仅 API 微调(本地权重社区用 LLaMA-Factory)

部署:vLLM · llama.cpp · Ollama · LM Studio

硬件参考:gpt-oss-120b 原生 MXFP4:单卡 80GB 可运行;20b:16GB 级