跳到主内容
显存罗盘VRAM Compass
NVIDIA · Ada Lovelace · 2022

RTX 408016GB)跑什么大模型 · 完整规格

16GB GDDR6X · 716.8 GB/s · 以下为常见开源模型在 8K 上下文、batch 1 下的推理判定。

完整规格

显存16 GB GDDR6X
显存带宽716.8 GB/s
位宽256-bit
FP3248.7 TFLOPS
FP16 Tensor194.8 TFLOPS
FP8 Tensor389.6 TFLOPS
TDP320 W
架构 / 年份Ada Lovelace · 2022
发布价$1,199

常见模型判定(8K 上下文 · batch 1)

模型 · 量化显存需求判定
Qwen3-8B · FP16 / BF1617.4 GiB能跑 · 需 2 卡
Qwen3-32B · GGUF Q4_K_M22.3 GiB能跑 · 需 2 卡
Llama 3.3 70B · GGUF Q4_K_M44.1 GiB勉强 · 需 3 卡
DeepSeek-V4-Flash · FP8 (E4M3)273.1 GiB跑不动 · 需 18 卡
gpt-oss-120b · MXFP4(gpt-oss 原生)59.9 GiB勉强 · 需 4 卡

「能跑」= 按所需最少卡数总显存占用 ≤85%;「勉强」≤100%。单卡装不下时标注需 N 卡(上限 8 卡,超出判「跑不动」)。速度与并发请打开计算器查看。

同系列相邻卡