跳到主内容
显存罗盘VRAM Compass
Accuracy & Verification

准确度与验证

每个公式都有出处,每个估算都声明误差

误差声明(先说清楚工具不能做什么)

  • 显存拆解:主打精度。权重与 KV 为精确公式,实际部署误差主要来自框架实现差异,典型 ±3%。
  • 速度/吞吐:估算值。同口径公开工具的中位误差 15–22%,本站输出统一标注 ±30% 区间。
  • 成本:取决于实时租价,页面价目为 2026-07 采集的静态值。
  • 经验项(计算缓冲/框架开销/互联系数/MFU)全部在公式卡中标注「假设」。

引擎回归测试(Vitest 自动化)

7B 全参微调 = 112GB112e9 B PASS
70B QLoRA ≈ 46GB(±12%)42.1e9 B PASS
Llama-3-8B GQA = MHA 的 1/40.25 PASS
DeepSeek-V3 MLA ≈ 70KB/token70,272 B PASS
Gemma3 SWA 局部层封顶min(s, 1024) PASS
4090 24GB 跑 8B Q4 @8K = 绿灯verdict ok PASS
671B Q4 需 ≥14 卡n ≥ 14 PASS
训练吞吐 / TTFT / 并发曲线> 0 PASS
激活值 TP 分摊而非放大t up, act down PASS
超单机卡位上限判红灯n > 8 → no PASS
多卡框架开销每卡各一份shard/n + C PASS
非法 URL 参数回退默认= default PASS
切模型后上下文自动夹取≤ ctx_max PASS

全部单元测试通过(npm test 可复现,含上方每条回归断言),锚点断言来自下方公开实测值。

公开实测锚点

65B 模型 4-bit 微调可放进单卡 48GB本站预测 39.3 GB48 GB偏差 -18.1%高置信
QLoRA 论文 arXiv:2305.14314
Llama-3.3-70B Q4_K_M GGUF 权重文件本站预测 42.8 GB42.5 GB偏差 +0.6%高置信
unsloth/Llama-3.3-70B-Instruct-GGUF(HF 文件实测)
Llama-3.3-70B Q8_0 GGUF 权重文件本站预测 75.0 GB75 GB偏差 -0.1%高置信
unsloth/Llama-3.3-70B-Instruct-GGUF(HF 文件实测)
gpt-oss-120b(117B,MXFP4 官方量化)单卡 80GB 可运行本站预测 64.3 GB≈80 GB(含激活/上下文)偏差 -19.6%高置信
OpenAI gpt-oss 发布页
DeepSeek-V3/R1 671B Q4_K_M 整体占用本站预测 406.8 GB≈380–404 GB(Q4_K_M)偏差 +0.7%中置信
Unsloth DeepSeek-V3 博客
7B 全参微调参数状态(权重14+Adam84+梯度14,未含激活)本站预测 112.0 GB≈112 GB(权重14+Adam84+梯度14,未含激活)偏差 +0.0%中置信
HF Transformers 显存解剖文档(推算口径)
Llama-3-8B 的 KV cache 为 MHA 的 1/4(32→8 KV 头)KV 为 MHA 的 1/4(32→8 KV 头)高置信
公式级验证(KV 结构类锚点,无可运行预测)
kipp.ly Transformer Inference Arithmetic / vLLM 文档
DeepSeek MLA 每 token 缓存 ≈70KB(61 层 × 576 元素 × 2B)≈70 KB/token(61 层 × 576 元素 × 2B)高置信
公式级验证(KV 结构类锚点,无可运行预测)
DeepSeek-V2/V3 论文 MLA 设计

≤5% 绿,≤15% 黄,>15% 红(速度类锚点区间天然更宽)

持续验证机制

新模型入库时:① 拉取 HF config.json 核实架构字段;② 若找到公开实测(GGUF 文件大小、Unsloth/Modal 博客、论文),加入锚点表并核对引擎预测偏差;③ 偏差超过阈值的公式与系数在下一次构建中校准,全程记录于更新日志。