Accuracy & Verification
准确度与验证
每个公式都有出处,每个估算都声明误差
误差声明(先说清楚工具不能做什么)
- 显存拆解:主打精度。权重与 KV 为精确公式,实际部署误差主要来自框架实现差异,典型 ±3%。
- 速度/吞吐:估算值。同口径公开工具的中位误差 15–22%,本站输出统一标注 ±30% 区间。
- 成本:取决于实时租价,页面价目为 2026-07 采集的静态值。
- 经验项(计算缓冲/框架开销/互联系数/MFU)全部在公式卡中标注「假设」。
引擎回归测试(Vitest 自动化)
7B 全参微调 = 112GB
112e9 B PASS70B QLoRA ≈ 46GB(±12%)
42.1e9 B PASSLlama-3-8B GQA = MHA 的 1/4
0.25 PASSDeepSeek-V3 MLA ≈ 70KB/token
70,272 B PASSGemma3 SWA 局部层封顶
min(s, 1024) PASS4090 24GB 跑 8B Q4 @8K = 绿灯
verdict ok PASS671B Q4 需 ≥14 卡
n ≥ 14 PASS训练吞吐 / TTFT / 并发曲线
> 0 PASS激活值 TP 分摊而非放大
t up, act down PASS超单机卡位上限判红灯
n > 8 → no PASS多卡框架开销每卡各一份
shard/n + C PASS非法 URL 参数回退默认
= default PASS切模型后上下文自动夹取
≤ ctx_max PASS全部单元测试通过(npm test 可复现,含上方每条回归断言),锚点断言来自下方公开实测值。
公开实测锚点
65B 模型 4-bit 微调可放进单卡 48GB本站预测 39.3 GB48 GB偏差 -18.1%高置信
QLoRA 论文 arXiv:2305.14314
Llama-3.3-70B Q4_K_M GGUF 权重文件本站预测 42.8 GB42.5 GB偏差 +0.6%高置信
unsloth/Llama-3.3-70B-Instruct-GGUF(HF 文件实测)
Llama-3.3-70B Q8_0 GGUF 权重文件本站预测 75.0 GB75 GB偏差 -0.1%高置信
unsloth/Llama-3.3-70B-Instruct-GGUF(HF 文件实测)
gpt-oss-120b(117B,MXFP4 官方量化)单卡 80GB 可运行本站预测 64.3 GB≈80 GB(含激活/上下文)偏差 -19.6%高置信
OpenAI gpt-oss 发布页
DeepSeek-V3/R1 671B Q4_K_M 整体占用本站预测 406.8 GB≈380–404 GB(Q4_K_M)偏差 +0.7%中置信
Unsloth DeepSeek-V3 博客
7B 全参微调参数状态(权重14+Adam84+梯度14,未含激活)本站预测 112.0 GB≈112 GB(权重14+Adam84+梯度14,未含激活)偏差 +0.0%中置信
HF Transformers 显存解剖文档(推算口径)
Llama-3-8B 的 KV cache 为 MHA 的 1/4(32→8 KV 头)KV 为 MHA 的 1/4(32→8 KV 头)高置信
公式级验证(KV 结构类锚点,无可运行预测)
kipp.ly Transformer Inference Arithmetic / vLLM 文档
DeepSeek MLA 每 token 缓存 ≈70KB(61 层 × 576 元素 × 2B)≈70 KB/token(61 层 × 576 元素 × 2B)高置信
公式级验证(KV 结构类锚点,无可运行预测)
DeepSeek-V2/V3 论文 MLA 设计
≤5% 绿,≤15% 黄,>15% 红(速度类锚点区间天然更宽)
持续验证机制
新模型入库时:① 拉取 HF config.json 核实架构字段;② 若找到公开实测(GGUF 文件大小、Unsloth/Modal 博客、论文),加入锚点表并核对引擎预测偏差;③ 偏差超过阈值的公式与系数在下一次构建中校准,全程记录于更新日志。