方法论与公式
每个公式都有出处,每个估算都声明误差
一、推理显存
总显存由四部分组成,其中权重与 KV cache 为精确公式(公开文献一致),计算缓冲与框架开销为经验值并在公式卡中标注。
VRAM_total = W_weights + KV_cache + Buffer_compute + C_overheadW = P × bpw / 8 (P: 参数量, bpw: 每参数比特数)KV = 2 × L × n_kv_heads × d_head × s × b × bytes (GQA 由 n_kv 体现)MLA(DeepSeek 系): KV = L × (kv_lora_rank + rope_dim) × s × b × bytesSWA 混合: 局部层封顶 min(s, window);线性混合层仅固定循环状态Buffer ≈ (s/1024 × 2 + 0.75) × n_heads × b MiB (llama.cpp 社区拟合,经验)出处:EleutherAI《Transformer Math 101》、kipp.ly《Transformer Inference Arithmetic》、DeepSeek-V2/V3 论文(MLA)、Gemma 3 技术报告(SWA 5:1)、llama.cpp 源码机制。
二、微调显存
参数状态按业界标准口径(混合精度 + AdamW),每参数字节数由优化器决定;激活值用 Megatron 论文(arXiv:2205.05198)式 2,其中 a 为注意力头数、t 为张量并行度(TP 分摊激活而非放大)。
全参 AdamW: 16 B/参 = fp16 w2 + g2 + fp32 master 4 + m 4 + v 48-bit 优化器: 10 B/参 纯 bf16 (torchtune): 8 B/参LoRA: 基座 × bpw + r×(d_in+d_out)×注入矩阵×L × 16BQLoRA: NF4 基座(4.127 bpw 含双重量化)+ LoRA 项激活(Megatron 式 2): s·b·h·L·(10 + 24/t + 5·a·s/(h·t)),a=注意力头数、t=张量并行度FlashAttention 开(默认): 不落盘 s×s 分数矩阵 → s·b·h·L·(10 + 24/t)梯度检查点: 2·s·b·h·L锚点:7B 全参 ≈112GB(14+84+14);70B QLoRA(4bit, r=16, s=1024) ≈46GB,与 QLoRA 论文(65B@48GB)与 Modal 实测一致。
三、性能估算
解码走 roofline:低并发时访存受限(每步读全部权重),高并发时算力受限;TTFT(prefill)按算力受限估算。速度类输出为估算(±30% 区间)。
t_decode = max( (W + B·KV) / (bwEff × BW), 2·P_active·B / (FLOPS × MFU) )TTFT = (2·P_active·N + 2·L·d·N²) / (FLOPS × MFU_prefill)训练吞吐: tok/s = MFU × FLOPS / (6·P) (C ≈ 6·P·D, PaLM 口径)默认系数:带宽有效利用率 0.9(FasterTransformer 实测 0.85–0.95)、解码 MFU 0.4、prefill MFU 0.5、训练 MFU 0.35(PaLM/A100 锚点区间 25–40%)。所有系数均可在高级面板调节。
四、多卡并行与卸载
TP: BW_eff = n × BW × 互联系数(NVLink5 0.9 / PCIe5 0.6 / PCIe4 0.5)PP: BW_eff = n × BW × 0.85(仅流水线气泡,无逐层通信)卸载: t = W_gpu/(bwEff×BW) + W_read/(PCIe 或 NVMe 速率)MoE 冷专家卸载按激活参数占比估计每步读取量(如 DeepSeek-V3 37/671 ≈ 5.5%);Apple 统一内存直接按其内存带宽建模。互联系数为经验值。
五、数据资产与更新
GPU 规格来自 NVIDIA/AMD/Intel/Apple 官方与 TechPowerUp(2025-08 全量调研 + 2026-08 增量核实);模型架构字段逐项对照 HuggingFace config.json;租价取 RunPod(2026-07)与 vast.ai。静态打包于前端,更新只需重新构建。