跳到主内容
显存罗盘VRAM Compass
QWEN3-8BFP168KRTX 4090 × 1
17.4
/ 24.0 可用 · 72.5%

用得顺手或有槽点,去留言墙说说

显存需求

能跑
总占用
17.4GiB
Target VRAM
24 GiB × 1
单卡占用17.4 GiB
权重显存15.3 GiB
公式P × bpw / 8
P = 8.19 B参bpw = 16 bit
结果15.3 GiB
出处EleutherAI · Transformer Math 101
KV Cache(MHA/GQA)0.88 GiB
公式2 × L × n_kv × d_head × s × b × bytes
L = 28 n_kv = 8d_head = 128s = 8,192 tokensb = 1bytes = 2 B/元素
结果0.88 GiB
出处kipp.ly · Transformer Inference Arithmetic
计算 / 输入缓冲0.52 GiB
公式(s/1024 × 2 + 0.75) × n_heads × b MiB
s = 8,192 tokensn_heads = 32b = 1
结果0.52 GiB
假设经验拟合式(llama.cpp 机制反推),随上下文线性增长、随 batch 放大,误差 ±20%。
出处llama.cpp 计算缓冲社区拟合
框架固定开销0.75 GiB
公式C_engine
C_engine = 800,000,000 bytes
结果0.75 GiB
假设CUDA context + 引擎运行时的固定占用,经验值,与负载无关。
出处PyTorch issue / CUDA context 实测
总显存17.4 GiB
公式
结果17.4 GiB

性能估算

估算 ±30%访存受限
单用户生成速度
52.4tok/s
36.7 ~ 68.1
总吞吐
52tok/s
首 Token 延迟 (TTFT)
929ms
最大并发
5
吞吐-并发曲线(continuous batching)
吞吐-并发曲线(continuous batching) · 总吞吐 tok/s 215 @ 556113169226性价比拐点 ≈ 5 并发concurrency →
总吞吐 tok/s单用户 tok/s
解码时延 · 访存受限19.1 ms
公式(W + B × KV) / (bwEff × BW_total)
W = 16,380,000,000 bytesB = 1KV = 939,524,096 bytes/序列bwEff = 0.9BW_total = 1,008 GB/s
结果19.1 ms
假设带宽有效利用率默认 0.9(FasterTransformer 实测区间 0.85–0.95)。
出处FasterTransformer 带宽利用率实测
解码时延 · 算力受限0.12 ms
公式2 × P_active × B / (FLOPS × MFU)
P_active = 8.19 B参B = 1FLOPS = 330 TFLOPSMFU = 0.4
结果0.12 ms
假设解码算力受限时的 MFU 经验默认 0.4。
生成速度52.4
公式1 / max(t_mem, t_comp)
结果52.4
假设速度类输出为估算,业界同口径工具的中位误差 15–22%,请按 ±30% 区间理解。
首 Token 延迟929 ms
公式(2·P·N + 2·L_eff·d·N²·kv比) / (FLOPS × MFU)
P_active = 8.19 B参N = 8,192 tokensL = 28 d = 4,096MFU = 0.5
结果929 ms
假设Prefill 按算力受限 roofline 估算;注意力项按注意力类型精确化(GQA 计 AV 项、MLA 取低秩上界、SWA/线性混合只计全注意力层,局部层按 s×w 矩形)。
出处kipp.ly · Transformer Inference Arithmetic

租卡成本

时租成本
$0.34
按天
$8
按月
$245
每百万 Token
$1.80
时租成本$0.34
公式P_h × n
P_h = 0.34 USD/hn = 1
结果$0.34
假设云租价取 RunPod community 档(2026-07 采集),实际价格随市场波动。
每百万 Token 成本1.8
公式C_h / (吞吐 × 3600) × 1e6
C_h = 0.34 USD/h吞吐 = 52.4 tok/s
结果1.8
假设速度类输出为估算,业界同口径工具的中位误差 15–22%,请按 ±30% 区间理解。
自建 vs API(盈亏平衡)
API 模型月成本盈亏平衡
DeepSeek · DeepSeek V4 Flash$0.28/1M↑$28当前用量下 API 更省886M tokens/月
DeepSeek · DeepSeek V4 Pro$0.87/1M↑$87当前用量下 API 更省285M tokens/月
Z.ai · GLM-4.6$2.2/1M↑$220当前用量下 API 更省113M tokens/月
Z.ai · GLM-5.3$4.4/1M↑$440当前用量下自建更省56M tokens/月

API 价格采集于 2026-08-29(DeepSeek 2026-08 调价后),以官方定价页为准

电费估算(7×24)
TDP × 1
0.45kW
月用电量
411kWh
月电费
¥287

PUE 1.25 已计入 · 租价采集于 2026-07-27,已过 34 天

全 GPU 红绿灯

按单卡(或最少卡数)能否容纳当前负载排序
能跑Apple M5 Ultra512GB
能跑Apple M3 Ultra512GB
能跑B300 (Blackwell Ultra)288GB
能跑Instinct MI355X288GB
能跑Instinct MI350X288GB
能跑B200192GB
能跑Instinct MI300X192GB
能跑Apple M2 Ultra192GB
能跑H200141GB
能跑Instinct MI300A (APU)128GB
能跑Instinct MI250X128GB
能跑DC GPU Max 1550128GB
能跑Gaudi 3128GB
能跑Apple M5 Max128GB
能跑Apple M4 Max128GB
能跑Apple M3 Max128GB
能跑Apple M1 Ultra128GB
能跑H20(中国特供)96GB
能跑Gaudi 296GB
能跑Apple M2 Max96GB
能跑H100 SXM80GB
能跑A100 SXM 80GB80GB
能跑A800(中国特供)80GB
能跑Instinct MI25064GB
能跑Instinct MI21064GB
能跑Apple M5 Pro64GB
能跑Apple M1 Max64GB
能跑Adreno X2-90 (Snapdragon X2)64GB
能跑Adreno X1-85 (Snapdragon X Elite)64GB
能跑壁仞 BR10064GB
能跑RTX 6000 Ada48GB
能跑RTX A600048GB
能跑L40S48GB
能跑L4048GB
能跑Radeon PRO W790048GB
能跑DC GPU Max 110048GB
能跑Apple M4 Pro48GB
能跑Apple M3 Pro36GB
能跑RTX 509032GB
能跑RTX 5000 Ada32GB

反向求解

推算口径:Llama 系密度缩放律(GQA 1/4 KV 头),±20% 量级参考。求解对象为稠密模型。

计算在浏览器本地完成,不上传任何数据。速度/成本为估算值,显存拆解为主打精度(±3% 内)。