跳到主内容
显存罗盘VRAM Compass
Deployment Blueprint

部署与微调指南

从微调方法到推理引擎的完整选型参考

部署场景选型

场景推荐理由
个人用户/初学者Ollama + Open WebUI一行命令安装,开箱即用
桌面用户LM Studio图形界面,隐私优先
开发者/研究vLLM + Hugging Face高性能、API 兼容
企业生产(NVIDIA)TensorRT-LLM + Triton + K8sNVIDIA 极致优化 + 企业级服务
边缘设备llama.cpp + MLC-LLM跨平台、轻量级
多模态应用LocalAI + KoboldCpp文本/视觉/语音/图像多模态
AMD GPUllama.cpp(ROCm)+ vLLM开源支持最好
Apple SiliconOllama + LM Studio + MLX统一内存原生优化

推理引擎对比

llama.cpp≈0.8 GB 开销
NVIDIA / AMD ROCm / Intel Vulkan / Apple Metal / 纯 CPU
GGUF (Q2_K~Q8_0)
  • CPU+GPU 混合推理(可跑超显存模型)
  • mmap 加载,单文件 GGUF 分发
  • 无需 Python 环境
个人使用、边缘设备、CPU 推理
Ollama≈0.9 GB 开销
NVIDIA / AMD / Apple Metal / CPU
GGUF
  • 一行命令安装与运行
  • REST API + OpenAI 兼容端点
  • 基于 llama.cpp 后端
初学者、快速体验
LM Studio≈0.9 GB 开销
NVIDIA / Apple Metal / CPU
GGUF / MLX
  • 图形界面,隐私优先
  • 同时支持 llama.cpp 与 MLX
桌面用户、可视化操作
vLLM≈1.2 GB 开销
NVIDIA / AMD
SafeTensors (FP16/BF16/FP8/AWQ/GPTQ)
  • PagedAttention:KV 显存利用率提升 2–4×
  • 连续批处理 + 前缀缓存 + 投机采样
  • OpenAI 兼容 API,200+ 架构
生产环境、高并发服务
SGLang≈1.2 GB 开销
NVIDIA / AMD
SafeTensors (FP16/BF16/FP8)
  • MLA 优化 + DP Attention(DeepSeek 官方推荐)
  • 结构化输出、推理模型优化
DeepSeek 系列、推理模型、结构化生成
TensorRT-LLM≈1.5 GB 开销
仅 NVIDIA
TensorRT 引擎 (FP16/FP8/INT4)
  • NVIDIA 硬件极致优化
  • 支持 DeepSeek-V3/Llama-4/gpt-oss
NVIDIA GPU 企业生产部署
MLX≈0.5 GB 开销
Apple Silicon
MLX (4/8-bit)
  • Apple 官方数组框架,统一内存原生
  • LM Studio 内置支持
Apple Silicon 本地推理
Transformers≈1.5 GB 开销
任意(CUDA/ROCm/CPU)
SafeTensors (任意精度 + bitsandbytes)
  • 生态最全,研究首选
  • bitsandbytes INT8/NF4 无缝集成
微调实验、原型验证

周边工具生态

Open WebUI
自托管 AI 平台:高级 RAG(9 种向量库)、插件系统、企业管理
企业部署、团队协作
Ollama + Open WebUI
一行命令安装 + 开箱即用 Web 界面
个人用户/初学者首选
Text Generation WebUI
100% 离线,支持 LoRA 微调与多模态,多后端
进阶用户
Jan
开源 ChatGPT 替代品,OpenAI 兼容 API + MCP
开源替代
GPT4All
完全离线,Vulkan 加速,可商用
隐私优先个人用户
KoboldCpp
单文件可执行,无安装无依赖
便携部署、快速测试
LocalAI
OpenAI API 本地替代:文本/视觉/语音/图像 60+ 后端
多模态本地服务
MLC-LLM
ML 编译通用部署:NVIDIA/AMD/Intel/Metal/移动/WebGPU
跨平台、边缘和移动端
Triton Inference Server
NVIDIA 企业级推理服务:动态批处理、多框架后端
企业级推理服务

量化级别选型

场景推荐理由
质量优先Q6_K / Q8_0接近无损
通用推荐Q4_K_M精度/性能最佳平衡
内存受限Q3_K_M / Q4_0更小体积
极端压缩Q2_K / QuIP#仅在必要时使用
企业部署AWQ / GPTQ 4-bit / FP8更高精度的 PTQ,vLLM/TensorRT 原生
GGUF Q8_0 · 8.5 bpwGGUF Q6_K · 6.59 bpwGGUF Q5_K_M · 5.69 bpwGGUF Q4_K_M · 4.85 bpwGGUF Q4_K_S · 4.58 bpwGGUF Q3_K_M · 3.91 bpwGGUF Q2_K · 2.63 bpw

微调方法选型

场景推荐理由
快速适配任务LoRA最流行 PEFT,参数量仅 0.1–1%
显存极度有限QLoRA单卡 24GB 可微调 65B
最佳效果全参数微调完整更新所有参数
对齐人类偏好DPO比 RLHF 简单,无需奖励模型
推理能力蒸馏GRPO + On-policy 蒸馏2025–2026 新趋势(R1 → 小模型)
生产级对齐RLHF(PPO/GRPO)传统但成熟

提示:计算器「微调」模式已支持全参/LoRA/QLoRA × SFT/DPO/GRPO 的显存估算(DPO/GRPO 含冻结参考模型)。

硬件 × 工具矩阵

场景推荐GPU 规格全景库
NVIDIA GPUvLLM、TensorRT-LLM、OllamaA100/H100(大模型)、RTX 4090(消费级)
AMD GPUllama.cpp(ROCm)、Ollama、vLLMMI300X/MI355X 系列
Apple Siliconllama.cpp(Metal)、Ollama、LM Studio、MLXM1–M5 系列(统一内存)
Intel GPUllama.cpp(Vulkan/SYCL)、OpenVINOArc 系列、Gaudi
纯 CPUllama.cpp、Ollama、GPT4All现代多核 CPU,16GB+ 内存
多 GPUvLLM、DeepSpeed、llama.cppNVLink 互连的 A100/H100
移动端llama.cpp、MLC-LLM、ONNX Runtime3B–7B 小模型,4-bit 量化
NVIDIAvLLM · TensorRT-LLM · OllamaAMDllama.cpp (ROCm) · vLLM · OllamaINTELllama.cpp (Vulkan/SYCL) · OpenVINOAPPLEMLX · Ollama · LM StudioQUALCOMMQNN / MLC-LLMMTHREADSllama.cpp (MUSA) · vLLM 社区移植BIREN自有 SDK(受制裁限制)

2025–2026 关键趋势

  • GRPO 替代 PPO:更简单高效的 RL 方法成为主流
  • On-policy 知识蒸馏:DeepSeek-R1 式推理蒸馏成趋势
  • 4-bit 量化成标准,2/3-bit 开始可用
  • MoE 架构普及:Qwen3、Llama 4、DeepSeek 均采用
  • 多模态融合成为旗舰标配
  • OpenAI 兼容 API 成为事实标准
  • 边缘部署增长:手机/IoT 运行 LLM 成为现实
  • 闭源模型逐步开放微调能力