Deployment Blueprint
部署与微调指南
从微调方法到推理引擎的完整选型参考
部署场景选型
| 场景 | 推荐 | 理由 |
|---|---|---|
| 个人用户/初学者 | Ollama + Open WebUI | 一行命令安装,开箱即用 |
| 桌面用户 | LM Studio | 图形界面,隐私优先 |
| 开发者/研究 | vLLM + Hugging Face | 高性能、API 兼容 |
| 企业生产(NVIDIA) | TensorRT-LLM + Triton + K8s | NVIDIA 极致优化 + 企业级服务 |
| 边缘设备 | llama.cpp + MLC-LLM | 跨平台、轻量级 |
| 多模态应用 | LocalAI + KoboldCpp | 文本/视觉/语音/图像多模态 |
| AMD GPU | llama.cpp(ROCm)+ vLLM | 开源支持最好 |
| Apple Silicon | Ollama + LM Studio + MLX | 统一内存原生优化 |
推理引擎对比
llama.cpp≈0.8 GB 开销
NVIDIA / AMD ROCm / Intel Vulkan / Apple Metal / 纯 CPU
GGUF (Q2_K~Q8_0)
- CPU+GPU 混合推理(可跑超显存模型)
- mmap 加载,单文件 GGUF 分发
- 无需 Python 环境
个人使用、边缘设备、CPU 推理
Ollama≈0.9 GB 开销
NVIDIA / AMD / Apple Metal / CPU
GGUF
- 一行命令安装与运行
- REST API + OpenAI 兼容端点
- 基于 llama.cpp 后端
初学者、快速体验
LM Studio≈0.9 GB 开销
NVIDIA / Apple Metal / CPU
GGUF / MLX
- 图形界面,隐私优先
- 同时支持 llama.cpp 与 MLX
桌面用户、可视化操作
vLLM≈1.2 GB 开销
NVIDIA / AMD
SafeTensors (FP16/BF16/FP8/AWQ/GPTQ)
- PagedAttention:KV 显存利用率提升 2–4×
- 连续批处理 + 前缀缓存 + 投机采样
- OpenAI 兼容 API,200+ 架构
生产环境、高并发服务
SGLang≈1.2 GB 开销
NVIDIA / AMD
SafeTensors (FP16/BF16/FP8)
- MLA 优化 + DP Attention(DeepSeek 官方推荐)
- 结构化输出、推理模型优化
DeepSeek 系列、推理模型、结构化生成
TensorRT-LLM≈1.5 GB 开销
仅 NVIDIA
TensorRT 引擎 (FP16/FP8/INT4)
- NVIDIA 硬件极致优化
- 支持 DeepSeek-V3/Llama-4/gpt-oss
NVIDIA GPU 企业生产部署
MLX≈0.5 GB 开销
Apple Silicon
MLX (4/8-bit)
- Apple 官方数组框架,统一内存原生
- LM Studio 内置支持
Apple Silicon 本地推理
Transformers≈1.5 GB 开销
任意(CUDA/ROCm/CPU)
SafeTensors (任意精度 + bitsandbytes)
- 生态最全,研究首选
- bitsandbytes INT8/NF4 无缝集成
微调实验、原型验证
周边工具生态
Open WebUI
自托管 AI 平台:高级 RAG(9 种向量库)、插件系统、企业管理
企业部署、团队协作
Ollama + Open WebUI
一行命令安装 + 开箱即用 Web 界面
个人用户/初学者首选
Text Generation WebUI
100% 离线,支持 LoRA 微调与多模态,多后端
进阶用户
Jan
开源 ChatGPT 替代品,OpenAI 兼容 API + MCP
开源替代
GPT4All
完全离线,Vulkan 加速,可商用
隐私优先个人用户
KoboldCpp
单文件可执行,无安装无依赖
便携部署、快速测试
LocalAI
OpenAI API 本地替代:文本/视觉/语音/图像 60+ 后端
多模态本地服务
MLC-LLM
ML 编译通用部署:NVIDIA/AMD/Intel/Metal/移动/WebGPU
跨平台、边缘和移动端
Triton Inference Server
NVIDIA 企业级推理服务:动态批处理、多框架后端
企业级推理服务
量化级别选型
| 场景 | 推荐 | 理由 |
|---|---|---|
| 质量优先 | Q6_K / Q8_0 | 接近无损 |
| 通用推荐 | Q4_K_M | 精度/性能最佳平衡 |
| 内存受限 | Q3_K_M / Q4_0 | 更小体积 |
| 极端压缩 | Q2_K / QuIP# | 仅在必要时使用 |
| 企业部署 | AWQ / GPTQ 4-bit / FP8 | 更高精度的 PTQ,vLLM/TensorRT 原生 |
GGUF Q8_0 · 8.5 bpwGGUF Q6_K · 6.59 bpwGGUF Q5_K_M · 5.69 bpwGGUF Q4_K_M · 4.85 bpwGGUF Q4_K_S · 4.58 bpwGGUF Q3_K_M · 3.91 bpwGGUF Q2_K · 2.63 bpw
微调方法选型
| 场景 | 推荐 | 理由 |
|---|---|---|
| 快速适配任务 | LoRA | 最流行 PEFT,参数量仅 0.1–1% |
| 显存极度有限 | QLoRA | 单卡 24GB 可微调 65B |
| 最佳效果 | 全参数微调 | 完整更新所有参数 |
| 对齐人类偏好 | DPO | 比 RLHF 简单,无需奖励模型 |
| 推理能力蒸馏 | GRPO + On-policy 蒸馏 | 2025–2026 新趋势(R1 → 小模型) |
| 生产级对齐 | RLHF(PPO/GRPO) | 传统但成熟 |
提示:计算器「微调」模式已支持全参/LoRA/QLoRA × SFT/DPO/GRPO 的显存估算(DPO/GRPO 含冻结参考模型)。
硬件 × 工具矩阵
| 场景 | 推荐 | GPU 规格全景库 |
|---|---|---|
| NVIDIA GPU | vLLM、TensorRT-LLM、Ollama | A100/H100(大模型)、RTX 4090(消费级) |
| AMD GPU | llama.cpp(ROCm)、Ollama、vLLM | MI300X/MI355X 系列 |
| Apple Silicon | llama.cpp(Metal)、Ollama、LM Studio、MLX | M1–M5 系列(统一内存) |
| Intel GPU | llama.cpp(Vulkan/SYCL)、OpenVINO | Arc 系列、Gaudi |
| 纯 CPU | llama.cpp、Ollama、GPT4All | 现代多核 CPU,16GB+ 内存 |
| 多 GPU | vLLM、DeepSpeed、llama.cpp | NVLink 互连的 A100/H100 |
| 移动端 | llama.cpp、MLC-LLM、ONNX Runtime | 3B–7B 小模型,4-bit 量化 |
NVIDIA:vLLM · TensorRT-LLM · OllamaAMD:llama.cpp (ROCm) · vLLM · OllamaINTEL:llama.cpp (Vulkan/SYCL) · OpenVINOAPPLE:MLX · Ollama · LM StudioQUALCOMM:QNN / MLC-LLMMTHREADS:llama.cpp (MUSA) · vLLM 社区移植BIREN:自有 SDK(受制裁限制)
2025–2026 关键趋势
- GRPO 替代 PPO:更简单高效的 RL 方法成为主流
- On-policy 知识蒸馏:DeepSeek-R1 式推理蒸馏成趋势
- 4-bit 量化成标准,2/3-bit 开始可用
- MoE 架构普及:Qwen3、Llama 4、DeepSeek 均采用
- 多模态融合成为旗舰标配
- OpenAI 兼容 API 成为事实标准
- 边缘部署增长:手机/IoT 运行 LLM 成为现实
- 闭源模型逐步开放微调能力