跳到主内容
显存罗盘VRAM Compass
Model Architecture Library

模型库

预设模型架构一览(config.json 核实)

Kimi K3
Moonshot AI · 2026
已核实
  • 参数2.78T · 激活 104B
  • 上下文1,048,576LINEAR-HYBRID · MoE 896→16
MoEKDA+MLA 混合1M 上下文
微调推荐LLaMA-Factory(社区支持)
部署推荐vLLM · SGLang · llama.cpp
硬件参考官方以 FP8/INT8 量化发布(K2 FP8 / K3 INT8);T 级参数需多节点
DeepSeek-V4-Pro
DeepSeek AI · 2026
已核实
  • 参数1.60T · 激活 49B
  • 上下文1,048,576MLA · MoE 384→6
MoEMLA1M 上下文旗舰
微调推荐LLaMA-Factory · 知识蒸馏(R1 → Qwen/Llama 小模型)
部署推荐SGLang(官方推荐,MLA + DP Attention) · vLLM · TensorRT-LLM · llama.cpp
硬件参考V3/R1 671B:2 节点 × 8 GPU(H100/A100);R1-Distill-7B:单卡 16GB+
R1 系列使用建议:温度 0.5–0.7(推荐 0.6),避免 system prompt,强制以 <think> 开头
Kimi K2 Instruct
Moonshot AI · 2025
已核实
  • 参数1.03T · 激活 32B
  • 上下文131,072MLA · MoE 384→8
MoEMLA
微调推荐LLaMA-Factory(社区支持)
部署推荐vLLM · SGLang · llama.cpp
硬件参考官方以 FP8/INT8 量化发布(K2 FP8 / K3 INT8);T 级参数需多节点
GLM-5
Z.ai (智谱) · 2026
已核实
  • 参数753.9B · 激活 42B
  • 上下文202,752MLA · MoE 256→8
MoEMLA+DSA
微调推荐官方仓库 finetune/ 目录 · LLaMA-Factory
部署推荐vLLM · llama.cpp · Transformers
硬件参考GLM-4-32B:约 64GB BF16,多卡 GPU
MiniMax-M3
MiniMax · 2026
已核实
  • 参数427B · 激活 23B
  • 上下文1,048,576GQA · MoE 128→4
MoE1M 上下文
微调推荐LLaMA-Factory(社区支持)
部署推荐vLLM · SGLang
硬件参考M3:427B 总参 / 23B 激活,原生 1M 上下文
Qwen3.5-397B-A17B
Alibaba Qwen · 2026
已核实
  • 参数403.4B · 激活 17B
  • 上下文262,144LINEAR-HYBRID · MoE 512→10
MoE混合线性注意力原生多模态
微调推荐LLaMA-Factory(中文生态最佳,支持 DoRA/GaLore) · ModelScope · DashScope 云端微调
部署推荐vLLM (≥0.5.3) · SGLang · Ollama · MLX
硬件参考Qwen3-30B-A3B:每 token 仅激活 3.3B,消费卡友好;72B BF16:至少 2×A100/H100
Llama 4 Maverick
Meta · 2025
已核实
  • 参数401.6B · 激活 17B
  • 上下文1,048,576GQA · MoE 128→1
MoE
微调推荐torchtune(Meta 官方) · LLaMA-Factory · Unsloth(2× 提速省 70% 显存) · Axolotl
部署推荐vLLM · SGLang · llama.cpp · Ollama
硬件参考8B LoRA:消费级 16GB+;Llama-4-Scout FP8:单台 H100 DGX
DeepSeek-V4-Flash
DeepSeek AI · 2026
已核实
  • 参数290.9B · 激活 13B
  • 上下文1,048,576MLA · MoE 256→6
MoEMLA1M 上下文
微调推荐LLaMA-Factory · 知识蒸馏(R1 → Qwen/Llama 小模型)
部署推荐SGLang(官方推荐,MLA + DP Attention) · vLLM · TensorRT-LLM · llama.cpp
硬件参考V3/R1 671B:2 节点 × 8 GPU(H100/A100);R1-Distill-7B:单卡 16GB+
R1 系列使用建议:温度 0.5–0.7(推荐 0.6),避免 system prompt,强制以 <think> 开头
Qwen3-235B-A22B
Alibaba Qwen · 2025
已核实
  • 参数235.09B · 激活 22B
  • 上下文40,960GQA · MoE 128→8
MoE
微调推荐LLaMA-Factory(中文生态最佳,支持 DoRA/GaLore) · ModelScope · DashScope 云端微调
部署推荐vLLM (≥0.5.3) · SGLang · Ollama · MLX
硬件参考Qwen3-30B-A3B:每 token 仅激活 3.3B,消费卡友好;72B BF16:至少 2×A100/H100
gpt-oss-120b
OpenAI · 2025
已核实
  • 参数116.83B · 激活 5.1B
  • 上下文131,072SWA-HYBRID · MoE 128→4
MoE原生 MXFP4SWA 1:1
微调推荐官方仅 API 微调(本地权重社区用 LLaMA-Factory)
部署推荐vLLM · llama.cpp · Ollama · LM Studio
硬件参考gpt-oss-120b 原生 MXFP4:单卡 80GB 可运行;20b:16GB 级
Llama 4 Scout
Meta · 2025
已核实
  • 参数108.6B · 激活 17B
  • 上下文1,048,576GQA · MoE 16→1
MoE
微调推荐torchtune(Meta 官方) · LLaMA-Factory · Unsloth(2× 提速省 70% 显存) · Axolotl
部署推荐vLLM · SGLang · llama.cpp · Ollama
硬件参考8B LoRA:消费级 16GB+;Llama-4-Scout FP8:单台 H100 DGX
Qwen3-Next 80B-A3B
Alibaba Qwen · 2025
已核实
  • 参数81.32B · 激活 3B
  • 上下文262,144LINEAR-HYBRID · MoE 512→10
MoE混合线性注意力高稀疏度
微调推荐LLaMA-Factory(中文生态最佳,支持 DoRA/GaLore) · ModelScope · DashScope 云端微调
部署推荐vLLM (≥0.5.3) · SGLang · Ollama · MLX
硬件参考Qwen3-30B-A3B:每 token 仅激活 3.3B,消费卡友好;72B BF16:至少 2×A100/H100
Qwen2.5-72B
Alibaba Qwen · 2024
已核实
  • 参数72.71B
  • 上下文131,072GQA
稠密
微调推荐LLaMA-Factory(中文生态最佳,支持 DoRA/GaLore) · ModelScope · DashScope 云端微调
部署推荐vLLM (≥0.5.3) · SGLang · Ollama · MLX
硬件参考Qwen3-30B-A3B:每 token 仅激活 3.3B,消费卡友好;72B BF16:至少 2×A100/H100
Llama 3.3 70B
Meta · 2024
已核实
  • 参数70.55B
  • 上下文131,072GQA
稠密
微调推荐torchtune(Meta 官方) · LLaMA-Factory · Unsloth(2× 提速省 70% 显存) · Axolotl
部署推荐vLLM · SGLang · llama.cpp · Ollama
硬件参考8B LoRA:消费级 16GB+;Llama-4-Scout FP8:单台 H100 DGX
Mixtral 8x7B
Mistral AI · 2023
已核实
  • 参数46.7B · 激活 12.9B
  • 上下文32,768GQA · MoE 8→2
MoE经典
微调推荐Mistral 微调 API(云端) · Hugging Face PEFT · Unsloth
部署推荐mistral-inference(官方) · vLLM · SGLang · llama.cpp
硬件参考Mistral 7B BF16:16GB+;Mixtral 8x7B:48GB+
Qwen3-32B
Alibaba Qwen · 2025
已核实
  • 参数32.76B
  • 上下文40,960GQA
稠密
微调推荐LLaMA-Factory(中文生态最佳,支持 DoRA/GaLore) · ModelScope · DashScope 云端微调
部署推荐vLLM (≥0.5.3) · SGLang · Ollama · MLX
硬件参考Qwen3-30B-A3B:每 token 仅激活 3.3B,消费卡友好;72B BF16:至少 2×A100/H100
Gemma 4 31B
Google DeepMind · 2026
已核实
  • 参数31.27B
  • 上下文262,144SWA-HYBRID
稠密SWA 5:1
微调推荐Tunix(Google 官方 JAX) · Gemma Library · QLoRA / Unsloth
部署推荐Ollama · LM Studio · llama.cpp · LiteRT-LM(边缘)
硬件参考Gemma 1B:可在手机运行;27B:24GB+ 显存
Qwen3-30B-A3B
Alibaba Qwen · 2025
已核实
  • 参数30.53B · 激活 3.3B
  • 上下文40,960GQA · MoE 128→8
MoE消费卡友好
微调推荐LLaMA-Factory(中文生态最佳,支持 DoRA/GaLore) · ModelScope · DashScope 云端微调
部署推荐vLLM (≥0.5.3) · SGLang · Ollama · MLX
硬件参考Qwen3-30B-A3B:每 token 仅激活 3.3B,消费卡友好;72B BF16:至少 2×A100/H100
Qwen3.5-27B
Alibaba Qwen · 2026
已核实
  • 参数27.78B
  • 上下文262,144LINEAR-HYBRID
稠密混合线性注意力24GB 友好
微调推荐LLaMA-Factory(中文生态最佳,支持 DoRA/GaLore) · ModelScope · DashScope 云端微调
部署推荐vLLM (≥0.5.3) · SGLang · Ollama · MLX
硬件参考Qwen3-30B-A3B:每 token 仅激活 3.3B,消费卡友好;72B BF16:至少 2×A100/H100
Gemma 4 26B-A4B
Google DeepMind · 2026
已核实
  • 参数25.81B · 激活 3.8B
  • 上下文262,144SWA-HYBRID · MoE 128→8
MoESWA 5:1
微调推荐Tunix(Google 官方 JAX) · Gemma Library · QLoRA / Unsloth
部署推荐Ollama · LM Studio · llama.cpp · LiteRT-LM(边缘)
硬件参考Gemma 1B:可在手机运行;27B:24GB+ 显存
Mistral Small 3.2 24B
Mistral AI · 2025
已核实
  • 参数24.01B
  • 上下文131,072GQA
稠密128K
微调推荐Mistral 微调 API(云端) · Hugging Face PEFT · Unsloth
部署推荐mistral-inference(官方) · vLLM · SGLang · llama.cpp
硬件参考Mistral 7B BF16:16GB+;Mixtral 8x7B:48GB+
gpt-oss-20b
OpenAI · 2025
已核实
  • 参数20.91B · 激活 3.6B
  • 上下文131,072SWA-HYBRID · MoE 32→4
MoE原生 MXFP416GB 友好
微调推荐官方仅 API 微调(本地权重社区用 LLaMA-Factory)
部署推荐vLLM · llama.cpp · Ollama · LM Studio
硬件参考gpt-oss-120b 原生 MXFP4:单卡 80GB 可运行;20b:16GB 级
Qwen2.5-14B
Alibaba Qwen · 2024
已核实
  • 参数14.77B
  • 上下文131,072GQA
稠密
微调推荐LLaMA-Factory(中文生态最佳,支持 DoRA/GaLore) · ModelScope · DashScope 云端微调
部署推荐vLLM (≥0.5.3) · SGLang · Ollama · MLX
硬件参考Qwen3-30B-A3B:每 token 仅激活 3.3B,消费卡友好;72B BF16:至少 2×A100/H100
Qwen3-8B
Alibaba Qwen · 2025
已核实
  • 参数8.19B
  • 上下文40,960GQA
稠密消费卡友好
微调推荐LLaMA-Factory(中文生态最佳,支持 DoRA/GaLore) · ModelScope · DashScope 云端微调
部署推荐vLLM (≥0.5.3) · SGLang · Ollama · MLX
硬件参考Qwen3-30B-A3B:每 token 仅激活 3.3B,消费卡友好;72B BF16:至少 2×A100/H100
Llama 3.1 8B
Meta · 2024
已核实
  • 参数8.03B
  • 上下文131,072GQA
稠密经典
微调推荐torchtune(Meta 官方) · LLaMA-Factory · Unsloth(2× 提速省 70% 显存) · Axolotl
部署推荐vLLM · SGLang · llama.cpp · Ollama
硬件参考8B LoRA:消费级 16GB+;Llama-4-Scout FP8:单台 H100 DGX
Qwen2.5-7B
Alibaba Qwen · 2024
已核实
  • 参数7.62B
  • 上下文131,072GQA
稠密消费卡友好
微调推荐LLaMA-Factory(中文生态最佳,支持 DoRA/GaLore) · ModelScope · DashScope 云端微调
部署推荐vLLM (≥0.5.3) · SGLang · Ollama · MLX
硬件参考Qwen3-30B-A3B:每 token 仅激活 3.3B,消费卡友好;72B BF16:至少 2×A100/H100