大语言模型(LLM)显存需求与推荐配置

速查逻辑:先按「上下文 + 中文能力」选模型,再按量化后显存倒推显卡。稠密模型看参数量,MoE 看总参数(不是激活参数)。

  • 8G 卡:Qwen3-8B / Gemma-3-12B(量化)
  • 12G 卡:Qwen3-14B / Phi-4 —— 本地日常甜点
  • 16G 卡:Qwen3-32B(轻度 offload)/ Mistral Small
  • 24G+ 卡:Qwen3-32B 全速 / Gemma-3-27B / 70B offload
  • 旗舰(R1/235B):走 API,本地不划算
模型厂商 / 参数上下文最低显存
量化
推荐显存强项推荐显卡 / 入口
DeepSeek-R1 MIT 推理链最强开源系,本地部署需多卡服务器,个人走 API
DeepSeek
671B MoE
128K——
深度推理数学代码
API / 云 查 API 价格
DeepSeek-V3(聊天主力) MIT 中文写作与综合能力的 API 性价比锚点
DeepSeek
671B MoE
128K——
通用对话写作长文
API / 云 查 API 价格
Qwen3-235B-A22B Apache-2.0 本地需 3 张以上 24G 卡,建议 API 或云端按量
阿里通义
235B MoE
256K——
旗舰级通用Agent
API / 云 查 API 价格
Qwen3-32B Apache-2.0 32B 级综合最强之一:本地写小说/报告的首选
阿里通义
32B 稠密
128K20G24G
本地生产力长文写作
比价
Qwen3-14B Apache-2.0 12G 卡即可跑,速度与质量的最佳平衡
阿里通义
14B 稠密
128K9G12G
主流本地档日常助手
比价
Qwen3-8B Apache-2.0 8G 卡全速,学生与轻量任务首选
阿里通义
8B 稠密
128K6G8G
入门嵌入式边缘
比价
GLM-5-Flash 商用免费 API 免费档主力,零成本起步写工具与 Agent
智谱 AI
未公开
128K——
免费 API原型开发
API / 云 查 API 价格
Llama 3.3 70B Llama License Q4 约 40G:双 24G 卡或 5090+offload
Meta
70B 稠密
128K40G48G
英文最强70B 档基准
比价
Gemma 3 27B Gemma License 支持图像理解,3090/5090 的舒适区
Google
27B 稠密
128K17G24G
多模态单卡 24G 甜点
比价
Gemma 3 12B Gemma License 12G 卡的多模态入门
Google
12B 稠密
128K8G12G
轻量多模态
比价
Mistral Small 3.x 24B Apache-2.0 16G 显存利用率最高的一档
Mistral
24B 稠密
128K14G16G
欧洲系16G 卡甜点
比价
Phi-4 14B MIT 体积小推理强,上下文短是短板
微软
14B 稠密
16K9G12G
小钢炮推理
比价

最低显存 = 量化(Q4/FP8)后可运行;推荐显存 = 舒适体验。推荐显卡为满足推荐显存的最便宜在售卡(自动匹配,与佣金无关)。数据 2026-10-02 更新。

常见问题

7B、14B、32B 模型各需要多少显存?
经验公式:Q4 量化显存 ≈ 参数量 × 0.6GB + 2GB 余量。7B 约 6G、14B 约 10G、32B 约 20G、70B 约 42G。再加上下文 KV 缓存(128K 上下文约再吃 2–6G)。
写小说选哪个模型?
本地:Qwen3-32B(中文长文最强之一,24G 卡)或 Qwen3-14B(12G 卡);API:DeepSeek-V3 综合性价比最高。长上下文比参数量更重要——大纲一致性靠 128K 上下文撑。详见 AI 写作场景指南。
MoE 模型为什么显存需求这么大?
MoE 每次只激活部分专家(速度快),但全部参数都要装进显存/内存:671B 级 MoE 即使 Q4 也要 380G+,属于多卡服务器或云的领地。个人玩家的 MoE 甜点是 30B-A3B 级(约 20G)。
↑