本地部署 Qwen3 需要什么配置?(8B / 14B / 32B / 235B)

短答案

Qwen3-8B:6G 显存;14B:9G(12G 卡舒适);32B:20G(24G 卡舒适);235B-A22B:本地需 3 张以上 24G 卡,个人建议直接 API。

Qwen3 全系显存速查(Q4 量化口径)

规格显存需求推荐显卡体验
8B6G4060 8G40+ tok/s,流畅
14B9G / 12G 舒适3060 12G / 507030 tok/s,甜点
32B20G / 24G 舒适3090(二手)/ 509020+ tok/s,生产力
235B-A22B130G+多卡服务器个人走 API

最小起步

# Ollama 一行起步(任何 8G+ 显卡的机器)
ollama run qwen3:14b
GeForce RTX 3060 12GB · 千元级 12G 传奇。学生党预算上限 2000 时的最优解。
12G 显存 AI 算力 13

Qwen3-14B 的最低成本舒适区

GeForce RTX 3090 24GB(二手) · 二手市场大显存之王。24G 跑 32B 从容,但无保修、功耗高,认准个人自用卡。
24G 显存 AI 算力 38

Qwen3-32B 全速运行的大显存解

各规格部署细节与替代模型见本地大模型指南与模型库。

常见问题

部署 Qwen3 用什么软件最简单?
Ollama 一行命令拉起(ollama run qwen3:14b),适合个人;对外提供服务用 vLLM 或 llama.cpp server(并发与 API 兼容更好);Windows 图形界面用 LM Studio。
为什么我 16G 显存跑 32B 会卡?
32B Q4 约 20G,16G 卡必须把部分层 offload 到内存,速度从 30+ tok/s 掉到 10 tok/s 以下。「能跑」和「好用」之间隔着一张 24G 卡(二手 3090 或 5090)。
↑