本地跑 32B 模型需要什么配置?Qwen3-32B 实战

短答案

32B Q4 ≈ 20G 显存 + 2-4G 上下文余量:24G 卡(3090/5090)全速 20+ tok/s;16G 卡 offload 跑 8-12 tok/s(可用);内存建议 64G。

32B 是本地大模型的甜点规格:能力跨入生产力档、显存需求仍在消费级射程内。

GeForce RTX 3090 24GB(二手) · 二手市场大显存之王。24G 跑 32B 从容,但无保修、功耗高,认准个人自用卡。
24G 显存 AI 算力 38

32B 全速运行的最低成本方案

模型选型:模型库。

常见问题

16G 卡跑 32B 值不值?
看耐心:offload 后 8-12 tok/s,日常对话可接受,长文生成会等。若 32B 是主力模型,24G 卡(二手 3090 ¥5.5k)是质变;偶尔用,16G 凑合。
32B 比 14B 强多少?
中文长文/复杂推理/代码明显更强一档——这是「本地生产力」的门槛级差异。显存允许就上 32B,它也是多数开源评测的甜点规格。
跑 32B 的整机预算?
入门 16G offload:¥9.6k;全速 24G(二手 3090):¥9.4k 学生档;旗舰 5090 + 96G:¥3 万。分别对应[本地大模型场景](/scenarios/local-llm/)三档。
↑