速查逻辑:先按「上下文 + 中文能力」选模型,再按量化后显存倒推显卡。稠密模型看参数量,MoE 看总参数(不是激活参数)。
- 8G 卡:Qwen3-8B / Gemma-3-12B(量化)
- 12G 卡:Qwen3-14B / Phi-4 —— 本地日常甜点
- 16G 卡:Qwen3-32B(轻度 offload)/ Mistral Small
- 24G+ 卡:Qwen3-32B 全速 / Gemma-3-27B / 70B offload
- 旗舰(R1/235B):走 API,本地不划算
| 模型 | 厂商 / 参数 | 上下文 | 最低显存 量化 | 推荐显存 | 强项 | 推荐显卡 / 入口 |
|---|---|---|---|---|---|---|
DeepSeek-R1
MIT
推理链最强开源系,本地部署需多卡服务器,个人走 API | DeepSeek 671B MoE | 128K | — | — | 深度推理数学代码 | API / 云
查 API 价格 |
DeepSeek-V3(聊天主力)
MIT
中文写作与综合能力的 API 性价比锚点 | DeepSeek 671B MoE | 128K | — | — | 通用对话写作长文 | API / 云
查 API 价格 |
Qwen3-235B-A22B
Apache-2.0
本地需 3 张以上 24G 卡,建议 API 或云端按量 | 阿里通义 235B MoE | 256K | — | — | 旗舰级通用Agent | API / 云
查 API 价格 |
Qwen3-32B
Apache-2.0
32B 级综合最强之一:本地写小说/报告的首选 | 阿里通义 32B 稠密 | 128K | 20G | 24G | 本地生产力长文写作 | GeForce RTX 3090 24GB(二手)
¥5,499
比价 |
Qwen3-14B
Apache-2.0
12G 卡即可跑,速度与质量的最佳平衡 | 阿里通义 14B 稠密 | 128K | 9G | 12G | 主流本地档日常助手 | GeForce RTX 3060 12GB
¥1,799
比价 |
Qwen3-8B
Apache-2.0
8G 卡全速,学生与轻量任务首选 | 阿里通义 8B 稠密 | 128K | 6G | 8G | 入门嵌入式边缘 | GeForce RTX 3060 12GB
¥1,799
比价 |
GLM-5-Flash
商用免费 API
免费档主力,零成本起步写工具与 Agent | 智谱 AI 未公开 | 128K | — | — | 免费 API原型开发 | API / 云
查 API 价格 |
Llama 3.3 70B
Llama License
Q4 约 40G:双 24G 卡或 5090+offload | Meta 70B 稠密 | 128K | 40G | 48G | 英文最强70B 档基准 | RTX 3090 48GB(魔改)
¥8,500
比价 |
Gemma 3 27B
Gemma License
支持图像理解,3090/5090 的舒适区 | Google 27B 稠密 | 128K | 17G | 24G | 多模态单卡 24G 甜点 | GeForce RTX 3090 24GB(二手)
¥5,499
比价 |
Gemma 3 12B
Gemma License
12G 卡的多模态入门 | Google 12B 稠密 | 128K | 8G | 12G | 轻量多模态 | GeForce RTX 3060 12GB
¥1,799
比价 |
Mistral Small 3.x 24B
Apache-2.0
16G 显存利用率最高的一档 | Mistral 24B 稠密 | 128K | 14G | 16G | 欧洲系16G 卡甜点 | RTX 2080 Ti 22GB(魔改)
¥2,650
比价 |
Phi-4 14B
MIT
体积小推理强,上下文短是短板 | 微软 14B 稠密 | 16K | 9G | 12G | 小钢炮推理 | GeForce RTX 3060 12GB
¥1,799
比价 |
最低显存 = 量化(Q4/FP8)后可运行;推荐显存 = 舒适体验。推荐显卡为满足推荐显存的最便宜在售卡(自动匹配,与佣金无关)。数据 2026-10-02 更新。
常见问题
7B、14B、32B 模型各需要多少显存?
经验公式:Q4 量化显存 ≈ 参数量 × 0.6GB + 2GB 余量。7B 约 6G、14B 约 10G、32B 约 20G、70B 约 42G。再加上下文 KV 缓存(128K 上下文约再吃 2–6G)。
写小说选哪个模型?
本地:Qwen3-32B(中文长文最强之一,24G 卡)或 Qwen3-14B(12G 卡);API:DeepSeek-V3 综合性价比最高。长上下文比参数量更重要——大纲一致性靠 128K 上下文撑。详见 AI 写作场景指南。
MoE 模型为什么显存需求这么大?
MoE 每次只激活部分专家(速度快),但全部参数都要装进显存/内存:671B 级 MoE 即使 Q4 也要 380G+,属于多卡服务器或云的领地。个人玩家的 MoE 甜点是 30B-A3B 级(约 20G)。