需求分析:本地大模型吃什么资源
与绘画不同,大模型推理的核心矛盾是「模型体积 vs 显存容量」:
- 显存容量(决定性)——经验公式:Q4 量化显存需求 ≈ 参数量 × 0.6GB + 2GB 上下文余量。7B 约 6G,14B 约 10G,32B 约 20G(略超 16G,需部分 offload 或更低量化),70B 约 42G。
- 显存带宽(决定速度)——推理是带宽密集型:tokens/s ≈ 带宽 ÷ 模型体积。这就是为什么 96GB/s 带宽的 CPU 内存跑大模型极慢,而 900GB/s+ 的 GDDR7 显存快。
- 内存容量(offload 底气)——显存不够时 CPU offload 依赖系统内存,96G 内存是高端玩家的入场券。
- 硬盘——一个 70B Q4 模型约 40G,模型收藏家请直接 4TB。
一句话:先决定你要跑多大的模型,再倒推显存容量;速度用带宽买。
选购要点
- 入门(¥7k 档):5060 Ti 16G——7B 全精度 30+ tokens/s,14B Q4 流畅,这个显存还能顺便跑 Flux。
- 主流(¥13k 档):5070 Ti 16G + 64G 内存——32B Q4 单卡,生产力级本地助手。
- 专业(¥30k 档):5090 32G + 96G 内存——70B Q4 单卡可跑,MoE 模型本地化的底线配置。
三档配置如下,每档标注实测可运行的模型规格:
按预算分三档
价格每日自动更新 · 点击型号可比价购买
入门档
7B 全精度 / 14B Q4 量化
整套参考价
¥7,143
16G 显存
GeForce RTX 5060 Ti 16GB
AI 算力指数 36 · 入门首选。带宽是短板,但 16G 显存让 Flux 和 14B 模型进得去,入门唯一推荐。
京东比价| 配件 | 型号 | 参考价 |
|---|---|---|
| 显卡 | RTX 5060 Ti 16GB | ¥3,599 |
| CPU | AMD R5 9600 | ¥1,099 |
| 主板 | B650M | ¥699 |
| 内存 | DDR5 5600 32GB(2×16) | ¥499 |
| 固态 | NVMe PCIe4.0 1TB | ¥399 |
| 电源 | 650W 金牌 ATX3.1 | ¥399 |
| 机箱散热 | ATX 机箱 + 风冷 | ¥449 |
| 合计 | ¥7,143 | |
可运行:
7B 全精度(30+ tok/s)14B Q4 量化SDXL 顺畅RAG 私有知识库
价格为电商参考价,自动更新于 2026-10-01;以实时价格与库存为准。
主流档
32B Q4 单卡 / 生产力级本地助手
整套参考价
¥12,893
16G 显存
GeForce RTX 5070 Ti
AI 算力指数 56 · 15000 元档主力卡。16G 显存 + 900GB/s 带宽,绘画与大模型两用性价比最高。
京东比价| 配件 | 型号 | 参考价 |
|---|---|---|
| 显卡 | RTX 5070 Ti 16GB | ¥6,299 |
| CPU | AMD R7 9700X | ¥2,199 |
| 主板 | B650E | ¥1,299 |
| 内存 | DDR5 6000 64GB(2×32) | ¥1,199 |
| 固态 | NVMe PCIe4.0 2TB | ¥749 |
| 电源 | 850W 金牌 ATX3.1 | ¥599 |
| 机箱散热 | 中塔机箱 + 塔式风冷 | ¥549 |
| 合计 | ¥12,893 | |
可运行:
32B Q4 量化(20+ tok/s)14B 全精度Flux dev FP8 流畅多路并发 API 服务
价格为电商参考价,自动更新于 2026-10-01;以实时价格与库存为准。
专业档
70B Q4 单卡 / MoE 模型本地化
整套参考价
¥29,793
32G 显存
GeForce RTX 5090
AI 算力指数 100 · 消费级天花板。32G 显存一步到位,本地 70B 不再需要多卡。
京东比价| 配件 | 型号 | 参考价 |
|---|---|---|
| 显卡 | RTX 5090 32GB | ¥16,999 |
| CPU | AMD R9 9950X | ¥4,099 |
| 主板 | X870E | ¥2,499 |
| 内存 | DDR5 6000 96GB(2×48) | ¥1,899 |
| 固态 | NVMe PCIe4.0 4TB | ¥1,699 |
| 电源 | 1200W 金牌 ATX3.1 | ¥1,199 |
| 机箱散热 | 全塔机箱 + 360 水冷 | ¥1,499 |
| 合计 | ¥29,793 | |
可运行:
70B Q4 量化(单卡 10+ tok/s)MoE 混合专家模型70B 全量 CPU offload本地 vLLM 服务
价格为电商参考价,自动更新于 2026-10-01;以实时价格与库存为准。
常见问题
32G 内存能跑 70B 模型吗?
纯内存 + CPU 推理可以,但速度只有 1–3 tokens/s,基本不可用。实用方案:70B Q4 量化约需 40G 显存,单卡 5090(32G)+ 部分 CPU offload 可到 8–10 tokens/s;双 24G 卡(如两张 3090)可全 GPU 推理。32G 内存跑 32B Q4 GPU 推理是舒适区。
Q4 量化对模型能力损失大吗?
日常对话、写作、代码补全几乎无感,综合能力损失约 2%–5%。对精度敏感的任务(数学推理、长链条逻辑)建议 Q6 或 Q8。显存装得下的前提下,量化等级越高越好。
本地大模型和直接调 API 比哪个划算?
轻中度使用(每天几万 tokens)API 更划算,DeepSeek/qwen 级别每百万 tokens 只要几块钱。每天百万 tokens 以上、或隐私合规要求高、或要深度定制微调,本地才回本。详见[云 vs 本地成本对比](/builds/cloud-vs-local/)。
MoE 模型(如开源混合专家模型)需要什么配置?
MoE 的优势是激活参数少、推理快,但全部参数仍需装入显存+内存。典型 235B-A22B 级别需要 64G 以上显存或显存+内存混合推理,96G 内存 + 32G 显存可跑 Q4,速度取决于内存带宽。
显卡还是 Mac 甜点?M 系列芯片统一内存值得买吗?
128G+ 统一内存的 Mac Studio 是 70B+ 模型的安静低功耗方案,内存带宽决定速度上限。缺点:价格高、无 CUDA、训练生态弱。纯推理且预算充足可考虑;兼顾绘画/训练仍推荐 N 卡。