本地大模型运行指南(7B / 14B / 32B / 70B)

短答案

7B 全精度 8G 显存;14B Q4 量化 12G;32B Q4 量化 16G;70B Q4 量化 24G(或 32G 单卡 / 双 24G)。入门首选 RTX 5060 Ti 16G,一步到位选 RTX 5090 32G。

需求分析:本地大模型吃什么资源

与绘画不同,大模型推理的核心矛盾是「模型体积 vs 显存容量」:

  1. 显存容量(决定性)——经验公式:Q4 量化显存需求 ≈ 参数量 × 0.6GB + 2GB 上下文余量。7B 约 6G,14B 约 10G,32B 约 20G(略超 16G,需部分 offload 或更低量化),70B 约 42G。
  2. 显存带宽(决定速度)——推理是带宽密集型:tokens/s ≈ 带宽 ÷ 模型体积。这就是为什么 96GB/s 带宽的 CPU 内存跑大模型极慢,而 900GB/s+ 的 GDDR7 显存快。
  3. 内存容量(offload 底气)——显存不够时 CPU offload 依赖系统内存,96G 内存是高端玩家的入场券。
  4. 硬盘——一个 70B Q4 模型约 40G,模型收藏家请直接 4TB。

一句话:先决定你要跑多大的模型,再倒推显存容量;速度用带宽买。

选购要点

  • 入门(¥7k 档):5060 Ti 16G——7B 全精度 30+ tokens/s,14B Q4 流畅,这个显存还能顺便跑 Flux。
  • 主流(¥13k 档):5070 Ti 16G + 64G 内存——32B Q4 单卡,生产力级本地助手。
  • 专业(¥30k 档):5090 32G + 96G 内存——70B Q4 单卡可跑,MoE 模型本地化的底线配置。

三档配置如下,每档标注实测可运行的模型规格:

按预算分三档

价格每日自动更新 · 点击型号可比价购买

入门档

7B 全精度 / 14B Q4 量化

整套参考价 ¥7,143
16G 显存 GeForce RTX 5060 Ti 16GB AI 算力指数 36 · 入门首选。带宽是短板,但 16G 显存让 Flux 和 14B 模型进得去,入门唯一推荐。
京东比价
配件型号参考价
显卡RTX 5060 Ti 16GB¥3,599
CPUAMD R5 9600¥1,099
主板B650M¥699
内存DDR5 5600 32GB(2×16)¥499
固态NVMe PCIe4.0 1TB¥399
电源650W 金牌 ATX3.1¥399
机箱散热ATX 机箱 + 风冷¥449
合计¥7,143
可运行: 7B 全精度(30+ tok/s)14B Q4 量化SDXL 顺畅RAG 私有知识库

价格为电商参考价,自动更新于 2026-10-01;以实时价格与库存为准。

主流档

32B Q4 单卡 / 生产力级本地助手

整套参考价 ¥12,893
16G 显存 GeForce RTX 5070 Ti AI 算力指数 56 · 15000 元档主力卡。16G 显存 + 900GB/s 带宽,绘画与大模型两用性价比最高。
京东比价
配件型号参考价
显卡RTX 5070 Ti 16GB¥6,299
CPUAMD R7 9700X¥2,199
主板B650E¥1,299
内存DDR5 6000 64GB(2×32)¥1,199
固态NVMe PCIe4.0 2TB¥749
电源850W 金牌 ATX3.1¥599
机箱散热中塔机箱 + 塔式风冷¥549
合计¥12,893
可运行: 32B Q4 量化(20+ tok/s)14B 全精度Flux dev FP8 流畅多路并发 API 服务

价格为电商参考价,自动更新于 2026-10-01;以实时价格与库存为准。

专业档

70B Q4 单卡 / MoE 模型本地化

整套参考价 ¥29,793
32G 显存 GeForce RTX 5090 AI 算力指数 100 · 消费级天花板。32G 显存一步到位,本地 70B 不再需要多卡。
京东比价
配件型号参考价
显卡RTX 5090 32GB¥16,999
CPUAMD R9 9950X¥4,099
主板X870E¥2,499
内存DDR5 6000 96GB(2×48)¥1,899
固态NVMe PCIe4.0 4TB¥1,699
电源1200W 金牌 ATX3.1¥1,199
机箱散热全塔机箱 + 360 水冷¥1,499
合计¥29,793
可运行: 70B Q4 量化(单卡 10+ tok/s)MoE 混合专家模型70B 全量 CPU offload本地 vLLM 服务

价格为电商参考价,自动更新于 2026-10-01;以实时价格与库存为准。

常见问题

32G 内存能跑 70B 模型吗?
纯内存 + CPU 推理可以,但速度只有 1–3 tokens/s,基本不可用。实用方案:70B Q4 量化约需 40G 显存,单卡 5090(32G)+ 部分 CPU offload 可到 8–10 tokens/s;双 24G 卡(如两张 3090)可全 GPU 推理。32G 内存跑 32B Q4 GPU 推理是舒适区。
Q4 量化对模型能力损失大吗?
日常对话、写作、代码补全几乎无感,综合能力损失约 2%–5%。对精度敏感的任务(数学推理、长链条逻辑)建议 Q6 或 Q8。显存装得下的前提下,量化等级越高越好。
本地大模型和直接调 API 比哪个划算?
轻中度使用(每天几万 tokens)API 更划算,DeepSeek/qwen 级别每百万 tokens 只要几块钱。每天百万 tokens 以上、或隐私合规要求高、或要深度定制微调,本地才回本。详见[云 vs 本地成本对比](/builds/cloud-vs-local/)。
MoE 模型(如开源混合专家模型)需要什么配置?
MoE 的优势是激活参数少、推理快,但全部参数仍需装入显存+内存。典型 235B-A22B 级别需要 64G 以上显存或显存+内存混合推理,96G 内存 + 32G 显存可跑 Q4,速度取决于内存带宽。
显卡还是 Mac 甜点?M 系列芯片统一内存值得买吗?
128G+ 统一内存的 Mac Studio 是 70B+ 模型的安静低功耗方案,内存带宽决定速度上限。缺点:价格高、无 CUDA、训练生态弱。纯推理且预算充足可考虑;兼顾绘画/训练仍推荐 N 卡。
↑