短答案:三条路线
| 路线 | 核心配置 | 参考速度 | 整机价 |
|---|---|---|---|
| 单卡旗舰 | RTX 5090 32G + 96G 内存 | 8–12 tok/s | ~¥30k |
| 双卡二手 | 2×3090 24G + 64G 内存 | 12–18 tok/s | ~¥15k(无保修) |
| CPU 混推 | 9950X + 96G DDR5 | 3–5 tok/s | ~¥11k |
展开
为什么是 42G:70B 参数 × Q4(0.55 byte/参数)≈ 38G 模型本体 + 4G 上下文与 KV 缓存。这是「全显存覆盖」的口径。
- 单卡 5090:32G 覆盖率约 76%,剩余层 offload 到内存,8–10 tok/s 可用;96G 内存是底气。
- 双 3090:48G 全覆盖 + 张量并行,速度反而最快,但二手无保修、功耗 700W+、需要折腾——只推荐动手党。
- CPU 混推:带宽决定天花板,DDR5 双通道 ~90GB/s,3–5 tok/s 只适合「让它慢慢想」的批处理任务。
务实建议:先问自己要不要 70B。32B Q4 + 5070 Ti 的组合,价格一半、速度三倍、能力覆盖 80% 场景。
GeForce RTX 5090
· 消费级天花板。32G 显存一步到位,本地 70B 不再需要多卡。
32G 显存
AI 算力 100
单卡跑 70B 的唯一在产消费级方案
¥16,999
京东比价DDR5 6000 96GB(2×48)
· CPU 推理与 MoE 模型的入场券,也是 70B CPU offload 的底气。
96GB
CPU offload 与 MoE 的入场券
¥1,899
京东比价完整配置见本地大模型指南与30000 元工作站。
常见问题
有没有 20G 显存跑 70B 的办法?
有,GGUF 逐层 offload:模型分层放显存+内存,显存占 60% 时约 5 tok/s。能跑,但「能用」的门槛是 8 tok/s 以上,对应显存覆盖率 80%+。
32B 模型是不是更务实?
是。32B Q4 约 20G,5070 Ti 16G 轻度 offload 或 5090 全显存覆盖;当前 32B 级开源模型的能力已覆盖 70B 的多数日常用途。除非明确需要 70B 级推理质量,否则 32B 是甜点。