本地跑 70B 模型最低配置

短答案

70B Q4 约需 42G 显存:单卡方案 RTX 5090 32G + 部分 offload(8–10 tok/s);双卡方案两张 3090 24G;穷玩方案 96G 内存 CPU 混推(3–5 tok/s)。

短答案:三条路线

路线核心配置参考速度整机价
单卡旗舰RTX 5090 32G + 96G 内存8–12 tok/s~¥30k
双卡二手2×3090 24G + 64G 内存12–18 tok/s~¥15k(无保修)
CPU 混推9950X + 96G DDR53–5 tok/s~¥11k

展开

为什么是 42G:70B 参数 × Q4(0.55 byte/参数)≈ 38G 模型本体 + 4G 上下文与 KV 缓存。这是「全显存覆盖」的口径。

  • 单卡 5090:32G 覆盖率约 76%,剩余层 offload 到内存,8–10 tok/s 可用;96G 内存是底气。
  • 双 3090:48G 全覆盖 + 张量并行,速度反而最快,但二手无保修、功耗 700W+、需要折腾——只推荐动手党。
  • CPU 混推:带宽决定天花板,DDR5 双通道 ~90GB/s,3–5 tok/s 只适合「让它慢慢想」的批处理任务。

务实建议:先问自己要不要 70B。32B Q4 + 5070 Ti 的组合,价格一半、速度三倍、能力覆盖 80% 场景。

GeForce RTX 5090 · 消费级天花板。32G 显存一步到位,本地 70B 不再需要多卡。
32G 显存 AI 算力 100

单卡跑 70B 的唯一在产消费级方案

DDR5 6000 96GB(2×48) · CPU 推理与 MoE 模型的入场券,也是 70B CPU offload 的底气。
96GB

CPU offload 与 MoE 的入场券

完整配置见本地大模型指南与30000 元工作站。

常见问题

有没有 20G 显存跑 70B 的办法?
有,GGUF 逐层 offload:模型分层放显存+内存,显存占 60% 时约 5 tok/s。能跑,但「能用」的门槛是 8 tok/s 以上,对应显存覆盖率 80%+。
32B 模型是不是更务实?
是。32B Q4 约 20G,5070 Ti 16G 轻度 offload 或 5090 全显存覆盖;当前 32B 级开源模型的能力已覆盖 70B 的多数日常用途。除非明确需要 70B 级推理质量,否则 32B 是甜点。
↑