七个方法,按见效速度排序
- 缓存命中——Agent 类应用把固定指令放进前缀,命中率上去后输入成本降到 1/4;
- 模型路由——80% 的请求用小模型(turbo/flash 级)就能答好,大模型只兜难题;
- 竞价实例——可中断任务直接 4-6 折,配 checkpoint;
- 包周/包月——稳定负载下再拿 10%-20% 折扣;
- 数据本地化——训练数据与模型权重放同厂商对象存储,内网拉取免流量费(存储选型);
- 冷启动保温——Serverless 推理留 1 路最小并发,避免每次冷启白白付费等待;
- 免费额度常态化——新人券 + 免费档组成「第 0 层」,测试流量永远不花真钱。
一个真实量级的例子
月度需求:4090×100 小时 + 2000 万 tokens API:
- 全按量:¥200(算力)+ 约 ¥60(API)≈ ¥260/月
- 优化后(包周 + 缓存 + 路由):约 ¥140/月
- 若日均超 6 小时:本地 5060 Ti 16G 整机(¥7.5k)约 14 个月回本
数字随价格变动,公式在云 vs 本地对比,代入自己的用量即可。
常见问题
竞价实例(Spot)能省多少?有什么坑?
公有云竞价 GPU 通常便宜 40%-60%。坑:可能被随时回收(提前 2 分钟通知)。适合无状态与可断续任务(数据处理、批量推理);训练任务务必配 checkpoint 续跑。
按量、包周、包月怎么选?
日用量 < 3 小时:按量。日用量 3-8 小时:包周(多数平台 8-9 折)。7×24 常驻:包月,或直接考虑买本地(见云 vs 本地对比,通常 8-10 个月回本)。
API 账单怎么压?
四板斧:①长 system prompt 触发缓存命中(部分平台命中价 1/4);②小模型做路由/初筛,大模型只处理难题;③输出长度控制(结构化输出比长篇省);④免费档承接低价值流量。组合下来常见账单降 50%-70%。