选型口径:输入价(清洗/抽取类任务敏感)× 输出价(生成类任务敏感)× 缓存折扣(Agent 敏感)× 上下文长度(长文档敏感)。别只看标价,看你的任务画像。
原型开发直接从免费档(GLM-5-Flash 等)起步,量起来再切换付费档。
| 模型 | 输入 ¥/百万tokens | 缓存命中 | 输出 ¥/百万tokens | 上下文 | 说明 | 直达 |
|---|---|---|---|---|---|---|
| deepseek-chat DeepSeek | ¥2 | ¥0.5 | ¥8 | 128K | 综合能力与价格平衡最好,缓存命中后成本骤降 | 前往 ↗ |
| qwen-plus 阿里云百炼 | ¥0.8 | ¥ | ¥2 | 131K | Agent 工具调用稳定,新用户有免费额度 | 前往 ↗ |
| qwen-turbo 阿里云百炼 | ¥0.3 | ¥ | ¥0.6 | 128K | 大批量清洗、分类、抽取的性价比之选 | 前往 ↗ |
| doubao-1.5-pro 火山引擎 | ¥0.8 | ¥ | ¥2 | 128K | 与豆包同源,中文语料风格自然 | 前往 ↗ |
| GLM-5-Flash 智谱 AI | ¥0 | ¥ | ¥0 | 128K | 免费档主力,原型开发与个人项目零成本起步 | 前往 ↗ |
价格为 2026-10-01 参考价(按量计费口径),云服务价格变动频繁,以官网实时报价为准。
常见问题
API 和本地大模型哪个便宜?
轻中度使用(月百万 tokens 级)API 便宜一个数量级:deepseek-chat 输出 ¥8/百万 tokens,10 块钱够写一个月的周报。日均百万 tokens 以上、或隐私刚需,本地才回本——详见云 vs 本地对比。
缓存命中是什么?为什么重要?
重复的系统提示词与长上下文前缀会被平台缓存,命中部分价格降到 1/4 左右。Agent 类应用(system prompt 长、重复率高)实际账单可能只有标价的 30%–50%,选型时要按缓存后的真实成本算。