门槛速查
| 任务 | 最低显存 | 舒适显存 | 时间参考(1000 样本) |
|---|---|---|---|
| SDXL LoRA | 12G | 16G | 1-2h |
| Flux LoRA | 16G | 24G | 3-5h |
| 7B QLoRA | 10G | 16G | 3-4h |
| 14B QLoRA | 16G | 24G | 6-8h |
常见问题
LoRA 和 QLoRA 什么区别?
LoRA(绘画圈用法):冻结底模训练低秩适配器,显存 ≈ 底模 + 激活;QLoRA(NLP 圈用法):先把底模量化到 4bit 再训 LoRA,显存再砍一半——7B 从 20G 压到 10G。
16G 卡训 Flux LoRA 现实吗?
现实:FP8 底模 + 梯度检查点 + batch 1,一个 1000 图的 LoRA 约 3-5 小时。24G 卡同样任务快一倍且能开 batch 2——偶尔训 16G 够,常训 24G+。
租云训练怎么算成本?
4090 约 ¥2/h:SDXL LoRA(2h)≈ ¥4/次,7B QLoRA(4h)≈ ¥8/次。月训练 < 30 小时,云比买卡便宜一个数量级——先云后卡。