LoRA 训练需要什么配置?SD/Flux/大模型微调门槛

短答案

SDXL LoRA:12G 起步 16G 舒适;Flux LoRA:16G 起步 24G 舒适;7B QLoRA:10G;14B QLoRA:16G。偶尔训练优先云 GPU(¥2/h),天天训练才买卡。

门槛速查

任务最低显存舒适显存时间参考(1000 样本)
SDXL LoRA12G16G1-2h
Flux LoRA16G24G3-5h
7B QLoRA10G16G3-4h
14B QLoRA16G24G6-8h

云方案:GPU 云对比;本地整机:训练场景。

常见问题

LoRA 和 QLoRA 什么区别?
LoRA(绘画圈用法):冻结底模训练低秩适配器,显存 ≈ 底模 + 激活;QLoRA(NLP 圈用法):先把底模量化到 4bit 再训 LoRA,显存再砍一半——7B 从 20G 压到 10G。
16G 卡训 Flux LoRA 现实吗?
现实:FP8 底模 + 梯度检查点 + batch 1,一个 1000 图的 LoRA 约 3-5 小时。24G 卡同样任务快一倍且能开 batch 2——偶尔训 16G 够,常训 24G+。
租云训练怎么算成本?
4090 约 ¥2/h:SDXL LoRA(2h)≈ ¥4/次,7B QLoRA(4h)≈ ¥8/次。月训练 < 30 小时,云比买卡便宜一个数量级——先云后卡。
↑