本地大模型 FAQ

显存需求、量化、70B、部署工具 —— 本地大模型的一切常见问题。 共收录 4 个页面的常见问题,点击问题展开答案,「查看全文」跳转深度指南。

按模型规格查显存:见模型库;按预算配整机:见本地大模型场景。

大语言模型(LLM)显存需求与推荐配置

7B、14B、32B 模型各需要多少显存?
经验公式:Q4 量化显存 ≈ 参数量 × 0.6GB + 2GB 余量。7B 约 6G、14B 约 10G、32B 约 20G、70B 约 42G。再加上下文 KV 缓存(128K 上下文约再吃 2–6G)。

查看全文 →

写小说选哪个模型?
本地:Qwen3-32B(中文长文最强之一,24G 卡)或 Qwen3-14B(12G 卡);API:DeepSeek-V3 综合性价比最高。长上下文比参数量更重要——大纲一致性靠 128K 上下文撑。详见 AI 写作场景指南。

查看全文 →

MoE 模型为什么显存需求这么大?
MoE 每次只激活部分专家(速度快),但全部参数都要装进显存/内存:671B 级 MoE 即使 Q4 也要 380G+,属于多卡服务器或云的领地。个人玩家的 MoE 甜点是 30B-A3B 级(约 20G)。

查看全文 →

图像生成模型显存需求(SD / Flux)

Flux 和 SDXL 怎么选?
显存 ≥12G 且追求画质/中文文字:Flux(注意 dev 许可为非商用,商用选 schnell);显存 8–12G 或需要成熟 ControlNet 工作流:SDXL。两者不冲突——很多工作流 SDXL 出构图、Flux 出精修。

查看全文 →

Flux 8G 显存能跑吗?
GGUF Q4 量化版可以勉强跑 512–768 分辨率,速度慢且大分辨率易爆。务实建议:12G 起步,16G 舒适。

查看全文 →

要生成带中文文字的海报选什么?
Qwen-Image(20B,中文文字渲染当前最能打,推荐 24G 显存)或走 API(即梦/Seedream 类产品)。SDXL/Flux 的中文文字基本不可用。

查看全文 →

视频生成模型显存需求(Wan / Hunyuan)

16G 显存能跑 14B 视频模型吗?
能:Wan2.2 14B 的量化版(/block swap)在 16G 卡上可跑 720p,但速度明显打折且偶有显存峰值溢出。舒适体验建议 24G(二手 3090 或 5090)。

查看全文 →

视频生成为什么比绘画吃显存?
多帧联合潜空间 + VAE 解码峰值:同样 1024 宽度,视频的显存占用约是单帧的 2–3 倍,还要给时序一致性模块留余量。

查看全文 →

速度优先选哪个?
LTX-Video(蒸馏版):同硬件速度数倍于同量级模型,适合快速迭代分镜;最终渲染再换 Wan2.2 14B 或 HunyuanVideo。

查看全文 →

音乐 / 音频生成模型显存需求

AI 生成完整歌曲(带人声)需要什么显卡?
中文歌:DiffRhythm(8G 起)最快;ACE-Step(8–12G)编曲最强;要开源里最好的人声:YuE,量化 12G 可跑、长歌建议 24G。生成速度普遍偏慢(分钟级),耐心是配置的一部分。

查看全文 →

AI 音乐对 CPU 和内存有要求吗?
有:音频后处理(分离、母带、格式转换)吃 CPU 多核;长歌生成的中间缓存吃内存,32G 起步舒适。硬盘建议 2TB+:样本与作品库增长很快。

查看全文 →

商用要注意什么许可?
ACE-Step / YuE / DiffRhythm 均为宽松许可(商用前再核对权重与数据条款);MusicGen 是 CC-BY-NC(不可商用);Stable Audio Open 有非商用条款。正式发行前逐一核对官方许可页。

查看全文 →

↑