按显存对号入座
| 显存 | 推荐模型 | 体验 |
|---|---|---|
| 8G | qwen3:8b | 40+ tok/s |
| 12G | qwen3:14b | 30+ tok/s |
| 16G | qwen3:14b / 32b(Q4, offload) | 全速 / 10 tok/s |
| 24G+ | qwen3:32b | 20+ tok/s |
进阶(并发/API 服务)见 vLLM vs Ollama。
常见问题
Ollama 怎么安装?
macOS/Windows 官网下载安装包;Linux 一行:curl -fsSL https://ollama.com/install.sh | sh。装完终端跑 ollama run qwen3:7b,模型自动下载运行,无需配环境。
我的显卡该装什么模型?
8G → 7-8B Q4;12G → 14B Q4(甜点);16G → 14B 全速 + 32B offload;24G+ → 32B 全速;无独显 → 7B 纯 CPU(10 tok/s 以内,仅尝鲜)。完整对照表见模型库。
和 LM Studio 怎么选?
Ollama:命令行/服务端首选,生态最大;LM Studio:图形界面 + 模型市场,新手友好。两者后端都是 llama.cpp,性能一致——按界面偏好选。
常见坑有哪些?
①显存被其他程序占用导致 offload 变慢(关掉游戏/浏览器硬件加速);②上下文拉满 128K 吃额外显存;③首次加载慢是硬盘读模型(40G 模型 SSD 上 10 秒,机械盘 1 分钟+)。