Ollama 新手入门:装完第一个跑什么模型

短答案

安装一行命令,选模型看显存:8G 跑 qwen3:8b、12G 跑 qwen3:14b、16G 跑 32b 量化(offload)、24G 跑 32b 全速。新手从 7B 开始,别上来就 70B。

按显存对号入座

显存推荐模型体验
8Gqwen3:8b40+ tok/s
12Gqwen3:14b30+ tok/s
16Gqwen3:14b / 32b(Q4, offload)全速 / 10 tok/s
24G+qwen3:32b20+ tok/s

进阶(并发/API 服务)见 vLLM vs Ollama。

常见问题

Ollama 怎么安装?
macOS/Windows 官网下载安装包;Linux 一行:curl -fsSL https://ollama.com/install.sh | sh。装完终端跑 ollama run qwen3:7b,模型自动下载运行,无需配环境。
我的显卡该装什么模型?
8G → 7-8B Q4;12G → 14B Q4(甜点);16G → 14B 全速 + 32B offload;24G+ → 32B 全速;无独显 → 7B 纯 CPU(10 tok/s 以内,仅尝鲜)。完整对照表见模型库。
和 LM Studio 怎么选?
Ollama:命令行/服务端首选,生态最大;LM Studio:图形界面 + 模型市场,新手友好。两者后端都是 llama.cpp,性能一致——按界面偏好选。
常见坑有哪些?
①显存被其他程序占用导致 offload 变慢(关掉游戏/浏览器硬件加速);②上下文拉满 128K 吃额外显存;③首次加载慢是硬盘读模型(40G 模型 SSD 上 10 秒,机械盘 1 分钟+)。
↑