想在本机跑大模型,最先劝退人的往往不是技术,而是那句”显存不够”。这篇速查帮你建立一套显存换算的直觉,看完你就能自己判断:我的显卡能跑什么。
先记住一个公式
模型占用的显存 ≈ 参数量 × 每参数字节数。精度决定了”每参数字节数”:
- FP16(半精度):每参数 2 字节 → 7B 模型约需 14GB
- Q8(8bit 量化):每参数约 1 字节 → 7B 模型约需 7GB
- Q4(4bit 量化):每参数约 0.5 字节 → 7B 模型约需 3.5-4.5GB
再加上 KV 缓存和运行时开销,实际占用一般比理论值多 1-2GB。所以 8GB 显存的显卡,跑 7B 级别的 Q4 量化模型 是最舒服的,13B 级别的 Q4 属于极限操作(通常需要把部分层放到内存)。
常见显存档位速查
| 显存 | 舒服能跑 | 极限能跑 |
|---|---|---|
| 4GB | 3B Q4 | 7B Q4(很勉强) |
| 6GB | 7B Q4(短上下文) | 7B Q8 |
| 8GB | 7B Q4/Q8 | 13B Q4 |
| 12-16GB | 13B Q8 / 32B Q4 | 更长上下文的 32B Q4 |
| 24GB | 32B Q4/Q8 | 部分 70B 低量化 |
量化版本怎么选
常见的量化格式有 GGUF(CPU/GPU 混跑,Ollama、llama.cpp 用)、GPTQ、AWQ(纯 GPU 推理)等。选择原则:
- 显存刚好够:选 Q4 系(如 Q4_K_M),质量与体积的平衡点。
- 显存充裕:上 Q6/Q8,质量损失几乎可以忽略。
- 显存不够:用支持 CPU offload 的工具(Ollama 自动处理),代价是速度下降。
三个实用建议
- 先跑 7B Q4 验证整条链路,再逐步上探更大模型,别一步到位。
- 上下文长度越大,KV 缓存吃显存越多,长文本需求要预留至少 2GB。
- 同参数量下,不同家族的模型对显存要求相近,但质量差异可能很大——先看社区评测再下载。
下一篇我们会讲用 Ollama 把这一切跑起来的完整命令,敬请关注。