8GB 显存能跑什么大模型?本地部署硬件需求速查

很多人卡在第一步:我的显卡到底能跑多大的模型?这篇速查讲清楚量化原理和显存换算,看完你自己就能判断。

想在本机跑大模型,最先劝退人的往往不是技术,而是那句”显存不够”。这篇速查帮你建立一套显存换算的直觉,看完你就能自己判断:我的显卡能跑什么。

先记住一个公式

模型占用的显存 ≈ 参数量 × 每参数字节数。精度决定了”每参数字节数”:

  • FP16(半精度):每参数 2 字节 → 7B 模型约需 14GB
  • Q8(8bit 量化):每参数约 1 字节 → 7B 模型约需 7GB
  • Q4(4bit 量化):每参数约 0.5 字节 → 7B 模型约需 3.5-4.5GB

再加上 KV 缓存和运行时开销,实际占用一般比理论值多 1-2GB。所以 8GB 显存的显卡,跑 7B 级别的 Q4 量化模型 是最舒服的,13B 级别的 Q4 属于极限操作(通常需要把部分层放到内存)。

常见显存档位速查

显存 舒服能跑 极限能跑
4GB 3B Q4 7B Q4(很勉强)
6GB 7B Q4(短上下文) 7B Q8
8GB 7B Q4/Q8 13B Q4
12-16GB 13B Q8 / 32B Q4 更长上下文的 32B Q4
24GB 32B Q4/Q8 部分 70B 低量化

量化版本怎么选

常见的量化格式有 GGUF(CPU/GPU 混跑,Ollama、llama.cpp 用)、GPTQ、AWQ(纯 GPU 推理)等。选择原则:

  • 显存刚好够:选 Q4 系(如 Q4_K_M),质量与体积的平衡点。
  • 显存充裕:上 Q6/Q8,质量损失几乎可以忽略。
  • 显存不够:用支持 CPU offload 的工具(Ollama 自动处理),代价是速度下降。

三个实用建议

  1. 先跑 7B Q4 验证整条链路,再逐步上探更大模型,别一步到位。
  2. 上下文长度越大,KV 缓存吃显存越多,长文本需求要预留至少 2GB。
  3. 同参数量下,不同家族的模型对显存要求相近,但质量差异可能很大——先看社区评测再下载。

下一篇我们会讲用 Ollama 把这一切跑起来的完整命令,敬请关注。

Leave a Reply

Your email address will not be published. Required fields are marked *