显存不够怎么办:量化与 GGUF,把大模型塞进小显卡
TuxAI · 2026年8月17日
显存不够怎么办:量化与 GGUF,把大模型塞进小显卡
看到某模型要求 24GB 显存,再看自己的 8GB 显卡,是不是觉得本地 AI 与自己无缘?先别急——「显存不够」是本地 AI 最常见的入门障碍,而它有一个标准解法:量化。
量化是什么:把模型「压缩」进显存
大模型的参数默认用高精度存储(16 位浮点,FP16)。「量化」就是降低参数精度来缩小体积:比如从 16 位降到 8 位(INT8)、4 位(INT4),体积直接减半或减到四分之一。8GB 显存放不下的模型,量化后可能刚好塞进去。
代价是精度损失。但研究与实践经验表明:对大多数对话、写作、代码场景,4 位量化后的模型表现与原始模型差距很小,普通人很难察觉。
GGUF:量化模型的「通用格式」
GGUF 是 llama.cpp 项目推出的模型格式,设计目标之一就是「量化友好」。如今 Hugging Face 上主流开源模型几乎都有 GGUF 版本(文件名常带 Q4_K_M、Q8_0 这类标记),Ollama 也直接使用这种格式。
常见量化档位(Q 数字越小,体积越小,精度越低)
| 档位 | 相对体积 | 适用场景 |
|---|---|---|
| Q8_0 | 约原始 8 位 | 显存充裕,追求质量 |
| Q6_K | 约原始 6 位 | 质量与体积均衡 |
| Q4_K_M | 约原始 4 位 | 最常用,性价比之王 |
| Q3_K_S | 约原始 3 位 | 显存极紧张,应急 |
实操路径
用 Ollama(最简单):ollama run 模型名 时,Ollama 默认就使用 4 位量化版本,无需任何手动操作。想指定档位,在模型标签里写清楚即可(如 qwen3:14b-q4_K_M)。
用 llama.cpp(更灵活):下载对应 GGUF 文件后直接运行,可以用 -ngl 参数把部分层卸载到 GPU,显存不够时自动让 CPU 兜底——这也是「显存小也能跑」的另一个技巧。详见llama.cpp 推理教程。
常见误区
- 量化 ≠ 模型变蠢:4 位量化在现代模型上损失有限,很多场景实测难分伯仲
- 显存不是唯一瓶颈:内存(RAM)不够、硬盘读速慢同样会卡。模型文件部分在内存/硬盘时速度会明显下降
- 量化救不了「规格」:参数量太小(如 3B)的模型再优化也有限,档位再低不如换大模型;而 70B 模型即便量化到 4 位也要约 40GB,消费级显卡依旧吃力
小结
量化 + GGUF 是本地 AI 的「省钱课」:一张主流显卡(8–12GB)配合 4 位量化,就能跑起 14B 级别的对话模型和主流生图模型。先记住两个结论:默认档位选 Q4_K_M,Ollama 已经帮你量化好了。
评论
评论区由 GitHub Discussions 驱动,使用 GitHub 账号即可参与讨论。