量化模型就是把模型权重从 16 位浮点数压成 4 到 8 位整数存放的版本,文件缩到原来的四分之一到一半,参数量和结构不变。本地部署几乎都用量化版,原因有三个:显存是硬边界,只有量化后模型才装得下;生成速度由显存带宽决定,权重越小每个 token 读得越快;同样一块显存,参数量比精度更值钱。 代价在评测上通常不到 1 个百分点。截至 2026 年 9 月 9 日,我们的建议是:默认用 4-bit(Q4_K_M 或 Unsloth 的 Q4_K_XL),显存宽裕也不必为 8-bit 加钱,2-bit 只给超大 MoE 模型,1-bit 不要用来做 agent。
什么是量化模型?为什么本地部署大模型几乎都用量化版(2026)
正文与 FAQ 中的数字截至 2026年9月9日;表格使用最新已发布价格,各设备采集时间可能不同。

量化到底改了什么?
量化改的只是每个权重占多少位,参数量、层数和结构一个都没变。 一个大模型就是几十亿到几千亿个数字,训练时每个数字用 16 位浮点(BF16 或 FP16)存,占 2 字节。量化把这些数字按块换算成低位整数,每块只保留一个缩放因子和一个偏移量,推理时再乘回去。按本站数据方法页的口径,各档位每参数的字节数是:
- FP16 / BF16:2 字节,也就是各家发布的「原版」。
- 8-bit(Q8_0):约 1.06 字节,每 32 个权重共用一个缩放因子,多出的 0.06 字节就是缩放因子。
- 4-bit(Q4_K_M):约 0.57 字节,不是正好 0.5,因为 K-quant 用两层分块缩放,而且注意力和输出层保留了更高精度。
- 2-bit(Q2_K_XL):约 0.38 字节,是 Unsloth 动态量化的档位,最敏感的层留在 4 到 8 位。
- 1-bit(IQ1_M):约 0.24 字节,靠查表式编码把每个权重压到 1.75 位左右。
所以名字里的位数只是主要位宽。Q4_K_M 的 Q4 是 4 位,K 是 llama.cpp 的分块量化方法,M 是中档,同一位宽还有 S 和 L;Unsloth 的 XL 是逐层挑量化类型的动态版本。这些格式的定义都在 GGUF 规范与 llama.cpp 的量化说明里,Ollama 库里不带后缀的默认标签用的也是 Q4_K_M。

为什么本地部署几乎都用量化版?
第一个原因是显存:没有量化,消费级显卡连 12B 模型都放不下。 下表按本站公式实时计算三个模型在 8K 上下文下的显存需求,包含权重、KV cache 和 1 GB 运行开销;MoE 模型整机放不下时,第二行给出专家卸载后「显存 + 内存」的需求:
| 模型 | FP16 | 8-bit | 4-bit | 2-bit |
|---|---|---|---|---|
| 8K | 8K | 8K | 8K | |
| Gemma 4 12B12B | 28 GB | 17 GB | 11 GB | 9 GB |
| Qwen3.8 27B27.8B | 58 GB | 32 GB | 19 GB | 14 GB |
| DeepSeek V4 Flash284B · A13B | 558 GB卸载:16 GB 显存 + 543 GB 内存 | 297 GB卸载:10 GB 显存 + 288 GB 内存 | 160 GB卸载:7 GB 显存 + 155 GB 内存 | 108 GB卸载:6 GB 显存 + 104 GB 内存 |
读法很直接。Gemma 4 12B 的 FP16 原版要 28 GB,24GB 的 RTX 3090 都放不下;4-bit 只要 11 GB,16GB 卡还能开更长上下文。Qwen3.8 27B 原版 58 GB,只有 96GB 的工作站卡才能整机跑;8-bit 要 32 GB,只有 RTX 5090 勉强放得下;4-bit 后 19 GB,正好落进一张 RTX 3090 或 RTX 4090。DeepSeek V4 Flash 是 284B 参数、每个 token 只激活 13B 的 MoE:原版 558 GB 是数据中心的东西,4-bit 也要 160 GB,整机放显存只有 Mac Studio M3 Ultra 512GB 这类机器能做到;但把专家权重放进系统内存后,显存只需要 7 GB,内存 155 GB,一张 8GB 的显卡也能以约 11 tokens/s 跑起来。2-bit 再把内存需求压到 104 GB,128GB 内存的台式机就装得下。量化在这里决定的不是「跑多快」,而是「能不能跑」。
第二个原因是速度:每生成一个 token,显卡都要把全部激活权重从显存读一遍,权重越小读得越快。 本站的速度估算就是每个 token 要读的字节除以显存带宽和效率系数,公式见数据方法。同样的显卡和模型,只换量化档位,预估速度差别如下。先看 8-bit:
| 型号 | Gemma 4 12B | Qwen3.8 27B | DeepSeek V4 Flash |
|---|---|---|---|
| 装不下 | 装不下 | 6* | |
| 45 | 装不下 | 6* | |
| 48 | 装不下 | 7* | |
| 83 | 40 | 7* |
8-bit、8K 上下文、单路解码的预估速度。带 * 的是 MoE 模型把专家权重放在系统内存里跑(按 70 GB/s 内存带宽算)。
再看 4-bit:
| 型号 | Gemma 4 12B | Qwen3.8 27B | DeepSeek V4 Flash |
|---|---|---|---|
| 71 | 装不下 | 12* | |
| 74 | 38 | 12* | |
| 79 | 41 | 12* | |
| 135 | 70 | 12* |
4-bit、8K 上下文、单路解码的预估速度。带 * 的是 MoE 模型把专家权重放在系统内存里跑(按 70 GB/s 内存带宽算)。
两张表放在一起,量化的好处一目了然。8-bit 下 Qwen3.8 27B 只有 RTX 5090 装得下,Gemma 4 12B 在 16GB 的 RTX 5070 Ti 上也装不下;换成 4-bit,27B 落进 24GB 卡,12B 每张卡都能跑,而且同一张卡同一个模型的速度快六到八成。V4 Flash 两张表里都是专家卸载的速度,4-bit 比 8-bit 快将近一倍,因为每个 token 从内存搬的专家权重少了一半。这些差距不来自算力,来自每个 token 少搬了多少字节。
第三个原因是同样的显存里,参数量比精度更值钱。 24GB 显存可以放 Gemma 4 12B 的 8-bit(17 GB),也可以放 Qwen3.8 27B 的 4-bit(18.5 GB),后者在评测上明显更强。4-bit 损失的不到 1 个百分点,远小于 12B 和 27B 之间的能力差距。这也是为什么各家模型卡的「最低显存」和本站模型页的「最便宜能跑的卡」都按 4-bit 算。
量化会损失多少质量?
4-bit 的损失在评测上通常不到 1 个百分点,3-bit 开始明显,2-bit 以下只适合大模型。 三组可核对的数据:
- llama.cpp 官方困惑度表(7B 模型):Q8_0 困惑度只升 0.0004,Q5_K_M 升 0.014,Q4_K_M 升 0.054,Q3_K_M 升 0.24,Q2_K 升 0.87。来源是 llama.cpp 讨论区的官方对照表。
- 2026 年 1 月对 Llama 3.1 8B 的统一评测:从 3-bit 到 8-bit 共 13 种量化,GSM8K、HellaSwag、IFEval、MMLU、TruthfulQA 五项平均,FP16 基线 69.47%,Q5_0 69.92%,Q4_K_S 69.17%,Q3_K_M 68.07%,Q3_K_S 65.49%。作者的结论是 4 到 5 bit 是平衡的默认档,数学推理对量化最敏感,Q3_K_S 让 GSM8K 从 77.6% 掉到 68.3%。见 arXiv:2601.14277。
- Unsloth 动态量化:对 Gemma 3 27B 的 MMLU 五样本,Q4_K_XL 71.47%(15.6 GB)、Q3_K_XL 70.87%(12.8 GB)、Q2_K_XL 68.70%(10.0 GB);他们给 Qwen3.8 27B 的 1-bit 档 IQ1_M 只有约 72% 的首选答案一致率,并提醒 1-bit 在工具调用上退化明显。见 Unsloth 动态量化文档。
另一个趋势是厂商在训练阶段就为量化做准备。Google 发布 Gemma 3 时同时提供了量化感知训练(QAT)版本,把 27B 的显存从 BF16 的 54 GB 压到 int4 的 14.1 GB,并称相对普通 Q4_0 量化把困惑度损失减少了 54%,见 Google 开发者博客。如果模型有官方 QAT 版,优先用它。
按任务分,感受差别最大的是数学、代码和长链推理,这类任务建议留在 4-bit 及以上;对话、翻译、摘要、写作在 3-bit 下也很难察觉。
量化格式和显卡有关系吗?
权重量化不挑显卡,任何显卡都能跑 GGUF;只有 FP8 和 FP4 这类需要专用张量核心的格式才挑架构。 本地推理常见的格式分三类:
- GGUF(llama.cpp、Ollama、LM Studio):把低位权重在计算时解压回 16 位再乘,所以 RTX 3090、AMD 显卡、Mac 都能跑,文件也最多。上面说的 Q4_K_M、Q8_0、Q2_K_XL 全是 GGUF。
- AWQ、GPTQ(vLLM、SGLang):4-bit 权重配专门的矩阵乘内核,多并发时吞吐更高,适合当服务跑;需要 CUDA 显卡。
- FP8、NVFP4(TensorRT-LLM、vLLM,以及图片和视频模型):这是真正用 8 位或 4 位浮点做乘法,需要 Ada 或 Blackwell 的张量核心;RTX 3090 没有 FP8 单元,只能把 FP8 权重当 16 位算。Wan 2.2 和 FLUX 常见的 fp8 版本就是这一类,见本地视频换显卡。
还有一个常被混淆的点:本地推理说的量化几乎都是只量化权重,KV cache 仍然是 16 位。所以量化只缩小权重那一项,上下文越长,KV cache 占比越大,量化省下的比例就越小。要压 KV cache 得单独开 8 位缓存选项,那是另一篇的话题,见显存不够加内存有用吗。
该选哪一档量化?
默认 4-bit;显存放不下就先降上下文再降到 3-bit;超大 MoE 才考虑 2-bit;8-bit 只在显存明显多出一倍时用。 以 Qwen3.8 27B 和 DeepSeek V4 Flash 为例,按显存对照:
| 你的显存 | Qwen3.8 27B 能跑到 | DeepSeek V4 Flash 能跑到 |
|---|---|---|
| 8GB | 跑不了,换 8B 级 4-bit(7 GB) | 卸载跑 4-bit,内存 160GB 以上 |
| 16GB | 2-bit 8K 上下文(13 GB);3-bit 要 16.3 GB,已装不下 | 同上,显存不是瓶颈 |
| 24GB | 4-bit 8K 上下文(18.5 GB) | 同上 |
| 32GB | 4-bit 32K 上下文(24.5 GB);8-bit 8K 勉强 | 同上 |
| 48GB | 8-bit 32K 上下文(38 GB) | 同上 |
| 512GB 统一内存 | FP16 都放得下 | 4-bit 整机放内存(160 GB),约 47 tokens/s |
也就是说,稠密模型看显存选档位,超大 MoE 看内存选档位。V4 Flash 在 2-bit 下需要 104 GB 内存,128GB 内存的台式机就能跑;4-bit 需要 155 GB,得上 192GB。下面是 32GB 及以下、有闲鱼报价的消费卡,最后一列是跑 Qwen3.8 27B 4-bit 的预估速度,装不下的显示「—」:
eBay
| 型号 | 显存 GB | 带宽 GB/s | INT8 TOPS | 功耗 W | eBay | 显存单价 | Qwen3.8 27B 速度 t/s |
|---|---|---|---|---|---|---|---|
| 16 | 576 | 95 | 335 | ¥3,363 | ¥210 | — | |
| 22 | 616 | 215 | 250 | ¥3,706 | ¥168 | 25 | |
| 16 | 624 | 75 | 263 | ¥3,820 | ¥239 | — | |
| 16 | 448 | 190 | 180 | ¥4,708 | ¥294 | — | |
| 20 | 800 | 103 | 315 | ¥4,708 | ¥235 | 23 | |
| 12 | 672 | 247 | 250 | ¥5,212 | ¥434 | — | |
| 16 | 640 | 389 | 304 | ¥5,347 | ¥334 | — | |
| 24 | 960 | 123 | 355 | ¥6,719 | ¥280 | 28 | |
| 16 | 896 | 352 | 300 | ¥8,071 | ¥504 | — | |
| 16 | 717 | 390 | 320 | ¥8,494 | ¥531 | — | |
| 24 | 936 | 285 | 350 | ¥10,425 | ¥434 | 38 | |
| 16 | 960 | 450 | 360 | ¥12,106 | ¥757 | — | |
| 24 | 1,008 | 661 | 450 | ¥21,515 | ¥896 | 41 | |
| 32 | 1,792 | 838 | 575 | ¥43,716 | ¥1,366 | 70 |
截至 2026 年 9 月 9 日闲鱼中位价,二手 RTX 3090 ¥8,100 是跑 27B 4-bit 的最低门槛,约 38 tokens/s;RTX 5070 Ti ¥9,899 显存只有 16GB,跑不了 27B 4-bit,只能退到 2-bit 或者换 14B 级模型;RTX 4090 ¥23,500 能跑的模型和 3090 完全一样,只快不到一成。预算在五千以内,RTX 5060 Ti 16GB ¥4,688 跑 Gemma 4 12B 4-bit 约 37 tokens/s,也很舒服。选卡的展开讨论见 3090 与 5070 Ti 之争和预算显卡指南。
最后三条实操建议:
- 下载时优先选 Unsloth 或 bartowski 的 GGUF 仓库,前者的 XL 档逐层挑过量化类型,后者档位全。本站模型页列的就是这两家的文件大小。
- 同一档位选带 imatrix 的版本,它用校准数据决定哪些权重更重要,同样体积下更准;HF 仓库名带
imatrix或UD的都是。 - 别拿文件大小当显存需求。文件是权重,显存还要加 KV cache 和约 1 GB 运行开销:Qwen3.8 27B 的 4-bit 文件 16.5 GB,8K 上下文下实际要 18.5 GB。本站每个模型页都按这个口径算好了。
常见问题
量化模型和原版模型是同一个模型吗?
是同一个模型的同一组参数,只是每个参数存的精度不同。Qwen3.8 27B 量化到 4-bit 之后仍然是 27.8B 参数、同样的 64 层和结构,只是每个权重从 16 位浮点变成 4 位整数加分块缩放因子。它不是蒸馏出来的小模型,也没有重新训练。
Q4_K_M、Q8_0、Q2_K_XL 这些名字怎么读?
开头的数字是主要位宽:Q4 是 4 位,Q8 是 8 位。K 表示 llama.cpp 的 K-quant 分块量化,比老式 Q4_0 在同样体积下更准。结尾的 S / M / L / XL 是同一位宽下的档位,越大表示越多敏感层保留了更高精度,文件也略大。XL 是 Unsloth 动态量化的命名,逐层选量化类型。
4-bit 会不会让模型变笨?
在评测上损失很小。llama.cpp 官方数据里 7B 模型 Q4_K_M 困惑度只升 0.05;2026 年 1 月对 Llama 3.1 8B 的评测里 4-bit 档五项基准平均只掉 0.4 个百分点。掉分明显的是 3-bit 以下:Q3_K_S 平均掉 5.7 个百分点,其中数学推理从 77.6% 掉到 68.3%。日常对话和写作几乎感觉不到 4-bit 的差别,做数学和长链推理时才建议留在 4-bit 以上。
显存够的话,是不是应该用 8-bit 甚至 FP16?
没有必要为 8-bit 花钱。8-bit 比 4-bit 在评测上的优势不到 1 个百分点,却要将近两倍显存、生成速度慢四成左右。同样的显存,把 4-bit 省下的空间用来开更长上下文,或者换更大参数量的模型,收益都比 8-bit 大。8-bit 适合显存宽裕又不想折腾的情况,FP16 只在做微调或需要复现官方数字时用。
2-bit 和 1-bit 模型能用吗?
2-bit 只推荐给超大的 MoE 模型,因为参数多的模型对低位宽更耐受,而且省下的是真金白银:DeepSeek V4 Flash 4-bit 卸载要 155 GB 内存,2-bit 只要 104 GB,128GB 内存的机器就能装下。30B 以下的稠密模型不要用 2-bit,掉分明显。1-bit 只用于把超大 MoE 塞进更小的内存,Unsloth 自己也提醒它在工具调用上退化明显,别拿来做 agent。