什么是量化模型?为什么本地部署大模型几乎都用量化版(2026)

量化模型就是把模型权重从 16 位浮点数压成 4 到 8 位整数存放的版本,文件缩到原来的四分之一到一半,参数量和结构不变。本地部署几乎都用量化版,原因有三个:显存是硬边界,只有量化后模型才装得下;生成速度由显存带宽决定,权重越小每个 token 读得越快;同样一块显存,参数量比精度更值钱。 代价在评测上通常不到 1 个百分点。截至 2026 年 9 月 9 日,我们的建议是:默认用 4-bit(Q4_K_M 或 Unsloth 的 Q4_K_XL),显存宽裕也不必为 8-bit 加钱,2-bit 只给超大 MoE 模型,1-bit 不要用来做 agent。

示意图:米色背景上的扁平插画,左边一摞布满圆点的大方块被一台压机压成一小摞,箭头指向右边一张线描显卡,小方块正好装进显卡里
示意图 · 米色背景上的扁平插画,左边一摞布满圆点的大方块被一台压机压成一小摞,箭头指向右边一张线描显卡,小方块正好装进显卡里

量化到底改了什么?

量化改的只是每个权重占多少位,参数量、层数和结构一个都没变。 一个大模型就是几十亿到几千亿个数字,训练时每个数字用 16 位浮点(BF16 或 FP16)存,占 2 字节。量化把这些数字按块换算成低位整数,每块只保留一个缩放因子和一个偏移量,推理时再乘回去。按本站数据方法页的口径,各档位每参数的字节数是:

  • FP16 / BF16:2 字节,也就是各家发布的「原版」。
  • 8-bit(Q8_0):约 1.06 字节,每 32 个权重共用一个缩放因子,多出的 0.06 字节就是缩放因子。
  • 4-bit(Q4_K_M):约 0.57 字节,不是正好 0.5,因为 K-quant 用两层分块缩放,而且注意力和输出层保留了更高精度。
  • 2-bit(Q2_K_XL):约 0.38 字节,是 Unsloth 动态量化的档位,最敏感的层留在 4 到 8 位。
  • 1-bit(IQ1_M):约 0.24 字节,靠查表式编码把每个权重压到 1.75 位左右。

所以名字里的位数只是主要位宽。Q4_K_M 的 Q4 是 4 位,K 是 llama.cpp 的分块量化方法,M 是中档,同一位宽还有 S 和 L;Unsloth 的 XL 是逐层挑量化类型的动态版本。这些格式的定义都在 GGUF 规范llama.cpp 的量化说明里,Ollama 库里不带后缀的默认标签用的也是 Q4_K_M。

示意图:米色背景上四行圆角色块从上到下依次减半,最上面一行 16 块,最下面一行 2 块,旁边一把木尺和一只放大镜
示意图:米色背景上四行圆角色块从上到下依次减半,最上面一行 16 块,最下面一行 2 块,旁边一把木尺和一只放大镜

为什么本地部署几乎都用量化版?

第一个原因是显存:没有量化,消费级显卡连 12B 模型都放不下。 下表按本站公式实时计算三个模型在 8K 上下文下的显存需求,包含权重、KV cache 和 1 GB 运行开销;MoE 模型整机放不下时,第二行给出专家卸载后「显存 + 内存」的需求:

模型FP168-bit4-bit2-bit
8K8K8K8K
Gemma 4 12B12B28 GB17 GB11 GB9 GB
Qwen3.8 27B27.8B58 GB32 GB19 GB14 GB
DeepSeek V4 Flash284B · A13B558 GB卸载:16 GB 显存 + 543 GB 内存297 GB卸载:10 GB 显存 + 288 GB 内存160 GB卸载:7 GB 显存 + 155 GB 内存108 GB卸载:6 GB 显存 + 104 GB 内存

读法很直接。Gemma 4 12B 的 FP16 原版要 28 GB,24GB 的 RTX 3090 都放不下;4-bit 只要 11 GB,16GB 卡还能开更长上下文。Qwen3.8 27B 原版 58 GB,只有 96GB 的工作站卡才能整机跑;8-bit 要 32 GB,只有 RTX 5090 勉强放得下;4-bit 后 19 GB,正好落进一张 RTX 3090 或 RTX 4090DeepSeek V4 Flash 是 284B 参数、每个 token 只激活 13B 的 MoE:原版 558 GB 是数据中心的东西,4-bit 也要 160 GB,整机放显存只有 Mac Studio M3 Ultra 512GB 这类机器能做到;但把专家权重放进系统内存后,显存只需要 7 GB,内存 155 GB,一张 8GB 的显卡也能以约 11 tokens/s 跑起来。2-bit 再把内存需求压到 104 GB,128GB 内存的台式机就装得下。量化在这里决定的不是「跑多快」,而是「能不能跑」。

第二个原因是速度:每生成一个 token,显卡都要把全部激活权重从显存读一遍,权重越小读得越快。 本站的速度估算就是每个 token 要读的字节除以显存带宽和效率系数,公式见数据方法。同样的显卡和模型,只换量化档位,预估速度差别如下。先看 8-bit:

型号Gemma 4 12BQwen3.8 27BDeepSeek V4 Flash
GeForce RTX 5070 Ti装不下装不下6*
GeForce RTX 309045装不下6*
GeForce RTX 409048装不下7*
GeForce RTX 509083407*

8-bit、8K 上下文、单路解码的预估速度。带 * 的是 MoE 模型把专家权重放在系统内存里跑(按 70 GB/s 内存带宽算)。

再看 4-bit:

型号Gemma 4 12BQwen3.8 27BDeepSeek V4 Flash
GeForce RTX 5070 Ti71装不下12*
GeForce RTX 3090743812*
GeForce RTX 4090794112*
GeForce RTX 50901357012*

4-bit、8K 上下文、单路解码的预估速度。带 * 的是 MoE 模型把专家权重放在系统内存里跑(按 70 GB/s 内存带宽算)。

两张表放在一起,量化的好处一目了然。8-bit 下 Qwen3.8 27B 只有 RTX 5090 装得下,Gemma 4 12B 在 16GB 的 RTX 5070 Ti 上也装不下;换成 4-bit,27B 落进 24GB 卡,12B 每张卡都能跑,而且同一张卡同一个模型的速度快六到八成。V4 Flash 两张表里都是专家卸载的速度,4-bit 比 8-bit 快将近一倍,因为每个 token 从内存搬的专家权重少了一半。这些差距不来自算力,来自每个 token 少搬了多少字节。

第三个原因是同样的显存里,参数量比精度更值钱。 24GB 显存可以放 Gemma 4 12B 的 8-bit(17 GB),也可以放 Qwen3.8 27B 的 4-bit(18.5 GB),后者在评测上明显更强。4-bit 损失的不到 1 个百分点,远小于 12B 和 27B 之间的能力差距。这也是为什么各家模型卡的「最低显存」和本站模型页的「最便宜能跑的卡」都按 4-bit 算。

量化会损失多少质量?

4-bit 的损失在评测上通常不到 1 个百分点,3-bit 开始明显,2-bit 以下只适合大模型。 三组可核对的数据:

  • llama.cpp 官方困惑度表(7B 模型):Q8_0 困惑度只升 0.0004,Q5_K_M 升 0.014,Q4_K_M 升 0.054,Q3_K_M 升 0.24,Q2_K 升 0.87。来源是 llama.cpp 讨论区的官方对照表
  • 2026 年 1 月对 Llama 3.1 8B 的统一评测:从 3-bit 到 8-bit 共 13 种量化,GSM8K、HellaSwag、IFEval、MMLU、TruthfulQA 五项平均,FP16 基线 69.47%,Q5_0 69.92%,Q4_K_S 69.17%,Q3_K_M 68.07%,Q3_K_S 65.49%。作者的结论是 4 到 5 bit 是平衡的默认档,数学推理对量化最敏感,Q3_K_S 让 GSM8K 从 77.6% 掉到 68.3%。见 arXiv:2601.14277
  • Unsloth 动态量化:对 Gemma 3 27B 的 MMLU 五样本,Q4_K_XL 71.47%(15.6 GB)、Q3_K_XL 70.87%(12.8 GB)、Q2_K_XL 68.70%(10.0 GB);他们给 Qwen3.8 27B 的 1-bit 档 IQ1_M 只有约 72% 的首选答案一致率,并提醒 1-bit 在工具调用上退化明显。见 Unsloth 动态量化文档

另一个趋势是厂商在训练阶段就为量化做准备。Google 发布 Gemma 3 时同时提供了量化感知训练(QAT)版本,把 27B 的显存从 BF16 的 54 GB 压到 int4 的 14.1 GB,并称相对普通 Q4_0 量化把困惑度损失减少了 54%,见 Google 开发者博客。如果模型有官方 QAT 版,优先用它。

按任务分,感受差别最大的是数学、代码和长链推理,这类任务建议留在 4-bit 及以上;对话、翻译、摘要、写作在 3-bit 下也很难察觉。

量化格式和显卡有关系吗?

权重量化不挑显卡,任何显卡都能跑 GGUF;只有 FP8 和 FP4 这类需要专用张量核心的格式才挑架构。 本地推理常见的格式分三类:

  • GGUF(llama.cpp、Ollama、LM Studio):把低位权重在计算时解压回 16 位再乘,所以 RTX 3090、AMD 显卡、Mac 都能跑,文件也最多。上面说的 Q4_K_M、Q8_0、Q2_K_XL 全是 GGUF。
  • AWQ、GPTQ(vLLM、SGLang):4-bit 权重配专门的矩阵乘内核,多并发时吞吐更高,适合当服务跑;需要 CUDA 显卡。
  • FP8、NVFP4(TensorRT-LLM、vLLM,以及图片和视频模型):这是真正用 8 位或 4 位浮点做乘法,需要 Ada 或 Blackwell 的张量核心;RTX 3090 没有 FP8 单元,只能把 FP8 权重当 16 位算。Wan 2.2 和 FLUX 常见的 fp8 版本就是这一类,见本地视频换显卡

还有一个常被混淆的点:本地推理说的量化几乎都是只量化权重,KV cache 仍然是 16 位。所以量化只缩小权重那一项,上下文越长,KV cache 占比越大,量化省下的比例就越小。要压 KV cache 得单独开 8 位缓存选项,那是另一篇的话题,见显存不够加内存有用吗

该选哪一档量化?

默认 4-bit;显存放不下就先降上下文再降到 3-bit;超大 MoE 才考虑 2-bit;8-bit 只在显存明显多出一倍时用。 以 Qwen3.8 27B 和 DeepSeek V4 Flash 为例,按显存对照:

你的显存 Qwen3.8 27B 能跑到 DeepSeek V4 Flash 能跑到
8GB 跑不了,换 8B 级 4-bit(7 GB) 卸载跑 4-bit,内存 160GB 以上
16GB 2-bit 8K 上下文(13 GB);3-bit 要 16.3 GB,已装不下 同上,显存不是瓶颈
24GB 4-bit 8K 上下文(18.5 GB) 同上
32GB 4-bit 32K 上下文(24.5 GB);8-bit 8K 勉强 同上
48GB 8-bit 32K 上下文(38 GB) 同上
512GB 统一内存 FP16 都放得下 4-bit 整机放内存(160 GB),约 47 tokens/s

也就是说,稠密模型看显存选档位,超大 MoE 看内存选档位。V4 Flash 在 2-bit 下需要 104 GB 内存,128GB 内存的台式机就能跑;4-bit 需要 155 GB,得上 192GB。下面是 32GB 及以下、有闲鱼报价的消费卡,最后一列是跑 Qwen3.8 27B 4-bit 的预估速度,装不下的显示「—」:

型号显存 GB带宽 GB/sINT8 TOPS功耗 W闲鱼显存单价Qwen3.8 27B 速度 t/s
GeForce RTX 2080 Ti 22GB22616215250¥2,600¥11825
Radeon RX 6950 XT1657695335¥2,999¥187
Radeon RX 7800 XT1662475263¥3,100¥194
Radeon RX 7900 XT20800103315¥4,299¥21523
GeForce RTX 5060 Ti 16GB16448190180¥4,688¥293
Radeon RX 7900 XTX24960123355¥5,800¥24228
Radeon RX 9070 XT16640389304¥6,100¥381
GeForce RTX 507012672247250¥6,175¥515
GeForce RTX 408016717390320¥7,750¥484
GeForce RTX 309024936285350¥8,100¥33738
GeForce RTX 5070 Ti16896352300¥9,899¥619
GeForce RTX 508016960450360¥12,450¥778
GeForce RTX 4090241,008661450¥23,500¥97941
GeForce RTX 5090 D V2241,344594575¥23,900¥99654
GeForce RTX 5090 D321,792594575¥32,900¥1,02870
GeForce RTX 5090321,792838575¥43,800¥1,36970

灰色价格为沿用上次报价,近期没有新挂单。

截至 2026 年 9 月 9 日闲鱼中位价,二手 RTX 3090 ¥8,100 是跑 27B 4-bit 的最低门槛,约 38 tokens/s;RTX 5070 Ti ¥9,899 显存只有 16GB,跑不了 27B 4-bit,只能退到 2-bit 或者换 14B 级模型;RTX 4090 ¥23,500 能跑的模型和 3090 完全一样,只快不到一成。预算在五千以内,RTX 5060 Ti 16GB ¥4,688 跑 Gemma 4 12B 4-bit 约 37 tokens/s,也很舒服。选卡的展开讨论见 3090 与 5070 Ti 之争预算显卡指南

最后三条实操建议:

  1. 下载时优先选 Unsloth 或 bartowski 的 GGUF 仓库,前者的 XL 档逐层挑过量化类型,后者档位全。本站模型页列的就是这两家的文件大小。
  2. 同一档位选带 imatrix 的版本,它用校准数据决定哪些权重更重要,同样体积下更准;HF 仓库名带 imatrixUD 的都是。
  3. 别拿文件大小当显存需求。文件是权重,显存还要加 KV cache 和约 1 GB 运行开销:Qwen3.8 27B 的 4-bit 文件 16.5 GB,8K 上下文下实际要 18.5 GB。本站每个模型页都按这个口径算好了。

常见问题

量化模型和原版模型是同一个模型吗?

是同一个模型的同一组参数,只是每个参数存的精度不同。Qwen3.8 27B 量化到 4-bit 之后仍然是 27.8B 参数、同样的 64 层和结构,只是每个权重从 16 位浮点变成 4 位整数加分块缩放因子。它不是蒸馏出来的小模型,也没有重新训练。

Q4_K_M、Q8_0、Q2_K_XL 这些名字怎么读?

开头的数字是主要位宽:Q4 是 4 位,Q8 是 8 位。K 表示 llama.cpp 的 K-quant 分块量化,比老式 Q4_0 在同样体积下更准。结尾的 S / M / L / XL 是同一位宽下的档位,越大表示越多敏感层保留了更高精度,文件也略大。XL 是 Unsloth 动态量化的命名,逐层选量化类型。

4-bit 会不会让模型变笨?

在评测上损失很小。llama.cpp 官方数据里 7B 模型 Q4_K_M 困惑度只升 0.05;2026 年 1 月对 Llama 3.1 8B 的评测里 4-bit 档五项基准平均只掉 0.4 个百分点。掉分明显的是 3-bit 以下:Q3_K_S 平均掉 5.7 个百分点,其中数学推理从 77.6% 掉到 68.3%。日常对话和写作几乎感觉不到 4-bit 的差别,做数学和长链推理时才建议留在 4-bit 以上。

显存够的话,是不是应该用 8-bit 甚至 FP16?

没有必要为 8-bit 花钱。8-bit 比 4-bit 在评测上的优势不到 1 个百分点,却要将近两倍显存、生成速度慢四成左右。同样的显存,把 4-bit 省下的空间用来开更长上下文,或者换更大参数量的模型,收益都比 8-bit 大。8-bit 适合显存宽裕又不想折腾的情况,FP16 只在做微调或需要复现官方数字时用。

2-bit 和 1-bit 模型能用吗?

2-bit 只推荐给超大的 MoE 模型,因为参数多的模型对低位宽更耐受,而且省下的是真金白银:DeepSeek V4 Flash 4-bit 卸载要 155 GB 内存,2-bit 只要 104 GB,128GB 内存的机器就能装下。30B 以下的稠密模型不要用 2-bit,掉分明显。1-bit 只用于把超大 MoE 塞进更小的内存,Unsloth 自己也提醒它在工具调用上退化明显,别拿来做 agent。

文中提到的显卡

文中提到的模型