量化模型就是把模型權重從 16 位元浮點數壓成 4 到 8 位元整數存放的版本,檔案縮到原來的四分之一到一半,參數量和結構不變。本地部署幾乎都用量化版,原因有三個:顯示記憶體是硬邊界,只有量化後模型才裝得下;生成速度由顯示記憶體頻寬決定,權重越小每個 token 讀得越快;同樣一塊顯示記憶體,參數量比精度更值錢。 代價在評測上通常不到 1 個百分點。截至 2026 年 9 月 9 日,我們的建議是:預設用 4-bit(Q4_K_M 或 Unsloth 的 Q4_K_XL),顯示記憶體寬裕也不必為 8-bit 加錢,2-bit 只給超大 MoE 模型,1-bit 不要用來做 agent。
什麼是量化模型?為什麼本地部署大模型幾乎都用量化版(2026)
譯自简体中文版 · 閱讀原文
正文與常見問題中的數字截至 2026年9月9日;表格使用最新已發布價格,各裝置採集時間可能不同。

量化到底改了什麼?
量化改的只是每個權重佔多少位元,參數量、層數和結構一個都沒變。 一個大模型就是幾十億到幾千億個數字,訓練時每個數字用 16 位元浮點(BF16 或 FP16)存,佔 2 位元組。量化把這些數字按塊換算成低位元整數,每塊只保留一個縮放因子和一個偏移量,推理時再乘回去。按本站資料方法頁的口徑,各檔位每參數的位元組數是:
- FP16 / BF16:2 位元組,也就是各家發布的「原版」。
- 8-bit(Q8_0):約 1.06 位元組,每 32 個權重共用一個縮放因子,多出的 0.06 位元組就是縮放因子。
- 4-bit(Q4_K_M):約 0.57 位元組,不是正好 0.5,因為 K-quant 用兩層分塊縮放,而且注意力和輸出層保留了更高精度。
- 2-bit(Q2_K_XL):約 0.38 位元組,是 Unsloth 動態量化的檔位,最敏感的層留在 4 到 8 位元。
- 1-bit(IQ1_M):約 0.24 位元組,靠查表式編碼把每個權重壓到 1.75 位元左右。
所以名字裡的位元數只是主要位元寬。Q4_K_M 的 Q4 是 4 位元,K 是 llama.cpp 的分塊量化方法,M 是中檔,同一位元寬還有 S 和 L;Unsloth 的 XL 是逐層挑量化類型的動態版本。這些格式的定義都在 GGUF 規範與 llama.cpp 的量化說明裡,Ollama 庫裡不帶後綴的預設標籤用的也是 Q4_K_M。

為什麼本地部署幾乎都用量化版?
第一個原因是顯示記憶體:沒有量化,消費級顯示卡連 12B 模型都放不下。 下表按本站公式即時計算三個模型在 8K 上下文下的顯示記憶體需求,包含權重、KV cache 和 1 GB 執行開銷;MoE 模型整機放不下時,第二行給出專家卸載後「顯示記憶體 + 記憶體」的需求:
| 模型 | FP16 | 8-bit | 4-bit | 2-bit |
|---|---|---|---|---|
| 8K | 8K | 8K | 8K | |
| Gemma 4 12B12B | 28 GB | 17 GB | 11 GB | 9 GB |
| Qwen3.8 27B27.8B | 58 GB | 32 GB | 19 GB | 14 GB |
| DeepSeek V4 Flash284B · A13B | 558 GB卸載:16 GB 顯示記憶體 + 543 GB 記憶體 | 297 GB卸載:10 GB 顯示記憶體 + 288 GB 記憶體 | 160 GB卸載:7 GB 顯示記憶體 + 155 GB 記憶體 | 108 GB卸載:6 GB 顯示記憶體 + 104 GB 記憶體 |
讀法很直接。Gemma 4 12B 的 FP16 原版要 28 GB,24GB 的 RTX 3090 都放不下;4-bit 只要 11 GB,16GB 卡還能開更長上下文。Qwen3.8 27B 原版 58 GB,只有 96GB 的工作站卡才能整機跑;8-bit 要 32 GB,只有 RTX 5090 勉強放得下;4-bit 後 19 GB,正好落進一張 RTX 3090 或 RTX 4090。DeepSeek V4 Flash 是 284B 參數、每個 token 只啟用 13B 的 MoE:原版 558 GB 是資料中心的東西,4-bit 也要 160 GB,整機放顯示記憶體只有 Mac Studio M3 Ultra 512GB 這類機器能做到;但把專家權重放進系統記憶體後,顯示記憶體只需要 7 GB,記憶體 155 GB,一張 8GB 的顯示卡也能以約 11 tokens/s 跑起來。2-bit 再把記憶體需求壓到 104 GB,128GB 記憶體的桌上型電腦就裝得下。量化在這裡決定的不是「跑多快」,而是「能不能跑」。
第二個原因是速度:每生成一個 token,顯示卡都要把全部啟用權重從顯示記憶體讀一遍,權重越小讀得越快。 本站的速度估算就是每個 token 要讀的位元組除以顯示記憶體頻寬和效率係數,公式見資料方法。同樣的顯示卡和模型,只換量化檔位,預估速度差別如下。先看 8-bit:
| 型號 | Gemma 4 12B | Qwen3.8 27B | DeepSeek V4 Flash |
|---|---|---|---|
| 裝不下 | 裝不下 | 6* | |
| 45 | 裝不下 | 6* | |
| 48 | 裝不下 | 7* | |
| 83 | 40 | 7* |
8-bit、8K 上下文、單路解碼的預估速度。帶 * 的是 MoE 模型把專家權重放在系統記憶體裡跑(按 70 GB/s 記憶體頻寬算)。
再看 4-bit:
| 型號 | Gemma 4 12B | Qwen3.8 27B | DeepSeek V4 Flash |
|---|---|---|---|
| 71 | 裝不下 | 12* | |
| 74 | 38 | 12* | |
| 79 | 41 | 12* | |
| 135 | 70 | 12* |
4-bit、8K 上下文、單路解碼的預估速度。帶 * 的是 MoE 模型把專家權重放在系統記憶體裡跑(按 70 GB/s 記憶體頻寬算)。
兩張表放在一起,量化的好處一目了然。8-bit 下 Qwen3.8 27B 只有 RTX 5090 裝得下,Gemma 4 12B 在 16GB 的 RTX 5070 Ti 上也裝不下;換成 4-bit,27B 落進 24GB 卡,12B 每張卡都能跑,而且同一張卡同一個模型的速度快六到八成。V4 Flash 兩張表裡都是專家卸載的速度,4-bit 比 8-bit 快將近一倍,因為每個 token 從記憶體搬的專家權重少了一半。這些差距不來自算力,來自每個 token 少搬了多少位元組。
第三個原因是同樣的顯示記憶體裡,參數量比精度更值錢。 24GB 顯示記憶體可以放 Gemma 4 12B 的 8-bit(17 GB),也可以放 Qwen3.8 27B 的 4-bit(18.5 GB),後者在評測上明顯更強。4-bit 損失的不到 1 個百分點,遠小於 12B 和 27B 之間的能力差距。這也是為什麼各家模型卡的「最低顯示記憶體」和本站模型頁的「最便宜能跑的卡」都按 4-bit 算。
量化會損失多少品質?
4-bit 的損失在評測上通常不到 1 個百分點,3-bit 開始明顯,2-bit 以下只適合大模型。 三組可核對的資料:
- llama.cpp 官方困惑度表(7B 模型):Q8_0 困惑度只升 0.0004,Q5_K_M 升 0.014,Q4_K_M 升 0.054,Q3_K_M 升 0.24,Q2_K 升 0.87。來源是 llama.cpp 討論區的官方對照表。
- 2026 年 1 月對 Llama 3.1 8B 的統一評測:從 3-bit 到 8-bit 共 13 種量化,GSM8K、HellaSwag、IFEval、MMLU、TruthfulQA 五項平均,FP16 基線 69.47%,Q5_0 69.92%,Q4_K_S 69.17%,Q3_K_M 68.07%,Q3_K_S 65.49%。作者的結論是 4 到 5 bit 是平衡的預設檔,數學推理對量化最敏感,Q3_K_S 讓 GSM8K 從 77.6% 掉到 68.3%。見 arXiv:2601.14277。
- Unsloth 動態量化:對 Gemma 3 27B 的 MMLU 五樣本,Q4_K_XL 71.47%(15.6 GB)、Q3_K_XL 70.87%(12.8 GB)、Q2_K_XL 68.70%(10.0 GB);他們給 Qwen3.8 27B 的 1-bit 檔 IQ1_M 只有約 72% 的首選答案一致率,並提醒 1-bit 在工具呼叫上退化明顯。見 Unsloth 動態量化文件。
另一個趨勢是廠商在訓練階段就為量化做準備。Google 發布 Gemma 3 時同時提供了量化感知訓練(QAT)版本,把 27B 的顯示記憶體從 BF16 的 54 GB 壓到 int4 的 14.1 GB,並稱相對普通 Q4_0 量化把困惑度損失減少了 54%,見 Google 開發者部落格。如果模型有官方 QAT 版,優先用它。
按任務分,感受差別最大的是數學、程式碼和長鏈推理,這類任務建議留在 4-bit 及以上;對話、翻譯、摘要、寫作在 3-bit 下也很難察覺。
量化格式和顯示卡有關係嗎?
權重量化不挑顯示卡,任何顯示卡都能跑 GGUF;只有 FP8 和 FP4 這類需要專用張量核心的格式才挑架構。 本地推理常見的格式分三類:
- GGUF(llama.cpp、Ollama、LM Studio):把低位元權重在計算時解壓回 16 位元再乘,所以 RTX 3090、AMD 顯示卡、Mac 都能跑,檔案也最多。上面說的 Q4_K_M、Q8_0、Q2_K_XL 全是 GGUF。
- AWQ、GPTQ(vLLM、SGLang):4-bit 權重配專門的矩陣乘核心,多併發時吞吐更高,適合當服務跑;需要 CUDA 顯示卡。
- FP8、NVFP4(TensorRT-LLM、vLLM,以及圖片和影片模型):這是真正用 8 位元或 4 位元浮點做乘法,需要 Ada 或 Blackwell 的張量核心;RTX 3090 沒有 FP8 單元,只能把 FP8 權重當 16 位元算。Wan 2.2 和 FLUX 常見的 fp8 版本就是這一類,見本地影片換顯示卡。
還有一個常被混淆的點:本地推理說的量化幾乎都是只量化權重,KV cache 仍然是 16 位元。所以量化只縮小權重那一項,上下文越長,KV cache 佔比越大,量化省下的比例就越小。要壓 KV cache 得單獨開 8 位元快取選項,那是另一篇的話題,見顯示記憶體不夠加記憶體有用嗎。
該選哪一檔量化?
預設 4-bit;顯示記憶體放不下就先降上下文再降到 3-bit;超大 MoE 才考慮 2-bit;8-bit 只在顯示記憶體明顯多出一倍時用。 以 Qwen3.8 27B 和 DeepSeek V4 Flash 為例,按顯示記憶體對照:
| 你的顯示記憶體 | Qwen3.8 27B 能跑到 | DeepSeek V4 Flash 能跑到 |
|---|---|---|
| 8GB | 跑不了,換 8B 級 4-bit(7 GB) | 卸載跑 4-bit,記憶體 160GB 以上 |
| 16GB | 2-bit 8K 上下文(13 GB);3-bit 要 16.3 GB,已裝不下 | 同上,顯示記憶體不是瓶頸 |
| 24GB | 4-bit 8K 上下文(18.5 GB) | 同上 |
| 32GB | 4-bit 32K 上下文(24.5 GB);8-bit 8K 勉強 | 同上 |
| 48GB | 8-bit 32K 上下文(38 GB) | 同上 |
| 512GB 統一記憶體 | FP16 都放得下 | 4-bit 整機放記憶體(160 GB),約 47 tokens/s |
也就是說,稠密模型看顯示記憶體選檔位,超大 MoE 看記憶體選檔位。V4 Flash 在 2-bit 下需要 104 GB 記憶體,128GB 記憶體的桌上型電腦就能跑;4-bit 需要 155 GB,得上 192GB。下面是 32GB 及以下、有閒魚報價的消費卡,最後一列是跑 Qwen3.8 27B 4-bit 的預估速度,裝不下的顯示「—」:
閒魚
| 型號 | 顯存 GB | 頻寬 GB/s | INT8 TOPS | 功耗 W | 閒魚 | 顯存單價 | Qwen3.8 27B 速度 t/s |
|---|---|---|---|---|---|---|---|
| 22 | 616 | 215 | 250 | NT$12,166 | NT$553 | 25 | |
| 16 | 576 | 95 | 335 | NT$14,033 | NT$877 | — | |
| 16 | 624 | 75 | 263 | NT$14,506 | NT$907 | — | |
| 20 | 800 | 103 | 315 | NT$20,116 | NT$1,006 | 23 | |
| 16 | 448 | 190 | 180 | NT$21,936 | NT$1,371 | — | |
| 24 | 960 | 123 | 355 | NT$27,140 | NT$1,131 | 28 | |
| 16 | 640 | 389 | 304 | NT$28,543 | NT$1,784 | — | |
| 12 | 672 | 247 | 250 | NT$28,894 | NT$2,408 | — | |
| 16 | 717 | 390 | 320 | NT$36,264 | NT$2,266 | — | |
| 24 | 936 | 285 | 350 | NT$37,902 | NT$1,579 | 38 | |
| 16 | 896 | 352 | 300 | NT$46,320 | NT$2,895 | — | |
| 16 | 960 | 450 | 360 | NT$58,256 | NT$3,641 | — | |
| 24 | 1,008 | 661 | 450 | NT$109,962 | NT$4,582 | 41 | |
| 24 | 1,344 | 594 | 575 | NT$111,834 | NT$4,660 | 54 | |
| 32 | 1,792 | 594 | 575 | NT$153,947 | NT$4,811 | 70 | |
| 32 | 1,792 | 838 | 575 | NT$204,950 | NT$6,405 | 70 |
灰色價格為沿用上次報價,近期沒有新掛單。
截至 2026 年 9 月 9 日閒魚掛單中位價換算,二手 RTX 3090 NT$37,902 是跑 27B 4-bit 的最低門檻,約 38 tokens/s;RTX 5070 Ti NT$46,320 顯示記憶體只有 16GB,跑不了 27B 4-bit,只能退到 2-bit 或者換 14B 級模型;RTX 4090 NT$109,962 能跑的模型和 3090 完全一樣,只快不到一成。預算在兩萬多,RTX 5060 Ti 16GB NT$21,936 跑 Gemma 4 12B 4-bit 約 37 tokens/s,也很舒服。選卡的展開討論見 3090 與 5070 Ti 之爭和預算顯示卡指南。
最後三條實作建議:
- 下載時優先選 Unsloth 或 bartowski 的 GGUF 倉庫,前者的 XL 檔逐層挑過量化類型,後者檔位全。本站模型頁列的就是這兩家的檔案大小。
- 同一檔位選帶 imatrix 的版本,它用校準資料決定哪些權重更重要,同樣體積下更準;HF 倉庫名帶
imatrix或UD的都是。 - 別拿檔案大小當顯示記憶體需求。檔案是權重,顯示記憶體還要加 KV cache 和約 1 GB 執行開銷:Qwen3.8 27B 的 4-bit 檔案 16.5 GB,8K 上下文下實際要 18.5 GB。本站每個模型頁都按這個口徑算好了。
常見問題
量化模型和原版模型是同一個模型嗎?
是同一個模型的同一組參數,只是每個參數存的精度不同。Qwen3.8 27B 量化到 4-bit 之後仍然是 27.8B 參數、同樣的 64 層和結構,只是每個權重從 16 位元浮點變成 4 位元整數加分塊縮放因子。它不是蒸餾出來的小模型,也沒有重新訓練。
Q4_K_M、Q8_0、Q2_K_XL 這些名字怎麼讀?
開頭的數字是主要位元寬:Q4 是 4 位元,Q8 是 8 位元。K 表示 llama.cpp 的 K-quant 分塊量化,比老式 Q4_0 在同樣體積下更準。結尾的 S / M / L / XL 是同一位元寬下的檔位,越大表示越多敏感層保留了更高精度,檔案也略大。XL 是 Unsloth 動態量化的命名,逐層選量化類型。
4-bit 會不會讓模型變笨?
在評測上損失很小。llama.cpp 官方資料裡 7B 模型 Q4_K_M 困惑度只升 0.05;2026 年 1 月對 Llama 3.1 8B 的評測裡 4-bit 檔五項基準平均只掉 0.4 個百分點。掉分明顯的是 3-bit 以下:Q3_K_S 平均掉 5.7 個百分點,其中數學推理從 77.6% 掉到 68.3%。日常對話和寫作幾乎感覺不到 4-bit 的差別,做數學和長鏈推理時才建議留在 4-bit 以上。
顯示記憶體夠的話,是不是應該用 8-bit 甚至 FP16?
沒有必要為 8-bit 花錢。8-bit 比 4-bit 在評測上的優勢不到 1 個百分點,卻要將近兩倍顯示記憶體、生成速度慢四成左右。同樣的顯示記憶體,把 4-bit 省下的空間用來開更長上下文,或者換更大參數量的模型,收益都比 8-bit 大。8-bit 適合顯示記憶體寬裕又不想折騰的情況,FP16 只在做微調或需要復現官方數字時用。
2-bit 和 1-bit 模型能用嗎?
2-bit 只推薦給超大的 MoE 模型,因為參數多的模型對低位元寬更耐受,而且省下的是真金白銀:DeepSeek V4 Flash 4-bit 卸載要 155 GB 記憶體,2-bit 只要 104 GB,128GB 記憶體的機器就能裝下。30B 以下的稠密模型不要用 2-bit,掉分明顯。1-bit 只用於把超大 MoE 塞進更小的記憶體,Unsloth 自己也提醒它在工具呼叫上退化明顯,別拿來做 agent。