Kimi K2 版本資訊
發布日期2025年9月3日
小版本0905
架構MoE
GGUF 倉庫—
Ollama 標籤—
Q4 最低記憶體559 GB · Q4_K_M · 8K
專家卸載9 GB 顯存 + 552 GB 記憶體
參數量1,000B
MoE32B
層數61
隱藏維度7,168
KV 頭64
頭維度192
上下文上限256K
廠商Moonshot AI
Kimi K2 本地部署需要多少顯示記憶體?
MoE:總參數 1,000B 全部要常駐記憶體,速度按每 token 啟用的 32B 計算。
| 量化 | 權重體積GB | 8K 總記憶體GB | 32K 總記憶體GB | 128K 總記憶體GB |
|---|
| 1-bit | 234.7估 | 236.2 | 237.8 | 244.3 |
| 2-bit | 371.6估 | 373.1 | 374.7 | 381.2 |
| 3-bit | 479.2估 | 480.7 | 482.3 | 488.7 |
| 4-bit | 557.4估 | 558.9 | 560.5 | 567 |
| 5-bit | 674.7估 | 676.3 | 677.9 | 684.3 |
| 8-bit | 1,036.6估 | 1,038.1 | 1,039.7 | 1,046.1 |
| FP16 | 1,955.8估 | 1,957.3 | 1,958.9 | 1,965.4 |
總記憶體 = 權重 + KV cache(FP16)+ 1GB 執行開銷。標 GGUF 的權重是倉庫裡的實測檔案體積,標「估」的按每參數位元組估算。超過這個模型 256K 上下文上限的檔位寫「—」。各檔取倉庫裡該位元數的任一檔案,優先 unsloth 動態量化,所以同一檔不同模型對應的檔名可能不同。
收錄的單卡都裝不下 Kimi K2:Q4_K_M、8K 上下文下至少需要 559GB 記憶體。
多卡方案至少要湊足 559GB 記憶體。
收錄的統一記憶體機型也裝不下。
專家權重放系統記憶體,需要 ≥ 552 GB 記憶體;顯存只放注意力層、共享專家和 KV cache,Q4 下最低 9 GB。速度受記憶體頻寬限制(按 70 GB/s 估算),比整機放顯存慢得多。
| 裝置 | 顯存GB | 價 | 需記憶體GB | 預估 t/s |
|---|
Tesla V100 16GB | 16 | NT$4,118 | 552 | 3.9 |
GeForce RTX 2080 Ti 22GB | 22 | NT$12,166 | 552 | 3.9 |
Instinct MI50 32GB | 32 | NT$12,751 | 552 | 3.9 |
Radeon RX 6950 XT | 16 | NT$14,033 | 552 | 3.7 |
Radeon RX 7800 XT | 16 | NT$14,506 | 552 | 3.8 |
Tesla V100 32GB | 32 | NT$14,974 | 552 | 3.9 |
Radeon RX 7900 XT | 20 | NT$20,116 | 552 | 3.8 |
GeForce RTX 5060 Ti 16GB | 16 | NT$21,936 | 552 | 3.8 |
Arc Pro B60 | 24 | NT$24,683 | 552 | 3.6 |
Radeon RX 7900 XTX | 24 | NT$27,140 | 552 | 3.9 |
Radeon RX 9070 XT | 16 | NT$28,543 | 552 | 3.8 |
GeForce RTX 5070 | 12 | NT$28,894 | 552 | 3.9 |
GeForce RTX 4080 | 16 | NT$36,264 | 552 | 3.9 |
GeForce RTX 3090 | 24 | NT$37,902 | 552 | 3.9 |
Arc Pro B70 | 32 | NT$46,090 | 552 | 3.7 |
GeForce RTX 5070 Ti | 16 | NT$46,320 | 552 | 3.9 |
Radeon AI PRO R9700 | 32 | NT$51,705 | 552 | 3.8 |
CMP 170HX 40GB | 40 | NT$52,875 | 552 | 4 |
Radeon PRO W7800 | 32 | NT$58,022 | 552 | 3.7 |
GeForce RTX 5080 | 16 | NT$58,256 | 552 | 3.9 |
CMP 170HX 64GB | 64 | NT$65,743 | 552 | 4 |
RTX PRO 4000 Blackwell | 24 | NT$73,230 | 552 | 3.9 |
Instinct MI210 | 64 | NT$86,566 | 552 | 4 |
Radeon PRO W7900 | 48 | NT$102,943 | 552 | 3.9 |
GeForce RTX 4090 | 24 | NT$109,962 | 552 | 3.9 |
GeForce RTX 5090 D V2 | 24 | NT$111,834 | 552 | 4 |
RTX PRO 4500 Blackwell | 32 | NT$120,958 | 552 | 3.9 |
GeForce RTX 4090 48GB | 48 | NT$124,467 | 552 | 3.9 |
A100 40GB PCIe | 40 | NT$144,822 | 552 | 4 |
| Mac Studio M4 Max 128GB | 128 | NT$150,671 | 552 | 3.8 |
DGX Spark 128GB | 128 | NT$152,075 | 552 | 3.6 |
GeForce RTX 5090 D | 32 | NT$153,947 | 552 | 4 |
| MacBook Pro M4 Max 128GB | 128 | NT$165,645 | 552 | 3.8 |
| Mac Studio M5 Max 128GB | 128 | NT$185,064 | 552 | 3.8 |
GeForce RTX 5090 | 32 | NT$204,950 | 552 | 4 |
RTX PRO 5000 Blackwell 48GB | 48 | NT$218,988 | 552 | 4 |
| MacBook Pro M5 Max 128GB | 128 | NT$256,422 | 552 | 3.8 |
RTX PRO 5000 Blackwell 72GB | 72 | NT$304,150 | 552 | 4 |
RTX PRO 6000D | 84 | NT$318,188 | 552 | 4 |
RTX PRO 6000 Blackwell | 96 | NT$579,756 | 552 | 4 |
| Mac Studio M3 Ultra 512GB | 512 | NT$607,832 | 552 | 3.9 |
Arc Pro B65 | 32 | — | 552 | 3.7 |
GeForce RTX 4080 SUPER 32GB | 32 | — | 552 | 3.9 |
Instinct MI100 | 32 | — | 552 | 3.9 |
Ryzen AI Max+ 395 128GB | 128 | — | 552 | 3.4 |
用 Ollama / llama.cpp / vLLM 本地部署 Kimi K2
vLLM
vLLM 跑的是原始精度權重,記憶體需求比 GGUF 高得多,通常要多卡。
vllm serve moonshotai/Kimi-K2-Instruct-0905
量化檔名以模型庫當週抓取為準,口徑見資料方法。 資料方法
常見問題
在 Q4_K_M 量化、8K 上下文下 Kimi K2 約需 559GB 記憶體,留到 672GB 更穩。
收錄的單卡都裝不下 Kimi K2,需要多卡或 Mac Studio 的統一記憶體。
暫時不行,Ollama 庫還沒有它的官方標籤,也還沒有公開的 GGUF 量化。