在家跑 DeepSeek,先分清兩類東西:R1 蒸餾版是 8B 到 70B 的稠密小模型,一張消費卡就能跑;滿血版(V3.2、V4 Flash、V4 Pro)是幾百 B 到 1.6T 的 MoE,權重幾百 GB 起步,個人只能靠記憶體卸載或 512GB 的 Mac Studio 勉強跑起來。截至 2026 年 9 月 5 日,我們的建議是:預算六千元買二手 RX 7900 XTX 跑 14B 到 32B;八千元檔直接買 RTX 3090,24GB 是 32B 蒸餾版的門檻;兩萬元檔 RTX 4090 或 RTX 5090 換來的主要是速度,不是更大的模型。滿血版不建議個人為它買卡。
本地部署 DeepSeek 該選什麼顯示卡?按版本和預算給出配置(2026 年 9 月)
譯自简体中文版 · 閱讀原文
正文與常見問題中的數字截至 2026年9月5日;表格使用最新已發布價格,各裝置採集時間可能不同。

本文提及的固定價格均以中國二手市場人民幣(CNY)為基準;動態表格則依頁面所選幣別顯示。
DeepSeek 現在有哪些版本能在本地跑?
能裝進一張消費卡的只有 R1 蒸餾版,滿血版都是 284B 以上的 MoE。 版本對照如下:
| 版本 | 結構 | 總參數 / 活躍參數 | 本地可行性 |
|---|---|---|---|
| R1 Qwen3 8B | 稠密(Qwen3 蒸餾) | 8.2B | 8GB 卡即可 |
| R1 Distill Qwen 14B | 稠密(Qwen2.5 蒸餾) | 14.8B | 12GB 起,16GB 舒適 |
| R1 Distill Qwen 32B | 稠密(Qwen2.5 蒸餾) | 32.8B | 24GB 卡下限 |
| V3.2 | MoE | 671B / 37B | 4-bit 約 375 GB,無官方 GGUF |
| V4 Flash | MoE | 284B / 13B | 4-bit 權重 155 GB,走記憶體卸載 |
| V4 Pro | MoE | 1.6T / 49B | 4-bit 權重 850 GB,家用不可行 |
蒸餾版的「DeepSeek」成分是訓練資料,底座是 Qwen 或 Llama。這不是貶義:14B 蒸餾版的推論題表現明顯好於同尺寸原版 Qwen,只是別把它和 API 上的 V4 混為一談。

每個版本在 4-bit 和 8-bit 下需要多少顯示記憶體?
顯示記憶體需求 = 權重 + KV cache + 約 1 GB 執行開銷,8K 上下文下 14B 4-bit 約 11 GB、32B 4-bit 約 21 GB。 下表由模型庫即時計算,MoE 版本額外給出專家卸載後的「顯示記憶體 + 記憶體」兩個數:
| 模型 | 4-bit | 8-bit | 最便宜能跑的卡 | ||
|---|---|---|---|---|---|
| 8K | 32K | 8K | 32K | ||
| DeepSeek R1 Qwen3 8B8.2B | 7 GB | 11 GB | 11 GB | 14 GB | |
| DeepSeek R1 Distill Qwen 14B14.8B | 11 GB | 16 GB | 18 GB | 23 GB | |
| DeepSeek R1 Distill Qwen 32B32.8B | 22 GB | 28 GB | 37 GB | 43 GB | |
| DeepSeek V4 Flash284B · A13B | 160 GB卸載:7 GB 顯示記憶體 + 155 GB 記憶體 | 162 GB卸載:9 GB 顯示記憶體 + 155 GB 記憶體 | 297 GB卸載:10 GB 顯示記憶體 + 288 GB 記憶體 | 299 GB卸載:12 GB 顯示記憶體 + 288 GB 記憶體 | |
| DeepSeek V4 Pro1,600B · A49B | 894 GB卸載:17 GB 顯示記憶體 + 879 GB 記憶體 | 897 GB卸載:20 GB 顯示記憶體 + 879 GB 記憶體 | 1,661 GB卸載:29 GB 顯示記憶體 + 1,634 GB 記憶體 | 1,664 GB卸載:32 GB 顯示記憶體 + 1,634 GB 記憶體 | |
幾個要點:
- 14B 從 8K 上下文拉到 32K,需求從約 11 GB 漲到 15 GB,16GB 卡剛好;12GB 卡只能跑 8K。
- 32B 4-bit 在 8K 下約 21 GB,24GB 卡放得下但沒多少餘量,32K 上下文就要 27 GB,得上 32GB 卡。
- 8-bit 對蒸餾版意義不大:14B 8-bit 要 18 GB,不如用同樣的顯示記憶體跑 32B 4-bit,後者能力高一檔。
六千元、八千元、兩萬元預算各選哪張卡?
三個預算檔對應的答案是 RX 7900 XTX、RTX 3090、RTX 4090 / RTX 5090,三張都是 24GB 起步,分界線在能不能跑 32B。 下表列出各檔候選顯示卡的當前二手價格與跑 R1 14B 的預估速度:
| 型號 | 顯存 GB | 頻寬 GB/s | INT8 TOPS | 功耗 W | 閒魚 | 顯存單價 | DeepSeek R1 Distill Qwen 14B 速度 t/s |
|---|---|---|---|---|---|---|---|
| 24 | 960 | 123 | 355 | NT$27,24911 筆掛單 | NT$1,136 | 50 | |
| 16 | 717 | 390 | 320 | NT$35,65810 筆掛單 | NT$2,229 | 52 | |
| 24 | 936 | 285 | 350 | NT$37,57913 筆掛單 | NT$1,566 | 68 | |
| 16 | 896 | 352 | 300 | NT$65,5378 筆掛單 | NT$4,096 | 65 | |
| 24 | 1,008 | 661 | 450 | NT$108,99422 筆掛單 | NT$4,541 | 73 | |
| 24 | 1,344 | 594 | 575 | NT$116,98117 筆掛單 | NT$4,874 | 95 | |
| 32 | 1,792 | 838 | 575 | NT$185,80712 筆掛單 | NT$5,807 | 123 |
六千元檔:RX 7900 XTX
這個價位閒魚上能穩定買到的 24GB 卡是 RX 7900 XTX,中位價比 RTX 3090 低兩千多,跑 32B 4-bit 預估約 24 tokens/s,夠用。如果只跑 llama.cpp / Ollama / LM Studio,7900 XTX 是這一檔的正確答案;要跑 vLLM 或者不想碰 ROCm,加錢上 3090。同價位的 Arc Pro B60 也是 24GB,但 456 GB/s 的頻寬只有 7900 XTX 的一半,不推薦。
八千元檔:RTX 3090,不要買 16GB 的新卡
八千元正好是 RTX 3090 的中位價。同價位的 RTX 5070 Ti、RTX 5080 都是 16GB,跑不了 32B 蒸餾版,速度優勢在 14B 上也不明顯(14B 4-bit 在 3090 約 68 tokens/s,5070 Ti 約 65 tokens/s)。跑 DeepSeek 顯示記憶體容量比架構新舊重要。
兩萬元檔:RTX 4090 或 RTX 5090,買的是速度
RTX 4090 二手中位價兩萬三、RTX 5090 近四萬。兩張卡跑 32B 4-bit 都是一張搞定,5090 的 32GB 多出來的 8GB 讓 32B 能開到 32K 上下文,速度約 61 tokens/s,是 3090 的近兩倍。如果預算到了這裡但只跑蒸餾版,我們更建議買兩張 3090(總價約一萬六):48GB 顯示記憶體能跑 70B 蒸餾版和 Llama 3.3 70B,見多卡入門。
滿血 DeepSeek 在家跑得起嗎?
跑得起但不划算:V4 Flash 需要 160GB 以上記憶體做專家卸載,預估 10 到 12 tokens/s;整機放進顯示記憶體只有 Mac Studio M3 Ultra 512GB 一個選項。 各裝置的預估速度如下:
| 型號 | DeepSeek V4 Flash | DeepSeek R1 Distill Qwen 32B |
|---|---|---|
| 12* | 35 | |
| 12* | 61 | |
| 12* | 61 | |
| Mac Studio M4 Max 128GB | 11* | 15 |
| Mac Studio M3 Ultra 512GB | 47 | 23 |
| 10* | 10 |
4-bit、8K 上下文、單路解碼的預估速度。帶 * 的是 MoE 模型把專家權重放在系統記憶體裡跑(按 70 GB/s 記憶體頻寬算)。
帶星號的是專家卸載:顯示卡只放注意力層、共享專家和 KV cache(約 7 GB),每 token 啟用的專家權重從系統記憶體讀,速度被記憶體頻寬卡死在 12 tokens/s 上下,換 RTX PRO 6000 也不會更快。Mac Studio M3 Ultra 512GB 能把 V4 Flash 4-bit 整個放進統一記憶體,預估 47 tokens/s,但機器本身十四萬元。V4 Pro 4-bit 權重 850 GB,沒有家用方案。
結論:想用滿血 V4,API 更便宜,見本地部署要花多少錢。買卡是為了蒸餾版和其他開源模型。
Ollama 和 llama.cpp 怎麼啟動?
Ollama 一條命令,llama.cpp 需要指定 GGUF 檔案;滿血版加 --n-cpu-moe 把專家放進記憶體。
Ollama(蒸餾版):
ollama run deepseek-r1:14b
ollama run deepseek-r1:32b
llama.cpp(14B,unsloth / bartowski 的 Q4_K_M):
llama-server -hf bartowski/DeepSeek-R1-Distill-Qwen-14B-GGUF:Q4_K_M -c 16384 -ngl 99
llama.cpp(V4 Flash 專家卸載,需要 160GB 以上記憶體):
llama-server -hf unsloth/DeepSeek-V4-Flash-0731-GGUF:Q4_K_M -c 8192 -ngl 99 --n-cpu-moe 43
--n-cpu-moe 43 表示 43 層的專家全放 CPU 記憶體;顯示記憶體夠的話把數字調小,讓更多層留在顯示卡上。
常見誤區
最常見的兩個錯誤是把蒸餾版當滿血版,以及只看顯示記憶體不看頻寬。
- Ollama 的
deepseek-r1:70b是 Llama 3.3 70B 蒸餾,和滿血版的差距遠大於它和 32B 蒸餾版的差距。 - 顯示記憶體裝得下只決定「能不能跑」,速度由頻寬決定:Mac Studio M4 Max 128GB 能裝 32B 4-bit,但 546 GB/s 的頻寬只有約 15 tokens/s,3090 是它的兩倍。
- 二手 3090 的風險是礦卡與顯示記憶體虛焊,買前要求賣家跑
memtest_vulkan或 OCCT 顯示記憶體測試滿 30 分鐘,見二手 3090 還是新 5070 Ti。 - 不要為 8-bit 加錢:蒸餾版 4-bit 與 8-bit 的評測分差在 1% 以內,省下的顯示記憶體拿來跑更大的模型或更長的上下文。
常見問題
本地跑 DeepSeek 最低要多少顯示記憶體?
R1 Qwen3 8B 蒸餾版在 4-bit、8K 上下文下約需 7 GB,8GB 卡能跑;14B 約需 11 GB,要 12GB 以上;32B 約需 21 GB,要 24GB 卡。
RTX 4090 能跑滿血 DeepSeek 嗎?
不能整機放進顯示記憶體。V4 Flash 4-bit 權重 155 GB,24GB 的 4090 只能把注意力層放顯示記憶體、專家權重放系統記憶體(llama.cpp 的 --n-cpu-moe),需要 160GB 以上記憶體,預估速度約 12 tokens/s。
Ollama 裡 deepseek-r1:14b 是滿血版嗎?
不是。Ollama 的 deepseek-r1:7b / 8b / 14b / 32b / 70b 都是用 R1 資料蒸餾的 Qwen 或 Llama 模型,滿血版只有 671B 一個尺寸。
買 24GB 卡跑 DeepSeek,3090 和 4090 差多少?
兩張都能跑 32B 蒸餾版 4-bit。按頻寬推算 3090 約 32 tokens/s、4090 約 35 tokens/s,差距不到一成,而二手價格差兩倍多,純跑 DeepSeek 選 3090。