本地部署 DeepSeek 該選什麼顯示卡?按版本和預算給出配置(2026 年 9 月)

譯自简体中文版 · 閱讀原文

在家跑 DeepSeek,先分清兩類東西:R1 蒸餾版是 8B 到 70B 的稠密小模型,一張消費卡就能跑;滿血版(V3.2、V4 Flash、V4 Pro)是幾百 B 到 1.6T 的 MoE,權重幾百 GB 起步,個人只能靠記憶體卸載或 512GB 的 Mac Studio 勉強跑起來。截至 2026 年 9 月 5 日,我們的建議是:預算六千元買二手 RX 7900 XTX 跑 14B 到 32B;八千元檔直接買 RTX 3090,24GB 是 32B 蒸餾版的門檻;兩萬元檔 RTX 4090RTX 5090 換來的主要是速度,不是更大的模型。滿血版不建議個人為它買卡。

示意圖:一張高階顯示卡立在桌上,旁邊疊著三張不同尺寸的二手顯示卡
示意圖 · 一張高階顯示卡立在桌上,旁邊疊著三張不同尺寸的二手顯示卡

本文提及的固定價格均以中國二手市場人民幣(CNY)為基準;動態表格則依頁面所選幣別顯示。

DeepSeek 現在有哪些版本能在本地跑?

能裝進一張消費卡的只有 R1 蒸餾版,滿血版都是 284B 以上的 MoE。 版本對照如下:

版本 結構 總參數 / 活躍參數 本地可行性
R1 Qwen3 8B 稠密(Qwen3 蒸餾) 8.2B 8GB 卡即可
R1 Distill Qwen 14B 稠密(Qwen2.5 蒸餾) 14.8B 12GB 起,16GB 舒適
R1 Distill Qwen 32B 稠密(Qwen2.5 蒸餾) 32.8B 24GB 卡下限
V3.2 MoE 671B / 37B 4-bit 約 375 GB,無官方 GGUF
V4 Flash MoE 284B / 13B 4-bit 權重 155 GB,走記憶體卸載
V4 Pro MoE 1.6T / 49B 4-bit 權重 850 GB,家用不可行

蒸餾版的「DeepSeek」成分是訓練資料,底座是 Qwen 或 Llama。這不是貶義:14B 蒸餾版的推論題表現明顯好於同尺寸原版 Qwen,只是別把它和 API 上的 V4 混為一談。

示意圖:拆掉散熱器的顯示卡電路板,GPU 核心周圍一圈顯示記憶體顆粒
示意圖:拆掉散熱器的顯示卡電路板,GPU 核心周圍一圈顯示記憶體顆粒

每個版本在 4-bit 和 8-bit 下需要多少顯示記憶體?

顯示記憶體需求 = 權重 + KV cache + 約 1 GB 執行開銷,8K 上下文下 14B 4-bit 約 11 GB、32B 4-bit 約 21 GB。 下表由模型庫即時計算,MoE 版本額外給出專家卸載後的「顯示記憶體 + 記憶體」兩個數:

模型4-bit8-bit最便宜能跑的卡
8K32K8K32K
DeepSeek R1 Qwen3 8B8.2B7 GB11 GB11 GB14 GBGeForce RTX 2080 TiNT$7,709
DeepSeek R1 Distill Qwen 14B14.8B11 GB16 GB18 GB23 GBGeForce RTX 2080 TiNT$7,709
DeepSeek R1 Distill Qwen 32B32.8B22 GB28 GB37 GB43 GBTesla V100 32GBNT$16,250
DeepSeek V4 Flash284B · A13B160 GB卸載:7 GB 顯示記憶體 + 155 GB 記憶體162 GB卸載:9 GB 顯示記憶體 + 155 GB 記憶體297 GB卸載:10 GB 顯示記憶體 + 288 GB 記憶體299 GB卸載:12 GB 顯示記憶體 + 288 GB 記憶體GeForce RTX 2080 TiNT$7,709 · 卸載
DeepSeek V4 Pro1,600B · A49B894 GB卸載:17 GB 顯示記憶體 + 879 GB 記憶體897 GB卸載:20 GB 顯示記憶體 + 879 GB 記憶體1,661 GB卸載:29 GB 顯示記憶體 + 1,634 GB 記憶體1,664 GB卸載:32 GB 顯示記憶體 + 1,634 GB 記憶體Tesla V100 32GBNT$16,250 · 卸載

幾個要點:

  • 14B 從 8K 上下文拉到 32K,需求從約 11 GB 漲到 15 GB,16GB 卡剛好;12GB 卡只能跑 8K。
  • 32B 4-bit 在 8K 下約 21 GB,24GB 卡放得下但沒多少餘量,32K 上下文就要 27 GB,得上 32GB 卡。
  • 8-bit 對蒸餾版意義不大:14B 8-bit 要 18 GB,不如用同樣的顯示記憶體跑 32B 4-bit,後者能力高一檔。

六千元、八千元、兩萬元預算各選哪張卡?

三個預算檔對應的答案是 RX 7900 XTX、RTX 3090、RTX 4090 / RTX 5090,三張都是 24GB 起步,分界線在能不能跑 32B。 下表列出各檔候選顯示卡的當前二手價格與跑 R1 14B 的預估速度:

型號顯存 GB頻寬 GB/sINT8 TOPS功耗 W閒魚顯存單價DeepSeek R1 Distill Qwen 14B 速度 t/s
Radeon RX 7900 XTX24960123355NT$27,24911 筆掛單NT$1,13650
GeForce RTX 408016717390320NT$35,65810 筆掛單NT$2,22952
GeForce RTX 309024936285350NT$37,57913 筆掛單NT$1,56668
GeForce RTX 5070 Ti16896352300NT$65,5378 筆掛單NT$4,09665
GeForce RTX 4090241,008661450NT$108,99422 筆掛單NT$4,54173
GeForce RTX 5090 D V2241,344594575NT$116,98117 筆掛單NT$4,87495
GeForce RTX 5090321,792838575NT$185,80712 筆掛單NT$5,807123

六千元檔:RX 7900 XTX

這個價位閒魚上能穩定買到的 24GB 卡是 RX 7900 XTX,中位價比 RTX 3090 低兩千多,跑 32B 4-bit 預估約 24 tokens/s,夠用。如果只跑 llama.cpp / Ollama / LM Studio,7900 XTX 是這一檔的正確答案;要跑 vLLM 或者不想碰 ROCm,加錢上 3090。同價位的 Arc Pro B60 也是 24GB,但 456 GB/s 的頻寬只有 7900 XTX 的一半,不推薦。

八千元檔:RTX 3090,不要買 16GB 的新卡

八千元正好是 RTX 3090 的中位價。同價位的 RTX 5070 TiRTX 5080 都是 16GB,跑不了 32B 蒸餾版,速度優勢在 14B 上也不明顯(14B 4-bit 在 3090 約 68 tokens/s,5070 Ti 約 65 tokens/s)。跑 DeepSeek 顯示記憶體容量比架構新舊重要。

兩萬元檔:RTX 4090 或 RTX 5090,買的是速度

RTX 4090 二手中位價兩萬三、RTX 5090 近四萬。兩張卡跑 32B 4-bit 都是一張搞定,5090 的 32GB 多出來的 8GB 讓 32B 能開到 32K 上下文,速度約 61 tokens/s,是 3090 的近兩倍。如果預算到了這裡但只跑蒸餾版,我們更建議買兩張 3090(總價約一萬六):48GB 顯示記憶體能跑 70B 蒸餾版和 Llama 3.3 70B,見多卡入門

滿血 DeepSeek 在家跑得起嗎?

跑得起但不划算:V4 Flash 需要 160GB 以上記憶體做專家卸載,預估 10 到 12 tokens/s;整機放進顯示記憶體只有 Mac Studio M3 Ultra 512GB 一個選項。 各裝置的預估速度如下:

型號DeepSeek V4 FlashDeepSeek R1 Distill Qwen 32B
GeForce RTX 409012*35
GeForce RTX 509012*61
RTX PRO 6000 Blackwell12*61
Mac Studio M4 Max 128GB11*15
Mac Studio M3 Ultra 512GB4723
DGX Spark 128GB10*10

4-bit、8K 上下文、單路解碼的預估速度。帶 * 的是 MoE 模型把專家權重放在系統記憶體裡跑(按 70 GB/s 記憶體頻寬算)。

帶星號的是專家卸載:顯示卡只放注意力層、共享專家和 KV cache(約 7 GB),每 token 啟用的專家權重從系統記憶體讀,速度被記憶體頻寬卡死在 12 tokens/s 上下,換 RTX PRO 6000 也不會更快。Mac Studio M3 Ultra 512GB 能把 V4 Flash 4-bit 整個放進統一記憶體,預估 47 tokens/s,但機器本身十四萬元。V4 Pro 4-bit 權重 850 GB,沒有家用方案。

結論:想用滿血 V4,API 更便宜,見本地部署要花多少錢。買卡是為了蒸餾版和其他開源模型。

Ollama 和 llama.cpp 怎麼啟動?

Ollama 一條命令,llama.cpp 需要指定 GGUF 檔案;滿血版加 --n-cpu-moe 把專家放進記憶體。

Ollama(蒸餾版):

ollama run deepseek-r1:14b
ollama run deepseek-r1:32b

llama.cpp(14B,unsloth / bartowski 的 Q4_K_M):

llama-server -hf bartowski/DeepSeek-R1-Distill-Qwen-14B-GGUF:Q4_K_M -c 16384 -ngl 99

llama.cpp(V4 Flash 專家卸載,需要 160GB 以上記憶體):

llama-server -hf unsloth/DeepSeek-V4-Flash-0731-GGUF:Q4_K_M -c 8192 -ngl 99 --n-cpu-moe 43

--n-cpu-moe 43 表示 43 層的專家全放 CPU 記憶體;顯示記憶體夠的話把數字調小,讓更多層留在顯示卡上。

常見誤區

最常見的兩個錯誤是把蒸餾版當滿血版,以及只看顯示記憶體不看頻寬。

  • Ollama 的 deepseek-r1:70b 是 Llama 3.3 70B 蒸餾,和滿血版的差距遠大於它和 32B 蒸餾版的差距。
  • 顯示記憶體裝得下只決定「能不能跑」,速度由頻寬決定:Mac Studio M4 Max 128GB 能裝 32B 4-bit,但 546 GB/s 的頻寬只有約 15 tokens/s,3090 是它的兩倍。
  • 二手 3090 的風險是礦卡與顯示記憶體虛焊,買前要求賣家跑 memtest_vulkan 或 OCCT 顯示記憶體測試滿 30 分鐘,見二手 3090 還是新 5070 Ti
  • 不要為 8-bit 加錢:蒸餾版 4-bit 與 8-bit 的評測分差在 1% 以內,省下的顯示記憶體拿來跑更大的模型或更長的上下文。

常見問題

本地跑 DeepSeek 最低要多少顯示記憶體?

R1 Qwen3 8B 蒸餾版在 4-bit、8K 上下文下約需 7 GB,8GB 卡能跑;14B 約需 11 GB,要 12GB 以上;32B 約需 21 GB,要 24GB 卡。

RTX 4090 能跑滿血 DeepSeek 嗎?

不能整機放進顯示記憶體。V4 Flash 4-bit 權重 155 GB,24GB 的 4090 只能把注意力層放顯示記憶體、專家權重放系統記憶體(llama.cpp 的 --n-cpu-moe),需要 160GB 以上記憶體,預估速度約 12 tokens/s。

Ollama 裡 deepseek-r1:14b 是滿血版嗎?

不是。Ollama 的 deepseek-r1:7b / 8b / 14b / 32b / 70b 都是用 R1 資料蒸餾的 Qwen 或 Llama 模型,滿血版只有 671B 一個尺寸。

買 24GB 卡跑 DeepSeek,3090 和 4090 差多少?

兩張都能跑 32B 蒸餾版 4-bit。按頻寬推算 3090 約 32 tokens/s、4090 約 35 tokens/s,差距不到一成,而二手價格差兩倍多,純跑 DeepSeek 選 3090。

文中提到的顯示卡

文中提到的模型