在家跑 DeepSeek,先分清两类东西:R1 蒸馏版是 8B 到 70B 的稠密小模型,一张消费卡就能跑;满血版(V3.2、V4 Flash、V4 Pro)是几百 B 到 1.6T 的 MoE,权重几百 GB 起步,个人只能靠内存卸载或 512GB 的 Mac Studio 勉强跑起来。截至 2026 年 9 月 5 日,我们的建议是:预算六千元买二手 RX 7900 XTX 跑 14B 到 32B;八千元档直接买 RTX 3090,24GB 是 32B 蒸馏版的门槛;两万元档 RTX 4090RTX 5090 换来的主要是速度,不是更大的模型。满血版不建议个人为它买卡。

DeepSeek 现在有哪些版本能在本地跑?

能装进一张消费卡的只有 R1 蒸馏版,满血版都是 284B 以上的 MoE。 版本对照如下:

版本 结构 总参数 / 激活 本地可行性
R1 Qwen3 8B 稠密(Qwen3 蒸馏) 8.2B 8GB 卡即可
R1 Distill Qwen 14B 稠密(Qwen2.5 蒸馏) 14.8B 12GB 起,16GB 舒适
R1 Distill Qwen 32B 稠密(Qwen2.5 蒸馏) 32.8B 24GB 卡下限
V3.2 MoE 671B / 37B 4-bit 约 375 GB,无官方 GGUF
V4 Flash MoE 284B / 13B 4-bit 权重 155 GB,走内存卸载
V4 Pro MoE 1.6T / 49B 4-bit 权重 850 GB,家用不可行

蒸馏版的「DeepSeek」成分是训练数据,底座是 Qwen 或 Llama。这不是贬义:14B 蒸馏版的推理题表现明显好于同尺寸原版 Qwen,只是别把它和 API 上的 V4 混为一谈。

示意图:拆掉散热器的显卡电路板,GPU 核心周围一圈显存颗粒
示意图:拆掉散热器的显卡电路板,GPU 核心周围一圈显存颗粒

每个版本在 4-bit 和 8-bit 下需要多少显存?

显存需求 = 权重 + KV cache + 约 1 GB 运行开销,8K 上下文下 14B 4-bit 约 11 GB、32B 4-bit 约 21 GB。 下表由模型库实时计算,MoE 版本额外给出专家卸载后的「显存 + 内存」两个数:

模型4-bit8-bit最便宜能跑的卡
8K32K8K32K
DeepSeek R1 Qwen3 8B8.2B7 GB11 GB11 GB14 GBGeForce RTX 2080 Ti¥1,641
DeepSeek R1 Distill Qwen 14B14.8B11 GB16 GB18 GB23 GBGeForce RTX 2080 Ti¥1,641
DeepSeek R1 Distill Qwen 32B32.8B22 GB28 GB37 GB43 GBTesla V100 32GB¥3,459
DeepSeek V4 Flash284B · A13B160 GB卸载:7 GB 显存 + 155 GB 内存162 GB卸载:9 GB 显存 + 155 GB 内存297 GB卸载:10 GB 显存 + 288 GB 内存299 GB卸载:12 GB 显存 + 288 GB 内存GeForce RTX 2080 Ti¥1,641 · 卸载
DeepSeek V4 Pro1,600B · A49B894 GB卸载:17 GB 显存 + 879 GB 内存897 GB卸载:20 GB 显存 + 879 GB 内存1,661 GB卸载:29 GB 显存 + 1,634 GB 内存1,664 GB卸载:32 GB 显存 + 1,634 GB 内存Tesla V100 32GB¥3,459 · 卸载

几个要点:

  • 14B 从 8K 上下文拉到 32K,需求从约 11 GB 涨到 15 GB,16GB 卡刚好;12GB 卡只能跑 8K。
  • 32B 4-bit 在 8K 下约 21 GB,24GB 卡放得下但没多少余量,32K 上下文就要 27 GB,得上 32GB 卡。
  • 8-bit 对蒸馏版意义不大:14B 8-bit 要 18 GB,不如用同样的显存跑 32B 4-bit,后者能力高一档。

六千元、八千元、两万元预算各选哪张卡?

三个预算档对应的答案是 RX 7900 XTX、RTX 3090、RTX 4090 / RTX 5090,三张都是 24GB 起步,分界线在能不能跑 32B。 下表列出各档候选卡的当前二手价与跑 R1 14B 的预估速度:

型号显存 GB带宽 GB/sINT8 TOPS功耗 W闲鱼显存单价DeepSeek R1 Distill Qwen 14B 速度 t/s
Radeon RX 7900 XTX24960123355¥5,70010 条挂单¥23850
GeForce RTX 408016717390320¥7,59010 条挂单¥47452
GeForce RTX 309024936285350¥7,99913 条挂单¥33368
GeForce RTX 5070 Ti16896352300¥13,9508 条挂单¥87265
GeForce RTX 4090241,008661450¥23,50023 条挂单¥97973
GeForce RTX 5090 D V2241,344594575¥24,90017 条挂单¥1,03895
GeForce RTX 5090321,792838575¥39,40014 条挂单¥1,231123

六千元档:RX 7900 XTX

这个价位闲鱼上能稳定买到的 24GB 卡是 RX 7900 XTX,中位价比 RTX 3090 低两千多,跑 32B 4-bit 预估约 24 tokens/s,够用。如果只跑 llama.cpp / Ollama / LM Studio,7900 XTX 是这一档的正确答案;要跑 vLLM 或者不想碰 ROCm,加钱上 3090。同价位的 Arc Pro B60 也是 24GB,但 456 GB/s 的带宽只有 7900 XTX 的一半,不推荐。

八千元档:RTX 3090,不要买 16GB 的新卡

八千元正好是 RTX 3090 的中位价。同价位的 RTX 5070 TiRTX 5080 都是 16GB,跑不了 32B 蒸馏版,速度优势在 14B 上也不明显(14B 4-bit 在 3090 约 68 tokens/s,5070 Ti 约 65 tokens/s)。跑 DeepSeek 显存容量比架构新旧重要。

两万元档:RTX 4090 或 RTX 5090,买的是速度

RTX 4090 二手中位价两万三、RTX 5090 近四万。两张卡跑 32B 4-bit 都是一张搞定,5090 的 32GB 多出来的 8GB 让 32B 能开到 32K 上下文,速度约 61 tokens/s,是 3090 的近两倍。如果预算到了这里但只跑蒸馏版,我们更建议买两张 3090(总价约一万六):48GB 显存能跑 70B 蒸馏版和 Llama 3.3 70B,见多卡入门

满血 DeepSeek 在家跑得起吗?

跑得起但不划算:V4 Flash 需要 160GB 以上内存做专家卸载,预估 10 到 12 tokens/s;整机放进显存只有 Mac Studio M3 Ultra 512GB 一个选项。 各设备的预估速度如下:

型号DeepSeek V4 FlashDeepSeek R1 Distill Qwen 32B
GeForce RTX 409012*35
GeForce RTX 509012*61
RTX PRO 6000 Blackwell12*61
Mac Studio M4 Max 128GB11*15
Mac Studio M3 Ultra 512GB4723
DGX Spark 128GB10*10

4-bit、8K 上下文、单路解码的预估速度。带 * 的是 MoE 模型把专家权重放在系统内存里跑(按 70 GB/s 内存带宽算)。

带星号的是专家卸载:显卡只放注意力层、共享专家和 KV cache(约 7 GB),每 token 激活的专家权重从系统内存读,速度被内存带宽卡死在 12 tokens/s 上下,换 RTX PRO 6000 也不会更快。Mac Studio M3 Ultra 512GB 能把 V4 Flash 4-bit 整个放进统一内存,预估 47 tokens/s,但机器本身十四万元。V4 Pro 4-bit 权重 850 GB,没有家用方案。

结论:想用满血 V4,API 更便宜,见本地部署要花多少钱。买卡是为了蒸馏版和其他开源模型。

Ollama 和 llama.cpp 怎么启动?

Ollama 一条命令,llama.cpp 需要指定 GGUF 文件;满血版加 --n-cpu-moe 把专家放进内存。

Ollama(蒸馏版):

ollama run deepseek-r1:14b
ollama run deepseek-r1:32b

llama.cpp(14B,unsloth / bartowski 的 Q4_K_M):

llama-server -hf bartowski/DeepSeek-R1-Distill-Qwen-14B-GGUF:Q4_K_M -c 16384 -ngl 99

llama.cpp(V4 Flash 专家卸载,需要 160GB 以上内存):

llama-server -hf unsloth/DeepSeek-V4-Flash-0731-GGUF:Q4_K_M -c 8192 -ngl 99 --n-cpu-moe 43

--n-cpu-moe 43 表示 43 层的专家全放 CPU 内存;显存够的话把数字调小,让更多层留在显卡上。

常见误区

最常见的两个错误是把蒸馏版当满血版,以及只看显存不看带宽。

  • Ollama 的 deepseek-r1:70b 是 Llama 3.3 70B 蒸馏,和满血版的差距远大于它和 32B 蒸馏版的差距。
  • 显存装得下只决定「能不能跑」,速度由带宽决定:Mac Studio M4 Max 128GB 能装 32B 4-bit,但 546 GB/s 的带宽只有约 15 tokens/s,3090 是它的两倍。
  • 二手 3090 的风险是矿卡与显存虚焊,买前要求卖家跑 memtest_vulkan 或 OCCT 显存测试满 30 分钟,见二手 3090 还是新 5070 Ti
  • 不要为 8-bit 加钱:蒸馏版 4-bit 与 8-bit 的评测分差在 1% 以内,省下的显存拿来跑更大的模型或更长的上下文。