在家跑 DeepSeek,先分清两类东西:R1 蒸馏版是 8B 到 70B 的稠密小模型,一张消费卡就能跑;满血版(V3.2、V4 Flash、V4 Pro)是几百 B 到 1.6T 的 MoE,权重几百 GB 起步,个人只能靠内存卸载或 512GB 的 Mac Studio 勉强跑起来。截至 2026 年 9 月 5 日,我们的建议是:预算六千元买二手 RX 7900 XTX 跑 14B 到 32B;八千元档直接买 RTX 3090,24GB 是 32B 蒸馏版的门槛;两万元档 RTX 4090 或 RTX 5090 换来的主要是速度,不是更大的模型。满血版不建议个人为它买卡。
DeepSeek 现在有哪些版本能在本地跑?
能装进一张消费卡的只有 R1 蒸馏版,满血版都是 284B 以上的 MoE。 版本对照如下:
| 版本 | 结构 | 总参数 / 激活 | 本地可行性 |
|---|---|---|---|
| R1 Qwen3 8B | 稠密(Qwen3 蒸馏) | 8.2B | 8GB 卡即可 |
| R1 Distill Qwen 14B | 稠密(Qwen2.5 蒸馏) | 14.8B | 12GB 起,16GB 舒适 |
| R1 Distill Qwen 32B | 稠密(Qwen2.5 蒸馏) | 32.8B | 24GB 卡下限 |
| V3.2 | MoE | 671B / 37B | 4-bit 约 375 GB,无官方 GGUF |
| V4 Flash | MoE | 284B / 13B | 4-bit 权重 155 GB,走内存卸载 |
| V4 Pro | MoE | 1.6T / 49B | 4-bit 权重 850 GB,家用不可行 |
蒸馏版的「DeepSeek」成分是训练数据,底座是 Qwen 或 Llama。这不是贬义:14B 蒸馏版的推理题表现明显好于同尺寸原版 Qwen,只是别把它和 API 上的 V4 混为一谈。

每个版本在 4-bit 和 8-bit 下需要多少显存?
显存需求 = 权重 + KV cache + 约 1 GB 运行开销,8K 上下文下 14B 4-bit 约 11 GB、32B 4-bit 约 21 GB。 下表由模型库实时计算,MoE 版本额外给出专家卸载后的「显存 + 内存」两个数:
| 模型 | 4-bit | 8-bit | 最便宜能跑的卡 | ||
|---|---|---|---|---|---|
| 8K | 32K | 8K | 32K | ||
| DeepSeek R1 Qwen3 8B8.2B | 7 GB | 11 GB | 11 GB | 14 GB | |
| DeepSeek R1 Distill Qwen 14B14.8B | 11 GB | 16 GB | 18 GB | 23 GB | |
| DeepSeek R1 Distill Qwen 32B32.8B | 22 GB | 28 GB | 37 GB | 43 GB | |
| DeepSeek V4 Flash284B · A13B | 160 GB卸载:7 GB 显存 + 155 GB 内存 | 162 GB卸载:9 GB 显存 + 155 GB 内存 | 297 GB卸载:10 GB 显存 + 288 GB 内存 | 299 GB卸载:12 GB 显存 + 288 GB 内存 | |
| DeepSeek V4 Pro1,600B · A49B | 894 GB卸载:17 GB 显存 + 879 GB 内存 | 897 GB卸载:20 GB 显存 + 879 GB 内存 | 1,661 GB卸载:29 GB 显存 + 1,634 GB 内存 | 1,664 GB卸载:32 GB 显存 + 1,634 GB 内存 | |
几个要点:
- 14B 从 8K 上下文拉到 32K,需求从约 11 GB 涨到 15 GB,16GB 卡刚好;12GB 卡只能跑 8K。
- 32B 4-bit 在 8K 下约 21 GB,24GB 卡放得下但没多少余量,32K 上下文就要 27 GB,得上 32GB 卡。
- 8-bit 对蒸馏版意义不大:14B 8-bit 要 18 GB,不如用同样的显存跑 32B 4-bit,后者能力高一档。
六千元、八千元、两万元预算各选哪张卡?
三个预算档对应的答案是 RX 7900 XTX、RTX 3090、RTX 4090 / RTX 5090,三张都是 24GB 起步,分界线在能不能跑 32B。 下表列出各档候选卡的当前二手价与跑 R1 14B 的预估速度:
| 型号 | 显存 GB | 带宽 GB/s | INT8 TOPS | 功耗 W | 闲鱼 | 显存单价 | DeepSeek R1 Distill Qwen 14B 速度 t/s |
|---|---|---|---|---|---|---|---|
| 24 | 960 | 123 | 355 | ¥5,70010 条挂单 | ¥238 | 50 | |
| 16 | 717 | 390 | 320 | ¥7,59010 条挂单 | ¥474 | 52 | |
| 24 | 936 | 285 | 350 | ¥7,99913 条挂单 | ¥333 | 68 | |
| 16 | 896 | 352 | 300 | ¥13,9508 条挂单 | ¥872 | 65 | |
| 24 | 1,008 | 661 | 450 | ¥23,50023 条挂单 | ¥979 | 73 | |
| 24 | 1,344 | 594 | 575 | ¥24,90017 条挂单 | ¥1,038 | 95 | |
| 32 | 1,792 | 838 | 575 | ¥39,40014 条挂单 | ¥1,231 | 123 |
六千元档:RX 7900 XTX
这个价位闲鱼上能稳定买到的 24GB 卡是 RX 7900 XTX,中位价比 RTX 3090 低两千多,跑 32B 4-bit 预估约 24 tokens/s,够用。如果只跑 llama.cpp / Ollama / LM Studio,7900 XTX 是这一档的正确答案;要跑 vLLM 或者不想碰 ROCm,加钱上 3090。同价位的 Arc Pro B60 也是 24GB,但 456 GB/s 的带宽只有 7900 XTX 的一半,不推荐。
八千元档:RTX 3090,不要买 16GB 的新卡
八千元正好是 RTX 3090 的中位价。同价位的 RTX 5070 Ti、RTX 5080 都是 16GB,跑不了 32B 蒸馏版,速度优势在 14B 上也不明显(14B 4-bit 在 3090 约 68 tokens/s,5070 Ti 约 65 tokens/s)。跑 DeepSeek 显存容量比架构新旧重要。
两万元档:RTX 4090 或 RTX 5090,买的是速度
RTX 4090 二手中位价两万三、RTX 5090 近四万。两张卡跑 32B 4-bit 都是一张搞定,5090 的 32GB 多出来的 8GB 让 32B 能开到 32K 上下文,速度约 61 tokens/s,是 3090 的近两倍。如果预算到了这里但只跑蒸馏版,我们更建议买两张 3090(总价约一万六):48GB 显存能跑 70B 蒸馏版和 Llama 3.3 70B,见多卡入门。
满血 DeepSeek 在家跑得起吗?
跑得起但不划算:V4 Flash 需要 160GB 以上内存做专家卸载,预估 10 到 12 tokens/s;整机放进显存只有 Mac Studio M3 Ultra 512GB 一个选项。 各设备的预估速度如下:
| 型号 | DeepSeek V4 Flash | DeepSeek R1 Distill Qwen 32B |
|---|---|---|
| 12* | 35 | |
| 12* | 61 | |
| 12* | 61 | |
| Mac Studio M4 Max 128GB | 11* | 15 |
| Mac Studio M3 Ultra 512GB | 47 | 23 |
| 10* | 10 |
4-bit、8K 上下文、单路解码的预估速度。带 * 的是 MoE 模型把专家权重放在系统内存里跑(按 70 GB/s 内存带宽算)。
带星号的是专家卸载:显卡只放注意力层、共享专家和 KV cache(约 7 GB),每 token 激活的专家权重从系统内存读,速度被内存带宽卡死在 12 tokens/s 上下,换 RTX PRO 6000 也不会更快。Mac Studio M3 Ultra 512GB 能把 V4 Flash 4-bit 整个放进统一内存,预估 47 tokens/s,但机器本身十四万元。V4 Pro 4-bit 权重 850 GB,没有家用方案。
结论:想用满血 V4,API 更便宜,见本地部署要花多少钱。买卡是为了蒸馏版和其他开源模型。
Ollama 和 llama.cpp 怎么启动?
Ollama 一条命令,llama.cpp 需要指定 GGUF 文件;满血版加 --n-cpu-moe 把专家放进内存。
Ollama(蒸馏版):
ollama run deepseek-r1:14b
ollama run deepseek-r1:32b
llama.cpp(14B,unsloth / bartowski 的 Q4_K_M):
llama-server -hf bartowski/DeepSeek-R1-Distill-Qwen-14B-GGUF:Q4_K_M -c 16384 -ngl 99
llama.cpp(V4 Flash 专家卸载,需要 160GB 以上内存):
llama-server -hf unsloth/DeepSeek-V4-Flash-0731-GGUF:Q4_K_M -c 8192 -ngl 99 --n-cpu-moe 43
--n-cpu-moe 43 表示 43 层的专家全放 CPU 内存;显存够的话把数字调小,让更多层留在显卡上。
常见误区
最常见的两个错误是把蒸馏版当满血版,以及只看显存不看带宽。
- Ollama 的
deepseek-r1:70b是 Llama 3.3 70B 蒸馏,和满血版的差距远大于它和 32B 蒸馏版的差距。 - 显存装得下只决定「能不能跑」,速度由带宽决定:Mac Studio M4 Max 128GB 能装 32B 4-bit,但 546 GB/s 的带宽只有约 15 tokens/s,3090 是它的两倍。
- 二手 3090 的风险是矿卡与显存虚焊,买前要求卖家跑
memtest_vulkan或 OCCT 显存测试满 30 分钟,见二手 3090 还是新 5070 Ti。 - 不要为 8-bit 加钱:蒸馏版 4-bit 与 8-bit 的评测分差在 1% 以内,省下的显存拿来跑更大的模型或更长的上下文。
