DeepSeek V4 Pro 本地部署需要多少显存?
看能跑的设备DeepSeek V4 Pro 是 MoE 模型,总参数 1,600B,每 token 激活 49B。Q4 量化整机放显存需要 894GB;把专家放进系统内存后只需 17GB 显存 + 879GB 内存。收录的单卡都装不下它,需要多卡或 Mac Studio 的统一内存。卸载模式下最便宜能跑的显卡是 Radeon RX 7900 XT,预估 3 tokens/s。
DeepSeek V4 Pro 版本信息
DeepSeek V4 Pro 各量化与上下文的显存需求
8K 总显存MoE:总参数 1,600B 全部要驻留显存,速度按每 token 激活的 49B 算。
| 量化 | 权重体积GB | 8K 总显存GB | 32K 总显存GB | 128K 总显存GB |
|---|---|---|---|---|
| 1-bit | 375.5估 | 377.5 | 380.3 | 391.8 |
| 2-bit | 594.6估 | 596.5 | 599.4 | 610.8 |
| 3-bit | 766.7估 | 768.6 | 771.5 | 782.9 |
| 4-bit | 849.7GGUF | 893.8 | 896.6 | 908.1 |
| 5-bit | 1,079.6估 | 1,081.5 | 1,084.4 | 1,095.8 |
| 8-bit | 873.4GGUF | 1,660.5 | 1,663.3 | 1,674.7 |
| FP16 | 3,129.2估 | 3,131.2 | 3,134.1 | 3,145.5 |
总显存 = 权重 + KV cache(FP16)+ 1GB 运行开销。标 GGUF 的权重是仓库里的实测文件体积,标「估」的按每参数字节估算。超过这个模型 1M 上下文上限的档位写「—」。各档取仓库里该比特数的任一文件,优先 unsloth 动态量化,所以同一档不同模型对应的文件名可能不同。
什么显卡能跑 DeepSeek V4 Pro?
Q4_K_M · 8K 上下文 · 按闲鱼二手价升序收录的单卡都装不下 DeepSeek V4 Pro:Q4_K_M、8K 上下文下至少需要 894GB 显存。
多卡方案至少要凑够 894GB 显存。
收录的统一内存机型也装不下。
把专家放进内存后还能跑 DeepSeek V4 Pro 的显卡
专家权重放系统内存,需要 ≥ 879 GB 内存;显存只放注意力层、共享专家和 KV cache,Q4 下最低 17 GB。速度受内存带宽限制(按 70 GB/s 估算),比整机放显存慢得多。
用 Ollama / llama.cpp / vLLM 启动 DeepSeek V4 Pro
Ollama 库暂无官方标签。
llama.cpp 直接从 Hugging Face 拉 GGUF,-c 是上下文长度。
llama-server -hf unsloth/DeepSeek-V4-Pro-0813-GGUF:Q4_K_M -c 8192
vLLM 跑的是原始精度权重,显存要求比 GGUF 高得多,通常要多卡。
vllm serve deepseek-ai/DeepSeek-V4-Pro-0813
量化文件名以模型库当周抓取为准,口径见数据方法。 数据方法
常见问题
DeepSeek V4 Pro 需要多少显存?
在 Q4_K_M 量化、8K 上下文下 DeepSeek V4 Pro 约需 894GB 显存,留到 1,076GB 更稳。
哪张显卡最便宜能跑 DeepSeek V4 Pro?
收录的单卡都装不下 DeepSeek V4 Pro,需要多卡或 Mac Studio 的统一内存。
DeepSeek V4 Pro 能用 Ollama 跑吗?
暂时不能,Ollama 库还没有它的官方标签;可以用 llama.cpp 加载 GGUF。