DeepSeek V4 Pro のローカル実行に必要なVRAMは?
動かせるデバイスを見るDeepSeek V4 Pro は総パラメータ 1,600B、1 トークンあたり 49B が有効になる MoE モデルです。Q4 で全量を VRAM に置くには 894GB 必要ですが、エキスパートをシステム RAM に置けば VRAM 17GB + RAM 879GB で動きます。収録している単体カードには収まらず、複数枚構成か Mac Studio のユニファイドメモリが必要です。オフロード構成で最も安く動かせるのは Radeon RX 7900 XT で、推定 3 tokens/s です。
DeepSeek V4 Pro のバージョン情報
DeepSeek V4 Pro の量子化・コンテキスト別の必要VRAM
8K 時の合計MoE:総パラメータ 1,600B すべてをメモリに常駐させる必要があり、速度は 1 トークンあたり有効な 49B で決まります。
| 量子化 | 重みサイズGB | 8K 時の合計GB | 32K 時の合計GB | 128K 時の合計GB |
|---|---|---|---|---|
| 1-bit | 375.5推定 | 377.5 | 380.3 | 391.8 |
| 2-bit | 594.6推定 | 596.5 | 599.4 | 610.8 |
| 3-bit | 766.7推定 | 768.6 | 771.5 | 782.9 |
| 4-bit | 849.7GGUF | 893.8 | 896.6 | 908.1 |
| 5-bit | 1,079.6推定 | 1,081.5 | 1,084.4 | 1,095.8 |
| 8-bit | 873.4GGUF | 1,660.5 | 1,663.3 | 1,674.7 |
| FP16 | 3,129.2推定 | 3,131.2 | 3,134.1 | 3,145.5 |
合計 = 重み + KV キャッシュ(FP16)+ 実行時オーバーヘッド 1GB。GGUF と付いた重みはリポジトリの実測ファイルサイズ、「推定」はパラメータあたりのバイト数からの概算です。このモデルの上限 1M を超えるコンテキストは「—」と表示します。各段はリポジトリにあるそのビット幅のファイルを使い、unsloth 動的量子化を優先するため、ファイル名はモデルごとに異なります。
DeepSeek V4 Pro を動かせるGPUは?
Q4_K_M・8K コンテキスト・eBayの中古価格の安い順収録している単体カードでは DeepSeek V4 Pro は収まりません。Q4_K_M・8K コンテキストで最低 894GB のVRAMが必要です。
複数枚構成でも合計で最低 894GB のVRAMが必要です。
収録しているユニファイドメモリ機にも収まりません。
エキスパートを RAM に置けば DeepSeek V4 Pro を動かせる GPU
エキスパート重みはシステム RAM に置き(879 GB 以上が必要)、VRAM にはアテンション層・共有エキスパート・KV キャッシュのみで Q4 なら最低 17 GB。速度は RAM 帯域幅(70 GB/s で推定)に縛られ、全量 VRAM 構成よりかなり遅くなります。
| デバイス | VRAMGB | 中古価格 | 必要 RAMGB | 推定 t/s |
|---|---|---|---|---|
| 20 | — | 879 | 3.1 | |
| 24 | — | 879 | 2.8 | |
| 24 | — | 879 | 3.2 | |
| 24 | — | 879 | 3.2 | |
| 24 | — | 879 | 3.3 | |
| 24 | — | 879 | 3.1 | |
| 24 | — | 879 | 3.1 | |
| 32 | — | 879 | 2.9 | |
| 32 | — | 879 | 2.9 | |
| 32 | — | 879 | 3.1 | |
| 32 | — | 879 | 3.3 | |
| 32 | — | 879 | 3.3 | |
| 32 | — | 879 | 3.2 | |
| 32 | — | 879 | 3 | |
| 32 | — | 879 | 2.9 | |
| 32 | — | 879 | 3.2 | |
| 32 | — | 879 | 3.2 | |
| 40 | — | 879 | 3.3 | |
| 40 | — | 879 | 3.3 | |
| 48 | — | 879 | 3.2 | |
| 48 | — | 879 | 3.1 | |
| 48 | — | 879 | 3.3 | |
| 64 | — | 879 | 3.3 | |
| 64 | — | 879 | 3.2 | |
| 72 | — | 879 | 3.3 | |
| 84 | — | 879 | 3.3 | |
| 96 | — | 879 | 3.3 | |
| 128 | — | 879 | 2.7 | |
| Mac Studio M4 Max 128GB | 128 | — | 879 | 3 |
| Mac Studio M5 Max 128GB | 128 | — | 879 | 3 |
| MacBook Pro M4 Max 128GB | 128 | — | 879 | 3 |
| MacBook Pro M5 Max 128GB | 128 | — | 879 | 3 |
| 128 | — | 879 | 2.5 | |
| Mac Studio M3 Ultra 512GB | 512 | — | 879 | 3.1 |
Ollama / llama.cpp / vLLM で DeepSeek V4 Pro を起動する
Ollama ライブラリに公式タグはまだありません。
llama.cpp は Hugging Face から GGUF を直接取得します。-c はコンテキスト長です。
llama-server -hf unsloth/DeepSeek-V4-Pro-0813-GGUF:Q4_K_M -c 8192
vLLM は元の精度の重みを読み込むため、GGUF よりはるかに多くのメモリ(通常は複数枚)が必要です。
vllm serve deepseek-ai/DeepSeek-V4-Pro-0813
ファイル名はその週のモデルライブラリ取得時点のものです。定義はデータ方法を参照してください。 データ方法
よくある質問
DeepSeek V4 Pro にはどれくらいのVRAMが必要ですか?
Q4_K_M・8K コンテキストでは DeepSeek V4 Pro に約 894GB のVRAMが必要で、1,076GB あれば余裕があります。
DeepSeek V4 Pro を動かせる最も安いGPUは?
収録している単体カードでは DeepSeek V4 Pro は動かせず、複数枚構成か Mac Studio のユニファイドメモリが必要です。
DeepSeek V4 Pro は Ollama で動かせますか?
まだできません。Ollama ライブラリに公式タグがないため、llama.cpp で GGUF を読み込んでください。