DeepSeekをローカルで動かすにはどのGPUが必要か?モデルと予算別の構成(2026年9月)

简体中文版からの翻訳 · 原文を読む

家庭でDeepSeekを動かすなら、まず二つを区別してください。R1蒸留版は8B〜70Bの高密度な小型モデルで、コンシューマーGPU 1枚で動きます。フルモデル(V3.2、V4 Flash、V4 Pro)は数百B〜1.6TのMoEで、重みは数百GBから始まります。個人ではメモリオフロードか512GBのMac Studioでようやく動かせる程度です。2026年9月5日時点での推奨は、中古価格6,000中国人民元(CNY)の予算ならRX 7900 XTXで14B〜32B、8,000 CNY帯ならRTX 3090です。24GBは32B蒸留版のしきい値です。20,000 CNY帯でRTX 4090またはRTX 5090を選んでも、得られるのは主に速度であり、より大きいモデルではありません。フルモデルのために個人がGPUを買うことは勧めません。中国の中古市場にある固定価格はCNYを基準とし、表はページで表示される通貨に従います。

イメージ図:ハイエンドGPUが机の上に立ち、その横にサイズの異なる中古GPUが3枚重ねられている
イメージ図 · ハイエンドGPUが机の上に立ち、その横にサイズの異なる中古GPUが3枚重ねられている

現在ローカルで動かせるDeepSeekのバージョンは?

コンシューマーGPU 1枚に載るのはR1蒸留版だけで、フルモデルはすべて284B以上のMoEです。 対応は次のとおりです。

バージョン 構造 総パラメータ / 活性化 ローカルでの実現性
R1 Qwen3 8B 高密度(Qwen3蒸留) 8.2B 8GBカードで可
R1 Distill Qwen 14B 高密度(Qwen2.5蒸留) 14.8B 12GBから、16GBなら余裕あり
R1 Distill Qwen 32B 高密度(Qwen2.5蒸留) 32.8B 24GBカードが下限
V3.2 MoE 671B / 37B 4-bitで約375 GB、公式GGUFなし
V4 Flash MoE 284B / 13B 4-bit重み155 GB、メモリオフロードが必要
V4 Pro MoE 1.6T / 49B 4-bit重み850 GB、家庭用では非現実的

蒸留版における「DeepSeek」の部分は学習データで、ベースはQwenまたはLlamaです。これは欠点ではありません。14B蒸留版は推論問題で同サイズの元のQwenより明らかに優れます。ただしAPIのV4と混同しないでください。

イメージ図:クーラーを外したGPU基板。GPUコアの周囲をVRAMチップが囲んでいる
イメージ図:クーラーを外したGPU基板。GPUコアの周囲をVRAMチップが囲んでいる

各バージョンに4-bitと8-bitで必要なVRAMは?

VRAM要件 = 重み + KVキャッシュ + 約1 GBの実行オーバーヘッドです。8Kコンテキストでは14Bの4-bitが約11 GB、32Bの4-bitが約21 GB必要です。 下表はモデルライブラリからリアルタイム計算します。MoE版にはエキスパートをオフロードした後の「VRAM + システムメモリ」も表示します。

モデル4-bit8-bit動かせる最安のカード
8K32K8K32K
DeepSeek R1 Qwen3 8B8.2B7 GB11 GB11 GB14 GBTesla V100 16GB¥44,978
DeepSeek R1 Distill Qwen 14B14.8B11 GB16 GB18 GB23 GBTesla V100 16GB¥44,978
DeepSeek R1 Distill Qwen 32B32.8B22 GB28 GB37 GB43 GBTesla V100 32GB¥111,507
DeepSeek V4 Flash284B · A13B160 GBオフロード:VRAM 7 GB + RAM 155 GB162 GBオフロード:VRAM 9 GB + RAM 155 GB297 GBオフロード:VRAM 10 GB + RAM 288 GB299 GBオフロード:VRAM 12 GB + RAM 288 GBTesla V100 16GB¥44,978 · オフロード
DeepSeek V4 Pro1,600B · A49B894 GBオフロード:VRAM 17 GB + RAM 879 GB897 GBオフロード:VRAM 20 GB + RAM 879 GB1,661 GBオフロード:VRAM 29 GB + RAM 1,634 GB1,664 GBオフロード:VRAM 32 GB + RAM 1,634 GBRadeon RX 7900 XT¥109,165 · オフロード

要点は以下です。

  • 14Bでコンテキストを8Kから32Kに上げると、要件は約11 GBから15 GBへ増えます。16GBカードならちょうどよく、12GBカードは8Kしか使えません。
  • 32Bの4-bitは8Kで約21 GBです。24GBカードに収まりますが余裕はほとんどなく、32Kコンテキストでは27 GBになり32GBカードが必要です。
  • 蒸留版で8-bitを選ぶ意味はあまりありません。14Bの8-bitには18 GBが必要で、同じVRAMで32Bの4-bitを動かすほうが能力は一段上です。

6,000、8,000、20,000 CNYの予算ではどのGPUを選ぶか?

三つの予算帯の答えはRX 7900 XTX、RTX 3090、RTX 4090 / RTX 5090です。いずれも24GBから始まり、32Bを動かせるかが分かれ目です。 以下の表では候補の現在の中古価格と、R1 14Bの推定速度を示します。

モデルVRAM GB帯域幅 GB/sINT8 TOPS消費電力 WeBayGB 単価DeepSeek R1 Distill Qwen 14B の速度 t/s
Radeon RX 7900 XTX24960123355¥156,17325 件の出品¥6,50850
GeForce RTX 5070 Ti16896352300¥179,59917 件の出品¥11,22665
GeForce RTX 408016717390320¥187,25137 件の出品¥11,70452
GeForce RTX 309024936285350¥253,78183 件の出品¥10,57468
GeForce RTX 4090241,008661450¥499,75342 件の出品¥20,82373
GeForce RTX 5090321,792838575¥1,013,87412 件の出品¥31,684123
GeForce RTX 5090 D V2241,34459457595

6,000 CNY帯:RX 7900 XTX

この価格帯でXianyuから安定して買える24GBカードはRX 7900 XTXです。中央値はRTX 3090より2,000 CNY以上低く、32Bの4-bitは推定約24 tokens/sで動き、実用になります。llama.cpp / Ollama / LM Studioだけを使うなら7900 XTXがこの帯の正解です。vLLMを使いたい、またはROCmに触れたくないなら予算を足して3090にしてください。同価格帯のArc Pro B60も24GBですが、帯域幅456 GB/sは7900 XTXの半分しかなく、勧めません。

8,000 CNY帯:RTX 3090。16GBの新型カードは買わない

8,000 CNYはRTX 3090の中古価格中央値にちょうど当たります。同価格帯のRTX 5070 TiRTX 5080はいずれも16GBで、32B蒸留版を動かせません。14Bでの速度優位も大きくありません(14Bの4-bitは3090で約68 tokens/s、5070 Tiで約65 tokens/s)。DeepSeekではアーキテクチャの新しさよりVRAM容量が重要です。

20,000 CNY帯:RTX 4090またはRTX 5090。買うのは速度

RTX 4090の中古価格中央値は23,000 CNY、RTX 5090は40,000 CNY近くです。どちらも32Bの4-bitを1枚で動かせます。5090の32GBは8GBの余裕をもたらし、32Bを32Kコンテキストで動かせ、速度は約61 tokens/sで3090のほぼ2倍です。この予算があり蒸留版だけを動かすなら、3090を2枚(合計約16,000 CNY)買うほうを勧めます。48GBのVRAMで70B蒸留版とLlama 3.3 70Bを動かせます。マルチGPU入門を参照してください。

フルモデルのDeepSeekは家庭で動かせるか?

動かせますが割に合いません。V4 Flashではエキスパートオフロードのために160GB以上のメモリが必要で、推定10〜12 tokens/sです。モデル全体をVRAMに載せる選択肢はMac Studio M3 Ultra 512GBだけです。 デバイス別の推定速度は以下です。

モデルDeepSeek V4 FlashDeepSeek R1 Distill Qwen 32B
GeForce RTX 409012*35
GeForce RTX 509012*61
RTX PRO 6000 Blackwell12*61
Mac Studio M4 Max 128GB11*15
Mac Studio M3 Ultra 512GB4723
DGX Spark 128GB10*10

4-bit、コンテキスト 8K、単一ストリームでの推定デコード速度。* 付きは MoE モデルのエキスパート重みをシステム RAM(70 GB/s と仮定)に置いて動かした場合です。

アスタリスク付きはエキスパートオフロードです。GPUにはアテンション層、共有エキスパート、KVキャッシュ(約7 GB)だけを置き、各tokenで活性化するエキスパート重みをシステムメモリから読みます。速度はメモリ帯域幅で約12 tokens/sに頭打ちとなり、RTX PRO 6000に替えても速くなりません。Mac Studio M3 Ultra 512GBはV4 Flashの4-bit全体をユニファイドメモリに載せ、推定47 tokens/sですが、マシン本体は140,000 CNYです。V4 Proの4-bit重み850 GBには家庭向けの解決策がありません。

結論として、フルモデルのV4を使いたいならAPIのほうが安価です。ローカル導入にかかる費用を参照してください。GPUを買う理由は蒸留版と他のオープンモデルです。

Ollamaとllama.cppの起動方法

Ollamaは一行のコマンド、llama.cppではGGUFファイルを指定します。フルモデルでは--n-cpu-moeを付けてエキスパートをメモリに置きます。

Ollama(蒸留版):

ollama run deepseek-r1:14b
ollama run deepseek-r1:32b

llama.cpp(14B、unsloth / bartowskiのQ4_K_M):

llama-server -hf bartowski/DeepSeek-R1-Distill-Qwen-14B-GGUF:Q4_K_M -c 16384 -ngl 99

llama.cpp(V4 Flashのエキスパートオフロード。160GB以上のメモリが必要):

llama-server -hf unsloth/DeepSeek-V4-Flash-0731-GGUF:Q4_K_M -c 8192 -ngl 99 --n-cpu-moe 43

--n-cpu-moe 43は43層のエキスパートをすべてCPUメモリに置く意味です。VRAMに余裕がある場合は数字を小さくし、より多くの層をGPUに残します。

よくある誤解

最も多い二つの誤りは、蒸留版をフルモデルと取り違えることと、VRAMだけを見て帯域幅を見ないことです。

  • Ollamaのdeepseek-r1:70bはLlama 3.3 70Bの蒸留版です。フルモデルとの差は、32B蒸留版との差よりはるかに大きいです。
  • VRAMに収まるかは「動くか」だけを決め、速度は帯域幅が決めます。Mac Studio M4 Max 128GBは32Bの4-bitを載せられますが、546 GB/sの帯域幅では約15 tokens/sで、3090の半分です。
  • 中古3090のリスクはマイニング由来とVRAMのはんだ不良です。購入前に出品者へmemtest_vulkanまたはOCCTのVRAMテストを30分完走させるよう求めてください。中古3090と新型5070 Tiも参照してください。
  • 8-bitのために追加費用を払わないでください。蒸留版の4-bitと8-bitの評価差は1%以内で、節約したVRAMはより大きいモデルまたは長いコンテキストに使えます。

よくある質問

DeepSeekをローカルで動かす最低VRAMはどれくらいですか?

R1 Qwen3 8B蒸留版は4-bit、8Kコンテキストで約7 GBなので8GBカードで動きます。14Bは約11 GBで12GB以上、32Bは約21 GBで24GBカードが必要です。

RTX 4090でフルモデルのDeepSeekを動かせますか?

モデル全体をVRAMに載せることはできません。V4 Flashの4-bit重みは155 GBで、24GBの4090ではアテンション層をVRAM、エキスパート重みをシステムメモリに置く(llama.cppの--n-cpu-moe)しかありません。160GB以上のメモリが必要で、推定速度は約12 tokens/sです。

Ollamaのdeepseek-r1:14bはフルモデルですか?

いいえ。Ollamaのdeepseek-r1:7b / 8b / 14b / 32b / 70bはすべて、R1のデータで蒸留されたQwenまたはLlamaモデルです。フルモデルは671Bの一つのサイズだけです。

DeepSeek用に24GBカードを買うなら、3090と4090の差は?

どちらも32B蒸留版の4-bitを動かせます。帯域幅からの推定では3090は約32 tokens/s、4090は約35 tokens/sで、差は1割未満ですが中古価格差は2倍以上です。DeepSeek専用なら3090を選びます。

このガイドに出てくる GPU

このガイドに出てくるモデル