家庭でDeepSeekを動かすなら、まず二つを区別してください。R1蒸留版は8B〜70Bの高密度な小型モデルで、コンシューマーGPU 1枚で動きます。フルモデル(V3.2、V4 Flash、V4 Pro)は数百B〜1.6TのMoEで、重みは数百GBから始まります。個人ではメモリオフロードか512GBのMac Studioでようやく動かせる程度です。2026年9月5日時点での推奨は、中古価格6,000中国人民元(CNY)の予算ならRX 7900 XTXで14B〜32B、8,000 CNY帯ならRTX 3090です。24GBは32B蒸留版のしきい値です。20,000 CNY帯でRTX 4090またはRTX 5090を選んでも、得られるのは主に速度であり、より大きいモデルではありません。フルモデルのために個人がGPUを買うことは勧めません。中国の中古市場にある固定価格はCNYを基準とし、表はページで表示される通貨に従います。
DeepSeekをローカルで動かすにはどのGPUが必要か?モデルと予算別の構成(2026年9月)
简体中文版からの翻訳 · 原文を読む
本文とFAQの数値は2026年9月5日時点です。表には最新の公開済み価格を使用し、収集日は機種ごとに異なる場合があります。

現在ローカルで動かせるDeepSeekのバージョンは?
コンシューマーGPU 1枚に載るのはR1蒸留版だけで、フルモデルはすべて284B以上のMoEです。 対応は次のとおりです。
| バージョン | 構造 | 総パラメータ / 活性化 | ローカルでの実現性 |
|---|---|---|---|
| R1 Qwen3 8B | 高密度(Qwen3蒸留) | 8.2B | 8GBカードで可 |
| R1 Distill Qwen 14B | 高密度(Qwen2.5蒸留) | 14.8B | 12GBから、16GBなら余裕あり |
| R1 Distill Qwen 32B | 高密度(Qwen2.5蒸留) | 32.8B | 24GBカードが下限 |
| V3.2 | MoE | 671B / 37B | 4-bitで約375 GB、公式GGUFなし |
| V4 Flash | MoE | 284B / 13B | 4-bit重み155 GB、メモリオフロードが必要 |
| V4 Pro | MoE | 1.6T / 49B | 4-bit重み850 GB、家庭用では非現実的 |
蒸留版における「DeepSeek」の部分は学習データで、ベースはQwenまたはLlamaです。これは欠点ではありません。14B蒸留版は推論問題で同サイズの元のQwenより明らかに優れます。ただしAPIのV4と混同しないでください。

各バージョンに4-bitと8-bitで必要なVRAMは?
VRAM要件 = 重み + KVキャッシュ + 約1 GBの実行オーバーヘッドです。8Kコンテキストでは14Bの4-bitが約11 GB、32Bの4-bitが約21 GB必要です。 下表はモデルライブラリからリアルタイム計算します。MoE版にはエキスパートをオフロードした後の「VRAM + システムメモリ」も表示します。
| モデル | 4-bit | 8-bit | 動かせる最安のカード | ||
|---|---|---|---|---|---|
| 8K | 32K | 8K | 32K | ||
| DeepSeek R1 Qwen3 8B8.2B | 7 GB | 11 GB | 11 GB | 14 GB | |
| DeepSeek R1 Distill Qwen 14B14.8B | 11 GB | 16 GB | 18 GB | 23 GB | |
| DeepSeek R1 Distill Qwen 32B32.8B | 22 GB | 28 GB | 37 GB | 43 GB | |
| DeepSeek V4 Flash284B · A13B | 160 GBオフロード:VRAM 7 GB + RAM 155 GB | 162 GBオフロード:VRAM 9 GB + RAM 155 GB | 297 GBオフロード:VRAM 10 GB + RAM 288 GB | 299 GBオフロード:VRAM 12 GB + RAM 288 GB | |
| DeepSeek V4 Pro1,600B · A49B | 894 GBオフロード:VRAM 17 GB + RAM 879 GB | 897 GBオフロード:VRAM 20 GB + RAM 879 GB | 1,661 GBオフロード:VRAM 29 GB + RAM 1,634 GB | 1,664 GBオフロード:VRAM 32 GB + RAM 1,634 GB | |
要点は以下です。
- 14Bでコンテキストを8Kから32Kに上げると、要件は約11 GBから15 GBへ増えます。16GBカードならちょうどよく、12GBカードは8Kしか使えません。
- 32Bの4-bitは8Kで約21 GBです。24GBカードに収まりますが余裕はほとんどなく、32Kコンテキストでは27 GBになり32GBカードが必要です。
- 蒸留版で8-bitを選ぶ意味はあまりありません。14Bの8-bitには18 GBが必要で、同じVRAMで32Bの4-bitを動かすほうが能力は一段上です。
6,000、8,000、20,000 CNYの予算ではどのGPUを選ぶか?
三つの予算帯の答えはRX 7900 XTX、RTX 3090、RTX 4090 / RTX 5090です。いずれも24GBから始まり、32Bを動かせるかが分かれ目です。 以下の表では候補の現在の中古価格と、R1 14Bの推定速度を示します。
| モデル | VRAM GB | 帯域幅 GB/s | INT8 TOPS | 消費電力 W | eBay | GB 単価 | DeepSeek R1 Distill Qwen 14B の速度 t/s |
|---|---|---|---|---|---|---|---|
| 24 | 960 | 123 | 355 | ¥156,17325 件の出品 | ¥6,508 | 50 | |
| 16 | 896 | 352 | 300 | ¥179,59917 件の出品 | ¥11,226 | 65 | |
| 16 | 717 | 390 | 320 | ¥187,25137 件の出品 | ¥11,704 | 52 | |
| 24 | 936 | 285 | 350 | ¥253,78183 件の出品 | ¥10,574 | 68 | |
| 24 | 1,008 | 661 | 450 | ¥499,75342 件の出品 | ¥20,823 | 73 | |
| 32 | 1,792 | 838 | 575 | ¥1,013,87412 件の出品 | ¥31,684 | 123 | |
| 24 | 1,344 | 594 | 575 | — | — | 95 |
6,000 CNY帯:RX 7900 XTX
この価格帯でXianyuから安定して買える24GBカードはRX 7900 XTXです。中央値はRTX 3090より2,000 CNY以上低く、32Bの4-bitは推定約24 tokens/sで動き、実用になります。llama.cpp / Ollama / LM Studioだけを使うなら7900 XTXがこの帯の正解です。vLLMを使いたい、またはROCmに触れたくないなら予算を足して3090にしてください。同価格帯のArc Pro B60も24GBですが、帯域幅456 GB/sは7900 XTXの半分しかなく、勧めません。
8,000 CNY帯:RTX 3090。16GBの新型カードは買わない
8,000 CNYはRTX 3090の中古価格中央値にちょうど当たります。同価格帯のRTX 5070 TiとRTX 5080はいずれも16GBで、32B蒸留版を動かせません。14Bでの速度優位も大きくありません(14Bの4-bitは3090で約68 tokens/s、5070 Tiで約65 tokens/s)。DeepSeekではアーキテクチャの新しさよりVRAM容量が重要です。
20,000 CNY帯:RTX 4090またはRTX 5090。買うのは速度
RTX 4090の中古価格中央値は23,000 CNY、RTX 5090は40,000 CNY近くです。どちらも32Bの4-bitを1枚で動かせます。5090の32GBは8GBの余裕をもたらし、32Bを32Kコンテキストで動かせ、速度は約61 tokens/sで3090のほぼ2倍です。この予算があり蒸留版だけを動かすなら、3090を2枚(合計約16,000 CNY)買うほうを勧めます。48GBのVRAMで70B蒸留版とLlama 3.3 70Bを動かせます。マルチGPU入門を参照してください。
フルモデルのDeepSeekは家庭で動かせるか?
動かせますが割に合いません。V4 Flashではエキスパートオフロードのために160GB以上のメモリが必要で、推定10〜12 tokens/sです。モデル全体をVRAMに載せる選択肢はMac Studio M3 Ultra 512GBだけです。 デバイス別の推定速度は以下です。
| モデル | DeepSeek V4 Flash | DeepSeek R1 Distill Qwen 32B |
|---|---|---|
| 12* | 35 | |
| 12* | 61 | |
| 12* | 61 | |
| Mac Studio M4 Max 128GB | 11* | 15 |
| Mac Studio M3 Ultra 512GB | 47 | 23 |
| 10* | 10 |
4-bit、コンテキスト 8K、単一ストリームでの推定デコード速度。* 付きは MoE モデルのエキスパート重みをシステム RAM(70 GB/s と仮定)に置いて動かした場合です。
アスタリスク付きはエキスパートオフロードです。GPUにはアテンション層、共有エキスパート、KVキャッシュ(約7 GB)だけを置き、各tokenで活性化するエキスパート重みをシステムメモリから読みます。速度はメモリ帯域幅で約12 tokens/sに頭打ちとなり、RTX PRO 6000に替えても速くなりません。Mac Studio M3 Ultra 512GBはV4 Flashの4-bit全体をユニファイドメモリに載せ、推定47 tokens/sですが、マシン本体は140,000 CNYです。V4 Proの4-bit重み850 GBには家庭向けの解決策がありません。
結論として、フルモデルのV4を使いたいならAPIのほうが安価です。ローカル導入にかかる費用を参照してください。GPUを買う理由は蒸留版と他のオープンモデルです。
Ollamaとllama.cppの起動方法
Ollamaは一行のコマンド、llama.cppではGGUFファイルを指定します。フルモデルでは--n-cpu-moeを付けてエキスパートをメモリに置きます。
Ollama(蒸留版):
ollama run deepseek-r1:14b
ollama run deepseek-r1:32b
llama.cpp(14B、unsloth / bartowskiのQ4_K_M):
llama-server -hf bartowski/DeepSeek-R1-Distill-Qwen-14B-GGUF:Q4_K_M -c 16384 -ngl 99
llama.cpp(V4 Flashのエキスパートオフロード。160GB以上のメモリが必要):
llama-server -hf unsloth/DeepSeek-V4-Flash-0731-GGUF:Q4_K_M -c 8192 -ngl 99 --n-cpu-moe 43
--n-cpu-moe 43は43層のエキスパートをすべてCPUメモリに置く意味です。VRAMに余裕がある場合は数字を小さくし、より多くの層をGPUに残します。
よくある誤解
最も多い二つの誤りは、蒸留版をフルモデルと取り違えることと、VRAMだけを見て帯域幅を見ないことです。
- Ollamaの
deepseek-r1:70bはLlama 3.3 70Bの蒸留版です。フルモデルとの差は、32B蒸留版との差よりはるかに大きいです。 - VRAMに収まるかは「動くか」だけを決め、速度は帯域幅が決めます。Mac Studio M4 Max 128GBは32Bの4-bitを載せられますが、546 GB/sの帯域幅では約15 tokens/sで、3090の半分です。
- 中古3090のリスクはマイニング由来とVRAMのはんだ不良です。購入前に出品者へ
memtest_vulkanまたはOCCTのVRAMテストを30分完走させるよう求めてください。中古3090と新型5070 Tiも参照してください。 - 8-bitのために追加費用を払わないでください。蒸留版の4-bitと8-bitの評価差は1%以内で、節約したVRAMはより大きいモデルまたは長いコンテキストに使えます。
よくある質問
DeepSeekをローカルで動かす最低VRAMはどれくらいですか?
R1 Qwen3 8B蒸留版は4-bit、8Kコンテキストで約7 GBなので8GBカードで動きます。14Bは約11 GBで12GB以上、32Bは約21 GBで24GBカードが必要です。
RTX 4090でフルモデルのDeepSeekを動かせますか?
モデル全体をVRAMに載せることはできません。V4 Flashの4-bit重みは155 GBで、24GBの4090ではアテンション層をVRAM、エキスパート重みをシステムメモリに置く(llama.cppの--n-cpu-moe)しかありません。160GB以上のメモリが必要で、推定速度は約12 tokens/sです。
Ollamaのdeepseek-r1:14bはフルモデルですか?
いいえ。Ollamaのdeepseek-r1:7b / 8b / 14b / 32b / 70bはすべて、R1のデータで蒸留されたQwenまたはLlamaモデルです。フルモデルは671Bの一つのサイズだけです。
DeepSeek用に24GBカードを買うなら、3090と4090の差は?
どちらも32B蒸留版の4-bitを動かせます。帯域幅からの推定では3090は約32 tokens/s、4090は約35 tokens/sで、差は1割未満ですが中古価格差は2倍以上です。DeepSeek専用なら3090を選びます。