16GB VRAMで動かせる大規模モデル:収まるモデル、量子化、速度(2026)

简体中文版からの翻訳 · 原文を読む

16GB VRAMは2026年で最も一般的な中級構成で、RTX 5070 TiRTX 5080RTX 4080RX 9070 XTはいずれもこの容量です。上限は明確で、14B Denseモデルの4-bitを32Kコンテキスト、または24B Denseモデルの4-bitを8Kコンテキストで動かせます。 さらに上はMoEでエキスパートをオフロードするか、GPUを増やします。2026年9月5日時点では、コーディングにはgpt-oss 20B、汎用対話と多言語にはGemma 4 12B、長文と推論にはDeepSeek R1 Distill Qwen 14Bを推奨します。最も買う価値のある16GBカードはRTX 5070 Tiで、予算が厳しければ中古RTX 4080です。固定の価格額は中国中古市場の人民元(CNY)基準であり、以下の表はページ表示通貨に従います。

イメージ図:側板を外した小型ケースに2スロットGPUが収まっている
イメージ図 · 側板を外した小型ケースに2スロットGPUが収まっている

16GB VRAMの上限はどこ?

収まる条件は、重み + KV cache + 実行時オーバーヘッド1 GB ≤ 16 GB、すなわち重みとキャッシュが15 GB以下です。 内訳は次のとおりです。

  • 重み ≈ パラメーター数 × 1パラメーターあたりのバイト数 × 1.05。4-bit(Q4_K_M)は1パラメーターあたり0.57バイトで、14Bモデルは約8 GBです。8-bitでは1.06バイト、14Bで約15 GBとなり余裕がありません。
  • KV cache = 2 × 層数 × KVヘッド数 × ヘッド次元 × コンテキスト × 2バイト。14B Denseモデル(48層、KVヘッド8、128次元)は8Kコンテキストごとに約1.5 GBです。
  • 実行時オーバーヘッドは約1 GBで、推論フレームワークのCUDAバッファと表示出力です。

したがって14B 4-bitは8Kで約11 GB、32Kで約15 GBです。24B 4-bitは8Kですでに15.6 GBとなり、より長いコンテキストは開けません。係数はすべてデータ手法ページで公開しています。

16GBに収まるモデルは?

モデルライブラリの2025年以降の版では、16GB単体GPUの4-bitに収まるのは14B以下のDenseモデルと、エキスパートをオフロードした30B級MoEです。 以下はリアルタイム計算で、✓は全体をVRAMに置くこと、「オフロード」はMoEのエキスパートをメモリに置くことを示します。

モデル4-bit8-bit
8K32K8K32K
Gemma 4 E4B8B7 GB9 GB10 GB12 GB
DeepSeek R1 Qwen3 8B8.2B7 GB11 GB11 GB14 GB
Qwen3 8B8.2B7 GB11 GB11 GB14 GB
Ministral 3 8B8.9B8 GB11 GB12 GB15 GB
Qwen3.5 9B9.7B8 GB11 GB12 GB15 GB
Gemma 4 12B12B11 GB20 GB17 GB26 GB
Ministral 3 14B14B11 GB14 GB17 GB21 GB
DeepSeek R1 Distill Qwen 14B14.8B11 GB16 GB18 GB23 GB
gpt-oss 20B20.9B · A3.6B14 GB15 GBオフロードオフロード:VRAM 4 GB + RAM 21 GBオフロードオフロード:VRAM 5 GB + RAM 21 GB
gpt-oss Safeguard 20B20.9B · A3.6B14 GB15 GBオフロードオフロード:VRAM 4 GB + RAM 21 GBオフロードオフロード:VRAM 5 GB + RAM 21 GB
Mistral Small 3.2 24B24B16 GB20 GB28 GB31 GB
Gemma 4 26B A4B25.8B · A4Bオフロードオフロード:VRAM 6 GB + RAM 13 GBオフロードオフロード:VRAM 11 GB + RAM 13 GBオフロードオフロード:VRAM 7 GB + RAM 25 GBオフロードオフロード:VRAM 13 GB + RAM 25 GB
GLM 4.7 Flash30B · A3Bオフロードオフロード:VRAM 4 GB + RAM 17 GBオフロードオフロード:VRAM 5 GB + RAM 17 GBオフロードオフロード:VRAM 4 GB + RAM 30 GBオフロードオフロード:VRAM 5 GB + RAM 30 GB
Qwen3.6 35B A3B36B · A3Bオフロードオフロード:VRAM 4 GB + RAM 19 GBオフロードオフロード:VRAM 6 GB + RAM 19 GBオフロードオフロード:VRAM 5 GB + RAM 36 GBオフロードオフロード:VRAM 7 GB + RAM 36 GB
Kimi Linear 48B A3B49.1B · A3Bオフロードオフロード:VRAM 3 GB + RAM 27 GBオフロードオフロード:VRAM 4 GB + RAM 27 GBオフロードオフロード:VRAM 4 GB + RAM 50 GBオフロードオフロード:VRAM 4 GB + RAM 50 GB

✓ は重み + KV キャッシュ + 実行時オーバーヘッドが 1 枚の 16 GB に収まることを示します。「オフロード」は MoE モデルのエキスパート重みをシステム RAM に置けば動くこと、— はそのモデルが対応しないコンテキスト長です。

  • Mistral Small 3.2 24Bで✓なのは4-bit / 8Kの1マスだけです。16GBでは限界構成で、システムに残るVRAMは1 GB未満となり、デスクトップ環境では不足しやすくなります。
  • gpt-oss 20BはMoEで、ネイティブMXFP4重みは約12 GBです。全体をVRAMに置いても32Kコンテキストが使え、このクラスで最も扱いやすい「大きい」モデルです。
  • Qwen3.6 35B A3BGemma 4 26B A4Bはエキスパートをオフロードします。VRAMにはAttention層とKV cacheだけを置き、エキスパート重みはメモリへ置くのでVRAM要件は4〜6 GBに下がります。代償は速度がメモリ帯域幅水準まで落ちることです。

コーディング、文章作成、多言語には何を選ぶ?

コーディングにはgpt-oss 20B、文章作成と多言語にはGemma 4 12B、推論連鎖が必要ならDeepSeek R1 Distill Qwen 14Bを選びます。 理由は次のとおりです。

  • gpt-oss 20B:ネイティブ4-bit、Apache-2.0で、ツール呼び出しとコード補完が20B級で最も安定しています。16GBでも32Kコンテキストを開いてファイル全体を置けます。弱点は中国語の文章作成が硬いことです。
  • Gemma 4 12B:12B Denseで4-bitは約7 GB、32Kコンテキストでも約11 GBです。140言語の翻訳とリライト品質はこのサイズで最良で、ライセンスはApache-2.0です。
  • DeepSeek R1 Distill Qwen 14B:数学と論理問題では思考連鎖が効きますが、出力が長く遅いため日常対話の既定には勧めません。
  • 16GBでMistral Small 3.2 24Bは勧めません。Gemma 4 12Bより能力が大きく上がるわけではないのに、VRAMを使い切ります。

推定速度(4-bit、8Kコンテキスト):

モデルGemma 4 12Bgpt-oss 20BDeepSeek R1 Distill Qwen 14BQwen3.6 35B A3B
GeForce RTX 5070 Ti711326554*
GeForce RTX 4080581185252*
GeForce RTX 5080761366954*
Radeon RX 9070 XT37913448*
Radeon RX 7800 XT36903348*

4-bit、コンテキスト 8K、単一ストリームでの推定デコード速度。* 付きは MoE モデルのエキスパート重みをシステム RAM(70 GB/s と仮定)に置いて動かした場合です。

イメージ図:中級GPU、NVMe SSD、開いたノートが木の机に置かれている
イメージ図:中級GPU、NVMe SSD、開いたノートが木の机に置かれている

買う価値のある16GB GPUは?

RTX 5070 Tiは16GBの中で帯域幅とエコシステムのバランスが最良です。中古RTX 4080は4割安く4分の1遅く、RX 9070 XTはLinuxユーザー向けです。 現在の中古価格とVRAM単価:

モデルVRAM GB帯域幅 GB/sINT8 TOPS消費電力 WeBayGB 単価Gemma 4 12B の速度 t/s
Tesla V100 16GB16900250¥44,97840 件の出品¥2,81171
Radeon RX 7800 XT1662475263¥87,76929 件の出品¥5,48636
Radeon RX 9070 XT16640389304¥117,13019 件の出品¥7,32137
GeForce RTX 5070 Ti16896352300¥179,59917 件の出品¥11,22671
GeForce RTX 408016717390320¥187,25137 件の出品¥11,70458
GeForce RTX 508016960450360¥265,49417 件の出品¥16,59376
  • RTX 5070 Ti:GDDR7、896 GB/s。5080は帯域幅が7%高いだけで価格差が大きく、モデル実行には見合いません。
  • RTX 4080:中古の中央値は5070 Tiより明確に低く、717 GB/s、AdaアーキテクチャでFP8対応です。中古で最も無難な1枚です。
  • RX 9070 XT:VRAM単価は最安ですが、640 GB/sの帯域幅とROCm効率により実速度は5070 Tiの半分強です。AMD GPUの現状を参照してください。
  • Tesla V100 16GB:900 GB/sのHBM2は魅力的に見えますが、BF16なし、INT8 Tensor Coreなし、PCIe 3.0、パッシブ冷却のため、2026年には選びません。

収まらないときは?

順番は、まずコンテキストを減らし、次に3-bitへ下げ、MoEはオフロードし、最後に24GBカードへ替えます。

  1. コンテキストを減らす:32Kから16Kへ下げるとすぐ3 GB節約でき、多くの作業に32Kは不要です。
  2. 量子化を下げる:Q3_K_XLはQ4_K_Mより14%節約でき、24Bモデルを限界状態から実用へ移せます。2-bitまで下げるとDenseモデルの品質が明らかに落ちるため避けます。
  3. CPU offloadllama.cppの-nglで一部レイヤーをCPUに置きます。レイヤーを10%逃がすごとに速度はおよそ半減し、ときどき大型モデルを動かす用途に限られます。
  4. 24GBへ替える:中古RTX 3090は約8千人民元で5070 Tiより安く、32B 4-bitを動かせます。16GBユーザーの標準的なアップグレードで、3090対5070 Tiを参照してください。

よくある質問

16GB VRAMで32Bモデルは動く?

Denseな32Bは動きません。4-bit重みだけで18 GB必要です。動かせるのはQwen3.6 35B A3Bのような30B級MoEで、エキスパート重みをシステムメモリに置けばVRAMは約4 GB、20GB超のメモリが必要で、速度は約20 tokens/sです。

16GBで14Bモデルはどれだけ長いコンテキストを使える?

4-bitで約32Kです。14BのKV cacheは8Kコンテキストあたり約1.5 GBなので、32Kでは6 GBです。重み8 GBとオーバーヘッド1 GBを足してちょうど15 GBです。

RTX 5070 TiとRTX 4080はモデル実行にどちらが良い?

どちらも16GBなので、動かせるモデルは完全に同じです。5070 Tiの896 GB/sは4080の717 GB/sより4分の1高く、速度も約4分の1速いです。4080の利点は中古価格だけです。

16GBカードから8-bit量子化のために24GBへ買い替える価値はある?

ありません。評価における8-bitの4-bitに対する品質向上は1%未満です。24GBの価値は32B 4-bitと70B 2-bitを動かせる点で、能力クラスの向上です。

このガイドに出てくる GPU

このガイドに出てくるモデル