16GB VRAMは2026年で最も一般的な中級構成で、RTX 5070 Ti、RTX 5080、RTX 4080、RX 9070 XTはいずれもこの容量です。上限は明確で、14B Denseモデルの4-bitを32Kコンテキスト、または24B Denseモデルの4-bitを8Kコンテキストで動かせます。 さらに上はMoEでエキスパートをオフロードするか、GPUを増やします。2026年9月5日時点では、コーディングにはgpt-oss 20B、汎用対話と多言語にはGemma 4 12B、長文と推論にはDeepSeek R1 Distill Qwen 14Bを推奨します。最も買う価値のある16GBカードはRTX 5070 Tiで、予算が厳しければ中古RTX 4080です。固定の価格額は中国中古市場の人民元(CNY)基準であり、以下の表はページ表示通貨に従います。
16GB VRAMで動かせる大規模モデル:収まるモデル、量子化、速度(2026)
简体中文版からの翻訳 · 原文を読む
本文とFAQの数値は2026年9月5日時点です。表には最新の公開済み価格を使用し、収集日は機種ごとに異なる場合があります。

16GB VRAMの上限はどこ?
収まる条件は、重み + KV cache + 実行時オーバーヘッド1 GB ≤ 16 GB、すなわち重みとキャッシュが15 GB以下です。 内訳は次のとおりです。
- 重み ≈ パラメーター数 × 1パラメーターあたりのバイト数 × 1.05。4-bit(Q4_K_M)は1パラメーターあたり0.57バイトで、14Bモデルは約8 GBです。8-bitでは1.06バイト、14Bで約15 GBとなり余裕がありません。
- KV cache = 2 × 層数 × KVヘッド数 × ヘッド次元 × コンテキスト × 2バイト。14B Denseモデル(48層、KVヘッド8、128次元)は8Kコンテキストごとに約1.5 GBです。
- 実行時オーバーヘッドは約1 GBで、推論フレームワークのCUDAバッファと表示出力です。
したがって14B 4-bitは8Kで約11 GB、32Kで約15 GBです。24B 4-bitは8Kですでに15.6 GBとなり、より長いコンテキストは開けません。係数はすべてデータ手法ページで公開しています。
16GBに収まるモデルは?
モデルライブラリの2025年以降の版では、16GB単体GPUの4-bitに収まるのは14B以下のDenseモデルと、エキスパートをオフロードした30B級MoEです。 以下はリアルタイム計算で、✓は全体をVRAMに置くこと、「オフロード」はMoEのエキスパートをメモリに置くことを示します。
| モデル | 4-bit | 8-bit | ||
|---|---|---|---|---|
| 8K | 32K | 8K | 32K | |
| Gemma 4 E4B8B | ✓7 GB | ✓9 GB | ✓10 GB | ✓12 GB |
| DeepSeek R1 Qwen3 8B8.2B | ✓7 GB | ✓11 GB | ✓11 GB | ✓14 GB |
| Qwen3 8B8.2B | ✓7 GB | ✓11 GB | ✓11 GB | ✓14 GB |
| Ministral 3 8B8.9B | ✓8 GB | ✓11 GB | ✓12 GB | ✓15 GB |
| Qwen3.5 9B9.7B | ✓8 GB | ✓11 GB | ✓12 GB | ✓15 GB |
| Gemma 4 12B12B | ✓11 GB | ✗20 GB | ✗17 GB | ✗26 GB |
| Ministral 3 14B14B | ✓11 GB | ✓14 GB | ✗17 GB | ✗21 GB |
| DeepSeek R1 Distill Qwen 14B14.8B | ✓11 GB | ✓16 GB | ✗18 GB | ✗23 GB |
| gpt-oss 20B20.9B · A3.6B | ✓14 GB | ✓15 GB | オフロードオフロード:VRAM 4 GB + RAM 21 GB | オフロードオフロード:VRAM 5 GB + RAM 21 GB |
| gpt-oss Safeguard 20B20.9B · A3.6B | ✓14 GB | ✓15 GB | オフロードオフロード:VRAM 4 GB + RAM 21 GB | オフロードオフロード:VRAM 5 GB + RAM 21 GB |
| Mistral Small 3.2 24B24B | ✓16 GB | ✗20 GB | ✗28 GB | ✗31 GB |
| Gemma 4 26B A4B25.8B · A4B | オフロードオフロード:VRAM 6 GB + RAM 13 GB | オフロードオフロード:VRAM 11 GB + RAM 13 GB | オフロードオフロード:VRAM 7 GB + RAM 25 GB | オフロードオフロード:VRAM 13 GB + RAM 25 GB |
| GLM 4.7 Flash30B · A3B | オフロードオフロード:VRAM 4 GB + RAM 17 GB | オフロードオフロード:VRAM 5 GB + RAM 17 GB | オフロードオフロード:VRAM 4 GB + RAM 30 GB | オフロードオフロード:VRAM 5 GB + RAM 30 GB |
| Qwen3.6 35B A3B36B · A3B | オフロードオフロード:VRAM 4 GB + RAM 19 GB | オフロードオフロード:VRAM 6 GB + RAM 19 GB | オフロードオフロード:VRAM 5 GB + RAM 36 GB | オフロードオフロード:VRAM 7 GB + RAM 36 GB |
| Kimi Linear 48B A3B49.1B · A3B | オフロードオフロード:VRAM 3 GB + RAM 27 GB | オフロードオフロード:VRAM 4 GB + RAM 27 GB | オフロードオフロード:VRAM 4 GB + RAM 50 GB | オフロードオフロード:VRAM 4 GB + RAM 50 GB |
✓ は重み + KV キャッシュ + 実行時オーバーヘッドが 1 枚の 16 GB に収まることを示します。「オフロード」は MoE モデルのエキスパート重みをシステム RAM に置けば動くこと、— はそのモデルが対応しないコンテキスト長です。
- Mistral Small 3.2 24Bで✓なのは4-bit / 8Kの1マスだけです。16GBでは限界構成で、システムに残るVRAMは1 GB未満となり、デスクトップ環境では不足しやすくなります。
- gpt-oss 20BはMoEで、ネイティブMXFP4重みは約12 GBです。全体をVRAMに置いても32Kコンテキストが使え、このクラスで最も扱いやすい「大きい」モデルです。
- Qwen3.6 35B A3BとGemma 4 26B A4Bはエキスパートをオフロードします。VRAMにはAttention層とKV cacheだけを置き、エキスパート重みはメモリへ置くのでVRAM要件は4〜6 GBに下がります。代償は速度がメモリ帯域幅水準まで落ちることです。
コーディング、文章作成、多言語には何を選ぶ?
コーディングにはgpt-oss 20B、文章作成と多言語にはGemma 4 12B、推論連鎖が必要ならDeepSeek R1 Distill Qwen 14Bを選びます。 理由は次のとおりです。
- gpt-oss 20B:ネイティブ4-bit、Apache-2.0で、ツール呼び出しとコード補完が20B級で最も安定しています。16GBでも32Kコンテキストを開いてファイル全体を置けます。弱点は中国語の文章作成が硬いことです。
- Gemma 4 12B:12B Denseで4-bitは約7 GB、32Kコンテキストでも約11 GBです。140言語の翻訳とリライト品質はこのサイズで最良で、ライセンスはApache-2.0です。
- DeepSeek R1 Distill Qwen 14B:数学と論理問題では思考連鎖が効きますが、出力が長く遅いため日常対話の既定には勧めません。
- 16GBでMistral Small 3.2 24Bは勧めません。Gemma 4 12Bより能力が大きく上がるわけではないのに、VRAMを使い切ります。
推定速度(4-bit、8Kコンテキスト):
| モデル | Gemma 4 12B | gpt-oss 20B | DeepSeek R1 Distill Qwen 14B | Qwen3.6 35B A3B |
|---|---|---|---|---|
| 71 | 132 | 65 | 54* | |
| 58 | 118 | 52 | 52* | |
| 76 | 136 | 69 | 54* | |
| 37 | 91 | 34 | 48* | |
| 36 | 90 | 33 | 48* |
4-bit、コンテキスト 8K、単一ストリームでの推定デコード速度。* 付きは MoE モデルのエキスパート重みをシステム RAM(70 GB/s と仮定)に置いて動かした場合です。

買う価値のある16GB GPUは?
RTX 5070 Tiは16GBの中で帯域幅とエコシステムのバランスが最良です。中古RTX 4080は4割安く4分の1遅く、RX 9070 XTはLinuxユーザー向けです。 現在の中古価格とVRAM単価:
| モデル | VRAM GB | 帯域幅 GB/s | INT8 TOPS | 消費電力 W | eBay | GB 単価 | Gemma 4 12B の速度 t/s |
|---|---|---|---|---|---|---|---|
| 16 | 900 | — | 250 | ¥44,97840 件の出品 | ¥2,811 | 71 | |
| 16 | 624 | 75 | 263 | ¥87,76929 件の出品 | ¥5,486 | 36 | |
| 16 | 640 | 389 | 304 | ¥117,13019 件の出品 | ¥7,321 | 37 | |
| 16 | 896 | 352 | 300 | ¥179,59917 件の出品 | ¥11,226 | 71 | |
| 16 | 717 | 390 | 320 | ¥187,25137 件の出品 | ¥11,704 | 58 | |
| 16 | 960 | 450 | 360 | ¥265,49417 件の出品 | ¥16,593 | 76 |
- RTX 5070 Ti:GDDR7、896 GB/s。5080は帯域幅が7%高いだけで価格差が大きく、モデル実行には見合いません。
- RTX 4080:中古の中央値は5070 Tiより明確に低く、717 GB/s、AdaアーキテクチャでFP8対応です。中古で最も無難な1枚です。
- RX 9070 XT:VRAM単価は最安ですが、640 GB/sの帯域幅とROCm効率により実速度は5070 Tiの半分強です。AMD GPUの現状を参照してください。
- Tesla V100 16GB:900 GB/sのHBM2は魅力的に見えますが、BF16なし、INT8 Tensor Coreなし、PCIe 3.0、パッシブ冷却のため、2026年には選びません。
収まらないときは?
順番は、まずコンテキストを減らし、次に3-bitへ下げ、MoEはオフロードし、最後に24GBカードへ替えます。
- コンテキストを減らす:32Kから16Kへ下げるとすぐ3 GB節約でき、多くの作業に32Kは不要です。
- 量子化を下げる:Q3_K_XLはQ4_K_Mより14%節約でき、24Bモデルを限界状態から実用へ移せます。2-bitまで下げるとDenseモデルの品質が明らかに落ちるため避けます。
- CPU offload:llama.cppの
-nglで一部レイヤーをCPUに置きます。レイヤーを10%逃がすごとに速度はおよそ半減し、ときどき大型モデルを動かす用途に限られます。 - 24GBへ替える:中古RTX 3090は約8千人民元で5070 Tiより安く、32B 4-bitを動かせます。16GBユーザーの標準的なアップグレードで、3090対5070 Tiを参照してください。
よくある質問
16GB VRAMで32Bモデルは動く?
Denseな32Bは動きません。4-bit重みだけで18 GB必要です。動かせるのはQwen3.6 35B A3Bのような30B級MoEで、エキスパート重みをシステムメモリに置けばVRAMは約4 GB、20GB超のメモリが必要で、速度は約20 tokens/sです。
16GBで14Bモデルはどれだけ長いコンテキストを使える?
4-bitで約32Kです。14BのKV cacheは8Kコンテキストあたり約1.5 GBなので、32Kでは6 GBです。重み8 GBとオーバーヘッド1 GBを足してちょうど15 GBです。
RTX 5070 TiとRTX 4080はモデル実行にどちらが良い?
どちらも16GBなので、動かせるモデルは完全に同じです。5070 Tiの896 GB/sは4080の717 GB/sより4分の1高く、速度も約4分の1速いです。4080の利点は中古価格だけです。
16GBカードから8-bit量子化のために24GBへ買い替える価値はある?
ありません。評価における8-bitの4-bitに対する品質向上は1%未満です。24GBの価値は32B 4-bitと70B 2-bitを動かせる点で、能力クラスの向上です。