Qwen3.8 2.4T A95B のローカル実行に必要なVRAMは?
動かせるデバイスを見るQwen3.8 2.4T A95B は総パラメータ 2,446B、1 トークンあたり 95B が有効になる MoE モデルです。Q4 で全量を VRAM に置くには 1,366GB 必要ですが、エキスパートをシステム RAM に置けば VRAM 30GB + RAM 1,337GB で動きます。収録している単体カードには収まらず、複数枚構成か Mac Studio のユニファイドメモリが必要です。オフロード構成で最も安く動かせるのは Arc Pro B65 で、推定 2 tokens/s です。
Qwen3.8 2.4T A95B のバージョン情報
Qwen3.8 2.4T A95B の量子化・コンテキスト別の必要VRAM
8K 時の合計MoE:総パラメータ 2,446B すべてをメモリに常駐させる必要があり、速度は 1 トークンあたり有効な 95B で決まります。
| 量子化 | 重みサイズGB | 8K 時の合計GB | 32K 時の合計GB | 128K 時の合計GB |
|---|---|---|---|---|
| 1-bit | 564GGUF | 575.8 | 577.9 | 586.6 |
| 2-bit | 730.7GGUF | 910.6 | 912.8 | 921.4 |
| 3-bit | 955.5GGUF | 1,173.8 | 1,175.9 | 1,184.5 |
| 4-bit | 1,310.9GGUF | 1,365.1 | 1,367.3 | 1,375.9 |
| 5-bit | 1,650.4推定 | 1,652.1 | 1,654.3 | 1,662.9 |
| 8-bit | 2,600.2GGUF | 2,537.1 | 2,539.3 | 2,547.9 |
| FP16 | 4,893.2GGUF | 4,785.6 | 4,787.7 | 4,796.3 |
合計 = 重み + KV キャッシュ(FP16)+ 実行時オーバーヘッド 1GB。GGUF と付いた重みはリポジトリの実測ファイルサイズ、「推定」はパラメータあたりのバイト数からの概算です。このモデルの上限 256K を超えるコンテキストは「—」と表示します。各段はリポジトリにあるそのビット幅のファイルを使い、unsloth 動的量子化を優先するため、ファイル名はモデルごとに異なります。
Qwen3.8 2.4T A95B を動かせるGPUは?
Q4_K_M・8K コンテキスト・eBayの中古価格の安い順収録している単体カードでは Qwen3.8 2.4T A95B は収まりません。Q4_K_M・8K コンテキストで最低 1,366GB のVRAMが必要です。
複数枚構成でも合計で最低 1,366GB のVRAMが必要です。
収録しているユニファイドメモリ機にも収まりません。
エキスパートを RAM に置けば Qwen3.8 2.4T A95B を動かせる GPU
エキスパート重みはシステム RAM に置き(1,337 GB 以上が必要)、VRAM にはアテンション層・共有エキスパート・KV キャッシュのみで Q4 なら最低 30 GB。速度は RAM 帯域幅(70 GB/s で推定)に縛られ、全量 VRAM 構成よりかなり遅くなります。
| デバイス | VRAMGB | 中古価格 | 必要 RAMGB | 推定 t/s |
|---|---|---|---|---|
| 32 | — | 1,337 | 1.5 | |
| 32 | — | 1,337 | 1.5 | |
| 32 | — | 1,337 | 1.7 | |
| 32 | — | 1,337 | 1.8 | |
| 32 | — | 1,337 | 1.8 | |
| 32 | — | 1,337 | 1.7 | |
| 32 | — | 1,337 | 1.6 | |
| 32 | — | 1,337 | 1.5 | |
| 32 | — | 1,337 | 1.7 | |
| 32 | — | 1,337 | 1.7 | |
| 40 | — | 1,337 | 1.7 | |
| 40 | — | 1,337 | 1.7 | |
| 48 | — | 1,337 | 1.7 | |
| 48 | — | 1,337 | 1.6 | |
| 48 | — | 1,337 | 1.7 | |
| 64 | — | 1,337 | 1.7 | |
| 64 | — | 1,337 | 1.7 | |
| 72 | — | 1,337 | 1.7 | |
| 84 | — | 1,337 | 1.7 | |
| 96 | — | 1,337 | 1.8 | |
| 128 | — | 1,337 | 1.4 | |
| Mac Studio M4 Max 128GB | 128 | — | 1,337 | 1.6 |
| Mac Studio M5 Max 128GB | 128 | — | 1,337 | 1.6 |
| MacBook Pro M4 Max 128GB | 128 | — | 1,337 | 1.6 |
| MacBook Pro M5 Max 128GB | 128 | — | 1,337 | 1.6 |
| 128 | — | 1,337 | 1.3 | |
| Mac Studio M3 Ultra 512GB | 512 | — | 1,337 | 1.6 |
Ollama / llama.cpp / vLLM で Qwen3.8 2.4T A95B を起動する
Ollama ライブラリに公式タグはまだありません。
llama.cpp は Hugging Face から GGUF を直接取得します。-c はコンテキスト長です。
llama-server -hf unsloth/Qwen3.8-2.4T-A95B-GGUF:Q4_K_M -c 8192
vLLM は元の精度の重みを読み込むため、GGUF よりはるかに多くのメモリ(通常は複数枚)が必要です。
vllm serve Qwen/Qwen3.8-2.4T-A95B
ファイル名はその週のモデルライブラリ取得時点のものです。定義はデータ方法を参照してください。 データ方法
よくある質問
Qwen3.8 2.4T A95B にはどれくらいのVRAMが必要ですか?
Q4_K_M・8K コンテキストでは Qwen3.8 2.4T A95B に約 1,366GB のVRAMが必要で、1,640GB あれば余裕があります。
Qwen3.8 2.4T A95B を動かせる最も安いGPUは?
収録している単体カードでは Qwen3.8 2.4T A95B は動かせず、複数枚構成か Mac Studio のユニファイドメモリが必要です。
Qwen3.8 2.4T A95B は Ollama で動かせますか?
まだできません。Ollama ライブラリに公式タグがないため、llama.cpp で GGUF を読み込んでください。