Qwen3.8 2.4T A95B をローカルに導入するには?
Qwen3.8 2.4T A95B は総パラメータ 2,446B、1 トークンあたり 95B が有効になる MoE モデルです。Q4 で全量を VRAM に置くには 1,366GB 必要ですが、エキスパートをシステム RAM に置けば VRAM 30GB + RAM 1,337GB で動きます。収録している単体カードには収まらず、複数枚構成か Mac Studio のユニファイドメモリが必要です。オフロード構成で最も安く動かせるのは Tesla V100 32GB で、推定 2 tokens/s です。
Qwen3.8 2.4T A95B のバージョン情報
Qwen3.8 2.4T A95B のローカル実行に必要なVRAMは?
MoE:総パラメータ 2,446B すべてをメモリに常駐させる必要があり、速度は 1 トークンあたり有効な 95B で決まります。
| 量子化 | 重みサイズGB | 8K 時の合計GB | 32K 時の合計GB | 128K 時の合計GB |
|---|---|---|---|---|
| 1-bit | 564GGUF | 575.8 | 577.9 | 586.6 |
| 2-bit | 730.7GGUF | 910.6 | 912.8 | 921.4 |
| 3-bit | 955.5GGUF | 1,173.8 | 1,175.9 | 1,184.5 |
| 4-bit | 1,310.9GGUF | 1,365.1 | 1,367.3 | 1,375.9 |
| 5-bit | 1,650.4推定 | 1,652.1 | 1,654.3 | 1,662.9 |
| 8-bit | 2,600.2GGUF | 2,537.1 | 2,539.3 | 2,547.9 |
| FP16 | 4,893.2GGUF | 4,785.6 | 4,787.7 | 4,796.3 |
合計 = 重み + KV キャッシュ(FP16)+ 実行時オーバーヘッド 1GB。GGUF と付いた重みはリポジトリの実測ファイルサイズ、「推定」はパラメータあたりのバイト数からの概算です。このモデルの上限 256K を超えるコンテキストは「—」と表示します。各段はリポジトリにあるそのビット幅のファイルを使い、unsloth 動的量子化を優先するため、ファイル名はモデルごとに異なります。
Qwen3.8 2.4T A95B を動かせるGPUは?
eBay
収録している単体カードでは Qwen3.8 2.4T A95B は収まりません。Q4_K_M・8K コンテキストで最低 1,366GB のVRAMが必要です。
複数枚構成でも合計で最低 1,366GB のVRAMが必要です。
収録しているユニファイドメモリ機にも収まりません。
Qwen3.8 2.4T A95B のCPU・GPU併用推論におすすめのGPU
eBay
エキスパート重みはシステム RAM に置き(1,337 GB 以上が必要)、VRAM にはアテンション層・共有エキスパート・KV キャッシュのみで Q4 なら最低 30 GB。速度は RAM 帯域幅(70 GB/s で推定)に縛られ、全量 VRAM 構成よりかなり遅くなります。
| デバイス | VRAMGB | 価格 | 必要 RAMGB | 推定 t/s |
|---|---|---|---|---|
| 32 | ¥110,588 | 1,337 | 1.7 | |
| 32 | ¥117,960 | 1,337 | 1.7 | |
| 32 | ¥153,440 | 1,337 | 1.7 | |
| 48 | ¥536,811 | 1,337 | 1.6 | |
| 32 | ¥660,454 | 1,337 | 1.7 | |
| 40 | ¥752,457 | 1,337 | 1.7 | |
| 64 | ¥775,035 | 1,337 | 1.7 | |
| MacBook Pro M4 Max 128GB | 128 | ¥852,293 | 1,337 | 1.6 |
| 32 | ¥998,361 | 1,337 | 1.8 | |
| Mac Studio M4 Max 128GB | 128 | ¥1,005,580 | 1,337 | 1.6 |
| MacBook Pro M5 Max 128GB | 128 | ¥1,113,557 | 1,337 | 1.6 |
| 96 | ¥2,608,794 | 1,337 | 1.8 | |
| Mac Studio M3 Ultra 512GB | 512 | ¥3,379,068 | 1,337 | 1.6 |
| 32 | — | 1,337 | 1.5 | |
| 32 | — | 1,337 | 1.5 | |
| 32 | — | 1,337 | 1.7 | |
| 32 | — | 1,337 | 1.8 | |
| 32 | — | 1,337 | 1.6 | |
| 32 | — | 1,337 | 1.5 | |
| 40 | — | 1,337 | 1.7 | |
| 48 | — | 1,337 | 1.7 | |
| 48 | — | 1,337 | 1.7 | |
| 64 | — | 1,337 | 1.7 | |
| 72 | — | 1,337 | 1.7 | |
| 84 | — | 1,337 | 1.7 | |
| 128 | — | 1,337 | 1.4 | |
| Mac Studio M5 Max 128GB | 128 | — | 1,337 | 1.6 |
| 128 | — | 1,337 | 1.3 |
Ollama / llama.cpp / vLLM で Qwen3.8 2.4T A95B をローカルに導入する
Ollama ライブラリに公式タグはまだありません。
llama.cpp は Hugging Face から GGUF を直接取得します。-c はコンテキスト長です。
llama-server -hf unsloth/Qwen3.8-2.4T-A95B-GGUF:Q4_K_M -c 8192
vLLM は元の精度の重みを読み込むため、GGUF よりはるかに多くのメモリ(通常は複数枚)が必要です。
vllm serve Qwen/Qwen3.8-2.4T-A95B
ファイル名はその週のモデルライブラリ取得時点のものです。定義はデータ方法を参照してください。 データ方法
よくある質問
Qwen3.8 2.4T A95B にはどれくらいのVRAMが必要ですか?
Q4_K_M・8K コンテキストでは Qwen3.8 2.4T A95B に約 1,366GB のVRAMが必要で、1,640GB あれば余裕があります。
Qwen3.8 2.4T A95B を動かせる最も安いGPUは?
収録している単体カードでは Qwen3.8 2.4T A95B は動かせず、複数枚構成か Mac Studio のユニファイドメモリが必要です。
Qwen3.8 2.4T A95B は Ollama で動かせますか?
まだできません。Ollama ライブラリに公式タグがないため、llama.cpp で GGUF を読み込んでください。