収録 GPU45価格追跡8 日2026年9月3日 から直近 24h の価格データ6,955 件24h 最大の値下げMac Studio M4 Max 128GB-6.7%24h 最大の値上げGeForce RTX 5070 Ti+21.0%データ更新

Hy3 をローカルに導入するには?

Hy3 は総パラメータ 295B、1 トークンあたり 21B が有効になる MoE モデルです。Q4 で全量を VRAM に置くには 168GB 必要ですが、エキスパートをシステム RAM に置けば VRAM 10GB + RAM 160GB で動きます。現在最も安く動かせるのは Mac Studio M3 Ultra 512GB(で約 ¥2,966,592)で、推定 30 tokens/s です。オフロード構成で最も安く動かせるのは Tesla V100 16GB で、推定 7 tokens/s です。

Hy3 のバージョン情報

発売日2026年7月6日
Hugging Face リポジトリtencent/Hy3
リビジョン
ライセンスApache-2.0
アーキテクチャMoE
GGUF リポジトリbartowski/Hy3-GGUF
Ollama タグ
Q4 最小VRAM168 GB · Q4_K_M · 8K
エキスパートオフロードVRAM 10 GB + RAM 160 GB
パラメータ数295B
MoE21B
レイヤー数80
隠れ層次元4,096
KV ヘッド数8
ヘッド次元128
最大コンテキスト256K
提供元Tencent

Hy3 のローカル実行に必要なVRAMは?

MoE:総パラメータ 295B すべてをメモリに常駐させる必要があり、速度は 1 トークンあたり有効な 21B で決まります。

量子化重みサイズGB8K 時の合計GB32K 時の合計GB128K 時の合計GB
1-bit71.1GGUF72.780.2110.2
2-bit107.2GGUF113.1120.6150.6
3-bit143.1GGUF144.9152.4182.4
4-bit182.2GGUF167.9175.4205.4
5-bit212.8GGUF202.5210240
8-bit317.7GGUF309.3316.8346.8
FP16577推定580.5588618

合計 = 重み + KV キャッシュ(FP16)+ 実行時オーバーヘッド 1GB。GGUF と付いた重みはリポジトリの実測ファイルサイズ、「推定」はパラメータあたりのバイト数からの概算です。このモデルの上限 256K を超えるコンテキストは「—」と表示します。各段はリポジトリにあるそのビット幅のファイルを使い、unsloth 動的量子化を優先するため、ファイル名はモデルごとに異なります。

Hy3 を動かせるGPUは?

Xianyu
デバイスVRAMGB価格推定 t/s推奨コンテキスト
Mac Studio M3 Ultra 512GB512¥2,966,5926 件の出品30128K

判定基準:重み + KV キャッシュ + 実行時オーバーヘッド ≤ 利用可能メモリ、1 枚構成。MoE モデルの「オフロード」はエキスパート重みをシステム RAM に置けば動作することを示し(VRAM にはアテンション層と KV キャッシュのみ)、その速度は RAM 帯域幅 70 GB/s を前提に推定。コンテキスト列は収まる最大段階です。

Hy3 のCPU・GPU併用推論におすすめのGPU

Xianyu

エキスパート重みはシステム RAM に置き(160 GB 以上が必要)、VRAM にはアテンション層・共有エキスパート・KV キャッシュのみで Q4 なら最低 10 GB。速度は RAM 帯域幅(70 GB/s で推定)に縛られ、全量 VRAM 構成よりかなり遅くなります。

デバイスVRAMGB価格必要 RAMGB推定 t/s
Tesla V100 16GB16¥20,0971606.5
GeForce RTX 2080 Ti 22GB22¥59,3781606.3
Instinct MI50 32GB32¥62,2321606.4
Radeon RX 6950 XT16¥68,4901606.1
Radeon RX 7800 XT16¥70,7961606.1
Tesla V100 32GB32¥73,0801606.5
Radeon RX 7900 XT20¥98,1781606.3
GeForce RTX 5060 Ti 16GB16¥107,0621606.1
Arc Pro B6024¥120,4681605.7
Radeon RX 7900 XTX24¥132,4581606.4
Radeon RX 9070 XT16¥139,3091606.1
GeForce RTX 507012¥141,0221606.4
GeForce RTX 408016¥176,9911606.4
GeForce RTX 309024¥184,9841606.6
Arc Pro B7032¥224,9491606
GeForce RTX 5070 Ti16¥226,0681606.5
Radeon AI PRO R970032¥252,3541606.1
CMP 170HX 40GB40¥258,0641606.7
Radeon PRO W780032¥283,1851606.1
GeForce RTX 508016¥284,3271606.6
CMP 170HX 64GB64¥320,8671606.7
RTX PRO 4000 Blackwell24¥357,4071606.4
Instinct MI21064¥422,4941606.6
Radeon PRO W790048¥502,4251606.4
GeForce RTX 409024¥536,6811606.6
GeForce RTX 5090 D V224¥545,8161606.7
RTX PRO 4500 Blackwell32¥590,3501606.5
GeForce RTX 4090 48GB48¥607,4781606.6
A100 40GB PCIe40¥706,8211606.7
Mac Studio M4 Max 128GB128¥735,3681606.1
DGX Spark 128GB128¥742,2191605.7
GeForce RTX 5090 D32¥751,3541606.8
MacBook Pro M4 Max 128GB128¥808,4481606.1
Mac Studio M5 Max 128GB128¥903,2231606.2
GeForce RTX 509032¥1,000,2831606.8
RTX PRO 5000 Blackwell 48GB48¥1,068,7951606.7
MacBook Pro M5 Max 128GB128¥1,251,4951606.2
RTX PRO 5000 Blackwell 72GB72¥1,484,4381606.7
RTX PRO 6000D84¥1,552,9511606.7
RTX PRO 6000 Blackwell96¥2,829,5671606.8
Arc Pro B65321606
GeForce RTX 4080 SUPER 32GB321606.4
Instinct MI100321606.5
Ryzen AI Max+ 395 128GB1281605.2

Ollama / llama.cpp / vLLM で Hy3 をローカルに導入する

Ollama

Ollama ライブラリに公式タグはまだありません。

llama.cpp

llama.cpp は Hugging Face から GGUF を直接取得します。-c はコンテキスト長です。

llama-server -hf bartowski/Hy3-GGUF:Q4_K_M --jinja -c 8192
vLLM

実行前にデプロイガイドで必要な実行環境とハードウェアを確認してください。

# Switch to trtllm backend to work-around mnnvl workspace size issue.
export VLLM_FLASHINFER_ALLREDUCE_BACKEND=trtllm
vllm serve tencent/Hy3 \
  --tensor-parallel-size 8 \
  --speculative-config.method mtp \
  --speculative-config.num_speculative_tokens 2 \
  --tool-call-parser hy_v3 \
  --reasoning-parser hy_v3 \
  --enable-auto-tool-choice \
  --port 8000 \
  --served-model-name hy3

ファイル名はその週のモデルライブラリ取得時点のものです。定義はデータ方法を参照してください。 データ方法

よくある質問

Hy3 にはどれくらいのVRAMが必要ですか?

Q4_K_M・8K コンテキストでは Hy3 に約 168GB のVRAMが必要で、204GB あれば余裕があります。

Hy3 を動かせる最も安いGPUは?

Mac Studio M3 Ultra 512GB です。VRAM 512GB、現在の中央値は約 ¥2,966,592、推定 30 tokens/s。

Hy3 は Ollama で動かせますか?

まだできません。Ollama ライブラリに公式タグがないため、llama.cpp で GGUF を読み込んでください。