收錄顯卡45價格追蹤6 天自 2026年9月3日近 24h 價格資料8,961 筆24h 降價最多CMP 170HX 64GB-9.1%24h 漲價最多MacBook Pro M5 Max 128GB+14.2%更新於

Hy4 preview 如何本地部署?

Hy4 preview 是 MoE 模型,總參數 770B,每 token 啟用 49B。Q4 量化整機放顯存需要 431GB;把專家放進系統記憶體後只需 18GB 顯存 + 415GB 記憶體。目前最便宜能跑的顯示卡是 Mac Studio M3 Ultra 512GB,二手約 NT$608,880,預估 15 tokens/s。卸載模式下最便宜能跑的顯示卡是 Tesla V100 32GB,預估 3 tokens/s。

Hy4 preview 版本資訊

發布日期2026年8月28日
Hugging Face 倉庫tencent/Hy4-preview
小版本
授權Apache-2.0
架構MoE
Ollama 標籤
Q4 最低記憶體431 GB · Q4_K_M · 8K
專家卸載18 GB 顯存 + 415 GB 記憶體
參數量770B
MoE49B
層數78
隱藏維度6,144
KV 頭8
頭維度64
上下文上限1M
廠商Tencent

Hy4 preview 本地部署需要多少顯示記憶體?

MoE:總參數 770B 全部要常駐記憶體,速度按每 token 啟用的 49B 計算。

量化權重體積GB8K 總記憶體GB32K 總記憶體GB128K 總記憶體GB
1-bit235.4GGUF182.4184.5192.7
2-bit286.1287.8289.9298.1
3-bit369370.6372.7380.9
4-bit467.3GGUF430.9432.9441.2
5-bit519.6521.2523.3531.5
8-bit798.2799.8801.9810.1
FP161,505.91,507.61,509.71,517.9

總記憶體 = 權重 + KV cache(FP16)+ 1GB 執行開銷。標 GGUF 的權重是倉庫裡的實測檔案體積,標「估」的按每參數位元組估算。超過這個模型 1M 上下文上限的檔位寫「—」。各檔取倉庫裡該位元數的任一檔案,優先 unsloth 動態量化,所以同一檔不同模型對應的檔名可能不同。

什麼顯示卡能跑 Hy4 preview?

Q4_K_M · 8K 上下文 · 依閒魚二手價升序
裝置顯存GB二手價預估 t/s建議上下文
Mac Studio M3 Ultra 512GB512NT$608,8803 筆掛單15128K

判定口徑:權重 + KV cache + 執行開銷 ≤ 可用記憶體,單卡。MoE 模型標「卸載」表示把專家權重放進系統記憶體後能跑(顯存只放注意力層與 KV cache),速度按記憶體頻寬 70 GB/s 估算。上下文欄給的是能裝下的最大檔位。

Hy4 preview 混合推論推薦顯示卡

專家權重放系統記憶體,需要 ≥ 415 GB 記憶體;顯存只放注意力層、共享專家和 KV cache,Q4 下最低 18 GB。速度受記憶體頻寬限制(按 70 GB/s 估算),比整機放顯存慢得多。

裝置顯存GB二手價需記憶體GB預估 t/s
Tesla V100 32GB32NT$14,7654153.4
Radeon RX 7900 XT20NT$19,3544153.2
Arc Pro B6024NT$24,7214152.9
Radeon RX 7900 XTX24NT$27,1864153.3
GeForce RTX 309024NT$37,4944153.4
Arc Pro B7032NT$45,4204153
CMP 170HX 40GB40NT$49,9204153.5
Radeon AI PRO R970032NT$51,5604153.1
Radeon PRO W780032NT$58,1234153.1
CMP 170HX 64GB64NT$60,9354153.5
RTX PRO 4000 Blackwell24NT$74,0594153.3
Instinct MI21064NT$86,7154153.4
GeForce RTX 409024NT$106,8704153.4
Radeon PRO W790048NT$107,3394153.2
GeForce RTX 5090 D V224NT$116,7144153.4
RTX PRO 4500 Blackwell32NT$121,4014153.4
GeForce RTX 4090 48GB48NT$124,6824153.4
A100 40GB PCIe40NT$133,5884153.5
MacBook Pro M4 Max 128GB128NT$154,6814153.1
DGX Spark 128GB128NT$157,9624152.8
GeForce RTX 5090 D32NT$159,1344153.5
Mac Studio M4 Max 128GB128NT$168,7434153.1
Mac Studio M5 Max 128GB128NT$186,7894153.1
GeForce RTX 509032NT$201,5544153.5
RTX PRO 5000 Blackwell 48GB48NT$219,8344153.4
MacBook Pro M5 Max 128GB128NT$257,0984153.1
RTX PRO 5000 Blackwell 72GB72NT$289,6754153.4
RTX PRO 6000D84NT$323,4244153.5
RTX PRO 6000 Blackwell96NT$576,0694153.5
GeForce RTX 2080 Ti 22GB224153.2
Arc Pro B65324153
GeForce RTX 4080 SUPER 32GB324153.3
Instinct MI100324153.3
Instinct MI50 32GB324153.3
Ryzen AI Max+ 395 128GB1284152.6

用 Ollama / llama.cpp / vLLM 本地部署 Hy4 preview

Ollama

Ollama 庫暫無官方標籤。

llama.cpp

執行前請依部署指南準備適配的執行環境與硬體。

./build-cuda/bin/llama-cli -m Hy4-preview-Q4_K_M.gguf -ngl 99 -c 8192 --jinja -st -f prompt.txt
vLLM

執行前請依部署指南準備適配的執行環境與硬體。

docker run --gpus all \
  -p 8000:8000 \
  --ipc=host \
  -v ~/.cache/huggingface:/root/.cache/huggingface \
  vllm/vllm-openai:hy4-preview tencent/Hy4-preview-FP8 \
    --tensor-parallel-size 8 \
    --speculative-config '{"num_speculative_tokens":3,"method":"mtp"}' \
    --attention-backend FLASHMLA_SPARSE \
    --tool-call-parser hy_v4 \
    --reasoning-parser hy_v4 \
    --enable-auto-tool-choice \
    --port 8000 \
    --served-model-name hy4-preview

量化檔名以模型庫當週抓取為準,口徑見資料方法。 資料方法

常見問題

Hy4 preview 需要多少記憶體?

在 Q4_K_M 量化、8K 上下文下 Hy4 preview 約需 431GB 記憶體,留到 520GB 更穩。

哪張顯示卡最便宜能跑 Hy4 preview?

Mac Studio M3 Ultra 512GB,512GB 記憶體,目前二手中位價約 NT$608,880,預估 15 tokens/s。

Hy4 preview 能用 Ollama 跑嗎?

暫時不行,Ollama 庫還沒有它的官方標籤;可以用 llama.cpp 載入 GGUF。