收錄顯卡56價格追蹤27 天近 24h 價格資料34,228 筆24h 降價最多GeForce RTX 4060 Ti 16GB-16.4%24h 漲價最多Radeon RX 7800 XT+19.1%更新於
NT$ TWD
繁體中文

RTX PRO 5500 價格與中古行情:能部署哪些大型語言模型?

RTX PRO 5500 有 84GB GDDR7 ECC 顯存,頻寬 1,398 GB/s。暫無價資料。4-bit 量化、8K 上下文下最大能裝約 143B 參數的稠密模型,預估 12 tokens/s。

RTX PRO 5500 價格走勢

價格更新於 —

資料不足,暫時無法產生走勢

累積足夠的有效報價後,將顯示中位價走勢。

購買連結可能含聯盟標記,不影響你支付的價格。

RTX PRO 5500 完整規格

  • 顯存84 GB · GDDR7 ECC
  • 頻寬1,398 GB/s
位寬
448-bit
架構
Blackwell (GB202)
核心
21,760
張量核心
680
生態
CUDA
介面
PCIe 5.0 x16
NVLink
不支援
功耗
600 W
槽位
2
長度
282 mm
類型
工作站
發布日期
2026年9月14日

RTX PRO 5500 能跑哪些模型?

單張 RTX PRO 5500 能跑哪些 50B 參數以內的模型,只列 2026 年起發布的版本

模型大小能否執行速度 t/s最大上下文
Gemma 4 E4B8B5 GB能跑174.2128K
Qwen3.5 9B9.7B5.7 GB能跑154.4256K
Gemma 4 12B12B7.1 GB能跑126.1256K
Gemma 4 26B A4B25.2B(啟用 3.8B)16.9 GB能跑150.2256K
Qwen3.6 27B27.8B16.8 GB能跑57.5256K
Qwen3.8 27B27.8B16.5 GB能跑58.4256K
GLM 4.7 Flash30B(啟用 3B)18.3 GB能跑166.9198K
Gemma 4 31B30.7B18.3 GB能跑51.7256K
Qwen3.6 35B A3B36B(啟用 3B)22.1 GB能跑170.2256K

能跑權重、KV 快取和執行開銷都裝得進顯存,速度按顯存頻寬估算。

需卸載到記憶體僅 MoE 模型:專家權重放進記憶體,速度按記憶體頻寬 70 GB/s 估算。

跑不了這一檔量化下單卡放不下,借記憶體也不行。

雙卡、四卡、八卡 RTX PRO 5500 能跑哪些大型語言模型?

2026 年起發布的 50B 以上模型,按 vLLM 張量並行、32K 上下文要幾張卡才裝得下

模型大小需要幾張總價總顯示記憶體速度 t/s總功耗
Qwen3.8 Flash Next176B(啟用 6B)111.3 GB2 張暫無168 GB123.81,200 W
DeepSeek V4 Flash284B(啟用 13B)155.1 GB2 張暫無168 GB90.91,200 W
Hy3295B(啟用 21B)182.2 GB4 張暫無336 GB462,400 W
GLM 5.3 Flash320B(啟用 18B)199.7 GB4 張暫無336 GB66.22,400 W
GLM 5.3744B(啟用 40B)467.3 GB8 張暫無672 GB33.54,800 W
Hy4 preview770B(啟用 49B)467.3 GB8 張暫無672 GB29.14,800 W
DeepSeek V4.1 Flash763B(啟用 8 / 16B)510.3 GB8 張暫無672 GB57.74,800 W
Kimi K2.7 Code1,000B(啟用 32B)583.7 GB8 張暫無672 GB434,800 W

張數取 1 / 2 / 4 / 8 張,每張按 90% 顯存計;速度按單卡頻寬估算,總價只算顯示卡。標「Engram 放記憶體」的另需約 203 GB 系統記憶體。不支援 NVLink,卡間走 PCIe。能否實際執行還要看 vLLM 是否支援。

其他市場價格

eBay · 美國
暫無
暫無掛單
去查看
閒魚 · 中國大陸
暫無
暫無掛單
去查看

購買連結可能含聯盟標記,不影響你支付的價格。

常見問題

RTX PRO 5500 能跑多大的模型?

單張 RTX PRO 5500 有 84GB GDDR7 ECC 顯示記憶體,在 4-bit 量化、8K 上下文下最大能裝約 143B 參數的稠密模型,8-bit 下約 77B。

RTX PRO 5500 能跑 70B 模型嗎?

能。在 4-bit 量化、8K 上下文下,70B 稠密模型約需 43GB,RTX PRO 5500 的 84GB 裝得下。

RTX PRO 5500 適合跑哪些大型語言模型?

2026 年發布的模型中,4-bit 下能完整放進顯示記憶體的最大稠密模型是 Gemma 4 31B,預估 51.7 tokens/s。MoE 模型中 Qwen3.6 35B A3B 最快,約 170.2 tokens/s。完整列表見上方「能跑哪些模型」表格。

RTX PRO 5500 跑大型語言模型每秒多少 token?

按顯示記憶體頻寬估算,4-bit、8K 上下文下:8B 稠密模型約 167.5 tokens/s、14B 稠密模型約 103.4 tokens/s、32B 稠密模型約 48.9 tokens/s、70B 稠密模型約 23.3 tokens/s。MoE 模型每個 token 只讀取啟用參數,會快很多。實測通常在估算值的 70%–100%。

雙卡 RTX PRO 5500 能跑哪些大型語言模型?

兩張 RTX PRO 5500(共 168GB)按 vLLM 張量並行、4-bit、32K 上下文,能裝下 Qwen3.8 Flash Next、DeepSeek V4 Flash。要在 4-bit、32K 上下文下跑 Kimi K2.7 Code,需要 8 張。

RTX PRO 5500 多少錢?

暫無價資料,價格接入後會顯示在這裡。