本地部署 GLM 需要什么显卡?各版本显存需求一览
GLM 目前有 5 个能本地部署的版本,最小的 GLM 4.7 Flash 在 Q4 量化下需要 4GB 显存,最大的 GLM 5.3 需要 41GB。最便宜能跑起来的设备是 Tesla V100 16GB,约 ¥2,051。
GLM 各版本的显存需求
eBay
| 版本 | 发布日期 | 上下文 | |||
|---|---|---|---|---|---|
| GLM 4.7 FlashMoE | 30B(激活 3B) | 2026年1月19日 | 198K | 4另需 17 GB 内存 | Tesla V100 16GB¥2,051 · 16 GB · 专家卸载 |
| GLM 4.5 AirMoE | 106B(激活 12B) | 2025年7月20日 | 128K | 7另需 56 GB 内存 | Tesla V100 16GB¥2,051 · 16 GB · 专家卸载 |
| GLM 5.3 FlashMoE | 320B(激活 18B) | 2026年8月25日 | 1M | 30另需 174 GB 内存 | Tesla V100 32GB¥4,842 · 32 GB · 专家卸载 |
| GLM 5.2MoE | 744B(激活 40B) | 2026年6月16日 | 1M | 41另需 406 GB 内存 | Radeon PRO W7900¥23,506 · 48 GB · 专家卸载 |
| GLM 5.3MoE | 744B(激活 40B) | 2026年8月25日 | 1M | 41另需 406 GB 内存 | Radeon PRO W7900¥23,506 · 48 GB · 专家卸载 |
最低显存 = Q4_K_M 权重 + 8K 上下文 KV cache + 1GB 运行开销,向上取整;最便宜能跑的设备按当前价格基准的中位价升序,取第一台装得下的。
关于 GLM
GLM 由 Z.ai / Zhipu AI 发布,许可证为 MIT / GLM-5.3 License。本页收录 5 个版本,参数量从 30B 到 744B,结构参数与量化体积依据 Hugging Face 等来源核验后更新。
厂商Z.ai / Zhipu AI
许可证MIT / GLM-5.3 License
官方主页https://z.ai/
Hugging Face 组织zai-org