本地部署 Llama 需要什麼顯示卡?各版本記憶體需求一覽
Llama 目前有 4 個能本地部署的版本,最小的 Llama 3.2 3B 在 Q4 量化下需要 4GB 記憶體,最大的 Llama 4 Scout 17B 16E 需要 10GB。最便宜能跑起來的裝置是 Tesla V100 16GB,約 NT$20,739。
Llama 各版本的記憶體需求
AmazonJP
| 版本 | 發布日期 | 上下文 | |||
|---|---|---|---|---|---|
| Llama 3.2 3B稠密 | 3.2B | 2024年9月18日 | 128K | 4 | Tesla V100 16GBNT$20,739 · 16 GB |
| Llama 3.1 8B稠密 | 8B | 2024年7月18日 | 128K | 7 | Tesla V100 16GBNT$20,739 · 16 GB |
| Llama 3.3 70B稠密 | 70.6B | 2024年11月26日 | 128K | 43 | Ryzen AI Max+ 395 128GBNT$123,134 · 128 GB |
| Llama 4 Scout 17B 16EMoE | 108.6B(啟用 17B) | 2025年4月2日 | 10M | 10另需 55 GB 記憶體 | Tesla V100 16GBNT$20,739 · 16 GB · 專家卸載 |
最低記憶體 = Q4_K_M 權重 + 8K 上下文 KV cache + 1GB 執行開銷,向上取整;最便宜能跑的裝置依目前價格基準的中位價升序,取第一台裝得下的。
關於 Llama
Llama 由 Meta AI 發布,授權為 Llama 3.2 Community License / Llama 3.1 Community License / Llama 3.3 Community License / Llama 4 Community License。本頁收錄 4 個版本,參數量介於 3.2B 與 108.6B,結構參數與量化大小依據 Hugging Face 等來源核驗後更新。
廠商Meta AI
授權Llama 3.2 Community License / Llama 3.1 Community License / Llama 3.3 Community License / Llama 4 Community License
Hugging Face 組織meta-llama