Llama をローカルで動かすには?バージョン別の必要VRAM
Llama には現在ローカルで動かせるバージョンが 4 個あります。最小の Llama 3.2 3B は Q4 量子化で 4GB、最大の Llama 4 Scout 17B 16E は 10GB が必要です。動かせる最も安いデバイスは GeForce RTX 2080 Ti ですが、中古価格のデータはまだありません。
Llama 各バージョンの必要VRAM
4 バージョン| バージョン | 公開日 | コンテキスト | ||||
|---|---|---|---|---|---|---|
| Llama 3.2 3BDense | 3.2B | 2024年9月18日 | 128K | 4 | GeForce RTX 2080 Ti— · 11 GB | 1,419,885 |
| Llama 3.1 8BDense | 8B | 2024年7月18日 | 128K | 7 | GeForce RTX 2080 Ti— · 11 GB | 5,734,979 |
| Llama 3.3 70BDense | 70.6B | 2024年11月26日 | 128K | 43 | GeForce RTX 4090 48GB (改造)— · 48 GB | 815,592 |
| Llama 4 Scout 17B 16EMoE | 108.6B(有効 17B) | 2025年4月2日 | 10M | 10別途 RAM 55 GB | CMP 170HX 64GB (改造)— · 64 GB | 174,923 |
最小VRAM = Q4_K_M の重み + 8K コンテキストの KV キャッシュ + 実行時オーバーヘッド 1GB(切り上げ)。最安デバイスは現在の価格基準の中古中央値が安い順で最初に収まるものです。
Llama について
Llama は Meta AI が Llama 3.2 Community License / Llama 3.1 Community License / Llama 3.3 Community License / Llama 4 Community License で公開しています。このページでは 3.2B から 108.6B までの 4 バージョンを収録し、構造パラメータと量子化サイズは毎週 Hugging Face から同期しています。
提供元Meta AI
ライセンスLlama 3.2 Community License / Llama 3.1 Community License / Llama 3.3 Community License / Llama 4 Community License
Hugging Face の組織meta-llama