収録 GPU41価格追跡3 日2026年9月3日 から直近 24h の価格データ11,753 件24h 最大の値下げ24h 最大の値上げデータ更新 2026年9月5日

Llama をローカルで動かすには?バージョン別の必要VRAM

Llama には現在ローカルで動かせるバージョンが 4 個あります。最小の Llama 3.2 3B は Q4 量子化で 4GB、最大の Llama 4 Scout 17B 16E は 10GB が必要です。動かせる最も安いデバイスは GeForce RTX 2080 Ti ですが、中古価格のデータはまだありません。

Llama 各バージョンの必要VRAM

4 バージョン
バージョン公開日コンテキスト
Llama 3.2 3BDense3.2B2024年9月18日128K4GeForce RTX 2080 Ti · 11 GB1,419,885
Llama 3.1 8BDense8B2024年7月18日128K7GeForce RTX 2080 Ti · 11 GB5,734,979
Llama 3.3 70BDense70.6B2024年11月26日128K43GeForce RTX 4090 48GB (改造) · 48 GB815,592
Llama 4 Scout 17B 16EMoE108.6B(有効 17B)2025年4月2日10M10別途 RAM 55 GBCMP 170HX 64GB (改造) · 64 GB174,923

最小VRAM = Q4_K_M の重み + 8K コンテキストの KV キャッシュ + 実行時オーバーヘッド 1GB(切り上げ)。最安デバイスは現在の価格基準の中古中央値が安い順で最初に収まるものです。

Llama について

Llama は Meta AI が Llama 3.2 Community License / Llama 3.1 Community License / Llama 3.3 Community License / Llama 4 Community License で公開しています。このページでは 3.2B から 108.6B までの 4 バージョンを収録し、構造パラメータと量子化サイズは毎週 Hugging Face から同期しています。

提供元Meta AI
ライセンスLlama 3.2 Community License / Llama 3.1 Community License / Llama 3.3 Community License / Llama 4 Community License
公式サイトhttps://www.llama.com/
Hugging Face の組織meta-llama