gpt-oss をローカルで動かすには?バージョン別の必要VRAM
gpt-oss には現在ローカルで動かせるバージョンが 3 個あります。最小の gpt-oss 20B は Q4 量子化で 4GB、最大の gpt-oss 120B は 4GB が必要です。動かせる最も安いデバイスは GeForce RTX 4080 ですが、中古価格のデータはまだありません。
gpt-oss 各バージョンの必要VRAM
3 バージョン| バージョン | 公開日 | コンテキスト | ||||
|---|---|---|---|---|---|---|
| gpt-oss 20BMoE | 20.9B(有効 3.6B) | 2025年8月4日 | 128K | 4別途 RAM 12 GB | GeForce RTX 4080— · 16 GB | 6,448,506 |
| gpt-oss Safeguard 20BMoE | 20.9B(有効 3.6B) | 2025年9月18日 | 128K | 4別途 RAM 12 GB | GeForce RTX 4080— · 16 GB | 78,266 |
| gpt-oss 120BMoE | 116.8B(有効 5.1B) | 2025年8月4日 | 128K | 4別途 RAM 65 GB | RTX PRO 5000 Blackwell 72GB— · 72 GB | 5,259,501 |
最小VRAM = Q4_K_M の重み + 8K コンテキストの KV キャッシュ + 実行時オーバーヘッド 1GB(切り上げ)。最安デバイスは現在の価格基準の中古中央値が安い順で最初に収まるものです。
gpt-oss について
gpt-oss は OpenAI が Apache-2.0 で公開しています。このページでは 20.9B から 116.8B までの 3 バージョンを収録し、構造パラメータと量子化サイズは毎週 Hugging Face から同期しています。
提供元OpenAI
ライセンスApache-2.0
Hugging Face の組織openai