収録 GPU45価格追跡8 日2026年9月3日 から直近 24h の価格データ6,955 件24h 最大の値下げ24h 最大の値上げデータ更新

Kimi K3 をローカルに導入するには?

Kimi K3 は総パラメータ 2,800B、1 トークンあたり 104B が有効になる MoE モデルです。Q4 で全量を VRAM に置くには 1,562GB 必要ですが、エキスパートをシステム RAM に置けば VRAM 33GB + RAM 1,531GB で動きます。収録している単体カードには収まらず、複数枚構成か Mac Studio のユニファイドメモリが必要です。オフロード構成で最も安く動かせるのは Ryzen AI Max+ 395 128GB で、推定 1 tokens/s です。

Kimi K3 のバージョン情報

発売日2026年6月13日
Hugging Face リポジトリmoonshotai/Kimi-K3
リビジョン
ライセンスKimi K3 License
アーキテクチャMoE
GGUF リポジトリunsloth/Kimi-K3-GGUF
Ollama タグ
Q4 最小VRAM1,562 GB · Q4_K_M · 8K
エキスパートオフロードVRAM 33 GB + RAM 1,531 GB
パラメータ数2,800B
MoE104B
レイヤー数93
隠れ層次元7,168
KV ヘッド数96
ヘッド次元192
最大コンテキスト1M
提供元Moonshot AI

Kimi K3 のローカル実行に必要なVRAMは?

MoE:総パラメータ 2,800B すべてをメモリに常駐させる必要があり、速度は 1 トークンあたり有効な 104B で決まります。

量子化重みサイズGB8K 時の合計GB32K 時の合計GB128K 時の合計GB
1-bit648.9GGUF658.4659661.5
2-bit861.3GGUF1,041.71,042.31,044.8
3-bit1,341.7推定1,342.91,343.51,346
4-bit1,508.7GGUF1,561.91,562.61,565.1
5-bit1,889.3推定1,890.51,891.11,893.7
8-bit1,561.2GGUF2,903.62,904.22,906.7
FP165,476.2推定5,477.45,4785,480.6

合計 = 重み + KV キャッシュ(FP16)+ 実行時オーバーヘッド 1GB。GGUF と付いた重みはリポジトリの実測ファイルサイズ、「推定」はパラメータあたりのバイト数からの概算です。このモデルの上限 1M を超えるコンテキストは「—」と表示します。各段はリポジトリにあるそのビット幅のファイルを使い、unsloth 動的量子化を優先するため、ファイル名はモデルごとに異なります。

Kimi K3 を動かせるGPUは?

AmazonJP

収録している単体カードでは Kimi K3 は収まりません。Q4_K_M・8K コンテキストで最低 1,562GB のVRAMが必要です。

複数枚構成でも合計で最低 1,562GB のVRAMが必要です。

収録しているユニファイドメモリ機にも収まりません。

Kimi K3 のCPU・GPU併用推論におすすめのGPU

AmazonJP

エキスパート重みはシステム RAM に置き(1,531 GB 以上が必要)、VRAM にはアテンション層・共有エキスパート・KV キャッシュのみで Q4 なら最低 33 GB。速度は RAM 帯域幅(70 GB/s で推定)に縛られ、全量 VRAM 構成よりかなり遅くなります。

デバイスVRAMGB価格必要 RAMGB推定 t/s
Ryzen AI Max+ 395 128GB128¥600,9711,5311.2
DGX Spark 128GB128¥1,262,9981,5311.4
A100 40GB PCIe401,5311.7
CMP 170HX 40GB401,5311.7
GeForce RTX 4090 48GB481,5311.6
Radeon PRO W7900481,5311.5
RTX PRO 5000 Blackwell 48GB481,5311.6
CMP 170HX 64GB641,5311.7
Instinct MI210641,5311.6
RTX PRO 5000 Blackwell 72GB721,5311.6
RTX PRO 6000D841,5311.7
RTX PRO 6000 Blackwell961,5311.7
Mac Studio M4 Max 128GB1281,5311.5
Mac Studio M5 Max 128GB1281,5311.5
MacBook Pro M4 Max 128GB1281,5311.5
MacBook Pro M5 Max 128GB1281,5311.5
Mac Studio M3 Ultra 512GB5121,5311.6

Ollama / llama.cpp / vLLM で Kimi K3 をローカルに導入する

Ollama

Ollama ライブラリに公式タグはまだありません。

llama.cpp

llama.cpp は Hugging Face から GGUF を直接取得します。-c はコンテキスト長です。

llama-server -hf unsloth/Kimi-K3-GGUF:Q4_K_M -c 8192
vLLM

vLLM は元の精度の重みを読み込むため、GGUF よりはるかに多くのメモリ(通常は複数枚)が必要です。

vllm serve moonshotai/Kimi-K3

ファイル名はその週のモデルライブラリ取得時点のものです。定義はデータ方法を参照してください。 データ方法

よくある質問

Kimi K3 にはどれくらいのVRAMが必要ですか?

Q4_K_M・8K コンテキストでは Kimi K3 に約 1,562GB のVRAMが必要で、1,876GB あれば余裕があります。

Kimi K3 を動かせる最も安いGPUは?

収録している単体カードでは Kimi K3 は動かせず、複数枚構成か Mac Studio のユニファイドメモリが必要です。

Kimi K3 は Ollama で動かせますか?

まだできません。Ollama ライブラリに公式タグがないため、llama.cpp で GGUF を読み込んでください。