Strataは、一般的なゲーミングPCでQwen3.8-Flash-Next(125BパラメータのMoEモデル)を動かすためのオープンソース推論エンジンです。 このモデルを丸ごとVRAMに載せると2-bit版でも約75GB必要ですが、Strataなら12GBのGPUと64GBのメモリで動き、作者のRTX 5070では53〜94 tokens/sを実測しています。同じくエキスパートをメモリに置く方式で比べると、速度はllama.cppの2倍以上です。10月4日のAmazon.co.jp価格で、RTX 5070と64GBメモリの構成は約39.6万円。Ryzen AI Max+ 395 128GBより約25.5万円安く、速度は2倍以上です。データは2026年10月4日時点、Strata v0.1.39のものです。
Strataとは?VRAM 12GBのGPUでQwen3.8-Flash-Nextを動かす方法(2026)
简体中文版からの翻訳 · 原文を読む
本文とFAQの数値は2026年10月4日時点です。表には最新の公開済み価格を使用し、収集日は機種ごとに異なる場合があります。

Strataとは?
Qwen3.8-Flash-Next専用に書かれた推論エンジンで、2026年9月にGitHubでMITライセンスのもと公開されました。
llama.cppやOllamaのような汎用ツールとの違いは、Qwen3.8-Flash-NextとそのCoder版、Swift版という派生モデルしか動かさず、処理の各段階をこのモデルの構造に合わせて作り込んでいることです。WindowsとLinuxに対応し、インストールするとWebのチャット画面が使えます。OpenAI互換とAnthropic互換のAPIもあり、Claude Codeのようなコーディングツールにつなげられます。
なぜVRAM 12GBで足りるのか
1トークン生成するたびに毎回使うのは、モデルのごく一部だけだからです。
モデルは1トークン生成するたびに、使うパラメータをすべて読み込みます。十分な速さで読めるのは、PCの中ではVRAMだけです。Qwen3.8-Flash-Nextの48層には、それぞれ2種類の部品があります。
- 共通部分:アテンションやルーターなど。毎トークン必ず使い、モデル全体で3.5GB。
- エキスパート:各層に512個、モデル全体で24,576個、合計34GB。1トークンごとに各層で10個だけを選ぶので、使うのは2%です。
このほかに28.8GBの参照テーブルがあり、1トークンごとに十数行を引くだけです。これが51Bパラメータあるため、当サイトのモデルデータベースでは総パラメータを176Bとしています。

66GBのモデルでも、1トークンで読むのは約4.2GBだけで、そのうち3.5GBが共通部分です。 そこでStrataは、共通部分と最もよく使う約4,500個のエキスパートだけをGPUに置きます。エキスパートはすべてメモリに置き、参照テーブルはストレージに置きます。どの行を引くかは前もって計算できるので、速度は落ちません。モデルが小さくなったわけではなく、大部分をVRAMからメモリへ移しただけなので、64GBのメモリが必要です。
Strataとllama.cppの違い
モデル全体をVRAMに載せる場合と比べると、Strataは必要なVRAMを約75GBから12GBへと8割以上減らします。llama.cppでエキスパートをメモリに置く場合と比べると、どちらも必要なVRAMは少なく、違いは速度です。同じマシンで、Strataはllama.cppの2倍以上速く動きます。

モデル全体をVRAMに載せるのに必要な量は、当サイトのモデルデータベースがリアルタイムに計算しています。
Xianyu
| モデル | 2-bit | 4-bit | 動かせる最安のカード | ||
|---|---|---|---|---|---|
| 8K コンテキスト | 32K コンテキスト | 8K コンテキスト | 32K コンテキスト | ||
| Qwen3.8 Flash Next176B · A6B | 75 GBオフロード:VRAM 4 GB + RAM 73 GB | 76 GBオフロード:VRAM 4 GB + RAM 73 GB | 105 GBオフロード:VRAM 4 GB + RAM 103 GB | 106 GBオフロード:VRAM 5 GB + RAM 103 GB | |
Strataが速い理由は3つあります。
その1:よく使うエキスパートを選んでGPUに置く
llama.cppは層単位で分けます。12GBのGPUから共通部分を引くと約6GBが残り、1層分のエキスパートは約0.7GBなので、置けるのは8層ほど、48層の6分の1です。Strataはすべての層から最もよく使う約4,500個のエキスパートを選んで同じ6GBに置き、会話しながら入れ替えます。実測では、1トークンで使うエキスパートの72%がGPU上にありました。CPUがメモリから読む量は、層単位で分ける場合の約3分の1です。
その2:GPUとCPUで同時に計算する

llama.cppでは、CPUがエキスパートを計算している間、GPUは待っています。Strataは各層で選ばれた10個のエキスパートを分担し、GPUが手元の約7個を、CPUが同時にメモリ上で残りの約3個を計算します。足りないエキスパートをGPUへ転送しないのは、PCIe 4.0 x16が約26 GB/sしかなく、CPUがメモリを直接読む速度(41〜52 GB/s)より遅いからです。
その3:先に予測してまとめて検証し、1回で複数トークンを出す

モデルには「見習い」役の1層(MTP予測層)が付いていて、先に最大3トークン先まで予測し、本体のモデルが1回の処理でまとめて検証して、当たったものを残します。1回の処理でいちばん重いのは3.5GBの共通部分を読むことで、何か所を検証しても読むのは1回だけです。実測では、この手法で速度が47〜57 tokens/sから82〜92 tokens/sに上がり、出力は予測なしの場合と1文字も違いません。
Strataのデメリットは?
- 精度が少し下がる:2〜3 bitの圧縮版を使います。Q2_0が最速、IQ3_Sが元のモデルに最も近い版です。仕組みは量子化モデルとは何か?を参照してください。
- このモデルしか動かない:ほかのモデルにはllama.cppやOllamaが必要です。
- 同時に使えるのは1人だけ:一度に1つのリクエストしか処理しないので、チームの共用サーバーには向きません。
- Coder版はコード以外が弱い:ユーザーの報告では英語以外の回答が崩れやすいので、普段使いにはQ2_0、IQ2_XS、IQ3_Sを選んでください。
Qwen3.8-Flash-Nextが動くGPU
NVIDIAはRTX 20シリーズ以降、AMDは主要なRX 7000・9000シリーズで、VRAMは12GB以上。メモリは64GB必要です。
- NVIDIA:GeForce RTX 20、30、40、50シリーズで、VRAM 12GB以上。
- AMD:RX 7900 XT/XTX、7800 XT、7700 XT、9060 XT、9070/9070 XT、Radeon AI PRO R9700。RX 6800/6900シリーズはインストールできますが、公式には検証されていません。
- 実験的サポート:Tesla P40、V100、Instinct MI50、Intel Arcにはコミュニティによる実験版があり、別途インストールするか自分でビルドします(説明)。
GPUはVRAM容量で選び、世代の新旧は気にしなくて構いません。 VRAMが1GB増えるごとにエキスパートを約700個多く置け、そのぶんCPUの負担が減ります。

RTX 5060 TiはVRAMが4GB多いものの帯域幅が低く(448対672 GB/s)、速度は5070とほぼ同じです。RTX 3090はVRAMが2倍で帯域幅も高く、推定で5割速くなります。RTX 5090の行はコミュニティの報告によるもので、いずれの数値も当サイトでは再検証していません。
当サイトに収録している対応GPUの現在価格です。
Xianyu
| モデル | VRAM GB | 帯域幅 GB/s | INT8 TOPS | 消費電力 W | Xianyu | GB 単価 |
|---|---|---|---|---|---|---|
| 12 | 360 | 102 | 170 | ¥46,970 | ¥3,914 | |
| Radeon RX 7800 XT | 16 | 624 | 75 | 263 | ¥72,803 | ¥4,550 |
| 16 | 288 | 177 | 165 | ¥84,546 | ¥5,284 | |
| 16 | 448 | 190 | 180 | ¥114,301 | ¥7,145 | |
| Radeon RX 9070 XT | 16 | 640 | 389 | 304 | ¥126,678 | ¥7,918 |
| 12 | 672 | 247 | 250 | ¥147,438 | ¥12,286 | |
| 24 | 936 | 285 | 350 | ¥192,435 | ¥8,019 | |
| 16 | 896 | 352 | 300 | ¥202,416 | ¥12,651 | |
| 24 | 1,008 | 661 | 450 | ¥547,057 | ¥22,794 | |
| 32 | 1,792 | 838 | 575 | ¥1,056,797 | ¥33,025 |
グレーの価格は前回の有効価格を引き継いだもので、最近は新しい出品がありません。
- いちばん安く動かすなら:RTX 3060 12GBで、Amazon.co.jpで約7.9万円です。ただしまだ実測した人がおらず、VRAM帯域幅はRTX 5070の半分強なので、いくらか遅くなります。
- はっきり速くしたいなら:RTX 3090 24GB。選ぶときの注意点は中古RTX 3090か新品RTX 5070 Tiか?を参照してください。
動くバージョンはメモリ容量で決まります(モデルの説明)。

メモリは32GBを2枚にし、16GBを4枚にはしないでください。DDR5は4枚挿すとクロックが下がることが多いからです。GPUに載らないエキスパートはCPUが計算するので、DDR5のプラットフォームとAVX-512対応のCPU(AMD Ryzen 7000・9000シリーズ)のほうが速くなります。DDR4の帯域幅はDDR5の約半分で、動きはしますが公式の数値には届きません。
Strataでいくら節約できるか
PC全体で比べると、RTX 5070と64GBメモリのStrata構成は約39.6万円で、Ryzen AI Max+ 395 128GBより約25.5万円安く、2-bitの速度は2倍以上です。DGX SparkはAmazon.co.jpに出品がなく、速度もStrata構成に及びません。

Amazon.co.jpでは、RTX 3090構成は395とほぼ同じ価格で、推定速度は3倍以上です。395とDGX Sparkの強みは、4-bitやほかのモデルも動かせることです。Qwen3.8-Flash-Nextを動かすためだけなら、Strata構成のほうが割安です。
Strataのインストール方法
GPUドライバーを入れてプロジェクトをダウンロードし、WindowsならSTART-HERE.batをダブルクリック、Linuxなら./setup.shを実行して、あとはEnterを押していくだけです。 Python、推論エンジン、モデルはすべてインストーラーが自動で入れます(インストール説明)。
- ドライバーを入れる:NVIDIAはドライバー580以降。AMDはWindowsなら最新のAdrenalin、Linuxならシステム標準のドライバーを使います。
- ストレージを空ける:モデルは約70〜80GBです。AVX-512対応のCPUでQ2_0を使う場合は、さらに約40GB空けておきます。
- プロジェクトをダウンロードする:GitHubからzipをダウンロードして展開するか、
git cloneします。 - インストーラーを実行する:Windowsは
START-HERE.batをダブルクリック、Linuxは./setup.shを実行します。GPUを認識し、メモリ容量に合わせておすすめのバージョンを提示するので、Enterで受け入れます。 - ダウンロードと起動を待つ:モデルは約70GBで、中断しても再開できます。ダウンロードが終わると自動で起動し、ブラウザーで
http://127.0.0.1:8080を開けばチャットできます。起動時に35〜55GBをメモリへ読み込むため、PCが1〜3分ほど固まることがありますが、正常です。
次回からはSTART-HERE.batをダブルクリックすればそのまま起動し、30〜90秒で読み込みが終わります。ウィンドウを閉じれば停止します。
- ほかのソフトにつなぐ:「OpenAI互換」のサービスを追加し、URLに
http://127.0.0.1:8080/v1を入れます。APIキーとモデル名は何でも構いません。Claude CodeではANTHROPIC_BASE_URL=http://127.0.0.1:8080を設定します。 - 複数GPU:NVIDIAのGPUなら2〜3枚を一緒に使え、NVLinkは不要です(複数GPUの説明、当サイトの複数GPU入門)。
データの出典:モデル構造、Strataの速度と必要なメモリはStrataリポジトリのREADME、ドキュメント、論文、コミュニティの報告に、llama.cppとの比較はissue #28に基づき、いずれも当サイトでは再検証していません。Ryzen AI Max+ 395とDGX Sparkの速度は当サイトの推定です。本文中の価格はAmazon.co.jpの2026年10月4日時点の中央値で、リアルタイムの表は当サイトのデータベースから生成しています。
よくある質問
StrataとOllama、LM Studioの違いは?
OllamaとLM Studioは汎用ツールで、どんなモデルでも動きます。StrataはQwen3.8-Flash-Next専用で、その構造に合わせて作り込まれています。よく使うエキスパートを選んでGPUに置き、GPUとCPUで同時に計算し、モデル自身が持つ予測層で1回の処理から複数のトークンを出します。このモデルを動かすならStrataのほうがずっと速いですが、ほかのモデルには使えません。
メモリが32GBしかなくても使えますか?
動くのはCoder版だけです。エキスパートを半分削った版で、コード以外は弱く、ユーザーの報告では英語以外の回答が崩れやすいとされています。24GBのGPUと組み合わせればQ2_0とIQ2_XSも動きます。48GBなら最小の2つ(Q2_0とIQ2_XS)が動き、64GBあればすべてのバージョンが動きます。
予算が限られているなら、メモリ増設とGPU交換のどちらが先?
メモリが先です。メモリが足りないとモデルが起動しません。GPUは速度に影響するだけです。メモリを64GBにしてからGPUを替えるなら、VRAM容量を基準に選んでください。
2〜3 bitまで圧縮すると、モデルの性能は落ちますか?
多少は落ちます。Q2_0がいちばん速く、IQ3_Sがいちばん元のモデルに近い版です。量子化を担当したISTA-DASLabは、IQ3_Sが公開ベンチマークで元のモデルと同等だとしていますが、当サイトでは再検証していません。品質を重視するなら、64GBのメモリでIQ3_Sを使ってください。
AMDのGPUやMacで使えますか?
AMDのGPUは使えます。RX 7900 XT/XTX、7800 XT、7700 XT、9060 XT、9070/9070 XTとRadeon AI PRO R9700に対応し、VRAMは12GB以上が必要です。Windowsでは今のところ画像を入力できません。Macは対応していません。StrataにはWindows版とLinux版しかありません。



