¥ JPY
日本語

Strataとは?VRAM 12GBのGPUでQwen3.8-Flash-Nextを動かす方法(2026)

简体中文版からの翻訳 · 原文を読む

Strataは、一般的なゲーミングPCでQwen3.8-Flash-Next(125BパラメータのMoEモデル)を動かすためのオープンソース推論エンジンです。 このモデルを丸ごとVRAMに載せると2-bit版でも約75GB必要ですが、Strataなら12GBのGPUと64GBのメモリで動き、作者のRTX 5070では53〜94 tokens/sを実測しています。同じくエキスパートをメモリに置く方式で比べると、速度はllama.cppの2倍以上です。10月4日のAmazon.co.jp価格で、RTX 5070と64GBメモリの構成は約39.6万円。Ryzen AI Max+ 395 128GBより約25.5万円安く、速度は2倍以上です。データは2026年10月4日時点、Strata v0.1.39のものです。

模式図:3階建ての断面図。最上階ではグラフィックスカードでできたコンロでシェフが炒め物をし、中階の食料庫には調味料の瓶が並んで副料理長がその場で下ごしらえをし、地下室にはSSDが1本置かれている。VRAM、メモリ、ストレージの役割分担のたとえ
イメージ図 · 3階建ての断面図。最上階ではグラフィックスカードでできたコンロでシェフが炒め物をし、中階の食料庫には調味料の瓶が並んで副料理長がその場で下ごしらえをし、地下室にはSSDが1本置かれている。VRAM、メモリ、ストレージの役割分担のたとえ

Strataとは?

Qwen3.8-Flash-Next専用に書かれた推論エンジンで、2026年9月にGitHubでMITライセンスのもと公開されました。

llama.cppやOllamaのような汎用ツールとの違いは、Qwen3.8-Flash-NextとそのCoder版、Swift版という派生モデルしか動かさず、処理の各段階をこのモデルの構造に合わせて作り込んでいることです。WindowsとLinuxに対応し、インストールするとWebのチャット画面が使えます。OpenAI互換とAnthropic互換のAPIもあり、Claude Codeのようなコーディングツールにつなげられます。

なぜVRAM 12GBで足りるのか

1トークン生成するたびに毎回使うのは、モデルのごく一部だけだからです。

モデルは1トークン生成するたびに、使うパラメータをすべて読み込みます。十分な速さで読めるのは、PCの中ではVRAMだけです。Qwen3.8-Flash-Nextの48層には、それぞれ2種類の部品があります。

  • 共通部分:アテンションやルーターなど。毎トークン必ず使い、モデル全体で3.5GB。
  • エキスパート:各層に512個、モデル全体で24,576個、合計34GB。1トークンごとに各層で10個だけを選ぶので、使うのは2%です。

このほかに28.8GBの参照テーブルがあり、1トークンごとに十数行を引くだけです。これが51Bパラメータあるため、当サイトのモデルデータベースでは総パラメータを176Bとしています。

模式図:上段はモデル全体の66GBと、1トークン生成ごとに読む約4.2GBの比較。下段はStrataの置き方で、GPUの12GBに共通部分3.5GBとよく使う約4,500個のエキスパート、64GBのメモリに全24,576個のエキスパート、SSDに28.8GBの参照テーブルを置く
模式図:上段はモデル全体の66GBと、1トークン生成ごとに読む約4.2GBの比較。下段はStrataの置き方で、GPUの12GBに共通部分3.5GBとよく使う約4,500個のエキスパート、64GBのメモリに全24,576個のエキスパート、SSDに28.8GBの参照テーブルを置く

66GBのモデルでも、1トークンで読むのは約4.2GBだけで、そのうち3.5GBが共通部分です。 そこでStrataは、共通部分と最もよく使う約4,500個のエキスパートだけをGPUに置きます。エキスパートはすべてメモリに置き、参照テーブルはストレージに置きます。どの行を引くかは前もって計算できるので、速度は落ちません。モデルが小さくなったわけではなく、大部分をVRAMからメモリへ移しただけなので、64GBのメモリが必要です。

Strataとllama.cppの違い

モデル全体をVRAMに載せる場合と比べると、Strataは必要なVRAMを約75GBから12GBへと8割以上減らします。llama.cppでエキスパートをメモリに置く場合と比べると、どちらも必要なVRAMは少なく、違いは速度です。同じマシンで、Strataはllama.cppの2倍以上速く動きます。

表:llama.cppで全体をVRAMに載せる、llama.cppでエキスパートをメモリに置く、Strataの3つの動かし方の比較。全体をVRAMに載せると2-bitで約75GB必要で、後の2つは12GBのGPUで動く。同じRTX 5080ワークステーションで、llama.cppのエキスパートオフロードは最高約38 tokens/s、Strataは約85
表:llama.cppで全体をVRAMに載せる、llama.cppでエキスパートをメモリに置く、Strataの3つの動かし方の比較。全体をVRAMに載せると2-bitで約75GB必要で、後の2つは12GBのGPUで動く。同じRTX 5080ワークステーションで、llama.cppのエキスパートオフロードは最高約38 tokens/s、Strataは約85

モデル全体をVRAMに載せるのに必要な量は、当サイトのモデルデータベースがリアルタイムに計算しています。

モデル2-bit4-bit動かせる最安のカード
8K コンテキスト32K コンテキスト8K コンテキスト32K コンテキスト
Qwen3.8 Flash Next176B · A6B75 GBオフロード:VRAM 4 GB + RAM 73 GB76 GBオフロード:VRAM 4 GB + RAM 73 GB105 GBオフロード:VRAM 4 GB + RAM 103 GB106 GBオフロード:VRAM 5 GB + RAM 103 GBTesla V100 16GB¥55,079 · オフロード

Strataが速い理由は3つあります。

その1:よく使うエキスパートを選んでGPUに置く

llama.cppは層単位で分けます。12GBのGPUから共通部分を引くと約6GBが残り、1層分のエキスパートは約0.7GBなので、置けるのは8層ほど、48層の6分の1です。Strataはすべての層から最もよく使う約4,500個のエキスパートを選んで同じ6GBに置き、会話しながら入れ替えます。実測では、1トークンで使うエキスパートの72%がGPU上にありました。CPUがメモリから読む量は、層単位で分ける場合の約3分の1です。

その2:GPUとCPUで同時に計算する

模式図:llama.cppでエキスパートをメモリに置くと、各層でまずGPUが共通部分を計算し、次にCPUがメモリから10個のエキスパートを読んで計算するため、互いに待ちが生じる。Strataでは、GPUが共通部分と手元の7個のエキスパートを計算し、CPUが残りの3個を同時にその場で計算するので、1層の所要時間がずっと短い
模式図:llama.cppでエキスパートをメモリに置くと、各層でまずGPUが共通部分を計算し、次にCPUがメモリから10個のエキスパートを読んで計算するため、互いに待ちが生じる。Strataでは、GPUが共通部分と手元の7個のエキスパートを計算し、CPUが残りの3個を同時にその場で計算するので、1層の所要時間がずっと短い

llama.cppでは、CPUがエキスパートを計算している間、GPUは待っています。Strataは各層で選ばれた10個のエキスパートを分担し、GPUが手元の約7個を、CPUが同時にメモリ上で残りの約3個を計算します。足りないエキスパートをGPUへ転送しないのは、PCIe 4.0 x16が約26 GB/sしかなく、CPUがメモリを直接読む速度(41〜52 GB/s)より遅いからです。

その3:先に予測してまとめて検証し、1回で複数トークンを出す

模式図:通常の方法では48層を3回通ってようやく3トークン。Strataでは1層だけの見習いが先に3トークンを予測し、本体のモデルが1回の処理でまとめて検証する。当たった2つは残し、外れた1つは本体のモデル自身のトークンに置き換えて、1回で3トークンを出す
模式図:通常の方法では48層を3回通ってようやく3トークン。Strataでは1層だけの見習いが先に3トークンを予測し、本体のモデルが1回の処理でまとめて検証する。当たった2つは残し、外れた1つは本体のモデル自身のトークンに置き換えて、1回で3トークンを出す

モデルには「見習い」役の1層(MTP予測層)が付いていて、先に最大3トークン先まで予測し、本体のモデルが1回の処理でまとめて検証して、当たったものを残します。1回の処理でいちばん重いのは3.5GBの共通部分を読むことで、何か所を検証しても読むのは1回だけです。実測では、この手法で速度が47〜57 tokens/sから82〜92 tokens/sに上がり、出力は予測なしの場合と1文字も違いません。

Strataのデメリットは?

  • 精度が少し下がる:2〜3 bitの圧縮版を使います。Q2_0が最速、IQ3_Sが元のモデルに最も近い版です。仕組みは量子化モデルとは何か?を参照してください。
  • このモデルしか動かない:ほかのモデルにはllama.cppやOllamaが必要です。
  • 同時に使えるのは1人だけ:一度に1つのリクエストしか処理しないので、チームの共用サーバーには向きません。
  • Coder版はコード以外が弱い:ユーザーの報告では英語以外の回答が崩れやすいので、普段使いにはQ2_0、IQ2_XS、IQ3_Sを選んでください。

Qwen3.8-Flash-Nextが動くGPU

NVIDIAはRTX 20シリーズ以降、AMDは主要なRX 7000・9000シリーズで、VRAMは12GB以上。メモリは64GB必要です。

  • NVIDIA:GeForce RTX 20、30、40、50シリーズで、VRAM 12GB以上。
  • AMD:RX 7900 XT/XTX、7800 XT、7700 XT、9060 XT、9070/9070 XT、Radeon AI PRO R9700。RX 6800/6900シリーズはインストールできますが、公式には検証されていません。
  • 実験的サポート:Tesla P40、V100、Instinct MI50、Intel Arcにはコミュニティによる実験版があり、別途インストールするか自分でビルドします(説明)。

GPUはVRAM容量で選び、世代の新旧は気にしなくて構いません。 VRAMが1GB増えるごとにエキスパートを約700個多く置け、そのぶんCPUの負担が減ります。

表:RTX 5070 12GBは実測94 tokens/s、RTX 5060 Ti 16GBは推定約87、RTX 3090 24GBは推定約140、RTX 5090 32GBはコミュニティの実測で179
表:RTX 5070 12GBは実測94 tokens/s、RTX 5060 Ti 16GBは推定約87、RTX 3090 24GBは推定約140、RTX 5090 32GBはコミュニティの実測で179

RTX 5060 TiはVRAMが4GB多いものの帯域幅が低く(448対672 GB/s)、速度は5070とほぼ同じです。RTX 3090はVRAMが2倍で帯域幅も高く、推定で5割速くなります。RTX 5090の行はコミュニティの報告によるもので、いずれの数値も当サイトでは再検証していません。

当サイトに収録している対応GPUの現在価格です。

モデルVRAM GB帯域幅 GB/sINT8 TOPS消費電力 WeBayGB 単価
GeForce RTX 3060 12GB12360102170¥70,861¥5,906
Radeon RX 7800 XT1662475263¥94,692¥5,918
GeForce RTX 4060 Ti 16GB16288177165¥108,896¥6,807
GeForce RTX 5060 Ti 16GB16448190180¥130,833¥8,177
GeForce RTX 507012672247250¥136,199¥11,350
Radeon RX 9070 XT16640389304¥149,929¥9,371
GeForce RTX 5070 Ti16896352300¥204,377¥12,774
GeForce RTX 309024936285350¥267,505¥11,147
GeForce RTX 4090241,008661450¥552,371¥23,015
GeForce RTX 5090321,792838575¥1,104,742¥34,523
  • いちばん安く動かすなら:RTX 3060 12GBで、Amazon.co.jpで約7.9万円です。ただしまだ実測した人がおらず、VRAM帯域幅はRTX 5070の半分強なので、いくらか遅くなります。
  • はっきり速くしたいなら:RTX 3090 24GB。選ぶときの注意点は中古RTX 3090か新品RTX 5070 Tiか?を参照してください。

動くバージョンはメモリ容量で決まります(モデルの説明)。

表:メモリ32GBではCoder版だけ、48GBではQ2_0とIQ2_XS、64GBなら全バージョンが動き、96GB以上なら7〜8.5 tokens/sの4-bit実験版も試せる
表:メモリ32GBではCoder版だけ、48GBではQ2_0とIQ2_XS、64GBなら全バージョンが動き、96GB以上なら7〜8.5 tokens/sの4-bit実験版も試せる

メモリは32GBを2枚にし、16GBを4枚にはしないでください。DDR5は4枚挿すとクロックが下がることが多いからです。GPUに載らないエキスパートはCPUが計算するので、DDR5のプラットフォームとAVX-512対応のCPU(AMD Ryzen 7000・9000シリーズ)のほうが速くなります。DDR4の帯域幅はDDR5の約半分で、動きはしますが公式の数値には届きません。

Strataでいくら節約できるか

PC全体で比べると、RTX 5070と64GBメモリのStrata構成は約39.6万円で、Ryzen AI Max+ 395 128GBより約25.5万円安く、2-bitの速度は2倍以上です。DGX SparkはAmazon.co.jpに出品がなく、速度もStrata構成に及びません。

表:Qwen3.8-Flash-Nextを動かす4つの構成の価格と速度。RTX 5070構成は約39.6万円で2-bit 94 tokens/s、RTX 3090構成は約65.6万円で約140、Ryzen AI Max+ 395 128GBは約65.1万円で約40、DGX SparkはAmazon.co.jpに出品がなく約56
表:Qwen3.8-Flash-Nextを動かす4つの構成の価格と速度。RTX 5070構成は約39.6万円で2-bit 94 tokens/s、RTX 3090構成は約65.6万円で約140、Ryzen AI Max+ 395 128GBは約65.1万円で約40、DGX SparkはAmazon.co.jpに出品がなく約56

Amazon.co.jpでは、RTX 3090構成は395とほぼ同じ価格で、推定速度は3倍以上です。395とDGX Sparkの強みは、4-bitやほかのモデルも動かせることです。Qwen3.8-Flash-Nextを動かすためだけなら、Strata構成のほうが割安です。

Strataのインストール方法

GPUドライバーを入れてプロジェクトをダウンロードし、WindowsならSTART-HERE.batをダブルクリック、Linuxなら./setup.shを実行して、あとはEnterを押していくだけです。 Python、推論エンジン、モデルはすべてインストーラーが自動で入れます(インストール説明)。

  1. ドライバーを入れる:NVIDIAはドライバー580以降。AMDはWindowsなら最新のAdrenalin、Linuxならシステム標準のドライバーを使います。
  2. ストレージを空ける:モデルは約70〜80GBです。AVX-512対応のCPUでQ2_0を使う場合は、さらに約40GB空けておきます。
  3. プロジェクトをダウンロードする:GitHubからzipをダウンロードして展開するか、git cloneします。
  4. インストーラーを実行する:WindowsはSTART-HERE.batをダブルクリック、Linuxは./setup.shを実行します。GPUを認識し、メモリ容量に合わせておすすめのバージョンを提示するので、Enterで受け入れます。
  5. ダウンロードと起動を待つ:モデルは約70GBで、中断しても再開できます。ダウンロードが終わると自動で起動し、ブラウザーでhttp://127.0.0.1:8080を開けばチャットできます。起動時に35〜55GBをメモリへ読み込むため、PCが1〜3分ほど固まることがありますが、正常です。

次回からはSTART-HERE.batをダブルクリックすればそのまま起動し、30〜90秒で読み込みが終わります。ウィンドウを閉じれば停止します。

  • ほかのソフトにつなぐ:「OpenAI互換」のサービスを追加し、URLにhttp://127.0.0.1:8080/v1を入れます。APIキーとモデル名は何でも構いません。Claude CodeではANTHROPIC_BASE_URL=http://127.0.0.1:8080を設定します。
  • 複数GPU:NVIDIAのGPUなら2〜3枚を一緒に使え、NVLinkは不要です(複数GPUの説明、当サイトの複数GPU入門)。

データの出典:モデル構造、Strataの速度と必要なメモリはStrataリポジトリのREADME、ドキュメント、論文、コミュニティの報告に、llama.cppとの比較はissue #28に基づき、いずれも当サイトでは再検証していません。Ryzen AI Max+ 395とDGX Sparkの速度は当サイトの推定です。本文中の価格はAmazon.co.jpの2026年10月4日時点の中央値で、リアルタイムの表は当サイトのデータベースから生成しています。

よくある質問

StrataとOllama、LM Studioの違いは?

OllamaとLM Studioは汎用ツールで、どんなモデルでも動きます。StrataはQwen3.8-Flash-Next専用で、その構造に合わせて作り込まれています。よく使うエキスパートを選んでGPUに置き、GPUとCPUで同時に計算し、モデル自身が持つ予測層で1回の処理から複数のトークンを出します。このモデルを動かすならStrataのほうがずっと速いですが、ほかのモデルには使えません。

メモリが32GBしかなくても使えますか?

動くのはCoder版だけです。エキスパートを半分削った版で、コード以外は弱く、ユーザーの報告では英語以外の回答が崩れやすいとされています。24GBのGPUと組み合わせればQ2_0とIQ2_XSも動きます。48GBなら最小の2つ(Q2_0とIQ2_XS)が動き、64GBあればすべてのバージョンが動きます。

予算が限られているなら、メモリ増設とGPU交換のどちらが先?

メモリが先です。メモリが足りないとモデルが起動しません。GPUは速度に影響するだけです。メモリを64GBにしてからGPUを替えるなら、VRAM容量を基準に選んでください。

2〜3 bitまで圧縮すると、モデルの性能は落ちますか?

多少は落ちます。Q2_0がいちばん速く、IQ3_Sがいちばん元のモデルに近い版です。量子化を担当したISTA-DASLabは、IQ3_Sが公開ベンチマークで元のモデルと同等だとしていますが、当サイトでは再検証していません。品質を重視するなら、64GBのメモリでIQ3_Sを使ってください。

AMDのGPUやMacで使えますか?

AMDのGPUは使えます。RX 7900 XT/XTX、7800 XT、7700 XT、9060 XT、9070/9070 XTとRadeon AI PRO R9700に対応し、VRAMは12GB以上が必要です。Windowsでは今のところ画像を入力できません。Macは対応していません。StrataにはWindows版とLinux版しかありません。

このガイドに出てくる GPU

モデルVRAMeBay
GeForce RTX 507012 GB¥136,199
Radeon RX 9070 XT16 GB¥149,929
GeForce RTX 309024 GB¥267,505
GeForce RTX 509032 GB¥1,104,742
DGX Spark 128GB128 GB¥1,420,225

このガイドに出てくるモデル

モデルパラメータ数4-bit サイズ
Qwen3.8 Flash Next176B(有効 6B)111.3 GB