Strata 是一個開源推論引擎,專門用來在一般遊戲電腦上跑千問 Qwen3.8-Flash-Next(125B 參數的 MoE 模型)。 這個模型整個放進顯示記憶體,2-bit 版也要約 75GB;用 Strata,一張 12GB 顯示卡加 64GB 記憶體就能跑,作者的 RTX 5070 實測每秒 53 到 94 個 token。同樣把專家放記憶體,它的速度是 llama.cpp 的兩倍多。按 10 月 4 日閒魚價換算新台幣,RTX 5070 加 64GB 記憶體的整機約 NT$69,100,比 Ryzen AI Max+ 395 128GB 便宜約 NT$12,400,速度是它的兩倍多。資料截至 2026 年 10 月 4 日,對應 Strata v0.1.39。
Strata 是什麼?12GB 顯示卡怎麼跑千問 Qwen3.8-Flash-Next(2026)
譯自简体中文版 · 閱讀原文
正文與常見問題中的數字截至 2026年10月4日;表格使用最新已發布價格,各裝置採集時間可能不同。

Strata 是什麼?
一個只為 Qwen3.8-Flash-Next 寫的推論引擎,2026 年 9 月在 GitHub 開源,MIT 授權,有中文說明。
它和 llama.cpp、Ollama 這類通用工具的差別是:只跑 Qwen3.8-Flash-Next 及其 Coder、Swift 衍生版,每一步都照著這個模型的結構量身打造。支援 Windows 和 Linux,裝好後有網頁聊天介面,也提供 OpenAI 和 Anthropic 相容 API,能接 Claude Code 這類寫程式工具。
為什麼 12GB 顯示卡就夠?
因為寫每個字時,只有一小部分模型每次都要用。
模型每寫一個字(token),都要把用到的參數讀一遍,電腦裡只有顯示記憶體讀得夠快。Qwen3.8-Flash-Next 的 48 層裡,每層有兩樣東西:
- 公共部分:注意力、路由器等,每個字都要用,全模型共 3.5GB。
- 專家:每層 512 個,全模型 24,576 個,共 34GB。每個字在每層只挑 10 個,只用到 2%。
另外還有一張 28.8GB 的查表資料,每個字只查十幾行。它有 51B 參數,所以本站模型庫把總參數記作 176B。

66GB 的模型,寫一個字只讀約 4.2GB,其中 3.5GB 是公共部分。 所以 Strata 只把公共部分和最常用的約 4,500 個專家放進顯示卡;全部專家放記憶體;查表資料放硬碟,要查哪幾行能提前算出來,不會拖慢速度。模型並沒有變小,只是大頭從顯示記憶體挪到了記憶體,所以要 64GB 記憶體。
Strata 和 llama.cpp 跑法有什麼不同?
和整個放進顯示記憶體比,Strata 把顯示記憶體需求從約 75GB 降到 12GB,少了八成多;和 llama.cpp 把專家放記憶體比,兩者需要的顯示記憶體都少,差別在速度:同一台機器上 Strata 是 llama.cpp 的兩倍多。

整個放進顯示記憶體要多少,本站模型庫即時計算:
Amazon.jp
| 模型 | 2-bit | 4-bit | 最便宜能跑的卡 | ||
|---|---|---|---|---|---|
| 8K 上下文 | 32K 上下文 | 8K 上下文 | 32K 上下文 | ||
| Qwen3.8 Flash Next176B · A6B | 75 GB卸載:4 GB 顯示記憶體 + 73 GB 記憶體 | 76 GB卸載:4 GB 顯示記憶體 + 73 GB 記憶體 | 105 GB卸載:4 GB 顯示記憶體 + 103 GB 記憶體 | 106 GB卸載:5 GB 顯示記憶體 + 103 GB 記憶體 | |
Strata 快在三處。
第一招:按專家挑常用的放顯示卡
llama.cpp 按層分:12GB 顯示卡扣掉公共部分還剩約 6GB,每層專家約 0.7GB,只放得下 8 層左右,佔 48 層的六分之一。Strata 從所有層裡挑最常用的約 4,500 個專家,放進同樣的 6GB,邊聊邊換,實測每個字要用的專家有 72% 在顯示卡上。CPU 要從記憶體讀的量,只有按層分的三分之一左右。
第二招:顯示卡和 CPU 同時算

llama.cpp 裡 CPU 算專家時,顯示卡在等。Strata 把每層選中的 10 個專家拆開:顯示卡算手上的約 7 個,CPU 同時在記憶體裡算剩下的約 3 個。缺的專家不搬去顯示卡,因為 PCIe 4.0 x16 只有約 26 GB/s,比 CPU 直接讀記憶體(41 到 52 GB/s)還慢。
第三招:先猜後驗,一趟出幾個字

模型內建一層「學徒」(MTP 預測層),先猜後面最多 3 個字,主模型走一趟一起檢查,猜對的留下。走一趟最貴的是讀 3.5GB 公共部分,檢查幾個位置都只讀一遍。實測這一招讓速度從每秒 47 到 57 個 token 提高到 82 到 92 個,輸出和不猜時一字不差。
代價是什麼?
- 精度低一些:用的是 2 到 3 bit 壓縮版,Q2_0 最快,IQ3_S 最接近原版。原理見《什麼是量化模型》。
- 只能跑這一個模型:換別的模型還是得用 llama.cpp、Ollama。
- 一次只服務一個人:一次只處理一個請求,不適合給團隊當共用伺服器。
- Coder 版中文差:中文使用者選 Q2_0、IQ2_XS 或 IQ3_S。
哪些顯示卡能跑 Qwen3.8-Flash-Next?
NVIDIA RTX 20 系列或更新、主流 AMD RX 7000 和 9000 系列,顯示記憶體 12GB 以上;記憶體要 64GB。
- NVIDIA:GeForce RTX 20、30、40、50 系列,顯示記憶體 12GB 以上。
- AMD:RX 7900 XT/XTX、7800 XT、7700 XT、9060 XT、9070/9070 XT、Radeon AI PRO R9700;RX 6800/6900 系列能裝但官方沒有驗證。
- 實驗支援:Tesla P40、V100、Instinct MI50、Intel Arc 有社群寫的實驗版,要另外安裝或自行編譯(說明)。
選卡看顯示記憶體容量,不看新舊。 顯示記憶體每多 1GB,能多放約 700 個專家,CPU 的工作就少一些:

RTX 5060 Ti 顯示記憶體多 4GB 但頻寬低(448 對 672 GB/s),速度和 5070 差不多;RTX 3090 顯示記憶體翻倍、頻寬也更高,估算快一半。RTX 5090 那行來自社群回報,以上數字本站都沒有複測。
本站收錄的支援顯示卡,目前二手價:
Amazon.jp
| 型號 | 顯存 GB | 頻寬 GB/s | INT8 TOPS | 功耗 W | Amazon.jp | 顯存單價 |
|---|---|---|---|---|---|---|
| 12 | 360 | 102 | 170 | NT$17,196 | NT$1,433 | |
| Radeon RX 7800 XT | 16 | 624 | 75 | 263 | NT$26,195 | NT$1,637 |
| Radeon RX 9070 XT | 16 | 640 | 389 | 304 | NT$29,832 | NT$1,864 |
| 16 | 448 | 190 | 180 | NT$30,235 | NT$1,890 | |
| 12 | 672 | 247 | 250 | NT$33,651 | NT$2,804 | |
| 16 | 288 | 177 | 165 | NT$42,144 | NT$2,634 | |
| 16 | 896 | 352 | 300 | NT$46,406 | NT$2,900 | |
| 24 | 936 | 285 | 350 | NT$84,315 | NT$3,513 | |
| 24 | 1,008 | 661 | 450 | NT$151,378 | NT$6,307 | |
| 32 | 1,792 | 838 | 575 | NT$221,778 | NT$6,930 | |
| 22 | 616 | 215 | 250 | — | — |
灰色價格近期沒有新掛單,顯示的是上次有效報價。
- 最便宜能跑:RTX 3060 12GB,閒魚約 NT$9,200,但還沒有人實測;顯示記憶體頻寬只有 RTX 5070 的一半多,會慢一些。
- 顯示記憶體大、價格低:2080 Ti 22GB 改裝卡,Turing 架構在支援範圍內,但改裝卡有售後風險。
- 想明顯更快:二手 RTX 3090 24GB,挑卡注意事項見《二手 3090 還是新 5070 Ti》。
記憶體決定能跑哪一版(模型說明):

記憶體買兩條 32GB,不要四條 16GB,DDR5 插滿四條常要降頻。沒進顯示卡的專家由 CPU 算,所以 DDR5 平台和支援 AVX-512 的 CPU(AMD Ryzen 7000、9000 系列)更快;DDR4 頻寬約為 DDR5 的一半,能跑但達不到官方數字。
用 Strata 能省多少錢?
按整機比:RTX 5070 加 64GB 記憶體的 Strata 主機約 NT$69,100,比 Ryzen AI Max+ 395 128GB 便宜約 NT$12,400,2-bit 速度是它的兩倍多;DGX Spark 要約 NT$164,000,貴一倍多,速度也不如 Strata 主機。

395 和 DGX Spark 的長處是還能跑 4-bit 和別的模型;只為跑 Qwen3.8-Flash-Next,Strata 主機更划算。
如何安裝 Strata?
裝好顯示卡驅動程式,下載專案,Windows 按兩下 START-HERE.bat、Linux 執行 ./setup.sh,一路按 Enter 就行。 Python、推論引擎和模型都由安裝程式自動安裝(安裝說明)。
- 裝驅動程式:NVIDIA 驅動程式要 580 或更新;AMD 在 Windows 用新版 Adrenalin,Linux 用系統內建驅動程式。
- 留硬碟空間:模型約 70 到 80GB;在支援 AVX-512 的 CPU 上用 Q2_0,還要多留約 40GB。
- 下載專案:從 GitHub 下載壓縮檔解壓縮,或者
git clone。 - 執行安裝:Windows 按兩下
START-HERE.bat,Linux 執行./setup.sh。它會辨識顯示卡、按記憶體推薦版本,按 Enter 接受推薦即可。 - 等下載和啟動:模型約 70GB,中斷後能續傳。下載完自動啟動,瀏覽器開啟
http://127.0.0.1:8080就能聊天。啟動時要把 35 到 55GB 讀進記憶體,電腦可能卡頓 1 到 3 分鐘,屬於正常現象。
之後再按兩下 START-HERE.bat 就直接啟動,30 到 90 秒載入,關掉視窗即停止。
- 接其他軟體:新增「OpenAI 相容」服務,網址填
http://127.0.0.1:8080/v1,金鑰和模型名稱隨便填;Claude Code 設定ANTHROPIC_BASE_URL=http://127.0.0.1:8080。 - 多張顯示卡:兩三張 NVIDIA 顯示卡可以一起用,不需要 NVLink(多卡說明、本站多卡入門)。
資料來源:模型結構、Strata 的速度和記憶體需求來自 Strata 儲存庫的 README、文件、論文和社群回報,llama.cpp 對比來自 issue #28,本站都沒有複測;Ryzen AI Max+ 395 和 DGX Spark 的速度是本站估算;手寫價格是 2026 年 10 月 4 日閒魚中位價,按 1 CNY = 4.74 TWD 換算為新台幣並四捨五入到百位,Ryzen 7 7700 + B650 與 650W 電源用本站美元參考價,按 1 USD = 31.85 TWD 換算;即時表格由本站資料庫產生。
常見問題
Strata 和 Ollama、LM Studio 有什麼不同?
Ollama 和 LM Studio 是通用工具,什麼模型都能跑。Strata 只跑 Qwen3.8-Flash-Next,照著它的結構量身打造:按專家挑常用的放顯示卡、顯示卡和 CPU 同時算、用模型內建的預測層一趟出幾個字。跑這個模型時 Strata 快得多,換別的模型就不能用。
我只有 32GB 記憶體,能用嗎?
只能跑 Coder 版,它刪掉了一半專家,中文回答容易出錯;配 24GB 顯示卡時也能跑 Q2_0 和 IQ2_XS。48GB 能跑最小的兩檔(Q2_0 和 IQ2_XS),64GB 所有版本都能跑。
預算有限,先加記憶體還是先換顯示卡?
先加記憶體。記憶體不夠,模型啟動不了;顯示卡只影響快慢。記憶體到 64GB 以後再升級顯示卡,主要看顯示記憶體大小。
壓縮到 2 到 3 bit,模型會不會變笨?
會損失一些。Q2_0 最快,IQ3_S 最接近原版;負責壓縮的 ISTA-DASLab 稱 IQ3_S 在公開評測上和原模型持平,本站沒有複測。重視品質就用 64GB 記憶體跑 IQ3_S。
AMD 顯示卡和 Mac 能用嗎?
AMD 顯示卡可以,支援 RX 7900 XT/XTX、7800 XT、7700 XT、9060 XT、9070/9070 XT 和 Radeon AI PRO R9700,顯示記憶體要 12GB 以上;Windows 下暫時不能輸入圖片。Mac 不支援,Strata 只有 Windows 和 Linux 版本。



