NT$ TWD
繁體中文

Strata 是什麼?12GB 顯示卡怎麼跑千問 Qwen3.8-Flash-Next(2026)

譯自简体中文版 · 閱讀原文

Strata 是一個開源推論引擎,專門用來在一般遊戲電腦上跑千問 Qwen3.8-Flash-Next(125B 參數的 MoE 模型)。 這個模型整個放進顯示記憶體,2-bit 版也要約 75GB;用 Strata,一張 12GB 顯示卡加 64GB 記憶體就能跑,作者的 RTX 5070 實測每秒 53 到 94 個 token。同樣把專家放記憶體,它的速度是 llama.cpp 的兩倍多。按 10 月 4 日閒魚價換算新台幣,RTX 5070 加 64GB 記憶體的整機約 NT$69,100,比 Ryzen AI Max+ 395 128GB 便宜約 NT$12,400,速度是它的兩倍多。資料截至 2026 年 10 月 4 日,對應 Strata v0.1.39。

示意圖:三層剖面,頂層用顯示卡做的爐台上主廚在炒菜,中層儲藏室擺滿調味料罐、二廚就地備料,底層地下室放著一條固態硬碟,比喻顯示記憶體、記憶體和硬碟的分工
示意圖 · 三層剖面,頂層用顯示卡做的爐台上主廚在炒菜,中層儲藏室擺滿調味料罐、二廚就地備料,底層地下室放著一條固態硬碟,比喻顯示記憶體、記憶體和硬碟的分工

Strata 是什麼?

一個只為 Qwen3.8-Flash-Next 寫的推論引擎,2026 年 9 月在 GitHub 開源,MIT 授權,有中文說明。

它和 llama.cpp、Ollama 這類通用工具的差別是:只跑 Qwen3.8-Flash-Next 及其 Coder、Swift 衍生版,每一步都照著這個模型的結構量身打造。支援 Windows 和 Linux,裝好後有網頁聊天介面,也提供 OpenAI 和 Anthropic 相容 API,能接 Claude Code 這類寫程式工具。

為什麼 12GB 顯示卡就夠?

因為寫每個字時,只有一小部分模型每次都要用。

模型每寫一個字(token),都要把用到的參數讀一遍,電腦裡只有顯示記憶體讀得夠快。Qwen3.8-Flash-Next 的 48 層裡,每層有兩樣東西:

  • 公共部分:注意力、路由器等,每個字都要用,全模型共 3.5GB。
  • 專家:每層 512 個,全模型 24,576 個,共 34GB。每個字在每層只挑 10 個,只用到 2%。

另外還有一張 28.8GB 的查表資料,每個字只查十幾行。它有 51B 參數,所以本站模型庫把總參數記作 176B。

示意圖:上半部對比整個模型 66GB 和每寫一個字要讀的約 4.2GB;下半部是 Strata 的放法:顯示卡 12GB 放公共部分 3.5GB 和約 4,500 個常用專家,記憶體 64GB 放全部 24,576 個專家,固態硬碟放 28.8GB 查表資料
示意圖:上半部對比整個模型 66GB 和每寫一個字要讀的約 4.2GB;下半部是 Strata 的放法:顯示卡 12GB 放公共部分 3.5GB 和約 4,500 個常用專家,記憶體 64GB 放全部 24,576 個專家,固態硬碟放 28.8GB 查表資料

66GB 的模型,寫一個字只讀約 4.2GB,其中 3.5GB 是公共部分。 所以 Strata 只把公共部分和最常用的約 4,500 個專家放進顯示卡;全部專家放記憶體;查表資料放硬碟,要查哪幾行能提前算出來,不會拖慢速度。模型並沒有變小,只是大頭從顯示記憶體挪到了記憶體,所以要 64GB 記憶體。

Strata 和 llama.cpp 跑法有什麼不同?

和整個放進顯示記憶體比,Strata 把顯示記憶體需求從約 75GB 降到 12GB,少了八成多;和 llama.cpp 把專家放記憶體比,兩者需要的顯示記憶體都少,差別在速度:同一台機器上 Strata 是 llama.cpp 的兩倍多。

表格:llama.cpp 整個放顯示記憶體、llama.cpp 專家放記憶體、Strata 三種跑法對比:整個放顯示記憶體 2-bit 要約 75GB,後兩種 12GB 顯示卡就能跑;同一台 RTX 5080 工作站上,llama.cpp 專家放記憶體最高約 38 tokens/s,Strata 約 85
表格:llama.cpp 整個放顯示記憶體、llama.cpp 專家放記憶體、Strata 三種跑法對比:整個放顯示記憶體 2-bit 要約 75GB,後兩種 12GB 顯示卡就能跑;同一台 RTX 5080 工作站上,llama.cpp 專家放記憶體最高約 38 tokens/s,Strata 約 85

整個放進顯示記憶體要多少,本站模型庫即時計算:

模型2-bit4-bit最便宜能跑的卡
8K 上下文32K 上下文8K 上下文32K 上下文
Qwen3.8 Flash Next176B · A6B75 GB卸載:4 GB 顯示記憶體 + 73 GB 記憶體76 GB卸載:4 GB 顯示記憶體 + 73 GB 記憶體105 GB卸載:4 GB 顯示記憶體 + 103 GB 記憶體106 GB卸載:5 GB 顯示記憶體 + 103 GB 記憶體GeForce RTX 3060 12GBNT$17,196 · 卸載

Strata 快在三處。

第一招:按專家挑常用的放顯示卡

llama.cpp 按層分:12GB 顯示卡扣掉公共部分還剩約 6GB,每層專家約 0.7GB,只放得下 8 層左右,佔 48 層的六分之一。Strata 從所有層裡挑最常用的約 4,500 個專家,放進同樣的 6GB,邊聊邊換,實測每個字要用的專家有 72% 在顯示卡上。CPU 要從記憶體讀的量,只有按層分的三分之一左右。

第二招:顯示卡和 CPU 同時算

示意圖:llama.cpp 專家放記憶體時,每一層先由顯示卡算公共部分,再由 CPU 從記憶體讀 10 個專家來算,兩邊輪流等;Strata 裡顯示卡算公共部分和手邊的 7 個專家,CPU 同時就地算剩下的 3 個,一層用時短得多
示意圖:llama.cpp 專家放記憶體時,每一層先由顯示卡算公共部分,再由 CPU 從記憶體讀 10 個專家來算,兩邊輪流等;Strata 裡顯示卡算公共部分和手邊的 7 個專家,CPU 同時就地算剩下的 3 個,一層用時短得多

llama.cpp 裡 CPU 算專家時,顯示卡在等。Strata 把每層選中的 10 個專家拆開:顯示卡算手上的約 7 個,CPU 同時在記憶體裡算剩下的約 3 個。缺的專家不搬去顯示卡,因為 PCIe 4.0 x16 只有約 26 GB/s,比 CPU 直接讀記憶體(41 到 52 GB/s)還慢。

第三招:先猜後驗,一趟出幾個字

示意圖:一般做法走三趟 48 層才寫出三個字;Strata 先讓只有一層的學徒猜三個字,主模型走一趟一起檢查,猜對的兩個留下,猜錯的換成主模型自己寫的字,一趟出三個字
示意圖:一般做法走三趟 48 層才寫出三個字;Strata 先讓只有一層的學徒猜三個字,主模型走一趟一起檢查,猜對的兩個留下,猜錯的換成主模型自己寫的字,一趟出三個字

模型內建一層「學徒」(MTP 預測層),先猜後面最多 3 個字,主模型走一趟一起檢查,猜對的留下。走一趟最貴的是讀 3.5GB 公共部分,檢查幾個位置都只讀一遍。實測這一招讓速度從每秒 47 到 57 個 token 提高到 82 到 92 個,輸出和不猜時一字不差。

代價是什麼?

  • 精度低一些:用的是 2 到 3 bit 壓縮版,Q2_0 最快,IQ3_S 最接近原版。原理見《什麼是量化模型》。
  • 只能跑這一個模型:換別的模型還是得用 llama.cpp、Ollama。
  • 一次只服務一個人:一次只處理一個請求,不適合給團隊當共用伺服器。
  • Coder 版中文差:中文使用者選 Q2_0、IQ2_XS 或 IQ3_S。

哪些顯示卡能跑 Qwen3.8-Flash-Next?

NVIDIA RTX 20 系列或更新、主流 AMD RX 7000 和 9000 系列,顯示記憶體 12GB 以上;記憶體要 64GB。

  • NVIDIA:GeForce RTX 20、30、40、50 系列,顯示記憶體 12GB 以上。
  • AMD:RX 7900 XT/XTX、7800 XT、7700 XT、9060 XT、9070/9070 XT、Radeon AI PRO R9700;RX 6800/6900 系列能裝但官方沒有驗證。
  • 實驗支援:Tesla P40、V100、Instinct MI50、Intel Arc 有社群寫的實驗版,要另外安裝或自行編譯(說明)。

選卡看顯示記憶體容量,不看新舊。 顯示記憶體每多 1GB,能多放約 700 個專家,CPU 的工作就少一些:

表格:RTX 5070 12GB 實測每秒 94 個 token,RTX 5060 Ti 16GB 估算約 87,RTX 3090 24GB 估算約 140,RTX 5090 32GB 社群實測 179
表格:RTX 5070 12GB 實測每秒 94 個 token,RTX 5060 Ti 16GB 估算約 87,RTX 3090 24GB 估算約 140,RTX 5090 32GB 社群實測 179

RTX 5060 Ti 顯示記憶體多 4GB 但頻寬低(448 對 672 GB/s),速度和 5070 差不多;RTX 3090 顯示記憶體翻倍、頻寬也更高,估算快一半。RTX 5090 那行來自社群回報,以上數字本站都沒有複測。

本站收錄的支援顯示卡,目前二手價:

型號顯存 GB頻寬 GB/sINT8 TOPS功耗 WAmazon.jp顯存單價
GeForce RTX 3060 12GB12360102170NT$17,196NT$1,433
Radeon RX 7800 XT1662475263NT$26,195NT$1,637
Radeon RX 9070 XT16640389304NT$29,832NT$1,864
GeForce RTX 5060 Ti 16GB16448190180NT$30,235NT$1,890
GeForce RTX 507012672247250NT$33,651NT$2,804
GeForce RTX 4060 Ti 16GB16288177165NT$42,144NT$2,634
GeForce RTX 5070 Ti16896352300NT$46,406NT$2,900
GeForce RTX 309024936285350NT$84,315NT$3,513
GeForce RTX 4090241,008661450NT$151,378NT$6,307
GeForce RTX 5090321,792838575NT$221,778NT$6,930
GeForce RTX 2080 Ti 22GB22616215250——

灰色價格近期沒有新掛單,顯示的是上次有效報價。

  • 最便宜能跑:RTX 3060 12GB,閒魚約 NT$9,200,但還沒有人實測;顯示記憶體頻寬只有 RTX 5070 的一半多,會慢一些。
  • 顯示記憶體大、價格低:2080 Ti 22GB 改裝卡,Turing 架構在支援範圍內,但改裝卡有售後風險。
  • 想明顯更快:二手 RTX 3090 24GB,挑卡注意事項見《二手 3090 還是新 5070 Ti》。

記憶體決定能跑哪一版(模型說明):

表格:32GB 記憶體只能跑 Coder 版,48GB 能跑 Q2_0 和 IQ2_XS,64GB 全部版本都能跑,96GB 以上還能試每秒 7 到 8.5 個 token 的 4-bit 實驗版
表格:32GB 記憶體只能跑 Coder 版,48GB 能跑 Q2_0 和 IQ2_XS,64GB 全部版本都能跑,96GB 以上還能試每秒 7 到 8.5 個 token 的 4-bit 實驗版

記憶體買兩條 32GB,不要四條 16GB,DDR5 插滿四條常要降頻。沒進顯示卡的專家由 CPU 算,所以 DDR5 平台和支援 AVX-512 的 CPU(AMD Ryzen 7000、9000 系列)更快;DDR4 頻寬約為 DDR5 的一半,能跑但達不到官方數字。

用 Strata 能省多少錢?

按整機比:RTX 5070 加 64GB 記憶體的 Strata 主機約 NT$69,100,比 Ryzen AI Max+ 395 128GB 便宜約 NT$12,400,2-bit 速度是它的兩倍多;DGX Spark 要約 NT$164,000,貴一倍多,速度也不如 Strata 主機。

表格:四台整機跑 Qwen3.8-Flash-Next 的價格和速度:RTX 5070 主機約 NT$69,100,2-bit 每秒 94 個 token;二手 RTX 3090 主機約 NT$78,600,約 140;Ryzen AI Max+ 395 128GB 約 NT$81,500,約 40;DGX Spark 約 NT$164,000,約 56
表格:四台整機跑 Qwen3.8-Flash-Next 的價格和速度:RTX 5070 主機約 NT$69,100,2-bit 每秒 94 個 token;二手 RTX 3090 主機約 NT$78,600,約 140;Ryzen AI Max+ 395 128GB 約 NT$81,500,約 40;DGX Spark 約 NT$164,000,約 56

395 和 DGX Spark 的長處是還能跑 4-bit 和別的模型;只為跑 Qwen3.8-Flash-Next,Strata 主機更划算。

如何安裝 Strata?

裝好顯示卡驅動程式,下載專案,Windows 按兩下 START-HERE.bat、Linux 執行 ./setup.sh,一路按 Enter 就行。 Python、推論引擎和模型都由安裝程式自動安裝(安裝說明)。

  1. 裝驅動程式:NVIDIA 驅動程式要 580 或更新;AMD 在 Windows 用新版 Adrenalin,Linux 用系統內建驅動程式。
  2. 留硬碟空間:模型約 70 到 80GB;在支援 AVX-512 的 CPU 上用 Q2_0,還要多留約 40GB。
  3. 下載專案:從 GitHub 下載壓縮檔解壓縮,或者 git clone。
  4. 執行安裝:Windows 按兩下 START-HERE.bat,Linux 執行 ./setup.sh。它會辨識顯示卡、按記憶體推薦版本,按 Enter 接受推薦即可。
  5. 等下載和啟動:模型約 70GB,中斷後能續傳。下載完自動啟動,瀏覽器開啟 http://127.0.0.1:8080 就能聊天。啟動時要把 35 到 55GB 讀進記憶體,電腦可能卡頓 1 到 3 分鐘,屬於正常現象。

之後再按兩下 START-HERE.bat 就直接啟動,30 到 90 秒載入,關掉視窗即停止。

  • 接其他軟體:新增「OpenAI 相容」服務,網址填 http://127.0.0.1:8080/v1,金鑰和模型名稱隨便填;Claude Code 設定 ANTHROPIC_BASE_URL=http://127.0.0.1:8080。
  • 多張顯示卡:兩三張 NVIDIA 顯示卡可以一起用,不需要 NVLink(多卡說明、本站多卡入門)。

資料來源:模型結構、Strata 的速度和記憶體需求來自 Strata 儲存庫的 README、文件、論文和社群回報,llama.cpp 對比來自 issue #28,本站都沒有複測;Ryzen AI Max+ 395 和 DGX Spark 的速度是本站估算;手寫價格是 2026 年 10 月 4 日閒魚中位價,按 1 CNY = 4.74 TWD 換算為新台幣並四捨五入到百位,Ryzen 7 7700 + B650 與 650W 電源用本站美元參考價,按 1 USD = 31.85 TWD 換算;即時表格由本站資料庫產生。

常見問題

Strata 和 Ollama、LM Studio 有什麼不同?

Ollama 和 LM Studio 是通用工具,什麼模型都能跑。Strata 只跑 Qwen3.8-Flash-Next,照著它的結構量身打造:按專家挑常用的放顯示卡、顯示卡和 CPU 同時算、用模型內建的預測層一趟出幾個字。跑這個模型時 Strata 快得多,換別的模型就不能用。

我只有 32GB 記憶體,能用嗎?

只能跑 Coder 版,它刪掉了一半專家,中文回答容易出錯;配 24GB 顯示卡時也能跑 Q2_0 和 IQ2_XS。48GB 能跑最小的兩檔(Q2_0 和 IQ2_XS),64GB 所有版本都能跑。

預算有限,先加記憶體還是先換顯示卡?

先加記憶體。記憶體不夠,模型啟動不了;顯示卡只影響快慢。記憶體到 64GB 以後再升級顯示卡,主要看顯示記憶體大小。

壓縮到 2 到 3 bit,模型會不會變笨?

會損失一些。Q2_0 最快,IQ3_S 最接近原版;負責壓縮的 ISTA-DASLab 稱 IQ3_S 在公開評測上和原模型持平,本站沒有複測。重視品質就用 64GB 記憶體跑 IQ3_S。

AMD 顯示卡和 Mac 能用嗎?

AMD 顯示卡可以,支援 RX 7900 XT/XTX、7800 XT、7700 XT、9060 XT、9070/9070 XT 和 Radeon AI PRO R9700,顯示記憶體要 12GB 以上;Windows 下暫時不能輸入圖片。Mac 不支援,Strata 只有 Windows 和 Linux 版本。

文中提到的顯示卡

型號顯存Amazon.jp
GeForce RTX 3060 12GB12 GBNT$17,196
GeForce RTX 507012 GBNT$33,651
Radeon RX 9070 XT16 GBNT$29,832
GeForce RTX 309024 GBNT$84,315
GeForce RTX 509032 GBNT$221,778
Ryzen AI Max+ 395 128GB128 GBNT$130,468

文中提到的模型

模型參數量4-bit 大小
Qwen3.8 Flash Next176B(啟用 6B)111.3 GB