¥ CNY
简体中文

Strata 是什么?12GB 显卡怎么跑千问 Qwen3.8-Flash-Next(2026)

Strata 是一个开源推理引擎,专门用来在普通游戏电脑上跑千问 Qwen3.8-Flash-Next(125B 参数的 MoE 模型)。 这个模型整个放进显存,2-bit 版也要约 75GB;用 Strata,一张 12GB 显卡加 64GB 内存就能跑,作者的 RTX 5070 实测每秒 53 到 94 个 token。同样把专家放内存,它的速度是 llama.cpp 的两倍多。按 10 月 4 日闲鱼价,RTX 5070 加 64GB 内存的整机约 14,600 元,比 Ryzen AI Max+ 395 128GB 便宜约 2,600 元,速度是它的两倍多。数据截至 2026 年 10 月 4 日,对应 Strata v0.1.39。

示意图:三层剖面,顶层显卡做的灶台上主厨在炒菜,中层储藏室摆满调料罐、二厨就地备菜,底层地下室放着一条固态硬盘,比喻显存、内存和硬盘分工
示意图 · 三层剖面,顶层显卡做的灶台上主厨在炒菜,中层储藏室摆满调料罐、二厨就地备菜,底层地下室放着一条固态硬盘,比喻显存、内存和硬盘分工

Strata 是什么?

一个只为 Qwen3.8-Flash-Next 写的推理引擎,2026 年 9 月在 GitHub 开源,MIT 协议,有中文说明。

它和 llama.cpp、Ollama 这类通用工具的区别是:只跑 Qwen3.8-Flash-Next 及其 Coder、Swift 衍生版,每一步都照着这个模型的结构定做。支持 Windows 和 Linux,装好后有网页聊天界面,也提供 OpenAI 和 Anthropic 兼容接口,能接 Claude Code 这类编程工具。

为什么 12GB 显卡就够?

因为写每个字时,只有一小部分模型每次都要用。

模型每写一个字(token),都要把用到的参数读一遍,电脑里只有显存读得够快。Qwen3.8-Flash-Next 的 48 层里,每层有两样东西:

  • 公共部分:注意力、路由器等,每个字都要用,全模型共 3.5GB。
  • 专家:每层 512 个,全模型 24,576 个,共 34GB。每个字在每层只挑 10 个,只用到 2%。

另外还有一张 28.8GB 的查表数据,每个字只查十几行。它有 51B 参数,所以本站模型库把总参数记作 176B。

示意图:上半部分对比整个模型 66GB 和每写一个字要读的约 4.2GB;下半部分是 Strata 的放法:显卡 12GB 放公共部分 3.5GB 和约 4,500 个常用专家,内存 64GB 放全部 24,576 个专家,固态硬盘放 28.8GB 查表数据
示意图:上半部分对比整个模型 66GB 和每写一个字要读的约 4.2GB;下半部分是 Strata 的放法:显卡 12GB 放公共部分 3.5GB 和约 4,500 个常用专家,内存 64GB 放全部 24,576 个专家,固态硬盘放 28.8GB 查表数据

66GB 的模型,写一个字只读约 4.2GB,其中 3.5GB 是公共部分。 所以 Strata 只把公共部分和最常用的约 4,500 个专家放进显卡;全部专家放内存;查表数据放硬盘,要查哪几行能提前算出来,不拖慢速度。模型并没有变小,只是大头从显存挪到了内存,所以要 64GB 内存。

Strata 和 llama.cpp 跑法有什么不同?

和整个放进显存比,Strata 把显存需求从约 75GB 降到 12GB,少了八成多;和 llama.cpp 把专家放内存比,两者显存都要得少,差别在速度:同一台机器上 Strata 是 llama.cpp 的两倍多。

表格:llama.cpp 整个放显存、llama.cpp 专家放内存、Strata 三种跑法对比:整个放显存 2-bit 要约 75GB,后两种 12GB 显卡就能跑;同一台 RTX 5080 工作站上,llama.cpp 专家放内存最高约 38 tokens/s,Strata 约 85
表格:llama.cpp 整个放显存、llama.cpp 专家放内存、Strata 三种跑法对比:整个放显存 2-bit 要约 75GB,后两种 12GB 显卡就能跑;同一台 RTX 5080 工作站上,llama.cpp 专家放内存最高约 38 tokens/s,Strata 约 85

整个放进显存要多少,本站模型库实时计算:

模型2-bit4-bit最便宜能跑的卡
8K 上下文32K 上下文8K 上下文32K 上下文
Qwen3.8 Flash Next176B · A6B75 GB卸载:4 GB 显存 + 73 GB 内存76 GB卸载:4 GB 显存 + 73 GB 内存105 GB卸载:4 GB 显存 + 103 GB 内存106 GB卸载:5 GB 显存 + 103 GB 内存GeForce RTX 3060 12GB¥3,628 · 卸载

Strata 快在三处。

第一招:按专家挑常用的放显卡

llama.cpp 按层分:12GB 显卡扣掉公共部分还剩约 6GB,每层专家约 0.7GB,只放得下 8 层左右,占 48 层的六分之一。Strata 从所有层里挑最常用的约 4,500 个专家,放进同样的 6GB,边聊边换,实测每个字要用的专家有 72% 在显卡上。CPU 要从内存读的量,只有按层分的三分之一左右。

第二招:显卡和 CPU 同时算

示意图:llama.cpp 专家放内存时,每一层先由显卡算公共部分,再由 CPU 从内存读 10 个专家来算,两边轮流等;Strata 里显卡算公共部分和手边的 7 个专家,CPU 同时就地算剩下的 3 个,一层用时短得多
示意图:llama.cpp 专家放内存时,每一层先由显卡算公共部分,再由 CPU 从内存读 10 个专家来算,两边轮流等;Strata 里显卡算公共部分和手边的 7 个专家,CPU 同时就地算剩下的 3 个,一层用时短得多

llama.cpp 里 CPU 算专家时,显卡在等。Strata 把每层选中的 10 个专家拆开:显卡算手上的约 7 个,CPU 同时在内存里算剩下的约 3 个。缺的专家不搬去显卡,因为 PCIe 4.0 x16 只有约 26 GB/s,比 CPU 直接读内存(41 到 52 GB/s)还慢。

第三招:先猜后验,一趟出几个字

示意图:普通做法走三趟 48 层才写出三个字;Strata 先让只有一层的学徒猜三个字,主模型走一趟一起检查,猜对的两个留下,猜错的换成主模型自己写的字,一趟出三个字
示意图:普通做法走三趟 48 层才写出三个字;Strata 先让只有一层的学徒猜三个字,主模型走一趟一起检查,猜对的两个留下,猜错的换成主模型自己写的字,一趟出三个字

模型自带一层「学徒」(MTP 预测层),先猜后面最多 3 个字,主模型走一趟一起检查,猜对的留下。走一趟最贵的是读 3.5GB 公共部分,检查几个位置都只读一遍。实测这一招让速度从每秒 47 到 57 个 token 提到 82 到 92 个,输出和不猜时一字不差。

代价是什么?

  • 精度低一些:用的是 2 到 3 bit 压缩版,Q2_0 最快,IQ3_S 最接近原版。原理见《量化模型是什么》。
  • 只能跑这一个模型:换别的模型还得用 llama.cpp、Ollama。
  • 一次只服务一个人:一次只处理一个请求,不适合给团队当公用服务器。
  • Coder 版中文差:中文用户选 Q2_0、IQ2_XS 或 IQ3_S。

哪些显卡能跑 Qwen3.8-Flash-Next?

NVIDIA RTX 20 系或更新、主流 AMD RX 7000 和 9000 系,显存 12GB 以上;内存要 64GB。

  • NVIDIA:GeForce RTX 20、30、40、50 系,显存 12GB 以上。
  • AMD:RX 7900 XT/XTX、7800 XT、7700 XT、9060 XT、9070/9070 XT、Radeon AI PRO R9700;RX 6800/6900 系列能装但官方没验证。
  • 实验支持:Tesla P40、V100、Instinct MI50、Intel Arc 有社区写的实验版,要单独安装或自己编译(说明)。

选卡看显存容量,不看新旧。 显存每多 1GB,能多放约 700 个专家,CPU 的活就少一些:

表格:RTX 5070 12GB 实测每秒 94 个 token,RTX 5060 Ti 16GB 估算约 87,RTX 3090 24GB 估算约 140,RTX 5090 32GB 社区实测 179
表格:RTX 5070 12GB 实测每秒 94 个 token,RTX 5060 Ti 16GB 估算约 87,RTX 3090 24GB 估算约 140,RTX 5090 32GB 社区实测 179

RTX 5060 Ti 显存多 4GB 但带宽低(448 对 672 GB/s),速度和 5070 差不多;RTX 3090 显存翻倍、带宽也更高,估算快一半。RTX 5090 那行来自社区报告,以上数字本站都没有复测。

本站收录的支持显卡,当前二手价:

型号显存 GB带宽 GB/sINT8 TOPS功耗 WAmazon.jp显存单价
GeForce RTX 3060 12GB12360102170¥3,628¥302
Radeon RX 7800 XT1662475263¥5,526¥345
Radeon RX 9070 XT16640389304¥6,293¥393
GeForce RTX 5060 Ti 16GB16448190180¥6,379¥399
GeForce RTX 507012672247250¥7,099¥592
GeForce RTX 4060 Ti 16GB16288177165¥8,891¥556
GeForce RTX 5070 Ti16896352300¥9,790¥612
GeForce RTX 309024936285350¥17,787¥741
GeForce RTX 4090241,008661450¥31,935¥1,331
GeForce RTX 5090321,792838575¥46,787¥1,462
GeForce RTX 2080 Ti 22GB22616215250——

灰色价格近期没有新挂单,显示的是上次有效报价。

  • 最便宜能跑:RTX 3060 12GB,闲鱼不到 2,000 元,但还没人实测;显存带宽只有 RTX 5070 的一半多,会慢一些。
  • 显存大、价格低:2080 Ti 22GB 魔改卡,Turing 架构在支持范围内,但魔改卡有售后风险。
  • 想明显更快:二手 RTX 3090 24GB,挑卡注意事项见《二手 3090 还是新 5070 Ti》。

内存决定能跑哪一版(模型说明):

表格:32GB 内存只能跑 Coder 版,48GB 能跑 Q2_0 和 IQ2_XS,64GB 全部版本都能跑,96GB 以上还能试每秒 7 到 8.5 个 token 的 4-bit 实验版
表格:32GB 内存只能跑 Coder 版,48GB 能跑 Q2_0 和 IQ2_XS,64GB 全部版本都能跑,96GB 以上还能试每秒 7 到 8.5 个 token 的 4-bit 实验版

内存买两条 32GB,不要四条 16GB,DDR5 插满四条常要降频。没进显卡的专家由 CPU 算,所以 DDR5 平台和支持 AVX-512 的 CPU(AMD Ryzen 7000、9000 系列)更快;DDR4 带宽约为 DDR5 的一半,能跑但达不到官方数字。

用 Strata 能省多少钱?

按整机比:RTX 5070 加 64GB 内存的 Strata 主机约 14,600 元,比 Ryzen AI Max+ 395 128GB 便宜约 2,600 元,2-bit 速度是它的两倍多;DGX Spark 要约 34,600 元,贵一倍多,速度也不如 Strata 主机。

表格:四台整机跑 Qwen3.8-Flash-Next 的价格和速度:RTX 5070 主机约 14,600 元,2-bit 每秒 94 个 token;二手 RTX 3090 主机约 16,600 元,约 140;Ryzen AI Max+ 395 128GB 约 17,200 元,约 40;DGX Spark 约 34,600 元,约 56
表格:四台整机跑 Qwen3.8-Flash-Next 的价格和速度:RTX 5070 主机约 14,600 元,2-bit 每秒 94 个 token;二手 RTX 3090 主机约 16,600 元,约 140;Ryzen AI Max+ 395 128GB 约 17,200 元,约 40;DGX Spark 约 34,600 元,约 56

395 和 DGX Spark 的长处是还能跑 4-bit 和别的模型;只为跑 Qwen3.8-Flash-Next,Strata 主机更划算。

如何安装 Strata?

装好显卡驱动,下载项目,Windows 双击 START-HERE.bat、Linux 运行 ./setup.sh,一路按回车就行。 Python、推理引擎和模型都由安装程序自动装(安装说明)。

  1. 装驱动:NVIDIA 驱动要 580 或更新;AMD 在 Windows 用新版 Adrenalin,Linux 用系统自带驱动。
  2. 留硬盘:模型约 70 到 80GB;在支持 AVX-512 的 CPU 上用 Q2_0,还要多留约 40GB。
  3. 下载项目:从 GitHub 下载压缩包解压,或者 git clone。
  4. 运行安装:Windows 双击 START-HERE.bat,Linux 运行 ./setup.sh。它会识别显卡、按内存推荐版本,按回车接受推荐即可。
  5. 等下载和启动:模型约 70GB,中断后能续传。下完自动启动,浏览器打开 http://127.0.0.1:8080 就能聊天。启动时要把 35 到 55GB 读进内存,电脑可能卡 1 到 3 分钟,属正常。

以后再双击 START-HERE.bat 就直接启动,30 到 90 秒载入,关掉窗口即停止。

  • 接其他软件:添加「OpenAI 兼容」服务,地址填 http://127.0.0.1:8080/v1,密钥和模型名随便填;Claude Code 设置 ANTHROPIC_BASE_URL=http://127.0.0.1:8080。
  • 多张显卡:两三张 NVIDIA 显卡可以一起用,不需要 NVLink(多卡说明、本站多卡入门)。

数据口径:模型结构、Strata 的速度和内存需求来自 Strata 仓库的 README、文档、论文和社区报告,llama.cpp 对比来自 issue #28,本站都没有复测;Ryzen AI Max+ 395 和 DGX Spark 的速度是本站估算;手写价格是 2026 年 10 月 4 日闲鱼中位价,实时表格由本站数据库生成。

常见问题

Strata 和 Ollama、LM Studio 有什么区别?

Ollama 和 LM Studio 是通用工具,什么模型都能跑。Strata 只跑 Qwen3.8-Flash-Next,照着它的结构定做:按专家挑常用的放显卡、显卡和 CPU 同时算、用模型自带的预测层一趟出几个字。跑这个模型时 Strata 快得多,换别的模型就用不了。

我只有 32GB 内存,能用吗?

只能跑 Coder 版,它删掉了一半专家,中文回答容易出错;配 24GB 显卡时也能跑 Q2_0 和 IQ2_XS。48GB 能跑最小的两档(Q2_0 和 IQ2_XS),64GB 所有版本都能跑。

钱有限,先加内存还是先换显卡?

先加内存。内存不够,模型启动不了;显卡只影响快慢。内存到 64GB 以后再升级显卡,主要看显存大小。

压缩到 2 到 3 bit,模型会不会变笨?

会损失一些。Q2_0 最快,IQ3_S 最接近原版;负责压缩的 ISTA-DASLab 称 IQ3_S 在公开测试上和原模型持平,本站没有复测。看重质量就用 64GB 内存跑 IQ3_S。

AMD 显卡和 Mac 能用吗?

AMD 显卡可以,支持 RX 7900 XT/XTX、7800 XT、7700 XT、9060 XT、9070/9070 XT 和 Radeon AI PRO R9700,显存要 12GB 以上;Windows 下暂时不能输入图片。Mac 不支持,Strata 只有 Windows 和 Linux 版本。

文中提到的显卡

型号显存Amazon.jp
GeForce RTX 507012 GB¥7,099
Radeon RX 9070 XT16 GB¥6,293
GeForce RTX 309024 GB¥17,787
GeForce RTX 509032 GB¥46,787

文中提到的模型

模型参数量4-bit 大小
Qwen3.8 Flash Next176B(激活 6B)111.3 GB