Strata 是一个开源推理引擎,专门用来在普通游戏电脑上跑千问 Qwen3.8-Flash-Next(125B 参数的 MoE 模型)。 这个模型整个放进显存,2-bit 版也要约 75GB;用 Strata,一张 12GB 显卡加 64GB 内存就能跑,作者的 RTX 5070 实测每秒 53 到 94 个 token。同样把专家放内存,它的速度是 llama.cpp 的两倍多。按 10 月 4 日闲鱼价,RTX 5070 加 64GB 内存的整机约 14,600 元,比 Ryzen AI Max+ 395 128GB 便宜约 2,600 元,速度是它的两倍多。数据截至 2026 年 10 月 4 日,对应 Strata v0.1.39。
Strata 是什么?12GB 显卡怎么跑千问 Qwen3.8-Flash-Next(2026)
正文与 FAQ 中的数字截至 2026年10月4日;表格使用最新已发布价格,各设备采集时间可能不同。

Strata 是什么?
一个只为 Qwen3.8-Flash-Next 写的推理引擎,2026 年 9 月在 GitHub 开源,MIT 协议,有中文说明。
它和 llama.cpp、Ollama 这类通用工具的区别是:只跑 Qwen3.8-Flash-Next 及其 Coder、Swift 衍生版,每一步都照着这个模型的结构定做。支持 Windows 和 Linux,装好后有网页聊天界面,也提供 OpenAI 和 Anthropic 兼容接口,能接 Claude Code 这类编程工具。
为什么 12GB 显卡就够?
因为写每个字时,只有一小部分模型每次都要用。
模型每写一个字(token),都要把用到的参数读一遍,电脑里只有显存读得够快。Qwen3.8-Flash-Next 的 48 层里,每层有两样东西:
- 公共部分:注意力、路由器等,每个字都要用,全模型共 3.5GB。
- 专家:每层 512 个,全模型 24,576 个,共 34GB。每个字在每层只挑 10 个,只用到 2%。
另外还有一张 28.8GB 的查表数据,每个字只查十几行。它有 51B 参数,所以本站模型库把总参数记作 176B。

66GB 的模型,写一个字只读约 4.2GB,其中 3.5GB 是公共部分。 所以 Strata 只把公共部分和最常用的约 4,500 个专家放进显卡;全部专家放内存;查表数据放硬盘,要查哪几行能提前算出来,不拖慢速度。模型并没有变小,只是大头从显存挪到了内存,所以要 64GB 内存。
Strata 和 llama.cpp 跑法有什么不同?
和整个放进显存比,Strata 把显存需求从约 75GB 降到 12GB,少了八成多;和 llama.cpp 把专家放内存比,两者显存都要得少,差别在速度:同一台机器上 Strata 是 llama.cpp 的两倍多。

整个放进显存要多少,本站模型库实时计算:
闲鱼
| 模型 | 2-bit | 4-bit | 最便宜能跑的卡 | ||
|---|---|---|---|---|---|
| 8K 上下文 | 32K 上下文 | 8K 上下文 | 32K 上下文 | ||
| Qwen3.8 Flash Next176B · A6B | 75 GB卸载:4 GB 显存 + 73 GB 内存 | 76 GB卸载:4 GB 显存 + 73 GB 内存 | 105 GB卸载:4 GB 显存 + 103 GB 内存 | 106 GB卸载:5 GB 显存 + 103 GB 内存 | |
Strata 快在三处。
第一招:按专家挑常用的放显卡
llama.cpp 按层分:12GB 显卡扣掉公共部分还剩约 6GB,每层专家约 0.7GB,只放得下 8 层左右,占 48 层的六分之一。Strata 从所有层里挑最常用的约 4,500 个专家,放进同样的 6GB,边聊边换,实测每个字要用的专家有 72% 在显卡上。CPU 要从内存读的量,只有按层分的三分之一左右。
第二招:显卡和 CPU 同时算

llama.cpp 里 CPU 算专家时,显卡在等。Strata 把每层选中的 10 个专家拆开:显卡算手上的约 7 个,CPU 同时在内存里算剩下的约 3 个。缺的专家不搬去显卡,因为 PCIe 4.0 x16 只有约 26 GB/s,比 CPU 直接读内存(41 到 52 GB/s)还慢。
第三招:先猜后验,一趟出几个字

模型自带一层「学徒」(MTP 预测层),先猜后面最多 3 个字,主模型走一趟一起检查,猜对的留下。走一趟最贵的是读 3.5GB 公共部分,检查几个位置都只读一遍。实测这一招让速度从每秒 47 到 57 个 token 提到 82 到 92 个,输出和不猜时一字不差。
代价是什么?
- 精度低一些:用的是 2 到 3 bit 压缩版,Q2_0 最快,IQ3_S 最接近原版。原理见《量化模型是什么》。
- 只能跑这一个模型:换别的模型还得用 llama.cpp、Ollama。
- 一次只服务一个人:一次只处理一个请求,不适合给团队当公用服务器。
- Coder 版中文差:中文用户选 Q2_0、IQ2_XS 或 IQ3_S。
哪些显卡能跑 Qwen3.8-Flash-Next?
NVIDIA RTX 20 系或更新、主流 AMD RX 7000 和 9000 系,显存 12GB 以上;内存要 64GB。
- NVIDIA:GeForce RTX 20、30、40、50 系,显存 12GB 以上。
- AMD:RX 7900 XT/XTX、7800 XT、7700 XT、9060 XT、9070/9070 XT、Radeon AI PRO R9700;RX 6800/6900 系列能装但官方没验证。
- 实验支持:Tesla P40、V100、Instinct MI50、Intel Arc 有社区写的实验版,要单独安装或自己编译(说明)。
选卡看显存容量,不看新旧。 显存每多 1GB,能多放约 700 个专家,CPU 的活就少一些:

RTX 5060 Ti 显存多 4GB 但带宽低(448 对 672 GB/s),速度和 5070 差不多;RTX 3090 显存翻倍、带宽也更高,估算快一半。RTX 5090 那行来自社区报告,以上数字本站都没有复测。
本站收录的支持显卡,当前二手价:
闲鱼
| 型号 | 显存 GB | 带宽 GB/s | INT8 TOPS | 功耗 W | 闲鱼 | 显存单价 |
|---|---|---|---|---|---|---|
| 12 | 360 | 102 | 170 | ¥2,000 | ¥167 | |
| 22 | 616 | 215 | 250 | ¥2,846 | ¥129 | |
| Radeon RX 7800 XT | 16 | 624 | 75 | 263 | ¥3,100 | ¥194 |
| 16 | 288 | 177 | 165 | ¥3,600 | ¥225 | |
| 16 | 448 | 190 | 180 | ¥4,867 | ¥304 | |
| Radeon RX 9070 XT | 16 | 640 | 389 | 304 | ¥5,394 | ¥337 |
| 12 | 672 | 247 | 250 | ¥6,278 | ¥523 | |
| 24 | 936 | 285 | 350 | ¥8,194 | ¥341 | |
| 16 | 896 | 352 | 300 | ¥8,619 | ¥539 | |
| 24 | 1,008 | 661 | 450 | ¥23,294 | ¥971 | |
| 32 | 1,792 | 838 | 575 | ¥44,999 | ¥1,406 |
灰色价格近期没有新挂单,显示的是上次有效报价。
- 最便宜能跑:RTX 3060 12GB,闲鱼不到 2,000 元,但还没人实测;显存带宽只有 RTX 5070 的一半多,会慢一些。
- 显存大、价格低:2080 Ti 22GB 魔改卡,Turing 架构在支持范围内,但魔改卡有售后风险。
- 想明显更快:二手 RTX 3090 24GB,挑卡注意事项见《二手 3090 还是新 5070 Ti》。
内存决定能跑哪一版(模型说明):

内存买两条 32GB,不要四条 16GB,DDR5 插满四条常要降频。没进显卡的专家由 CPU 算,所以 DDR5 平台和支持 AVX-512 的 CPU(AMD Ryzen 7000、9000 系列)更快;DDR4 带宽约为 DDR5 的一半,能跑但达不到官方数字。
用 Strata 能省多少钱?
按整机比:RTX 5070 加 64GB 内存的 Strata 主机约 14,600 元,比 Ryzen AI Max+ 395 128GB 便宜约 2,600 元,2-bit 速度是它的两倍多;DGX Spark 要约 34,600 元,贵一倍多,速度也不如 Strata 主机。

395 和 DGX Spark 的长处是还能跑 4-bit 和别的模型;只为跑 Qwen3.8-Flash-Next,Strata 主机更划算。
如何安装 Strata?
装好显卡驱动,下载项目,Windows 双击 START-HERE.bat、Linux 运行 ./setup.sh,一路按回车就行。 Python、推理引擎和模型都由安装程序自动装(安装说明)。
- 装驱动:NVIDIA 驱动要 580 或更新;AMD 在 Windows 用新版 Adrenalin,Linux 用系统自带驱动。
- 留硬盘:模型约 70 到 80GB;在支持 AVX-512 的 CPU 上用 Q2_0,还要多留约 40GB。
- 下载项目:从 GitHub 下载压缩包解压,或者
git clone。 - 运行安装:Windows 双击
START-HERE.bat,Linux 运行./setup.sh。它会识别显卡、按内存推荐版本,按回车接受推荐即可。 - 等下载和启动:模型约 70GB,中断后能续传。下完自动启动,浏览器打开
http://127.0.0.1:8080就能聊天。启动时要把 35 到 55GB 读进内存,电脑可能卡 1 到 3 分钟,属正常。
以后再双击 START-HERE.bat 就直接启动,30 到 90 秒载入,关掉窗口即停止。
- 接其他软件:添加「OpenAI 兼容」服务,地址填
http://127.0.0.1:8080/v1,密钥和模型名随便填;Claude Code 设置ANTHROPIC_BASE_URL=http://127.0.0.1:8080。 - 多张显卡:两三张 NVIDIA 显卡可以一起用,不需要 NVLink(多卡说明、本站多卡入门)。
数据口径:模型结构、Strata 的速度和内存需求来自 Strata 仓库的 README、文档、论文和社区报告,llama.cpp 对比来自 issue #28,本站都没有复测;Ryzen AI Max+ 395 和 DGX Spark 的速度是本站估算;手写价格是 2026 年 10 月 4 日闲鱼中位价,实时表格由本站数据库生成。
常见问题
Strata 和 Ollama、LM Studio 有什么区别?
Ollama 和 LM Studio 是通用工具,什么模型都能跑。Strata 只跑 Qwen3.8-Flash-Next,照着它的结构定做:按专家挑常用的放显卡、显卡和 CPU 同时算、用模型自带的预测层一趟出几个字。跑这个模型时 Strata 快得多,换别的模型就用不了。
我只有 32GB 内存,能用吗?
只能跑 Coder 版,它删掉了一半专家,中文回答容易出错;配 24GB 显卡时也能跑 Q2_0 和 IQ2_XS。48GB 能跑最小的两档(Q2_0 和 IQ2_XS),64GB 所有版本都能跑。
钱有限,先加内存还是先换显卡?
先加内存。内存不够,模型启动不了;显卡只影响快慢。内存到 64GB 以后再升级显卡,主要看显存大小。
压缩到 2 到 3 bit,模型会不会变笨?
会损失一些。Q2_0 最快,IQ3_S 最接近原版;负责压缩的 ISTA-DASLab 称 IQ3_S 在公开测试上和原模型持平,本站没有复测。看重质量就用 64GB 内存跑 IQ3_S。
AMD 显卡和 Mac 能用吗?
AMD 显卡可以,支持 RX 7900 XT/XTX、7800 XT、7700 XT、9060 XT、9070/9070 XT 和 Radeon AI PRO R9700,显存要 12GB 以上;Windows 下暂时不能输入图片。Mac 不支持,Strata 只有 Windows 和 Linux 版本。



