用二手服务器加 DDR4 低成本跑大模型:双 3090 方案能跑多快,钱花在哪(2026)

想在家跑 DeepSeek V4 FlashGLM 5.3 Flash 这种 300B 级的模型,最便宜的路不是买显卡,是买内存。一颗二手 EPYC、8 条 32GB DDR4、两张 RTX 3090,闲鱼价三万三千元上下,就能跑 Q4 量化的 V4 Flash 和 GLM 5.3 Flash,预估生成 20 到 30 tokens/s。 同样装得下这两个模型的其他方案,最便宜的是八张 3090 或一台 Mac Studio M3 Ultra 512GB,都要贵两到四倍。下面按四个问题讲:为什么能跑、为什么要双 3090、能跑多快、钱花在哪。数据截至 2026 年 9 月 14 日。

示意图:蓝图风格的等距插画,一台打开顶盖的双路机架服务器,两颗 CPU 周围插满琥珀色的内存条,虚线箭头从内存指向 CPU,旁边放着一张涡轮显卡
示意图 · 蓝图风格的等距插画,一台打开顶盖的双路机架服务器,两颗 CPU 周围插满琥珀色的内存条,虚线箭头从内存指向 CPU,旁边放着一张涡轮显卡

为什么服务器加 DDR4 能跑 300B 的模型?

因为这些模型是 MoE,每个 token 只用一小部分参数,而且这一小部分可以从内存读;干这件事的软件是 llama.cpp 和它的分支 ik_llama.cpp。 DeepSeek V4 Flash 有 284B 参数、256 个专家,每个 token 只激活 6 个专家加注意力层,合计 13B。GLM 5.3 Flash 是 320B、288 个专家,每个 token 激活 18B。

llama.cpp 把这两类权重分开放:注意力层、共享专家和 KV cache 放显卡,占几个 GB;256 个专家放内存,占 100 到 200 GB。每生成一个 token,显卡算自己那部分,再从内存读 6 到 8 个专家。读得多快,生成就多快。

内存读多快,取决于通道数乘以频率:

表格:台式机双通道 DDR5 90 GB/s,二手 Xeon 6 通道 DDR4 141 GB/s,二手 EPYC 8 通道 DDR4-2666 171 GB/s、DDR4-3200 205 GB/s,新 EPYC 12 通道 DDR5 461 GB/s
表格:台式机双通道 DDR5 90 GB/s,二手 Xeon 6 通道 DDR4 141 GB/s,二手 EPYC 8 通道 DDR4-2666 171 GB/s、DDR4-3200 205 GB/s,新 EPYC 12 通道 DDR5 461 GB/s
示意图:多车道高速公路上车流畅通,旁边的双车道山路排着长队,比喻八通道服务器内存与双通道台式机内存的带宽差距
示意图:多车道高速公路上车流畅通,旁边的双车道山路排着长队,比喻八通道服务器内存与双通道台式机内存的带宽差距

台式机也能跑,但 8 通道服务器比它快一倍多,而且台式机最多插 128GB,装不下 V4 Flash 的 Q4。这就是为什么要买服务器:不是为了 CPU,是为了 8 条内存槽。

为什么要配两张 3090?

一张 3090 负责三件事:放注意力层和共享专家、放 KV cache、批量处理提示词;第二张的价值是把 KV cache 翻倍、多放六层专家、提示词处理更快,生成速度只快一成。 先看一张卡的 24GB 都用在哪:

表格:一张 RTX 3090 的 24GB 显存怎么分:注意力层和共享专家 3.7 到 5.3 GB,32K 上下文的 KV cache 1.4 到 2.7 GB,计算缓冲约 2 GB,剩下放 3 到 4 层专家
表格:一张 RTX 3090 的 24GB 显存怎么分:注意力层和共享专家 3.7 到 5.3 GB,32K 上下文的 KV cache 1.4 到 2.7 GB,计算缓冲约 2 GB,剩下放 3 到 4 层专家

生成速度的大头在内存那段:每个 token 从内存读 3.7 GB(V4 Flash)或 4.9 GB(GLM)的专家,8 通道 DDR4-2666 要 30 到 40 毫秒;显卡那段只有 5 到 8 毫秒。所以第二张卡多放六层专家,只是把内存那段缩短一成多,生成从 25 提到 27 tokens/s。

第二张卡真正值的是另外两件事:

  • 上下文。 KV cache 从一张卡剩的十几 GB 变成四十多 GB,V4 Flash 能开到 128K,Agent 场景多轮对话不用频繁清空。
  • 提示词处理。 读提示词是按批算的,llama.cpp 会把整批 token 送进显卡,连放在内存里的专家也临时搬过去算。显卡越多、批越大,这一步越快,实测 65 到 500 tokens/s,取决于批大小和上下文长度。

选 3090 而不是 4090、5090 的理由很简单:这套方案里显卡不是瓶颈,24GB 显存每 GB 333 元是最便宜的;两张 3090 一万六,一张 4090 就要两万三。两张卡不需要 NVLink。

反例也要写在前面:一位 4 通道 DDR4 的用户双 3090 只有 5 到 6 tokens/s,换回单卡反而 9.5;另一位 4 张 3090 加 256GB DDR4 的用户「最多 6」。多卡拆分没调对会更慢,所以先用一张卡跑通,再加第二张(Unsloth V4 Flash 讨论区)。

能跑多快,各精度要多少显存和内存?

Q4 是日常能用的精度:V4 Flash 要 155 GB、GLM 5.3 Flash 要 200 GB 内存;生成速度 2 张 3090 加 8 通道 DDR4 约 27 和 21 tokens/s,降到 3-bit 快两成,2-bit 快五成。 先看各精度的文件大小,两个模型都取 Unsloth 的 UD 动态量化,准确率是 Unsloth 在 GLM 5.3 Flash 上测的 top-1(V4 Flash GGUFGLM 5.3 Flash GGUF):

表格:DeepSeek V4 Flash 与 GLM 5.3 Flash 从 1-bit 到 8-bit 各精度的 GGUF 文件大小、GLM 的准确率,以及 128GB 和 256GB 两档各能跑到哪一级
表格:DeepSeek V4 Flash 与 GLM 5.3 Flash 从 1-bit 到 8-bit 各精度的 GGUF 文件大小、GLM 的准确率,以及 128GB 和 256GB 两档各能跑到哪一级

内存要按文件大小减去放进显卡的几个 GB 再留两成余量。上下文开多大主要影响显存那一份:下表由模型库按参数量实时估算,给 3-bit 和 4-bit 在 32K、128K、256K 上下文下的总需求,「卸载」列是显卡和内存各占多少:

模型3-bit4-bit
32K 上下文128K 上下文256K 上下文32K 上下文128K 上下文256K 上下文
DeepSeek V4 Flash284B · A13B140 GB卸载:8 GB 显存 + 133 GB 内存148 GB卸载:16 GB 显存 + 133 GB 内存159 GB卸载:27 GB 显存 + 133 GB 内存162 GB卸载:9 GB 显存 + 155 GB 内存171 GB卸载:17 GB 显存 + 155 GB 内存181 GB卸载:28 GB 显存 + 155 GB 内存
GLM 5.3 Flash320B · A18B156 GB卸载:8 GB 显存 + 149 GB 内存160 GB卸载:13 GB 显存 + 149 GB 内存166 GB卸载:18 GB 显存 + 149 GB 内存181 GB卸载:9 GB 显存 + 174 GB 内存185 GB卸载:13 GB 显存 + 174 GB 内存191 GB卸载:19 GB 显存 + 174 GB 内存

生成速度按本站的专家卸载公式(方法说明)算,32K 上下文:

表格:2-bit、3-bit、4-bit 下 V4 Flash 与 GLM 5.3 Flash 在一张和两张 3090 加 8 通道 DDR4-2666 上的预估生成速度,从 41 到 19 tokens/s
表格:2-bit、3-bit、4-bit 下 V4 Flash 与 GLM 5.3 Flash 在一张和两张 3090 加 8 通道 DDR4-2666 上的预估生成速度,从 41 到 19 tokens/s

算法是每个 token 的耗时分三段相加:显卡读注意力层、共享专家和放进显存的那几层专家,按 936 GB/s 算;内存读剩下的专家,8 通道 DDR4-2666 按 171 GB/s 算;再加 4 毫秒的路由开销。带宽都乘 0.7 的效率。换成 DDR4-3200 快一成,换成 12 通道 DDR5 快七成。

拿公开实测校一下公式。三张 3090 加 DDR4 跑 GLM 5.3 Flash 的 IQ3_XXS,实测生成 14.6 tokens/s,公式给 25,六成;双路 EPYC 8 通道 DDR4-2666 跑 V4 Flash 的 Q8_K_XL,实测 20,公式按 Q4 口径算是 27,七成(ik_llama.cpp PR #2376Unsloth V4 Flash 讨论区)。所以表里的数按六到十成看,V4 Flash Q4 落在 18 到 27 之间是正常的。

两件事会让数字偏离这张表:

  • 提示词处理是另一个数,别混。 llama.cpp 每次回答完打两行速度,prompt eval 是读提示词的速度,批大小开到 4096 时 65 到 500 tokens/s 都正常;eval 才是生成回答的速度,就是上表这个数。网上「跑到 100 多」的帖子,多半贴的是第一行。
  • 上下文越长越慢。 同一台单 3090 加 8 通道 DDR4-3200 的机器,喂 69K 的提示词跑 GLM 5.3 Flash,实测生成只剩 6.1 tokens/s,因为每个 token 都要多算一大段注意力。

钱花在哪,比多卡和 Mac 便宜多少?

内存只买 DDR4,分两档:8 条 16GB 的 128GB 档约一万九千元,跑到 3-bit;8 条 32GB 的 256GB 档约三万三千元,跑到 Q4,V4 Flash 还能上无损的 Q8_K_XL。 内存价格是实时数据,按单路插满 8 通道算:

规格单条价格每 GB 单价最高支持通道数最大带宽 GB/s插满通道(单路)
DDR4-2666 16 GB服务器 · RDIMM¥1,374¥868171128 GB8 条 × 16 GB · ¥10,995
DDR4-2666 32 GB服务器 · RDIMM¥1,793¥568171256 GB8 条 × 32 GB · ¥14,348

单条中位价,套装按核实条数折算。带宽是这种条子在对应平台插满通道时的理论上限(台式机 2 通道;DDR4 服务器单路 8 通道;DDR5 服务器单路 12 通道),实际由 CPU 与主板决定。「插满通道」按服务器单路每通道一条、台式机 4 条算,只含内存条本身,不含 CPU、主板与整机。

两档整机按闲鱼当前价:

表格:128GB 档与 256GB 档的整机清单,内存、显卡、CPU 主板、电源机箱各多少钱,合计约 19,000 元与 33,000 元,各自能跑的最高精度与预估生成速度
表格:128GB 档与 256GB 档的整机清单,内存、显卡、CPU 主板、电源机箱各多少钱,合计约 19,000 元与 33,000 元,各自能跑的最高精度与预估生成速度

CPU 和主板这一行本站不采集,是按 2026 年 9 月 eBay 上双路 EPYC 7642 加 512GB 整机 2,700 到 3,300 美元的行情倒推的。128GB 档便宜一万四,代价是精度停在 3-bit:GLM 5.3 Flash 的 3-bit 准确率 82%,Q4 是 92%,写代码和长推理能感觉出来。想用 16GB 的条子凑 256GB 要 16 条,单路主板插不下。

再看同样装得下 V4 Flash Q4 的其他方案:

表格:同样装得下 V4 Flash Q4 的五种方案:DDR4 256GB 加两张 3090 约 33,000 元,8 张 3090 显卡就要 64,000 元,两张 RTX PRO 6000 约 250,000 元,Mac Studio M3 Ultra 512GB 约 131,800 元,Ryzen AI Max+ 395 128GB 约 18,000 元只能跑 3-bit
表格:同样装得下 V4 Flash Q4 的五种方案:DDR4 256GB 加两张 3090 约 33,000 元,8 张 3090 显卡就要 64,000 元,两张 RTX PRO 6000 约 250,000 元,Mac Studio M3 Ultra 512GB 约 131,800 元,Ryzen AI Max+ 395 128GB 约 18,000 元只能跑 3-bit
型号显存 GB带宽 GB/sINT8 TOPS功耗 WAmazonJP显存单价
Ryzen AI Max+ 395 128GB12825659120¥26,143¥204
GeForce RTX 309024936285350¥17,672¥736
RTX PRO 6000 Blackwell961,7921,000600
Mac Studio M3 Ultra 512GB512819480

三个结论:

  • 纯显卡方案没有中间档。 4 张 3090 的 96GB 连 V4 Flash 的 2-bit(97 GB)都装不下,要装 Q4 得 8 张,光卡就六万四,还要能插 8 卡的主板、拆分线和 3000W 电源。两张 RTX PRO 6000 是 25 万。
  • Mac 是速度快一半、价格贵四倍。 M3 Ultra 512GB 的 819 GB/s 统一内存跑 V4 Flash Q4 预估 43 tokens/s,能跑无损版,安静、省电、不用折腾,但 13 万。
  • Ryzen AI Max+ 395 是 128GB 档的对手。 1 万 8 的迷你主机,128GB 统一内存只有 256 GB/s,跑 V4 Flash 3-bit 预估 16 tokens/s,比 128GB 档的 DDR4 服务器慢一半,但体积和噪音是另一个世界。

DDR4 每 GB 44 元,是 DDR5 服务器条的五分之一、3090 显存的八分之一,所以 2026 年这条路只有 DDR4 走得通。坏消息是 DDR4 在停产周期里:美光 2026 年 6 月发出停产通知,三星、海力士只把停产推迟到 2026 年(TrendForce)。2025 年 1 月有人 400 美元买到 512GB DDR4-2400(Digital Spaceport),2026 年 9 月同样的量在 eBay 要 3,200 美元。要买先买内存。

配件选择的三条经验:

  • CPU 买 EPYC 7003,7002 也行,但避开 7232P、7252、7262、7272、7282。 这五颗只有两个 CCD,内存带宽减半(ServeTheHome)。核数 32 够用,再多没有回报。
  • 主板要单路 8 槽。 Gigabyte MZ32-AR0、Supermicro H12SSL 是常见选择。双路主板只在你确认要 16 条以上内存时才买。
  • 内存整机同一种。 RDIMM 和 LRDIMM 不能混插;2666 和 3200 价差不大时买 3200,带宽差两成。

装好之后怎么启动?

用 llama.cpp 的 llama-server,注意力层全放显卡,专家权重全放内存,跑通了再把专家往显卡挪。 第一步,专家全放内存:

./llama-server -m DeepSeek-V4-Flash-0731-UD-Q4_K_XL-00001-of-00004.gguf \
  -ngl 99 --n-cpu-moe 43 -t 32 -c 32768 -fa on -b 4096 -ub 4096 \
  --host 0.0.0.0 --port 8080

三个参数决定一切:-ngl 99 把所有层交给显卡;--n-cpu-moe 43 再把 43 层的专家权重退回内存,V4 Flash 有 43 层,GLM 5.3 Flash 填 45;-b 4096 -ub 4096 让提示词按 4096 个 token 一批送进显卡算,这是提示词处理能到几百的关键,不加只有几十。-t 填物理核数。

第二步,看 nvidia-smi 的显存余量,把 --n-cpu-moe 往下调。每减 1,就有一层的专家(V4 Flash 约 3.7 GB)搬进显卡,生成快一点。一张 3090 大约减到 39,两张减到 33,剩多少余量给 KV cache 要自己试。两张卡时先加 -ts 1,1 确认两张卡的显存都用上了,再动这个数。

ik_llama.cpp 是 llama.cpp 的分支,CPU 上的 MoE 内核更快,长上下文的 GLM 5.3 Flash 用它更合适。上面实测里三张 3090 那位的命令是:

./llama-server -m GLM-5.3-Flash-UD-IQ3_XXS-00001-of-00003.gguf \
  --flash-attn on -mla 1 -ctk f16 -ctv f16 --dsa -ngl 999 -ot exps=CPU \
  -amb 512 -b 8192 -ub 2048 -c 32768

-ot exps=CPU--n-cpu-moe 是一回事,用正则把所有专家张量指到 CPU;想留几层在显卡,改成 -ot "blk\.(3[0-9]|4[0-4])\.ffn.*exps=CPU" 这种只匹配后面几层的写法。

会踩哪些坑?

三个坑按代价排序:双路 NUMA、稠密模型、卡的拆分。

  1. 双路服务器不会快一倍。 两颗 CPU 各接 8 通道,理论带宽翻倍,但 llama.cpp 跨节点读内存的开销至今是开放问题(llama.cpp Issue #1437),实际拿到 1.3 到 1.6 倍。单路 8 条 32GB 不够用时,先换 64GB 的条子,再考虑双路。真上双路就加 --numa distribute
  2. 稠密模型别走这条路。 Qwen3.8 27B 这种全部激活的模型,每个 token 要从内存读 16 GB,8 通道 DDR4-3200 上只有 8 tokens/s,加 CPU 核数没用。稠密模型请回到显卡,账见显存不够,加内存有用吗
  3. 多卡拆分调不好会更慢。 上面双 3090 比单卡慢的例子就是这个。多卡时先加 -ts 手动指定两张卡的比例,确认两张卡显存都用上了,再动 --n-cpu-moe

结论

一个人用、目标是 300B 级的 MoE 模型、能接受二三十 tokens/s 的生成速度,256GB 档三万三千元的机器是 2026 年最便宜的答案;只想试跑或预算卡在两万,128GB 档跑 3-bit;要 50 以上的生成速度、或者主力是稠密模型,别买。

常见问题

第二张 3090 到底买不买?

先用一张跑通再说。第二张卡的 24GB 能多放六层专家权重,生成速度只快一成左右,真正的收益是 KV cache 翻倍、上下文能开到 128K、提示词处理更快。反例也有:一位用户双卡 5 到 6 tokens/s,换回单卡反而 9.5,问题出在两张卡的拆分设置。

128GB 内存够跑哪些精度?

DeepSeek V4 Flash 能跑到 UD-IQ3_S(117 GB),GLM 5.3 Flash 能跑到 UD-IQ3_XXS(120 GB),也就是 3-bit。Q4 分别要 155 GB 和 200 GB,装不下。想日常用 Q4 就买 8 条 32GB 上到 256GB。

用 llama.cpp 还是 ik_llama.cpp?

先用 llama.cpp,官方支持新模型最快、--n-cpu-moe 一个参数就能把专家放进内存。ik_llama.cpp 是它的分支,CPU 上的 MoE 内核更快、长上下文的 MLA 和稀疏注意力实现更省显存,GLM 5.3 Flash 这类要跑几万 token 上下文的用它更合适,但新模型的支持会晚几天到几周。

2026 年 DDR4 还便宜吗?

相对便宜。DDR4-2666 32GB 服务器条闲鱼约 1,400 元,每 GB 44 元,是 DDR5 服务器条的五分之一。但 2025 年初 512GB 只要 400 美元,现在 eBay 要 3,200 美元,而且美光已发停产通知、三星和海力士也只推迟到 2026 年。要买就早买,本站内存榜每 6 小时更新。

文中提到的显卡

文中提到的模型