用二手伺服器加 DDR4 低成本跑大模型:雙 3090 方案能跑多快,錢花在哪(2026)

譯自简体中文版 · 閱讀原文

想在家跑 DeepSeek V4 FlashGLM 5.3 Flash 這種 300B 級的模型,最便宜的路不是買顯示卡,是買記憶體。一顆二手 EPYC、8 條 32GB DDR4、兩張 RTX 3090,閒魚價約 NT$15.5 萬(人民幣 33,000 元換算)上下,就能跑 Q4 量化的 V4 Flash 和 GLM 5.3 Flash,預估生成 20 到 30 tokens/s。 同樣裝得下這兩個模型的其他方案,最便宜的是八張 3090 或一台 Mac Studio M3 Ultra 512GB,都要貴兩到四倍。下面按四個問題講:為什麼能跑、為什麼要雙 3090、能跑多快、錢花在哪。資料截至 2026 年 9 月 14 日。

示意圖:藍圖風格的等距插畫,一台打開頂蓋的雙路機架伺服器,兩顆 CPU 周圍插滿琥珀色的記憶體條,虛線箭頭從記憶體指向 CPU,旁邊放著一張渦輪顯示卡
示意圖 · 藍圖風格的等距插畫,一台打開頂蓋的雙路機架伺服器,兩顆 CPU 周圍插滿琥珀色的記憶體條,虛線箭頭從記憶體指向 CPU,旁邊放著一張渦輪顯示卡

為什麼伺服器加 DDR4 能跑 300B 的模型?

因為這些模型是 MoE,每個 token 只用一小部分參數,而且這一小部分可以從記憶體讀;做這件事的軟體是 llama.cpp 和它的分支 ik_llama.cpp。 DeepSeek V4 Flash 有 284B 參數、256 個專家,每個 token 只啟用 6 個專家加注意力層,合計 13B。GLM 5.3 Flash 是 320B、288 個專家,每個 token 啟用 18B。

llama.cpp 把這兩類權重分開放:注意力層、共享專家和 KV cache 放顯示卡,佔幾個 GB;256 個專家放記憶體,佔 100 到 200 GB。每生成一個 token,顯示卡算自己那部分,再從記憶體讀 6 到 8 個專家。讀得多快,生成就多快。

記憶體讀多快,取決於通道數乘以頻率:

表格:桌上型電腦雙通道 DDR5 90 GB/s,二手 Xeon 6 通道 DDR4 141 GB/s,二手 EPYC 8 通道 DDR4-2666 171 GB/s、DDR4-3200 205 GB/s,新 EPYC 12 通道 DDR5 461 GB/s
表格:桌上型電腦雙通道 DDR5 90 GB/s,二手 Xeon 6 通道 DDR4 141 GB/s,二手 EPYC 8 通道 DDR4-2666 171 GB/s、DDR4-3200 205 GB/s,新 EPYC 12 通道 DDR5 461 GB/s
示意圖:多車道高速公路上車流暢通,旁邊的雙車道山路排著長隊,比喻八通道伺服器記憶體與雙通道桌上型電腦記憶體的頻寬差距
示意圖:多車道高速公路上車流暢通,旁邊的雙車道山路排著長隊,比喻八通道伺服器記憶體與雙通道桌上型電腦記憶體的頻寬差距

桌上型電腦也能跑,但 8 通道伺服器比它快一倍多,而且桌上型電腦最多插 128GB,裝不下 V4 Flash 的 Q4。這就是為什麼要買伺服器:不是為了 CPU,是為了 8 條記憶體插槽。

為什麼要配兩張 3090?

一張 3090 負責三件事:放注意力層和共享專家、放 KV cache、批次處理提示詞;第二張的價值是把 KV cache 翻倍、多放六層專家、提示詞處理更快,生成速度只快一成。 先看一張卡的 24GB 都用在哪:

表格:一張 RTX 3090 的 24GB 顯示記憶體怎麼分:注意力層和共享專家 3.7 到 5.3 GB,32K 上下文的 KV cache 1.4 到 2.7 GB,計算緩衝約 2 GB,剩下放 3 到 4 層專家
表格:一張 RTX 3090 的 24GB 顯示記憶體怎麼分:注意力層和共享專家 3.7 到 5.3 GB,32K 上下文的 KV cache 1.4 到 2.7 GB,計算緩衝約 2 GB,剩下放 3 到 4 層專家

生成速度的大頭在記憶體那段:每個 token 從記憶體讀 3.7 GB(V4 Flash)或 4.9 GB(GLM)的專家,8 通道 DDR4-2666 要 30 到 40 毫秒;顯示卡那段只有 5 到 8 毫秒。所以第二張卡多放六層專家,只是把記憶體那段縮短一成多,生成從 25 提到 27 tokens/s。

第二張卡真正值的是另外兩件事:

  • 上下文。 KV cache 從一張卡剩的十幾 GB 變成四十多 GB,V4 Flash 能開到 128K,Agent 場景多輪對話不用頻繁清空。
  • 提示詞處理。 讀提示詞是按批次算的,llama.cpp 會把整批 token 送進顯示卡,連放在記憶體裡的專家也臨時搬過去算。顯示卡越多、批次越大,這一步越快,實測 65 到 500 tokens/s,取決於批次大小和上下文長度。

選 3090 而不是 4090、5090 的理由很簡單:這套方案裡顯示卡不是瓶頸,24GB 顯示記憶體每 GB 約 NT$1,570 是最便宜的;兩張 3090 約 NT$7.5 萬,一張 4090 就要約 NT$10.8 萬。兩張卡不需要 NVLink。

反例也要寫在前面:一位 4 通道 DDR4 的使用者雙 3090 只有 5 到 6 tokens/s,換回單卡反而 9.5;另一位 4 張 3090 加 256GB DDR4 的使用者「最多 6」。多卡拆分沒調對會更慢,所以先用一張卡跑通,再加第二張(Unsloth V4 Flash 討論區)。

能跑多快,各精度要多少顯示記憶體和記憶體?

Q4 是日常能用的精度:V4 Flash 要 155 GB、GLM 5.3 Flash 要 200 GB 記憶體;生成速度 2 張 3090 加 8 通道 DDR4 約 27 和 21 tokens/s,降到 3-bit 快兩成,2-bit 快五成。 先看各精度的檔案大小,兩個模型都取 Unsloth 的 UD 動態量化,準確率是 Unsloth 在 GLM 5.3 Flash 上測的 top-1(V4 Flash GGUFGLM 5.3 Flash GGUF):

表格:DeepSeek V4 Flash 與 GLM 5.3 Flash 從 1-bit 到 8-bit 各精度的 GGUF 檔案大小、GLM 的準確率,以及 128GB 和 256GB 兩檔各能跑到哪一級
表格:DeepSeek V4 Flash 與 GLM 5.3 Flash 從 1-bit 到 8-bit 各精度的 GGUF 檔案大小、GLM 的準確率,以及 128GB 和 256GB 兩檔各能跑到哪一級

記憶體要按檔案大小減去放進顯示卡的幾個 GB 再留兩成餘量。上下文開多大主要影響顯示記憶體那一份:下面這張表由模型庫按參數量即時估算,給 3-bit 和 4-bit 在 32K、128K、256K 上下文下的總需求,「卸載」列是顯示卡和記憶體各佔多少:

模型3-bit4-bit
32K 上下文128K 上下文256K 上下文32K 上下文128K 上下文256K 上下文
DeepSeek V4 Flash284B · A13B140 GB卸載:8 GB 顯示記憶體 + 133 GB 記憶體148 GB卸載:16 GB 顯示記憶體 + 133 GB 記憶體159 GB卸載:27 GB 顯示記憶體 + 133 GB 記憶體162 GB卸載:9 GB 顯示記憶體 + 155 GB 記憶體171 GB卸載:17 GB 顯示記憶體 + 155 GB 記憶體181 GB卸載:28 GB 顯示記憶體 + 155 GB 記憶體
GLM 5.3 Flash320B · A18B156 GB卸載:8 GB 顯示記憶體 + 149 GB 記憶體160 GB卸載:13 GB 顯示記憶體 + 149 GB 記憶體166 GB卸載:18 GB 顯示記憶體 + 149 GB 記憶體181 GB卸載:9 GB 顯示記憶體 + 174 GB 記憶體185 GB卸載:13 GB 顯示記憶體 + 174 GB 記憶體191 GB卸載:19 GB 顯示記憶體 + 174 GB 記憶體

生成速度按本站的專家卸載公式(方法說明)算,32K 上下文:

表格:2-bit、3-bit、4-bit 下 V4 Flash 與 GLM 5.3 Flash 在一張和兩張 3090 加 8 通道 DDR4-2666 上的預估生成速度,從 41 到 19 tokens/s
表格:2-bit、3-bit、4-bit 下 V4 Flash 與 GLM 5.3 Flash 在一張和兩張 3090 加 8 通道 DDR4-2666 上的預估生成速度,從 41 到 19 tokens/s

演算法是每個 token 的耗時分三段相加:顯示卡讀注意力層、共享專家和放進顯示記憶體的那幾層專家,按 936 GB/s 算;記憶體讀剩下的專家,8 通道 DDR4-2666 按 171 GB/s 算;再加 4 毫秒的路由開銷。頻寬都乘 0.7 的效率。換成 DDR4-3200 快一成,換成 12 通道 DDR5 快七成。

拿公開實測校一下公式。三張 3090 加 DDR4 跑 GLM 5.3 Flash 的 IQ3_XXS,實測生成 14.6 tokens/s,公式給 25,六成;雙路 EPYC 8 通道 DDR4-2666 跑 V4 Flash 的 Q8_K_XL,實測 20,公式按 Q4 口徑算是 27,七成(ik_llama.cpp PR #2376Unsloth V4 Flash 討論區)。所以上面那張速度表裡的數按六到十成看,V4 Flash Q4 落在 18 到 27 之間是正常的。

兩件事會讓數字偏離上面那張速度表:

  • 提示詞處理是另一個數,別混。 llama.cpp 每次回答完打兩行速度,prompt eval 是讀提示詞的速度,批次大小開到 4096 時 65 到 500 tokens/s 都正常;eval 才是生成回答的速度,就是上面那張速度表這個數。網路上「跑到 100 多」的貼文,多半貼的是第一行。
  • 上下文越長越慢。 同一台單 3090 加 8 通道 DDR4-3200 的機器,餵 69K 的提示詞跑 GLM 5.3 Flash,實測生成只剩 6.1 tokens/s,因為每個 token 都要多算一大段注意力。

錢花在哪,比多卡和 Mac 便宜多少?

記憶體只買 DDR4,分兩檔:8 條 16GB 的 128GB 檔約 NT$89,000,跑到 3-bit;8 條 32GB 的 256GB 檔約 NT$155,000,跑到 Q4,V4 Flash 還能上無損的 Q8_K_XL。 記憶體價格是即時資料,按單路插滿 8 通道算:

規格單條價格每 GB 單價最高支援通道數最大頻寬 GB/s插滿通道(單路)
DDR4-2666 16 GB伺服器 · RDIMMNT$4,261NT$2668171128 GB8 條 × 16 GB · NT$34,085
DDR4-2666 32 GB伺服器 · RDIMMNT$6,375NT$1998171256 GB8 條 × 32 GB · NT$51,001

單條中位價,套裝按核實條數換算。頻寬是這種條子在對應平台插滿通道時的理論上限(桌上型電腦 2 通道;DDR4 伺服器單路 8 通道;DDR5 伺服器單路 12 通道),實際由 CPU 與主機板決定。「插滿通道」按伺服器單路每通道一條、桌上型電腦 4 條算,只含記憶體條本身,不含 CPU、主機板與整機。

兩檔整機按閒魚目前價:

表格:128GB 檔與 256GB 檔的整機清單,記憶體、顯示卡、CPU 主機板、電源機殼各多少錢,合計約 NT$89,000 與 NT$155,000,各自能跑的最高精度與預估生成速度
表格:128GB 檔與 256GB 檔的整機清單,記憶體、顯示卡、CPU 主機板、電源機殼各多少錢,合計約 NT$89,000 與 NT$155,000,各自能跑的最高精度與預估生成速度

CPU 和主機板這一行本站不採集,是按 2026 年 9 月 eBay 上雙路 EPYC 7642 加 512GB 整機 2,700 到 3,300 美元的行情倒推的。128GB 檔便宜約 NT$6.6 萬,代價是精度停在 3-bit:GLM 5.3 Flash 的 3-bit 準確率 82%,Q4 是 92%,寫程式碼和長推理能感覺出來。想用 16GB 的記憶體條湊 256GB 要 16 條,單路主機板插不下。

再看同樣裝得下 V4 Flash Q4 的其他方案:

表格:同樣裝得下 V4 Flash Q4 的五種方案:DDR4 256GB 加兩張 3090 約 NT$155,000,8 張 3090 顯示卡就要 NT$30 萬,兩張 RTX PRO 6000 約 NT$118 萬,Mac Studio M3 Ultra 512GB 約 NT$62 萬,Ryzen AI Max+ 395 128GB 約 NT$8.5 萬只能跑 3-bit
表格:同樣裝得下 V4 Flash Q4 的五種方案:DDR4 256GB 加兩張 3090 約 NT$155,000,8 張 3090 顯示卡就要 NT$30 萬,兩張 RTX PRO 6000 約 NT$118 萬,Mac Studio M3 Ultra 512GB 約 NT$62 萬,Ryzen AI Max+ 395 128GB 約 NT$8.5 萬只能跑 3-bit
型號顯存 GB頻寬 GB/sINT8 TOPS功耗 WeBay顯存單價
Ryzen AI Max+ 395 128GB12825659120NT$129,869NT$1,015
Mac Studio M3 Ultra 512GB512819480NT$654,866NT$1,279
GeForce RTX 309024936285350NT$50,496NT$2,104
RTX PRO 6000 Blackwell961,7921,000600NT$536,043NT$5,584

三個結論:

  • 純顯示卡方案沒有中間檔。 4 張 3090 的 96GB 連 V4 Flash 的 2-bit(97 GB)都裝不下,要裝 Q4 得 8 張,光卡就約 NT$30 萬,還要能插 8 卡的主機板、拆分線和 3000W 電源供應器。兩張 RTX PRO 6000 是約 NT$118 萬。
  • Mac 是速度快一半、價格貴四倍。 M3 Ultra 512GB 的 819 GB/s 統一記憶體跑 V4 Flash Q4 預估 43 tokens/s,能跑無損版,安靜、省電、不用折騰,但約 NT$62 萬。
  • Ryzen AI Max+ 395 是 128GB 檔的對手。 約 NT$8.5 萬的迷你主機,128GB 統一記憶體只有 256 GB/s,跑 V4 Flash 3-bit 預估 16 tokens/s,比 128GB 檔的 DDR4 伺服器慢一半,但體積和噪音是另一個世界。

DDR4 每 GB 約 NT$206,是 DDR5 伺服器條的五分之一、3090 顯示記憶體的八分之一,所以 2026 年這條路只有 DDR4 走得通。壞消息是 DDR4 在停產週期裡:美光 2026 年 6 月發出停產通知,三星、海力士只把停產推遲到 2026 年(TrendForce)。2025 年 1 月有人 400 美元買到 512GB DDR4-2400(Digital Spaceport),2026 年 9 月同樣的量在 eBay 要 3,200 美元。要買先買記憶體。

配件選擇的三條經驗:

  • CPU 買 EPYC 7003,7002 也行,但避開 7232P、7252、7262、7272、7282。 這五顆只有兩個 CCD,記憶體頻寬減半(ServeTheHome)。核數 32 夠用,再多沒有回報。
  • 主機板要單路 8 槽。 Gigabyte MZ32-AR0、Supermicro H12SSL 是常見選擇。雙路主機板只在你確認要 16 條以上記憶體時才買。
  • 記憶體整機同一種。 RDIMM 和 LRDIMM 不能混插;2666 和 3200 價差不大時買 3200,頻寬差兩成。

裝好之後怎麼啟動?

用 llama.cpp 的 llama-server,注意力層全放顯示卡,專家權重全放記憶體,跑通了再把專家往顯示卡挪。 第一步,專家全放記憶體:

./llama-server -m DeepSeek-V4-Flash-0731-UD-Q4_K_XL-00001-of-00004.gguf \
  -ngl 99 --n-cpu-moe 43 -t 32 -c 32768 -fa on -b 4096 -ub 4096 \
  --host 0.0.0.0 --port 8080

三個參數決定一切:-ngl 99 把所有層交給顯示卡;--n-cpu-moe 43 再把 43 層的專家權重退回記憶體,V4 Flash 有 43 層,GLM 5.3 Flash 填 45;-b 4096 -ub 4096 讓提示詞按 4096 個 token 一批送進顯示卡算,這是提示詞處理能到幾百的關鍵,不加只有幾十。-t 填實體核心數。

第二步,看 nvidia-smi 的顯示記憶體餘量,把 --n-cpu-moe 往下調。每減 1,就有一層的專家(V4 Flash 約 3.7 GB)搬進顯示卡,生成快一點。一張 3090 大約減到 39,兩張減到 33,剩多少餘量給 KV cache 要自己試。兩張卡時先加 -ts 1,1 確認兩張卡的顯示記憶體都用上了,再動這個數。

ik_llama.cpp 是 llama.cpp 的分支,CPU 上的 MoE 運算核心更快,長上下文的 GLM 5.3 Flash 用它更合適。上面實測裡三張 3090 那位的命令是:

./llama-server -m GLM-5.3-Flash-UD-IQ3_XXS-00001-of-00003.gguf \
  --flash-attn on -mla 1 -ctk f16 -ctv f16 --dsa -ngl 999 -ot exps=CPU \
  -amb 512 -b 8192 -ub 2048 -c 32768

-ot exps=CPU--n-cpu-moe 是一回事,用正規表示式把所有專家張量指到 CPU;想留幾層在顯示卡,改成 -ot "blk\.(3[0-9]|4[0-4])\.ffn.*exps=CPU" 這種只匹配後面幾層的寫法。

會踩哪些坑?

三個坑按代價排序:雙路 NUMA、稠密模型、卡的拆分。

  1. 雙路伺服器不會快一倍。 兩顆 CPU 各接 8 通道,理論頻寬翻倍,但 llama.cpp 跨節點讀記憶體的開銷至今是開放問題(llama.cpp Issue #1437),實際拿到 1.3 到 1.6 倍。單路 8 條 32GB 不夠用時,先換 64GB 的記憶體條,再考慮雙路。真上雙路就加 --numa distribute
  2. 稠密模型別走這條路。 Qwen3.8 27B 這種全部啟用的模型,每個 token 要從記憶體讀 16 GB,8 通道 DDR4-3200 上只有 8 tokens/s,加 CPU 核數沒用。稠密模型請回到顯示卡,帳見顯示記憶體不夠,加記憶體有用嗎
  3. 多卡拆分調不好會更慢。 上面雙 3090 比單卡慢的例子就是這個。多卡時先加 -ts 手動指定兩張卡的比例,確認兩張卡顯示記憶體都用上了,再動 --n-cpu-moe

結論

一個人用、目標是 300B 級的 MoE 模型、能接受二三十 tokens/s 的生成速度,256GB 檔約 NT$15.5 萬的機器是 2026 年最便宜的答案;只想試跑或預算卡在約 NT$9 萬,128GB 檔跑 3-bit;要 50 以上的生成速度、或者主力是稠密模型,別買。

常見問題

第二張 3090 到底買不買?

先用一張跑通再說。第二張卡的 24GB 能多放六層專家權重,生成速度只快一成左右,真正的收益是 KV cache 翻倍、上下文能開到 128K、提示詞處理更快。反例也有:一位使用者雙卡 5 到 6 tokens/s,換回單卡反而 9.5,問題出在兩張卡的拆分設定。

128GB 記憶體夠跑哪些精度?

DeepSeek V4 Flash 能跑到 UD-IQ3_S(117 GB),GLM 5.3 Flash 能跑到 UD-IQ3_XXS(120 GB),也就是 3-bit。Q4 分別要 155 GB 和 200 GB,裝不下。想日常用 Q4 就買 8 條 32GB 上到 256GB。

用 llama.cpp 還是 ik_llama.cpp?

先用 llama.cpp,官方支援新模型最快、--n-cpu-moe 一個參數就能把專家放進記憶體。ik_llama.cpp 是它的分支,CPU 上的 MoE 運算核心更快、長上下文的 MLA 和稀疏注意力實作更省顯示記憶體,GLM 5.3 Flash 這類要跑幾萬 token 上下文的用它更合適,但新模型的支援會晚幾天到幾週。

2026 年 DDR4 還便宜嗎?

相對便宜。DDR4-2666 32GB 伺服器條閒魚約 NT$6,600,每 GB 約 NT$206,是 DDR5 伺服器條的五分之一。但 2025 年初 512GB 只要 400 美元,現在 eBay 要 3,200 美元,而且美光已發停產通知、三星和海力士也只推遲到 2026 年。要買就早買,本站記憶體榜每 6 小時更新。

文中提到的顯示卡

文中提到的模型