想在家跑 DeepSeek V4 Flash 或 GLM 5.3 Flash 這種 300B 級的模型,最便宜的路不是買顯示卡,是買記憶體。一顆二手 EPYC、8 條 32GB DDR4、兩張 RTX 3090,閒魚價約 NT$15.5 萬(人民幣 33,000 元換算)上下,就能跑 Q4 量化的 V4 Flash 和 GLM 5.3 Flash,預估生成 20 到 30 tokens/s。 同樣裝得下這兩個模型的其他方案,最便宜的是八張 3090 或一台 Mac Studio M3 Ultra 512GB,都要貴兩到四倍。下面按四個問題講:為什麼能跑、為什麼要雙 3090、能跑多快、錢花在哪。資料截至 2026 年 9 月 14 日。
用二手伺服器加 DDR4 低成本跑大模型:雙 3090 方案能跑多快,錢花在哪(2026)
譯自简体中文版 · 閱讀原文
正文與常見問題中的數字截至 2026年9月14日;表格使用最新已發布價格,各裝置採集時間可能不同。

為什麼伺服器加 DDR4 能跑 300B 的模型?
因為這些模型是 MoE,每個 token 只用一小部分參數,而且這一小部分可以從記憶體讀;做這件事的軟體是 llama.cpp 和它的分支 ik_llama.cpp。 DeepSeek V4 Flash 有 284B 參數、256 個專家,每個 token 只啟用 6 個專家加注意力層,合計 13B。GLM 5.3 Flash 是 320B、288 個專家,每個 token 啟用 18B。
llama.cpp 把這兩類權重分開放:注意力層、共享專家和 KV cache 放顯示卡,佔幾個 GB;256 個專家放記憶體,佔 100 到 200 GB。每生成一個 token,顯示卡算自己那部分,再從記憶體讀 6 到 8 個專家。讀得多快,生成就多快。
記憶體讀多快,取決於通道數乘以頻率:


桌上型電腦也能跑,但 8 通道伺服器比它快一倍多,而且桌上型電腦最多插 128GB,裝不下 V4 Flash 的 Q4。這就是為什麼要買伺服器:不是為了 CPU,是為了 8 條記憶體插槽。
為什麼要配兩張 3090?
一張 3090 負責三件事:放注意力層和共享專家、放 KV cache、批次處理提示詞;第二張的價值是把 KV cache 翻倍、多放六層專家、提示詞處理更快,生成速度只快一成。 先看一張卡的 24GB 都用在哪:

生成速度的大頭在記憶體那段:每個 token 從記憶體讀 3.7 GB(V4 Flash)或 4.9 GB(GLM)的專家,8 通道 DDR4-2666 要 30 到 40 毫秒;顯示卡那段只有 5 到 8 毫秒。所以第二張卡多放六層專家,只是把記憶體那段縮短一成多,生成從 25 提到 27 tokens/s。
第二張卡真正值的是另外兩件事:
- 上下文。 KV cache 從一張卡剩的十幾 GB 變成四十多 GB,V4 Flash 能開到 128K,Agent 場景多輪對話不用頻繁清空。
- 提示詞處理。 讀提示詞是按批次算的,llama.cpp 會把整批 token 送進顯示卡,連放在記憶體裡的專家也臨時搬過去算。顯示卡越多、批次越大,這一步越快,實測 65 到 500 tokens/s,取決於批次大小和上下文長度。
選 3090 而不是 4090、5090 的理由很簡單:這套方案裡顯示卡不是瓶頸,24GB 顯示記憶體每 GB 約 NT$1,570 是最便宜的;兩張 3090 約 NT$7.5 萬,一張 4090 就要約 NT$10.8 萬。兩張卡不需要 NVLink。
反例也要寫在前面:一位 4 通道 DDR4 的使用者雙 3090 只有 5 到 6 tokens/s,換回單卡反而 9.5;另一位 4 張 3090 加 256GB DDR4 的使用者「最多 6」。多卡拆分沒調對會更慢,所以先用一張卡跑通,再加第二張(Unsloth V4 Flash 討論區)。
能跑多快,各精度要多少顯示記憶體和記憶體?
Q4 是日常能用的精度:V4 Flash 要 155 GB、GLM 5.3 Flash 要 200 GB 記憶體;生成速度 2 張 3090 加 8 通道 DDR4 約 27 和 21 tokens/s,降到 3-bit 快兩成,2-bit 快五成。 先看各精度的檔案大小,兩個模型都取 Unsloth 的 UD 動態量化,準確率是 Unsloth 在 GLM 5.3 Flash 上測的 top-1(V4 Flash GGUF、GLM 5.3 Flash GGUF):

記憶體要按檔案大小減去放進顯示卡的幾個 GB 再留兩成餘量。上下文開多大主要影響顯示記憶體那一份:下面這張表由模型庫按參數量即時估算,給 3-bit 和 4-bit 在 32K、128K、256K 上下文下的總需求,「卸載」列是顯示卡和記憶體各佔多少:
| 模型 | 3-bit | 4-bit | ||||
|---|---|---|---|---|---|---|
| 32K 上下文 | 128K 上下文 | 256K 上下文 | 32K 上下文 | 128K 上下文 | 256K 上下文 | |
| DeepSeek V4 Flash284B · A13B | 140 GB卸載:8 GB 顯示記憶體 + 133 GB 記憶體 | 148 GB卸載:16 GB 顯示記憶體 + 133 GB 記憶體 | 159 GB卸載:27 GB 顯示記憶體 + 133 GB 記憶體 | 162 GB卸載:9 GB 顯示記憶體 + 155 GB 記憶體 | 171 GB卸載:17 GB 顯示記憶體 + 155 GB 記憶體 | 181 GB卸載:28 GB 顯示記憶體 + 155 GB 記憶體 |
| GLM 5.3 Flash320B · A18B | 156 GB卸載:8 GB 顯示記憶體 + 149 GB 記憶體 | 160 GB卸載:13 GB 顯示記憶體 + 149 GB 記憶體 | 166 GB卸載:18 GB 顯示記憶體 + 149 GB 記憶體 | 181 GB卸載:9 GB 顯示記憶體 + 174 GB 記憶體 | 185 GB卸載:13 GB 顯示記憶體 + 174 GB 記憶體 | 191 GB卸載:19 GB 顯示記憶體 + 174 GB 記憶體 |
生成速度按本站的專家卸載公式(方法說明)算,32K 上下文:

演算法是每個 token 的耗時分三段相加:顯示卡讀注意力層、共享專家和放進顯示記憶體的那幾層專家,按 936 GB/s 算;記憶體讀剩下的專家,8 通道 DDR4-2666 按 171 GB/s 算;再加 4 毫秒的路由開銷。頻寬都乘 0.7 的效率。換成 DDR4-3200 快一成,換成 12 通道 DDR5 快七成。
拿公開實測校一下公式。三張 3090 加 DDR4 跑 GLM 5.3 Flash 的 IQ3_XXS,實測生成 14.6 tokens/s,公式給 25,六成;雙路 EPYC 8 通道 DDR4-2666 跑 V4 Flash 的 Q8_K_XL,實測 20,公式按 Q4 口徑算是 27,七成(ik_llama.cpp PR #2376、Unsloth V4 Flash 討論區)。所以上面那張速度表裡的數按六到十成看,V4 Flash Q4 落在 18 到 27 之間是正常的。
兩件事會讓數字偏離上面那張速度表:
- 提示詞處理是另一個數,別混。 llama.cpp 每次回答完打兩行速度,
prompt eval是讀提示詞的速度,批次大小開到 4096 時 65 到 500 tokens/s 都正常;eval才是生成回答的速度,就是上面那張速度表這個數。網路上「跑到 100 多」的貼文,多半貼的是第一行。 - 上下文越長越慢。 同一台單 3090 加 8 通道 DDR4-3200 的機器,餵 69K 的提示詞跑 GLM 5.3 Flash,實測生成只剩 6.1 tokens/s,因為每個 token 都要多算一大段注意力。
錢花在哪,比多卡和 Mac 便宜多少?
記憶體只買 DDR4,分兩檔:8 條 16GB 的 128GB 檔約 NT$89,000,跑到 3-bit;8 條 32GB 的 256GB 檔約 NT$155,000,跑到 Q4,V4 Flash 還能上無損的 Q8_K_XL。 記憶體價格是即時資料,按單路插滿 8 通道算:
AmazonJP
| 規格 | 單條價格 | 每 GB 單價 | 最高支援通道數 | 最大頻寬 GB/s | 插滿通道(單路) |
|---|---|---|---|---|---|
| DDR4-2666 16 GB伺服器 · RDIMM | NT$6,459 | NT$404 | 8 | 171 | 128 GB8 條 × 16 GB · NT$51,670 |
| DDR4-2666 32 GB伺服器 · RDIMM | NT$8,428 | NT$263 | 8 | 171 | 256 GB8 條 × 32 GB · NT$67,428 |
單條中位價,套裝按核實條數換算。頻寬是這種條子在對應平台插滿通道時的理論上限(桌上型電腦 2 通道;DDR4 伺服器單路 8 通道;DDR5 伺服器單路 12 通道),實際由 CPU 與主機板決定。「插滿通道」按伺服器單路每通道一條、桌上型電腦 4 條算,只含記憶體條本身,不含 CPU、主機板與整機。
兩檔整機按閒魚目前價:

CPU 和主機板這一行本站不採集,是按 2026 年 9 月 eBay 上雙路 EPYC 7642 加 512GB 整機 2,700 到 3,300 美元的行情倒推的。128GB 檔便宜約 NT$6.6 萬,代價是精度停在 3-bit:GLM 5.3 Flash 的 3-bit 準確率 82%,Q4 是 92%,寫程式碼和長推理能感覺出來。想用 16GB 的記憶體條湊 256GB 要 16 條,單路主機板插不下。
再看同樣裝得下 V4 Flash Q4 的其他方案:

AmazonJP
| 型號 | 顯存 GB | 頻寬 GB/s | INT8 TOPS | 功耗 W | AmazonJP | 顯存單價 |
|---|---|---|---|---|---|---|
| 128 | 256 | 59 | 120 | NT$122,860 | NT$960 | |
| 24 | 936 | 285 | 350 | NT$83,048 | NT$3,460 | |
| 96 | 1,792 | 1,000 | 600 | — | — | |
| Mac Studio M3 Ultra 512GB | 512 | 819 | — | 480 | — | — |
三個結論:
- 純顯示卡方案沒有中間檔。 4 張 3090 的 96GB 連 V4 Flash 的 2-bit(97 GB)都裝不下,要裝 Q4 得 8 張,光卡就約 NT$30 萬,還要能插 8 卡的主機板、拆分線和 3000W 電源供應器。兩張 RTX PRO 6000 是約 NT$118 萬。
- Mac 是速度快一半、價格貴四倍。 M3 Ultra 512GB 的 819 GB/s 統一記憶體跑 V4 Flash Q4 預估 43 tokens/s,能跑無損版,安靜、省電、不用折騰,但約 NT$62 萬。
- Ryzen AI Max+ 395 是 128GB 檔的對手。 約 NT$8.5 萬的迷你主機,128GB 統一記憶體只有 256 GB/s,跑 V4 Flash 3-bit 預估 16 tokens/s,比 128GB 檔的 DDR4 伺服器慢一半,但體積和噪音是另一個世界。
DDR4 每 GB 約 NT$206,是 DDR5 伺服器條的五分之一、3090 顯示記憶體的八分之一,所以 2026 年這條路只有 DDR4 走得通。壞消息是 DDR4 在停產週期裡:美光 2026 年 6 月發出停產通知,三星、海力士只把停產推遲到 2026 年(TrendForce)。2025 年 1 月有人 400 美元買到 512GB DDR4-2400(Digital Spaceport),2026 年 9 月同樣的量在 eBay 要 3,200 美元。要買先買記憶體。
配件選擇的三條經驗:
- CPU 買 EPYC 7003,7002 也行,但避開 7232P、7252、7262、7272、7282。 這五顆只有兩個 CCD,記憶體頻寬減半(ServeTheHome)。核數 32 夠用,再多沒有回報。
- 主機板要單路 8 槽。 Gigabyte MZ32-AR0、Supermicro H12SSL 是常見選擇。雙路主機板只在你確認要 16 條以上記憶體時才買。
- 記憶體整機同一種。 RDIMM 和 LRDIMM 不能混插;2666 和 3200 價差不大時買 3200,頻寬差兩成。
裝好之後怎麼啟動?
用 llama.cpp 的 llama-server,注意力層全放顯示卡,專家權重全放記憶體,跑通了再把專家往顯示卡挪。 第一步,專家全放記憶體:
./llama-server -m DeepSeek-V4-Flash-0731-UD-Q4_K_XL-00001-of-00004.gguf \
-ngl 99 --n-cpu-moe 43 -t 32 -c 32768 -fa on -b 4096 -ub 4096 \
--host 0.0.0.0 --port 8080
三個參數決定一切:-ngl 99 把所有層交給顯示卡;--n-cpu-moe 43 再把 43 層的專家權重退回記憶體,V4 Flash 有 43 層,GLM 5.3 Flash 填 45;-b 4096 -ub 4096 讓提示詞按 4096 個 token 一批送進顯示卡算,這是提示詞處理能到幾百的關鍵,不加只有幾十。-t 填實體核心數。
第二步,看 nvidia-smi 的顯示記憶體餘量,把 --n-cpu-moe 往下調。每減 1,就有一層的專家(V4 Flash 約 3.7 GB)搬進顯示卡,生成快一點。一張 3090 大約減到 39,兩張減到 33,剩多少餘量給 KV cache 要自己試。兩張卡時先加 -ts 1,1 確認兩張卡的顯示記憶體都用上了,再動這個數。
ik_llama.cpp 是 llama.cpp 的分支,CPU 上的 MoE 運算核心更快,長上下文的 GLM 5.3 Flash 用它更合適。上面實測裡三張 3090 那位的命令是:
./llama-server -m GLM-5.3-Flash-UD-IQ3_XXS-00001-of-00003.gguf \
--flash-attn on -mla 1 -ctk f16 -ctv f16 --dsa -ngl 999 -ot exps=CPU \
-amb 512 -b 8192 -ub 2048 -c 32768
-ot exps=CPU 和 --n-cpu-moe 是一回事,用正規表示式把所有專家張量指到 CPU;想留幾層在顯示卡,改成 -ot "blk\.(3[0-9]|4[0-4])\.ffn.*exps=CPU" 這種只匹配後面幾層的寫法。
會踩哪些坑?
三個坑按代價排序:雙路 NUMA、稠密模型、卡的拆分。
- 雙路伺服器不會快一倍。 兩顆 CPU 各接 8 通道,理論頻寬翻倍,但 llama.cpp 跨節點讀記憶體的開銷至今是開放問題(llama.cpp Issue #1437),實際拿到 1.3 到 1.6 倍。單路 8 條 32GB 不夠用時,先換 64GB 的記憶體條,再考慮雙路。真上雙路就加
--numa distribute。 - 稠密模型別走這條路。 Qwen3.8 27B 這種全部啟用的模型,每個 token 要從記憶體讀 16 GB,8 通道 DDR4-3200 上只有 8 tokens/s,加 CPU 核數沒用。稠密模型請回到顯示卡,帳見顯示記憶體不夠,加記憶體有用嗎。
- 多卡拆分調不好會更慢。 上面雙 3090 比單卡慢的例子就是這個。多卡時先加
-ts手動指定兩張卡的比例,確認兩張卡顯示記憶體都用上了,再動--n-cpu-moe。
結論
一個人用、目標是 300B 級的 MoE 模型、能接受二三十 tokens/s 的生成速度,256GB 檔約 NT$15.5 萬的機器是 2026 年最便宜的答案;只想試跑或預算卡在約 NT$9 萬,128GB 檔跑 3-bit;要 50 以上的生成速度、或者主力是稠密模型,別買。
- 跑 DeepSeek V4 Flash、GLM 5.3 Flash 的 Q4:單路 EPYC + 8 × 32GB DDR4 + 兩張 3090。
- 跑 Qwen3.8 Flash Next、gpt-oss 120B,或者 300B 模型的 3-bit:8 × 16GB 加一張 3090 就夠。
- 要跑 763B 的 DeepSeek V4.1 Flash 或 1T 的 Kimi K2.6:記憶體換成 8 × 64GB 上到 512GB,其他不變。
- 只有桌上型電腦、目標是 100B 級 MoE:不用買伺服器,96GB 記憶體加一張 16GB 卡就夠,見顯示記憶體不夠,加記憶體有用嗎。
- 想要快一半又不在乎錢:Mac Studio M3 Ultra 512GB,見 Mac 統一記憶體 vs 獨立顯示卡。
常見問題
第二張 3090 到底買不買?
先用一張跑通再說。第二張卡的 24GB 能多放六層專家權重,生成速度只快一成左右,真正的收益是 KV cache 翻倍、上下文能開到 128K、提示詞處理更快。反例也有:一位使用者雙卡 5 到 6 tokens/s,換回單卡反而 9.5,問題出在兩張卡的拆分設定。
128GB 記憶體夠跑哪些精度?
DeepSeek V4 Flash 能跑到 UD-IQ3_S(117 GB),GLM 5.3 Flash 能跑到 UD-IQ3_XXS(120 GB),也就是 3-bit。Q4 分別要 155 GB 和 200 GB,裝不下。想日常用 Q4 就買 8 條 32GB 上到 256GB。
用 llama.cpp 還是 ik_llama.cpp?
先用 llama.cpp,官方支援新模型最快、--n-cpu-moe 一個參數就能把專家放進記憶體。ik_llama.cpp 是它的分支,CPU 上的 MoE 運算核心更快、長上下文的 MLA 和稀疏注意力實作更省顯示記憶體,GLM 5.3 Flash 這類要跑幾萬 token 上下文的用它更合適,但新模型的支援會晚幾天到幾週。
2026 年 DDR4 還便宜嗎?
相對便宜。DDR4-2666 32GB 伺服器條閒魚約 NT$6,600,每 GB 約 NT$206,是 DDR5 伺服器條的五分之一。但 2025 年初 512GB 只要 400 美元,現在 eBay 要 3,200 美元,而且美光已發停產通知、三星和海力士也只推遲到 2026 年。要買就早買,本站記憶體榜每 6 小時更新。