70B 是本地部署最常問的門檻,答案是:兩張 RTX 3090 能跑 Llama 3.3 70B 的 4-bit 版本,8K 上下文約 43 GB,48GB 剛好裝下,預估 16 tokens/s。 但要知道兩個限制:32K 上下文需要 50 GB 就裝不下了;多卡只疊加容量不疊加頻寬,兩張卡的速度等於一張卡。截至 2026 年 9 月 5 日,兩張 3090 總價約一萬六,是 70B 的最低門檻;NVLink 非必需;四張小卡湊容量不划算。整機怎麼配、軟體怎麼設,下面逐項說。
多卡跑大模型入門:兩張 RTX 3090 能跑 70B 嗎,怎麼配(2026)
譯自简体中文版 · 閱讀原文
正文與常見問題中的數字截至 2026年9月5日;表格使用最新已發布價格,各裝置採集時間可能不同。

本文提及的固定價格均以中國二手市場人民幣(CNY)為基準;動態表格則依頁面所選幣別顯示。
多卡顯示記憶體能直接相加嗎?
容量能加,頻寬不能:llama.cpp 的層拆分讓兩張 24GB 卡裝下 43 GB 的模型,但速度還是單卡水平;vLLM 的張量並行才能讓兩張卡一起算。 兩種拆法:
- 層拆分(pipeline / layer split):llama.cpp 預設方式,前 40 層放卡 1、後 40 層放卡 2,token 依次流過。任何時刻只有一張卡在讀權重,所以速度 ≈ 單卡頻寬 ÷ 權重體積,兩張 3090 跑 70B 4-bit 約 16 tokens/s。好處是對 PCIe 頻寬和卡的一致性要求都低。
- 張量並行(tensor parallel):vLLM、SGLang、exllama 的方式,每一層的矩陣切成兩半同時算,兩張卡的頻寬疊加,實測能到單卡的 1.6 到 1.8 倍。要求卡數是 2 的冪、最好同型號,PCIe 至少 x8,有 NVLink 更好。
個人聊天用 llama.cpp 夠了;要給多人提供服務,vLLM 的張量並行加連續批處理才是多卡的真正價值。
70B 模型在 4-bit 下需要多少顯示記憶體?
Llama 3.3 70B 4-bit:8K 上下文約 43 GB,32K 約 50 GB,128K 約 73 GB;48GB 雙卡只夠 8K 到 16K。 即時計算:
| 模型 | 2-bit | 4-bit | 8-bit | 最便宜能跑的卡 | |||
|---|---|---|---|---|---|---|---|
| 8K | 32K | 8K | 32K | 8K | 32K | ||
| Llama 3.3 70B70.6B | 30 GB | 38 GB | 43 GB | 51 GB | 77 GB | 85 GB | |
| DeepSeek R1 Distill Qwen 32B32.8B | 16 GB | 22 GB | 22 GB | 28 GB | 37 GB | 43 GB | |
| gpt-oss 120B117B · A5.1B | 45 GB卸載:4 GB 顯示記憶體 + 43 GB 記憶體 | 47 GB卸載:5 GB 顯示記憶體 + 43 GB 記憶體 | 67 GB卸載:4 GB 顯示記憶體 + 65 GB 記憶體 | 69 GB卸載:6 GB 顯示記憶體 + 65 GB 記憶體 | 123 GB卸載:5 GB 顯示記憶體 + 120 GB 記憶體 | 125 GB卸載:6 GB 顯示記憶體 + 120 GB 記憶體 | |
| GLM 4.5 Air106B · A12B | 42 GB卸載:6 GB 顯示記憶體 + 38 GB 記憶體 | 47 GB卸載:10 GB 顯示記憶體 + 38 GB 記憶體 | 62 GB卸載:7 GB 顯示記憶體 + 56 GB 記憶體 | 66 GB卸載:11 GB 顯示記憶體 + 56 GB 記憶體 | 113 GB卸載:10 GB 顯示記憶體 + 104 GB 記憶體 | 117 GB卸載:14 GB 顯示記憶體 + 104 GB 記憶體 | |
順帶看兩個 MoE:gpt-oss 120B 和 GLM 4.5 Air 整機放顯示記憶體要 62 到 74 GB,雙 3090 裝不下,但專家卸載後單卡就能跑,這時多買一張卡不如多插 64GB 記憶體,見16GB 能跑哪些模型裡對卸載的說明。
兩張 3090 / 兩張 4090 / 三張 4080 的成本與速度
兩張 3090 是 70B 4-bit 的最低價方案,兩張 4090 貴一倍快 8%,三張 4080 和四張 16GB 卡都不如兩張 3090。 組合對比(Llama 3.3 70B、4-bit、8K):
| 配置 | 總顯示記憶體 GB | 裝得下 | 二手總價 | 速度 t/s t/s | 總功耗 W |
|---|---|---|---|---|---|
| 2 × | 48 | ✓ | NT$75,159 | 16 | 700 |
| 2 × | 48 | ✓ | NT$217,988 | 17 | 900 |
| 3 × | 48 | ✓ | NT$106,974 | 12 | 960 |
| 2 × | 48 | ✓ | NT$54,497 | 12 | 710 |
| 2 × | 64 | ✓ | NT$371,614 | 30 | 1,150 |
| 2 × | 64 | ✓ | NT$110,873 | 8 | 600 |
| 1 × | 48 | ✓ | NT$119,800 | 17 | 450 |
| 1 × | 96 | ✓ | NT$573,159 | 30 | 600 |
Llama 3.3 70B 在 4-bit、8K 上下文下約需 43 GB。速度按單卡估算:llama.cpp 的層拆分是逐層串行走完,多卡只疊加容量、不疊加頻寬。
讀表:
- 兩張 3090:最便宜的 48GB,16 tokens/s。礦卡風險見二手 3090 指南。
- 兩張 4090:貴一倍,速度只快 8%,除非你已經有一張。
- 兩張 5090:64GB 能開 32K 上下文,30 tokens/s,是「快」的方案,但總價接近八萬。
- 兩張 7900 XTX:便宜,能跑,ROCm 多卡只推薦 llama.cpp 層拆分。
- RTX 4090 48GB 改裝卡:單卡搞定,不用折騰雙卡,無質保。
- RTX PRO 6000:96GB 單卡 30 tokens/s、128K 上下文,商用方案。

主機板、電源、機箱怎麼選?
雙卡整機的硬要求:兩條間距三槽以上的 PCIe x16 物理插槽、1000W 以上電源、能裝兩張三槽卡的機箱。
- 主機板:消費級 Z790 / X870 一般給第二條槽 x4,層拆分夠用;要張量並行,選能拆成 x8 / x8 的板子(X670E、X870E 部分型號,或 W790 / TRX50 工作站板)。檢查兩條槽的間距,三槽卡疊在一起上面那張會過熱。
- 電源:兩張 3090 峰值 350W × 2 加 CPU,選 1000W 到 1200W、ATX 3.0;每張卡用獨立的兩條 8-pin 線,不要用一條線的分叉頭。
- 機箱:全塔或支援豎裝的中塔,卡之間至少留一個槽位散熱;兩張 350W 的卡在小機箱裡會互相加熱降頻。
- 功耗限制:
nvidia-smi -pl 280把 3090 限到 280W,推論速度掉不到 5%,溫度和電費明顯下降。 - 散熱噪音:雙卡滿載 700W 相當於一個電暖器,夏天要考慮房間空調。
軟體配置:llama.cpp 與 vLLM 的多卡參數
llama.cpp 預設自動層拆分,vLLM 加 --tensor-parallel-size 2。
llama.cpp(預設按顯示記憶體比例拆層,-ts 手動指定比例):
llama-server -hf bartowski/Llama-3.3-70B-Instruct-GGUF:Q4_K_M -c 8192 -ngl 99 -ts 1,1 -fa on
Ollama 自動識別多卡並拆層,不需要額外參數:
ollama run llama3.3:70b
vLLM 張量並行(需要 AWQ / GPTQ / FP8 權重,兩張同型號卡):
vllm serve casperhansen/llama-3.3-70b-instruct-awq --tensor-parallel-size 2 --max-model-len 8192 --gpu-memory-utilization 0.92
排錯順序:nvidia-smi 先確認兩張卡都被識別;顯示記憶體爆了先降 -c / --max-model-len;vLLM 報 NCCL 錯誤多半是 PCIe ACS 或 IOMMU,在 BIOS 裡關掉。
結論:70B 該怎麼配
兩張 3090 是 70B 的最低門檻,NVLink 非必需,四張小卡不划算;要快選兩張 5090,要省事選 Mac 128GB 或 4090 48GB 改裝卡。
- 預算一萬六到兩萬、能接受 16 tokens/s:兩張 RTX 3090。
- 想要 30 tokens/s 和 32K 上下文:兩張 RTX 5090 或一張 RTX PRO 6000。
- 不想折騰雙卡:Mac Studio 128GB 慢一半但安靜,見 Mac 統一記憶體 vs 獨立顯示卡。
- 主要跑 MoE(gpt-oss 120B、GLM Air):一張 24GB 卡加 128GB 記憶體,不要多卡。
常見問題
兩張顯示卡的顯示記憶體能直接相加嗎?
容量可以,頻寬不行。llama.cpp 把層分到兩張卡上序列執行,48GB 能裝 43 GB 的模型,但每個 token 仍然只有一張卡在讀權重,速度等於單卡。vLLM 的張量並行讓兩張卡同時算同一層,速度能到單卡的 1.6 到 1.8 倍。
兩張 3090 需要 NVLink 嗎?
不需要。llama.cpp 的層拆分只在層邊界傳幾 MB 的啟用值,PCIe 4.0 x8 足夠;vLLM 張量並行有 NVLink 能快一到兩成,沒有也能跑。NVLink 橋二手價格人民幣三百到八百元,不是必需品。
四張 16GB 卡(64GB)比兩張 24GB 卡好嗎?
不好。四張 RX 7800 XT 或 RTX 4080 總價接近或超過兩張 3090,佔四個槽位、需要 1200W 以上電源、PCIe 通道要拆成 x4,速度還是單卡水平。多卡方案裡卡數越少越好。
跑 70B 選兩張 3090 還是一張 RTX PRO 6000?
兩張 3090 約一萬六,預估 16 tokens/s;RTX PRO 6000 Blackwell 96GB 約十二萬,預估 30 tokens/s 且能開 128K 上下文。個人用兩張 3090,團隊或商用才值得上 PRO 6000。