多卡跑大模型入門:兩張 RTX 3090 能跑 70B 嗎,怎麼配(2026)

譯自简体中文版 · 閱讀原文

70B 是本地部署最常問的門檻,答案是:兩張 RTX 3090 能跑 Llama 3.3 70B 的 4-bit 版本,8K 上下文約 43 GB,48GB 剛好裝下,預估 16 tokens/s。 但要知道兩個限制:32K 上下文需要 50 GB 就裝不下了;多卡只疊加容量不疊加頻寬,兩張卡的速度等於一張卡。截至 2026 年 9 月 5 日,兩張 3090 總價約一萬六,是 70B 的最低門檻;NVLink 非必需;四張小卡湊容量不划算。整機怎麼配、軟體怎麼設,下面逐項說。

示意圖:全塔機箱裡裝著兩張大顯示卡,中間空出一個槽位
示意圖 · 全塔機箱裡裝著兩張大顯示卡,中間空出一個槽位

本文提及的固定價格均以中國二手市場人民幣(CNY)為基準;動態表格則依頁面所選幣別顯示。

多卡顯示記憶體能直接相加嗎?

容量能加,頻寬不能:llama.cpp 的層拆分讓兩張 24GB 卡裝下 43 GB 的模型,但速度還是單卡水平;vLLM 的張量並行才能讓兩張卡一起算。 兩種拆法:

  • 層拆分(pipeline / layer split):llama.cpp 預設方式,前 40 層放卡 1、後 40 層放卡 2,token 依次流過。任何時刻只有一張卡在讀權重,所以速度 ≈ 單卡頻寬 ÷ 權重體積,兩張 3090 跑 70B 4-bit 約 16 tokens/s。好處是對 PCIe 頻寬和卡的一致性要求都低。
  • 張量並行(tensor parallel):vLLM、SGLang、exllama 的方式,每一層的矩陣切成兩半同時算,兩張卡的頻寬疊加,實測能到單卡的 1.6 到 1.8 倍。要求卡數是 2 的冪、最好同型號,PCIe 至少 x8,有 NVLink 更好。

個人聊天用 llama.cpp 夠了;要給多人提供服務,vLLM 的張量並行加連續批處理才是多卡的真正價值。

70B 模型在 4-bit 下需要多少顯示記憶體?

Llama 3.3 70B 4-bit:8K 上下文約 43 GB,32K 約 50 GB,128K 約 73 GB;48GB 雙卡只夠 8K 到 16K。 即時計算:

模型2-bit4-bit8-bit最便宜能跑的卡
8K32K8K32K8K32K
Llama 3.3 70B70.6B30 GB38 GB43 GB51 GB77 GB85 GBCMP 170HX 64GBNT$60,370
DeepSeek R1 Distill Qwen 32B32.8B16 GB22 GB22 GB28 GB37 GB43 GBTesla V100 32GBNT$16,250
gpt-oss 120B117B · A5.1B45 GB卸載:4 GB 顯示記憶體 + 43 GB 記憶體47 GB卸載:5 GB 顯示記憶體 + 43 GB 記憶體67 GB卸載:4 GB 顯示記憶體 + 65 GB 記憶體69 GB卸載:6 GB 顯示記憶體 + 65 GB 記憶體123 GB卸載:5 GB 顯示記憶體 + 120 GB 記憶體125 GB卸載:6 GB 顯示記憶體 + 120 GB 記憶體GeForce RTX 2080 TiNT$7,709 · 卸載
GLM 4.5 Air106B · A12B42 GB卸載:6 GB 顯示記憶體 + 38 GB 記憶體47 GB卸載:10 GB 顯示記憶體 + 38 GB 記憶體62 GB卸載:7 GB 顯示記憶體 + 56 GB 記憶體66 GB卸載:11 GB 顯示記憶體 + 56 GB 記憶體113 GB卸載:10 GB 顯示記憶體 + 104 GB 記憶體117 GB卸載:14 GB 顯示記憶體 + 104 GB 記憶體GeForce RTX 2080 TiNT$7,709 · 卸載

順帶看兩個 MoE:gpt-oss 120BGLM 4.5 Air 整機放顯示記憶體要 62 到 74 GB,雙 3090 裝不下,但專家卸載後單卡就能跑,這時多買一張卡不如多插 64GB 記憶體,見16GB 能跑哪些模型裡對卸載的說明。

兩張 3090 / 兩張 4090 / 三張 4080 的成本與速度

兩張 3090 是 70B 4-bit 的最低價方案,兩張 4090 貴一倍快 8%,三張 4080 和四張 16GB 卡都不如兩張 3090。 組合對比(Llama 3.3 70B、4-bit、8K):

配置總顯示記憶體 GB裝得下二手總價速度 t/s t/s總功耗 W
2 × GeForce RTX 309048NT$75,15916700
2 × GeForce RTX 409048NT$217,98817900
3 × GeForce RTX 408048NT$106,97412960
2 × Radeon RX 7900 XTX48NT$54,49712710
2 × GeForce RTX 509064NT$371,614301,150
2 × Radeon AI PRO R970064NT$110,8738600
1 × GeForce RTX 4090 48GB48NT$119,80017450
1 × RTX PRO 6000 Blackwell96NT$573,15930600

Llama 3.3 70B 在 4-bit、8K 上下文下約需 43 GB。速度按單卡估算:llama.cpp 的層拆分是逐層串行走完,多卡只疊加容量、不疊加頻寬。

讀表:

  • 兩張 3090:最便宜的 48GB,16 tokens/s。礦卡風險見二手 3090 指南
  • 兩張 4090:貴一倍,速度只快 8%,除非你已經有一張。
  • 兩張 5090:64GB 能開 32K 上下文,30 tokens/s,是「快」的方案,但總價接近八萬。
  • 兩張 7900 XTX:便宜,能跑,ROCm 多卡只推薦 llama.cpp 層拆分。
  • RTX 4090 48GB 改裝卡:單卡搞定,不用折騰雙卡,無質保。
  • RTX PRO 6000:96GB 單卡 30 tokens/s、128K 上下文,商用方案。
示意圖:機箱裡的大功率模組電源,多條 PCIe 供電線走向兩張顯示卡
示意圖:機箱裡的大功率模組電源,多條 PCIe 供電線走向兩張顯示卡

主機板、電源、機箱怎麼選?

雙卡整機的硬要求:兩條間距三槽以上的 PCIe x16 物理插槽、1000W 以上電源、能裝兩張三槽卡的機箱。

  • 主機板:消費級 Z790 / X870 一般給第二條槽 x4,層拆分夠用;要張量並行,選能拆成 x8 / x8 的板子(X670E、X870E 部分型號,或 W790 / TRX50 工作站板)。檢查兩條槽的間距,三槽卡疊在一起上面那張會過熱。
  • 電源:兩張 3090 峰值 350W × 2 加 CPU,選 1000W 到 1200W、ATX 3.0;每張卡用獨立的兩條 8-pin 線,不要用一條線的分叉頭。
  • 機箱:全塔或支援豎裝的中塔,卡之間至少留一個槽位散熱;兩張 350W 的卡在小機箱裡會互相加熱降頻。
  • 功耗限制nvidia-smi -pl 280 把 3090 限到 280W,推論速度掉不到 5%,溫度和電費明顯下降。
  • 散熱噪音:雙卡滿載 700W 相當於一個電暖器,夏天要考慮房間空調。

軟體配置:llama.cpp 與 vLLM 的多卡參數

llama.cpp 預設自動層拆分,vLLM 加 --tensor-parallel-size 2

llama.cpp(預設按顯示記憶體比例拆層,-ts 手動指定比例):

llama-server -hf bartowski/Llama-3.3-70B-Instruct-GGUF:Q4_K_M -c 8192 -ngl 99 -ts 1,1 -fa on

Ollama 自動識別多卡並拆層,不需要額外參數:

ollama run llama3.3:70b

vLLM 張量並行(需要 AWQ / GPTQ / FP8 權重,兩張同型號卡):

vllm serve casperhansen/llama-3.3-70b-instruct-awq --tensor-parallel-size 2 --max-model-len 8192 --gpu-memory-utilization 0.92

排錯順序:nvidia-smi 先確認兩張卡都被識別;顯示記憶體爆了先降 -c / --max-model-len;vLLM 報 NCCL 錯誤多半是 PCIe ACS 或 IOMMU,在 BIOS 裡關掉。

結論:70B 該怎麼配

兩張 3090 是 70B 的最低門檻,NVLink 非必需,四張小卡不划算;要快選兩張 5090,要省事選 Mac 128GB 或 4090 48GB 改裝卡。

  • 預算一萬六到兩萬、能接受 16 tokens/s:兩張 RTX 3090。
  • 想要 30 tokens/s 和 32K 上下文:兩張 RTX 5090 或一張 RTX PRO 6000。
  • 不想折騰雙卡:Mac Studio 128GB 慢一半但安靜,見 Mac 統一記憶體 vs 獨立顯示卡
  • 主要跑 MoE(gpt-oss 120B、GLM Air):一張 24GB 卡加 128GB 記憶體,不要多卡。

常見問題

兩張顯示卡的顯示記憶體能直接相加嗎?

容量可以,頻寬不行。llama.cpp 把層分到兩張卡上序列執行,48GB 能裝 43 GB 的模型,但每個 token 仍然只有一張卡在讀權重,速度等於單卡。vLLM 的張量並行讓兩張卡同時算同一層,速度能到單卡的 1.6 到 1.8 倍。

兩張 3090 需要 NVLink 嗎?

不需要。llama.cpp 的層拆分只在層邊界傳幾 MB 的啟用值,PCIe 4.0 x8 足夠;vLLM 張量並行有 NVLink 能快一到兩成,沒有也能跑。NVLink 橋二手價格人民幣三百到八百元,不是必需品。

四張 16GB 卡(64GB)比兩張 24GB 卡好嗎?

不好。四張 RX 7800 XT 或 RTX 4080 總價接近或超過兩張 3090,佔四個槽位、需要 1200W 以上電源、PCIe 通道要拆成 x4,速度還是單卡水平。多卡方案裡卡數越少越好。

跑 70B 選兩張 3090 還是一張 RTX PRO 6000?

兩張 3090 約一萬六,預估 16 tokens/s;RTX PRO 6000 Blackwell 96GB 約十二萬,預估 30 tokens/s 且能開 128K 上下文。個人用兩張 3090,團隊或商用才值得上 PRO 6000。

文中提到的顯示卡

文中提到的模型