70B 是本地部署最常问的门槛,答案是:两张 RTX 3090 能跑 Llama 3.3 70B 的 4-bit 版本,8K 上下文约 43 GB,48GB 刚好装下,预估 16 tokens/s。 但要知道两个限制:32K 上下文需要 50 GB 就装不下了;多卡只叠加容量不叠加带宽,两张卡的速度等于一张卡。截至 2026 年 9 月 5 日,两张 3090 总价约一万六,是 70B 的最低门槛;NVLink 非必需;四张小卡凑容量不划算。整机怎么配、软件怎么设,下面逐项说。

多卡显存能直接相加吗?

容量能加,带宽不能:llama.cpp 的层拆分让两张 24GB 卡装下 43 GB 的模型,但速度还是单卡水平;vLLM 的张量并行才能让两张卡一起算。 两种拆法:

  • 层拆分(pipeline / layer split):llama.cpp 默认方式,前 40 层放卡 1、后 40 层放卡 2,token 依次流过。任何时刻只有一张卡在读权重,所以速度 ≈ 单卡带宽 ÷ 权重体积,两张 3090 跑 70B 4-bit 约 16 tokens/s。好处是对 PCIe 带宽和卡的一致性要求都低。
  • 张量并行(tensor parallel):vLLM、SGLang、exllama 的方式,每一层的矩阵切成两半同时算,两张卡的带宽叠加,实测能到单卡的 1.6 到 1.8 倍。要求卡数是 2 的幂、最好同型号,PCIe 至少 x8,有 NVLink 更好。

个人聊天用 llama.cpp 够了;要给多人提供服务,vLLM 的张量并行加连续批处理才是多卡的真正价值。

70B 模型在 4-bit 下需要多少显存?

Llama 3.3 70B 4-bit:8K 上下文约 43 GB,32K 约 50 GB,128K 约 73 GB;48GB 双卡只够 8K 到 16K。 实时计算:

模型2-bit4-bit8-bit最便宜能跑的卡
8K32K8K32K8K32K
Llama 3.3 70B70.6B30 GB38 GB43 GB51 GB77 GB85 GBCMP 170HX 64GB¥12,850
DeepSeek R1 Distill Qwen 32B32.8B16 GB22 GB22 GB28 GB37 GB43 GBTesla V100 32GB¥3,459
gpt-oss 120B117B · A5.1B45 GB卸载:4 GB 显存 + 43 GB 内存47 GB卸载:5 GB 显存 + 43 GB 内存67 GB卸载:4 GB 显存 + 65 GB 内存69 GB卸载:6 GB 显存 + 65 GB 内存123 GB卸载:5 GB 显存 + 120 GB 内存125 GB卸载:6 GB 显存 + 120 GB 内存GeForce RTX 2080 Ti¥1,641 · 卸载
GLM 4.5 Air106B · A12B42 GB卸载:6 GB 显存 + 38 GB 内存47 GB卸载:10 GB 显存 + 38 GB 内存62 GB卸载:7 GB 显存 + 56 GB 内存66 GB卸载:11 GB 显存 + 56 GB 内存113 GB卸载:10 GB 显存 + 104 GB 内存117 GB卸载:14 GB 显存 + 104 GB 内存GeForce RTX 2080 Ti¥1,641 · 卸载

顺带看两个 MoE:gpt-oss 120BGLM 4.5 Air 整机放显存要 62 到 74 GB,双 3090 装不下,但专家卸载后单卡就能跑,这时多买一张卡不如多插 64GB 内存,见16GB 能跑哪些模型里对卸载的说明。

两张 3090 / 两张 4090 / 三张 4080 的成本与速度

两张 3090 是 70B 4-bit 的最低价方案,两张 4090 贵一倍快 8%,三张 4080 和四张 16GB 卡都不如两张 3090。 组合对比(Llama 3.3 70B、4-bit、8K):

配置总显存 GB装得下二手总价速度 t/s t/s总功耗 W
2 × GeForce RTX 309048¥15,99816700
2 × GeForce RTX 409048¥47,00017900
3 × GeForce RTX 408048¥22,77012960
2 × Radeon RX 7900 XTX48¥11,40012710
2 × GeForce RTX 509064¥78,800301,150
2 × Radeon AI PRO R970064¥23,7008600
1 × GeForce RTX 4090 48GB48¥25,50017450
1 × RTX PRO 6000 Blackwell96¥122,00030600

Llama 3.3 70B 在 4-bit、8K 上下文下约需 43 GB。速度按单卡估算:llama.cpp 的层拆分是按层串行走完,多卡只叠加容量、不叠加带宽。

读表:

  • 两张 3090:最便宜的 48GB,16 tokens/s。矿卡风险见二手 3090 指南
  • 两张 4090:贵一倍,速度只快 8%,除非你已经有一张。
  • 两张 5090:64GB 能开 32K 上下文,30 tokens/s,是「快」的方案,但总价接近八万。
  • 两张 7900 XTX:便宜,能跑,ROCm 多卡只推荐 llama.cpp 层拆分。
  • RTX 4090 48GB 改装卡:单卡搞定,不用折腾双卡,无质保。
  • RTX PRO 6000:96GB 单卡 30 tokens/s、128K 上下文,商用方案。
示意图:机箱里的大功率模组电源,多条 PCIe 供电线走向两张显卡
示意图:机箱里的大功率模组电源,多条 PCIe 供电线走向两张显卡

主板、电源、机箱怎么选?

双卡整机的硬要求:两条间距三槽以上的 PCIe x16 物理插槽、1000W 以上电源、能装两张三槽卡的机箱。

  • 主板:消费级 Z790 / X870 一般给第二条槽 x4,层拆分够用;要张量并行,选能拆成 x8 / x8 的板子(X670E、X870E 部分型号,或 W790 / TRX50 工作站板)。检查两条槽的间距,三槽卡叠在一起上面那张会过热。
  • 电源:两张 3090 峰值 350W × 2 加 CPU,选 1000W 到 1200W、ATX 3.0;每张卡用独立的两条 8-pin 线,不要用一条线的分叉头。
  • 机箱:全塔或支持竖装的中塔,卡之间至少留一个槽位散热;两张 350W 的卡在小机箱里会互相加热降频。
  • 功耗限制nvidia-smi -pl 280 把 3090 限到 280W,推理速度掉不到 5%,温度和电费明显下降。
  • 散热噪音:双卡满载 700W 相当于一个电暖器,夏天要考虑房间空调。

软件配置:llama.cpp 与 vLLM 的多卡参数

llama.cpp 默认自动层拆分,vLLM 加 --tensor-parallel-size 2

llama.cpp(默认按显存比例拆层,-ts 手动指定比例):

llama-server -hf bartowski/Llama-3.3-70B-Instruct-GGUF:Q4_K_M -c 8192 -ngl 99 -ts 1,1 -fa on

Ollama 自动识别多卡并拆层,不需要额外参数:

ollama run llama3.3:70b

vLLM 张量并行(需要 AWQ / GPTQ / FP8 权重,两张同型号卡):

vllm serve casperhansen/llama-3.3-70b-instruct-awq --tensor-parallel-size 2 --max-model-len 8192 --gpu-memory-utilization 0.92

排错顺序:nvidia-smi 先确认两张卡都被识别;显存爆了先降 -c / --max-model-len;vLLM 报 NCCL 错误多半是 PCIe ACS 或 IOMMU,在 BIOS 里关掉。

结论:70B 该怎么配

两张 3090 是 70B 的最低门槛,NVLink 非必需,四张小卡不划算;要快选两张 5090,要省事选 Mac 128GB 或 4090 48GB 改装卡。

  • 预算一万六到两万、能接受 16 tokens/s:两张 RTX 3090。
  • 想要 30 tokens/s 和 32K 上下文:两张 RTX 5090 或一张 RTX PRO 6000。
  • 不想折腾双卡:Mac Studio 128GB 慢一半但安静,见 Mac 统一内存 vs 独立显卡
  • 主要跑 MoE(gpt-oss 120B、GLM Air):一张 24GB 卡加 128GB 内存,不要多卡。