70B 是本地部署最常问的门槛,答案是:两张 RTX 3090 能跑 Llama 3.3 70B 的 4-bit 版本,8K 上下文约 43 GB,48GB 刚好装下,预估 16 tokens/s。 但要知道两个限制:32K 上下文需要 50 GB 就装不下了;多卡只叠加容量不叠加带宽,两张卡的速度等于一张卡。截至 2026 年 9 月 5 日,两张 3090 总价约一万六,是 70B 的最低门槛;NVLink 非必需;四张小卡凑容量不划算。整机怎么配、软件怎么设,下面逐项说。
多卡显存能直接相加吗?
容量能加,带宽不能:llama.cpp 的层拆分让两张 24GB 卡装下 43 GB 的模型,但速度还是单卡水平;vLLM 的张量并行才能让两张卡一起算。 两种拆法:
- 层拆分(pipeline / layer split):llama.cpp 默认方式,前 40 层放卡 1、后 40 层放卡 2,token 依次流过。任何时刻只有一张卡在读权重,所以速度 ≈ 单卡带宽 ÷ 权重体积,两张 3090 跑 70B 4-bit 约 16 tokens/s。好处是对 PCIe 带宽和卡的一致性要求都低。
- 张量并行(tensor parallel):vLLM、SGLang、exllama 的方式,每一层的矩阵切成两半同时算,两张卡的带宽叠加,实测能到单卡的 1.6 到 1.8 倍。要求卡数是 2 的幂、最好同型号,PCIe 至少 x8,有 NVLink 更好。
个人聊天用 llama.cpp 够了;要给多人提供服务,vLLM 的张量并行加连续批处理才是多卡的真正价值。
70B 模型在 4-bit 下需要多少显存?
Llama 3.3 70B 4-bit:8K 上下文约 43 GB,32K 约 50 GB,128K 约 73 GB;48GB 双卡只够 8K 到 16K。 实时计算:
| 模型 | 2-bit | 4-bit | 8-bit | 最便宜能跑的卡 | |||
|---|---|---|---|---|---|---|---|
| 8K | 32K | 8K | 32K | 8K | 32K | ||
| Llama 3.3 70B70.6B | 30 GB | 38 GB | 43 GB | 51 GB | 77 GB | 85 GB | |
| DeepSeek R1 Distill Qwen 32B32.8B | 16 GB | 22 GB | 22 GB | 28 GB | 37 GB | 43 GB | |
| gpt-oss 120B117B · A5.1B | 45 GB卸载:4 GB 显存 + 43 GB 内存 | 47 GB卸载:5 GB 显存 + 43 GB 内存 | 67 GB卸载:4 GB 显存 + 65 GB 内存 | 69 GB卸载:6 GB 显存 + 65 GB 内存 | 123 GB卸载:5 GB 显存 + 120 GB 内存 | 125 GB卸载:6 GB 显存 + 120 GB 内存 | |
| GLM 4.5 Air106B · A12B | 42 GB卸载:6 GB 显存 + 38 GB 内存 | 47 GB卸载:10 GB 显存 + 38 GB 内存 | 62 GB卸载:7 GB 显存 + 56 GB 内存 | 66 GB卸载:11 GB 显存 + 56 GB 内存 | 113 GB卸载:10 GB 显存 + 104 GB 内存 | 117 GB卸载:14 GB 显存 + 104 GB 内存 | |
顺带看两个 MoE:gpt-oss 120B 和 GLM 4.5 Air 整机放显存要 62 到 74 GB,双 3090 装不下,但专家卸载后单卡就能跑,这时多买一张卡不如多插 64GB 内存,见16GB 能跑哪些模型里对卸载的说明。
两张 3090 / 两张 4090 / 三张 4080 的成本与速度
两张 3090 是 70B 4-bit 的最低价方案,两张 4090 贵一倍快 8%,三张 4080 和四张 16GB 卡都不如两张 3090。 组合对比(Llama 3.3 70B、4-bit、8K):
| 配置 | 总显存 GB | 装得下 | 二手总价 | 速度 t/s t/s | 总功耗 W |
|---|---|---|---|---|---|
| 2 × | 48 | ✓ | ¥15,998 | 16 | 700 |
| 2 × | 48 | ✓ | ¥47,000 | 17 | 900 |
| 3 × | 48 | ✓ | ¥22,770 | 12 | 960 |
| 2 × | 48 | ✓ | ¥11,400 | 12 | 710 |
| 2 × | 64 | ✓ | ¥78,800 | 30 | 1,150 |
| 2 × | 64 | ✓ | ¥23,700 | 8 | 600 |
| 1 × | 48 | ✓ | ¥25,500 | 17 | 450 |
| 1 × | 96 | ✓ | ¥122,000 | 30 | 600 |
Llama 3.3 70B 在 4-bit、8K 上下文下约需 43 GB。速度按单卡估算:llama.cpp 的层拆分是按层串行走完,多卡只叠加容量、不叠加带宽。
读表:
- 两张 3090:最便宜的 48GB,16 tokens/s。矿卡风险见二手 3090 指南。
- 两张 4090:贵一倍,速度只快 8%,除非你已经有一张。
- 两张 5090:64GB 能开 32K 上下文,30 tokens/s,是「快」的方案,但总价接近八万。
- 两张 7900 XTX:便宜,能跑,ROCm 多卡只推荐 llama.cpp 层拆分。
- RTX 4090 48GB 改装卡:单卡搞定,不用折腾双卡,无质保。
- RTX PRO 6000:96GB 单卡 30 tokens/s、128K 上下文,商用方案。

主板、电源、机箱怎么选?
双卡整机的硬要求:两条间距三槽以上的 PCIe x16 物理插槽、1000W 以上电源、能装两张三槽卡的机箱。
- 主板:消费级 Z790 / X870 一般给第二条槽 x4,层拆分够用;要张量并行,选能拆成 x8 / x8 的板子(X670E、X870E 部分型号,或 W790 / TRX50 工作站板)。检查两条槽的间距,三槽卡叠在一起上面那张会过热。
- 电源:两张 3090 峰值 350W × 2 加 CPU,选 1000W 到 1200W、ATX 3.0;每张卡用独立的两条 8-pin 线,不要用一条线的分叉头。
- 机箱:全塔或支持竖装的中塔,卡之间至少留一个槽位散热;两张 350W 的卡在小机箱里会互相加热降频。
- 功耗限制:
nvidia-smi -pl 280把 3090 限到 280W,推理速度掉不到 5%,温度和电费明显下降。 - 散热噪音:双卡满载 700W 相当于一个电暖器,夏天要考虑房间空调。
软件配置:llama.cpp 与 vLLM 的多卡参数
llama.cpp 默认自动层拆分,vLLM 加 --tensor-parallel-size 2。
llama.cpp(默认按显存比例拆层,-ts 手动指定比例):
llama-server -hf bartowski/Llama-3.3-70B-Instruct-GGUF:Q4_K_M -c 8192 -ngl 99 -ts 1,1 -fa on
Ollama 自动识别多卡并拆层,不需要额外参数:
ollama run llama3.3:70b
vLLM 张量并行(需要 AWQ / GPTQ / FP8 权重,两张同型号卡):
vllm serve casperhansen/llama-3.3-70b-instruct-awq --tensor-parallel-size 2 --max-model-len 8192 --gpu-memory-utilization 0.92
排错顺序:nvidia-smi 先确认两张卡都被识别;显存爆了先降 -c / --max-model-len;vLLM 报 NCCL 错误多半是 PCIe ACS 或 IOMMU,在 BIOS 里关掉。
结论:70B 该怎么配
两张 3090 是 70B 的最低门槛,NVLink 非必需,四张小卡不划算;要快选两张 5090,要省事选 Mac 128GB 或 4090 48GB 改装卡。
- 预算一万六到两万、能接受 16 tokens/s:两张 RTX 3090。
- 想要 30 tokens/s 和 32K 上下文:两张 RTX 5090 或一张 RTX PRO 6000。
- 不想折腾双卡:Mac Studio 128GB 慢一半但安静,见 Mac 统一内存 vs 独立显卡。
- 主要跑 MoE(gpt-oss 120B、GLM Air):一张 24GB 卡加 128GB 内存,不要多卡。
