苹果的统一内存把「显存不够」这个问题换成了「带宽不够」。一台 128GB 的 Mac Studio 能单机跑 Llama 3.3 70B 和 gpt-oss 120B,这是任何一张消费显卡做不到的;但同样的模型在装得下的 RTX 卡上,速度是 Mac 的两到三倍。 截至 2026 年 9 月 5 日,我们的结论是:要跑 100B 以上的 MoE 模型、看重安静与省电、或者本来就要买 Mac,选 Mac;主力是 8B 到 32B 的稠密模型、追求响应速度和显存单价,选 RTX。下面用同一套公式把两边放进同一张表。

统一内存和显存有什么区别?
统一内存是 CPU 与 GPU 共享的一整块 LPDDR5X,容量大、带宽低;显存是显卡独占的 GDDR,容量小、带宽高。 数字对比:
| 设备 | 内存 / 显存 | 带宽 | 类型 |
|---|---|---|---|
| Mac Studio M4 Max 128GB | 128 GB | 546 GB/s | LPDDR5X 统一内存 |
| Mac Studio M5 Max 128GB | 128 GB | 614 GB/s | LPDDR5X 统一内存 |
| Mac Studio M3 Ultra 512GB | 512 GB | 819 GB/s | LPDDR5X 统一内存 |
| RTX 3090 | 24 GB | 936 GB/s | GDDR6X |
| RTX 4090 | 24 GB | 1,008 GB/s | GDDR6X |
| RTX 5090 | 32 GB | 1,792 GB/s | GDDR7 |
| RTX PRO 6000 Blackwell | 96 GB | 1,792 GB/s | GDDR7 |
大模型解码是带宽密集型:每生成一个 token 要把全部激活权重读一遍,所以速度 ≈ 带宽 ÷ 权重体积。容量决定能不能跑,带宽决定跑多快,两边正好互为短板。
同价位能跑的最大模型
四万元以内,Mac 能跑的最大模型是 70B 稠密或 120B MoE,RTX 能跑的是 32B 稠密;十万元以上 RTX PRO 6000 才追上 Mac 的容量。 当前二手价与 4-bit / 8K 下能跑的最大稠密档位:
| 项目 | Mac Studio M4 Max 128GB | |||
|---|---|---|---|---|
| 显存 | 128 GB LPDDR5X | 24 GB GDDR6X | 32 GB GDDR7 | 96 GB GDDR7 ECC |
| 带宽 | 546 GB/s | 1,008 GB/s | 1,792 GB/s | 1,792 GB/s |
| BF16 | — | 330.3 TFLOPS | 419 TFLOPS | 500 TFLOPS |
| INT8 | — | 661 TOPS | 838 TOPS | 1,000 TOPS |
| 功耗 | 480 W | 450 W | 575 W | 600 W |
| 接口 | — | PCIe 4.0 x16 | PCIe 5.0 x16 | PCIe 5.0 x16 |
| 发布日期 | 2025年3月12日 | 2022年10月12日 | 2025年1月30日 | 2025年3月18日 |
| 官方定价 | — | ¥10,768 | ¥13,462 | — |
| 闲鱼二手 | ¥38,500 | ¥23,500 | ¥39,400 | ¥122,000 |
| 显存单价 | ¥301 | ¥979 | ¥1,231 | ¥1,271 |
| 能跑的最大稠密档位(4-bit、8K) | 70B | 32B | 32B | 70B |
| Llama 3.3 70B 速度 | 7 t/s | 装不下 | 装不下 | 30 t/s |
M4 Max 128GB 的价格与一张 RTX 4090 相当,但 4090 装不下 70B。要用显卡跑 70B 4-bit,最便宜的路是两张 3090(48GB,约一万六),见多卡入门。
速度对比:带宽决定一切
都装得下的模型上,RTX 4090 的速度是 M4 Max 的两倍以上;Mac 独有的大模型上,RTX 走专家卸载后反而比 Mac 慢。 预估解码速度(4-bit、8K 上下文):
| 型号 | Qwen3 8B | Qwen3.8 27B | Llama 3.3 70B | gpt-oss 120B |
|---|---|---|---|---|
| Mac Studio M4 Max 128GB | 55 | 18 | 7 | 68 |
| Mac Studio M5 Max 128GB | 61 | 20 | 8 | 74 |
| Mac Studio M3 Ultra 512GB | 81 | 26 | 11 | 90 |
| 114 | 38 | 装不下 | 21* | |
| 122 | 41 | 装不下 | 21* | |
| 201 | 70 | 装不下 | 21* | |
| 36 | 11 | 5 | 48 | |
| 24 | 8 | 3 | 35 |
4-bit、8K 上下文、单路解码的预估速度。带 * 的是 MoE 模型把专家权重放在系统内存里跑(按 70 GB/s 内存带宽算)。
三个结论:
- 8B 到 27B 稠密模型,Mac 的体感明显慢:Qwen3.8 27B 在 M4 Max 约 18 tokens/s,4090 约 41 tokens/s。
- gpt-oss 120B 这类大 MoE 是 Mac 的主场:整机放内存约 68 tokens/s,4090 只能把专家放系统内存,约 21 tokens/s。
- DGX Spark 与 Ryzen AI Max+ 395 的 128GB 是低带宽版本,同样的 70B 只有 3 到 5 tokens/s,只适合批处理和开发调试。
70B 以上模型只有 Mac 能单机跑吗?
不是,但 Mac 是最省事的一台机器:显卡方案要两张 24GB 卡或一张 96GB 的 RTX PRO 6000,前者要折腾机箱电源,后者要十几万。 70B 4-bit 的各条路:
- 两张 RTX 3090:48GB,约一万六,预估 16 tokens/s,是 Mac 的两倍,但要 1000W 电源、大机箱,噪音和功耗都高。
- RTX 4090 48GB 改装卡:单卡 48GB,二手约两万五,预估 17 tokens/s,无质保。
- RTX PRO 6000 Blackwell 96GB:预估 30 tokens/s,能开 128K 上下文,十二万。
- Mac Studio M4 Max / M5 Max 128GB:7 到 8 tokens/s,静音、150W 以内、还能当主力电脑。
- Mac Studio M3 Ultra 512GB:唯一能整机装下 DeepSeek V4 Flash(155 GB)和 Qwen3.8 Flash Next 的家用机器,前者约 47 tokens/s。
对 200B 以上的 MoE,Mac 512GB 是家用唯一解;对 70B 稠密,两张 3090 更快更便宜。
软件生态:MLX、llama.cpp、Ollama 在 Mac 上的现状
llama.cpp 和 Ollama 在 Mac 上开箱即用,MLX 在 Apple Silicon 上比 llama.cpp 快一到两成,vLLM 与微调生态仍以 CUDA 为主。
- llama.cpp / Ollama:Metal 后端成熟,GGUF 直接用,
ollama run一条命令。是本文速度估算的口径。 - MLX:苹果自家框架,权重用 MLX 格式(Hugging Face 上 mlx-community 有全套),解码速度普遍比 llama.cpp 高 10% 到 20%,LM Studio 已内置。
- vLLM / SGLang:没有 Metal 后端,批量服务和高并发场景 Mac 不适用。
- 微调:MLX 能做 LoRA,速度慢于同价位 RTX 数倍;正经微调仍要 CUDA。
- 内存上限:macOS 默认只让 GPU 用约 75% 的统一内存,
sudo sysctl iogpu.wired_limit_mb=110000可以把 128GB 机器放开到 110GB。
结论:按需求给答案
跑 70B 以上且接受 10 tokens/s 以内选 Mac;主力 32B 以内、要快、要便宜选 RTX;两者都要就两张 3090 加一台普通 Mac。
- 选 Mac:要跑 gpt-oss 120B、GLM 4.5 Air、DeepSeek V4 Flash 这类大 MoE;办公室或卧室不能有噪音;本来就要换 Mac。
- 选 RTX:日常用 8B 到 32B 模型,响应速度是第一要求;要做微调、vLLM 服务;预算按显存单价算,见预算有限跑本地大模型。
- 不选 DGX Spark / Ryzen AI Max+ 395:除非你需要 CUDA 开发环境(Spark)或 x86 Linux(Strix Halo),否则同样的钱 M4 Max 快一倍。
- AMD 显卡:显存单价更低但生态有坑,见 AMD 显卡跑本地大模型现状。
