苹果的统一内存把「显存不够」这个问题换成了「带宽不够」。一台 128GB 的 Mac Studio 能单机跑 Llama 3.3 70Bgpt-oss 120B,这是任何一张消费显卡做不到的;但同样的模型在装得下的 RTX 卡上,速度是 Mac 的两到三倍。 截至 2026 年 9 月 5 日,我们的结论是:要跑 100B 以上的 MoE 模型、看重安静与省电、或者本来就要买 Mac,选 Mac;主力是 8B 到 32B 的稠密模型、追求响应速度和显存单价,选 RTX。下面用同一套公式把两边放进同一张表。

示意图:主板上的大型 SoC 封装,内存颗粒直接焊在旁边
示意图:主板上的大型 SoC 封装,内存颗粒直接焊在旁边

统一内存和显存有什么区别?

统一内存是 CPU 与 GPU 共享的一整块 LPDDR5X,容量大、带宽低;显存是显卡独占的 GDDR,容量小、带宽高。 数字对比:

设备 内存 / 显存 带宽 类型
Mac Studio M4 Max 128GB 128 GB 546 GB/s LPDDR5X 统一内存
Mac Studio M5 Max 128GB 128 GB 614 GB/s LPDDR5X 统一内存
Mac Studio M3 Ultra 512GB 512 GB 819 GB/s LPDDR5X 统一内存
RTX 3090 24 GB 936 GB/s GDDR6X
RTX 4090 24 GB 1,008 GB/s GDDR6X
RTX 5090 32 GB 1,792 GB/s GDDR7
RTX PRO 6000 Blackwell 96 GB 1,792 GB/s GDDR7

大模型解码是带宽密集型:每生成一个 token 要把全部激活权重读一遍,所以速度 ≈ 带宽 ÷ 权重体积。容量决定能不能跑,带宽决定跑多快,两边正好互为短板。

同价位能跑的最大模型

四万元以内,Mac 能跑的最大模型是 70B 稠密或 120B MoE,RTX 能跑的是 32B 稠密;十万元以上 RTX PRO 6000 才追上 Mac 的容量。 当前二手价与 4-bit / 8K 下能跑的最大稠密档位:

项目Mac Studio M4 Max 128GBGeForce RTX 4090GeForce RTX 5090RTX PRO 6000 Blackwell
显存128 GB LPDDR5X24 GB GDDR6X32 GB GDDR796 GB GDDR7 ECC
带宽546 GB/s1,008 GB/s1,792 GB/s1,792 GB/s
BF16330.3 TFLOPS419 TFLOPS500 TFLOPS
INT8661 TOPS838 TOPS1,000 TOPS
功耗480 W450 W575 W600 W
接口PCIe 4.0 x16PCIe 5.0 x16PCIe 5.0 x16
发布日期2025年3月12日2022年10月12日2025年1月30日2025年3月18日
官方定价¥10,768¥13,462
闲鱼二手¥38,500¥23,500¥39,400¥122,000
显存单价¥301¥979¥1,231¥1,271
能跑的最大稠密档位(4-bit、8K)70B32B32B70B
Llama 3.3 70B 速度7 t/s装不下装不下30 t/s

M4 Max 128GB 的价格与一张 RTX 4090 相当,但 4090 装不下 70B。要用显卡跑 70B 4-bit,最便宜的路是两张 3090(48GB,约一万六),见多卡入门

速度对比:带宽决定一切

都装得下的模型上,RTX 4090 的速度是 M4 Max 的两倍以上;Mac 独有的大模型上,RTX 走专家卸载后反而比 Mac 慢。 预估解码速度(4-bit、8K 上下文):

型号Qwen3 8BQwen3.8 27BLlama 3.3 70Bgpt-oss 120B
Mac Studio M4 Max 128GB5518768
Mac Studio M5 Max 128GB6120874
Mac Studio M3 Ultra 512GB81261190
GeForce RTX 309011438装不下21*
GeForce RTX 409012241装不下21*
GeForce RTX 509020170装不下21*
DGX Spark 128GB3611548
Ryzen AI Max+ 395 128GB248335

4-bit、8K 上下文、单路解码的预估速度。带 * 的是 MoE 模型把专家权重放在系统内存里跑(按 70 GB/s 内存带宽算)。

三个结论:

  • 8B 到 27B 稠密模型,Mac 的体感明显慢:Qwen3.8 27B 在 M4 Max 约 18 tokens/s,4090 约 41 tokens/s。
  • gpt-oss 120B 这类大 MoE 是 Mac 的主场:整机放内存约 68 tokens/s,4090 只能把专家放系统内存,约 21 tokens/s。
  • DGX Spark 与 Ryzen AI Max+ 395 的 128GB 是低带宽版本,同样的 70B 只有 3 到 5 tokens/s,只适合批处理和开发调试。

70B 以上模型只有 Mac 能单机跑吗?

不是,但 Mac 是最省事的一台机器:显卡方案要两张 24GB 卡或一张 96GB 的 RTX PRO 6000,前者要折腾机箱电源,后者要十几万。 70B 4-bit 的各条路:

  • 两张 RTX 3090:48GB,约一万六,预估 16 tokens/s,是 Mac 的两倍,但要 1000W 电源、大机箱,噪音和功耗都高。
  • RTX 4090 48GB 改装卡:单卡 48GB,二手约两万五,预估 17 tokens/s,无质保。
  • RTX PRO 6000 Blackwell 96GB:预估 30 tokens/s,能开 128K 上下文,十二万。
  • Mac Studio M4 Max / M5 Max 128GB:7 到 8 tokens/s,静音、150W 以内、还能当主力电脑。
  • Mac Studio M3 Ultra 512GB:唯一能整机装下 DeepSeek V4 Flash(155 GB)和 Qwen3.8 Flash Next 的家用机器,前者约 47 tokens/s。

对 200B 以上的 MoE,Mac 512GB 是家用唯一解;对 70B 稠密,两张 3090 更快更便宜。

软件生态:MLX、llama.cpp、Ollama 在 Mac 上的现状

llama.cpp 和 Ollama 在 Mac 上开箱即用,MLX 在 Apple Silicon 上比 llama.cpp 快一到两成,vLLM 与微调生态仍以 CUDA 为主。

  • llama.cpp / Ollama:Metal 后端成熟,GGUF 直接用,ollama run 一条命令。是本文速度估算的口径。
  • MLX:苹果自家框架,权重用 MLX 格式(Hugging Face 上 mlx-community 有全套),解码速度普遍比 llama.cpp 高 10% 到 20%,LM Studio 已内置。
  • vLLM / SGLang:没有 Metal 后端,批量服务和高并发场景 Mac 不适用。
  • 微调:MLX 能做 LoRA,速度慢于同价位 RTX 数倍;正经微调仍要 CUDA。
  • 内存上限:macOS 默认只让 GPU 用约 75% 的统一内存,sudo sysctl iogpu.wired_limit_mb=110000 可以把 128GB 机器放开到 110GB。

结论:按需求给答案

跑 70B 以上且接受 10 tokens/s 以内选 Mac;主力 32B 以内、要快、要便宜选 RTX;两者都要就两张 3090 加一台普通 Mac。

  • 选 Mac:要跑 gpt-oss 120B、GLM 4.5 Air、DeepSeek V4 Flash 这类大 MoE;办公室或卧室不能有噪音;本来就要换 Mac。
  • 选 RTX:日常用 8B 到 32B 模型,响应速度是第一要求;要做微调、vLLM 服务;预算按显存单价算,见预算有限跑本地大模型
  • 不选 DGX Spark / Ryzen AI Max+ 395:除非你需要 CUDA 开发环境(Spark)或 x86 Linux(Strix Halo),否则同样的钱 M4 Max 快一倍。
  • AMD 显卡:显存单价更低但生态有坑,见 AMD 显卡跑本地大模型现状