Mac 統一記憶體跑大模型靠譜嗎?Mac Studio 與 RTX 顯示卡的真實對比(2026)

譯自简体中文版 · 閱讀原文

蘋果的統一記憶體把「顯示記憶體不夠」這個問題換成了「頻寬不夠」。一臺 128GB 的 Mac Studio 能單機跑 Llama 3.3 70Bgpt-oss 120B,這是任何一張消費顯示卡做不到的;但同樣的模型在裝得下的 RTX 卡上,速度是 Mac 的兩到三倍。 截至 2026 年 9 月 5 日,我們的結論是:要跑 100B 以上的 MoE 模型、看重安靜與省電、或者本來就要買 Mac,選 Mac;主力是 8B 到 32B 的稠密模型、追求響應速度和顯示記憶體單價,選 RTX。下面用同一套公式把兩邊放進同一張表。

示意圖:一臺鋁製小型桌面主機與一臺帶玻璃側板、裝著大顯示卡的塔式機並排
示意圖 · 一臺鋁製小型桌面主機與一臺帶玻璃側板、裝著大顯示卡的塔式機並排

本文提及的固定價格均以中國二手市場人民幣(CNY)為基準;動態表格則依頁面所選幣別顯示。

示意圖:主機板上的大型 SoC 封裝,記憶體顆粒直接焊在旁邊
示意圖:主機板上的大型 SoC 封裝,記憶體顆粒直接焊在旁邊

統一記憶體和顯示記憶體有什麼區別?

統一記憶體是 CPU 與 GPU 共享的一整塊 LPDDR5X,容量大、頻寬低;顯示記憶體是顯示卡獨佔的 GDDR,容量小、頻寬高。 數字對比:

裝置 記憶體 / 顯示記憶體 頻寬 型別
Mac Studio M4 Max 128GB 128 GB 546 GB/s LPDDR5X 統一記憶體
Mac Studio M5 Max 128GB 128 GB 614 GB/s LPDDR5X 統一記憶體
Mac Studio M3 Ultra 512GB 512 GB 819 GB/s LPDDR5X 統一記憶體
RTX 3090 24 GB 936 GB/s GDDR6X
RTX 4090 24 GB 1,008 GB/s GDDR6X
RTX 5090 32 GB 1,792 GB/s GDDR7
RTX PRO 6000 Blackwell 96 GB 1,792 GB/s GDDR7

大模型解碼是頻寬密集型:每生成一個 token 要把全部啟用權重讀一遍,所以速度 ≈ 頻寬 ÷ 權重體積。容量決定能不能跑,頻寬決定跑多快,兩邊正好互為短板。

同價位能跑的最大模型

四萬元以內,Mac 能跑的最大模型是 70B 稠密或 120B MoE,RTX 能跑的是 32B 稠密;十萬元以上 RTX PRO 6000 才追上 Mac 的容量。 當前二手價格與 4-bit / 8K 下能跑的最大稠密檔位:

項目Mac Studio M4 Max 128GBGeForce RTX 4090GeForce RTX 5090RTX PRO 6000 Blackwell
顯存128 GB LPDDR5X24 GB GDDR6X32 GB GDDR796 GB GDDR7 ECC
頻寬546 GB/s1,008 GB/s1,792 GB/s1,792 GB/s
BF16330.3 TFLOPS419 TFLOPS500 TFLOPS
INT8661 TOPS838 TOPS1,000 TOPS
功耗480 W450 W575 W600 W
介面PCIe 4.0 x16PCIe 5.0 x16PCIe 5.0 x16
發布日期2025年3月12日2022年10月12日2025年1月30日2025年3月18日
官方定價NT$50,590NT$63,245
閒魚二手NT$178,055NT$108,994NT$185,807NT$573,159
顯存單價NT$1,391NT$4,541NT$5,807NT$5,970
能跑的最大稠密檔位(4-bit、8K)70B32B32B70B
Llama 3.3 70B 速度7 t/s裝不下裝不下30 t/s

M4 Max 128GB 的價格與一張 RTX 4090 相當,但 4090 裝不下 70B。要用顯示卡跑 70B 4-bit,最便宜的路是兩張 3090(48GB,約一萬六),見多卡入門

速度對比:頻寬決定一切

都裝得下的模型上,RTX 4090 的速度是 M4 Max 的兩倍以上;Mac 獨有的大模型上,RTX 走專家卸載後反而比 Mac 慢。 預估解碼速度(4-bit、8K 上下文):

型號Qwen3 8BQwen3.8 27BLlama 3.3 70Bgpt-oss 120B
Mac Studio M4 Max 128GB5518768
Mac Studio M5 Max 128GB6120874
Mac Studio M3 Ultra 512GB81261190
GeForce RTX 309011438裝不下21*
GeForce RTX 409012241裝不下21*
GeForce RTX 509020170裝不下21*
DGX Spark 128GB3611548
Ryzen AI Max+ 395 128GB248335

4-bit、8K 上下文、單路解碼的預估速度。帶 * 的是 MoE 模型把專家權重放在系統記憶體裡跑(按 70 GB/s 記憶體頻寬算)。

三個結論:

  • 8B 到 27B 稠密模型,Mac 的體感明顯慢:Qwen3.8 27B 在 M4 Max 約 18 tokens/s,4090 約 41 tokens/s。
  • gpt-oss 120B 這類大 MoE 是 Mac 的主場:整機放記憶體約 68 tokens/s,4090 只能把專家放系統記憶體,約 21 tokens/s。
  • DGX Spark 與 Ryzen AI Max+ 395 的 128GB 是低頻寬版本,同樣的 70B 只有 3 到 5 tokens/s,只適合批處理和開發除錯。

70B 以上模型只有 Mac 能單機跑嗎?

不是,但 Mac 是最省事的一臺機器:顯示卡方案要兩張 24GB 卡或一張 96GB 的 RTX PRO 6000,前者要折騰機箱電源,後者要十幾萬。 70B 4-bit 的各條路:

  • 兩張 RTX 3090:48GB,約一萬六,預估 16 tokens/s,是 Mac 的兩倍,但要 1000W 電源、大機箱,噪音和功耗都高。
  • RTX 4090 48GB 改裝卡:單卡 48GB,二手約兩萬五,預估 17 tokens/s,無質保。
  • RTX PRO 6000 Blackwell 96GB:預估 30 tokens/s,能開 128K 上下文,十二萬。
  • Mac Studio M4 Max / M5 Max 128GB:7 到 8 tokens/s,靜音、150W 以內、還能當主力電腦。
  • Mac Studio M3 Ultra 512GB:唯一能整機裝下 DeepSeek V4 Flash(155 GB)和 Qwen3.8 Flash Next 的家用機器,前者約 47 tokens/s。

對 200B 以上的 MoE,Mac 512GB 是家用唯一解;對 70B 稠密,兩張 3090 更快更便宜。

軟體生態:MLX、llama.cpp、Ollama 在 Mac 上的現狀

llama.cpp 和 Ollama 在 Mac 上開箱即用,MLX 在 Apple Silicon 上比 llama.cpp 快一到兩成,vLLM 與微調生態仍以 CUDA 為主。

  • llama.cpp / Ollama:Metal 後端成熟,GGUF 直接用,ollama run 一條命令。是本文速度估算的口徑。
  • MLX:蘋果自家框架,權重用 MLX 格式(Hugging Face 上 mlx-community 有全套),解碼速度普遍比 llama.cpp 高 10% 到 20%,LM Studio 已內建。
  • vLLM / SGLang:沒有 Metal 後端,批次服務和高併發場景 Mac 不適用。
  • 微調:MLX 能做 LoRA,速度慢於同價位 RTX 數倍;正經微調仍要 CUDA。
  • 記憶體上限:macOS 預設只讓 GPU 用約 75% 的統一記憶體,sudo sysctl iogpu.wired_limit_mb=110000 可以把 128GB 機器放開到 110GB。

結論:按需求給答案

跑 70B 以上且接受 10 tokens/s 以內選 Mac;主力 32B 以內、要快、要便宜選 RTX;兩者都要就兩張 3090 加一臺普通 Mac。

  • 選 Mac:要跑 gpt-oss 120B、GLM 4.5 Air、DeepSeek V4 Flash 這類大 MoE;辦公室或臥室不能有噪音;本來就要換 Mac。
  • 選 RTX:日常用 8B 到 32B 模型,響應速度是第一要求;要做微調、vLLM 服務;預算按顯示記憶體單價算,見預算有限跑本地大模型
  • 不選 DGX Spark / Ryzen AI Max+ 395:除非你需要 CUDA 開發環境(Spark)或 x86 Linux(Strix Halo),否則同樣的錢 M4 Max 快一倍。
  • AMD 顯示卡:顯示記憶體單價更低但生態有坑,見 AMD 顯示卡跑本地大模型現狀

常見問題

Mac 跑大模型比顯示卡慢多少?

同一個模型、都裝得下的情況下,速度比約等於頻寬比再打個折:M4 Max 546 GB/s 對 RTX 4090 1,008 GB/s,Metal 後端效率又略低於 CUDA,Qwen3.8 27B 4-bit 預估 18 對 41 tokens/s,慢一半以上。

128GB 的 Mac 能跑 70B 模型嗎?

能。Llama 3.3 70B 4-bit 加 8K 上下文約 43 GB,128GB 統一記憶體放得下並能開到 128K 上下文,預估 7 到 8 tokens/s,閱讀速度的下限。

Mac 統一記憶體全部能給 GPU 用嗎?

預設不能,macOS 把 GPU 可用上限設在總記憶體的約 75%。用 sysctl iogpu.wired_limit_mb 可以調高,留 8 到 16GB 給系統即可。本站的能跑判斷按總記憶體算,實際留餘量。

DGX Spark 和 Ryzen AI Max+ 395 這類 128GB 迷你主機比 Mac 好嗎?

容量一樣,頻寬差很多:DGX Spark 273 GB/s、Ryzen AI Max+ 395 256 GB/s,只有 M4 Max 的一半,跑 70B 只有 3 到 5 tokens/s。它們的優勢是 CUDA 或 x86 生態與價格,不是速度。

文中提到的顯示卡

文中提到的模型