蘋果的統一記憶體把「顯示記憶體不夠」這個問題換成了「頻寬不夠」。一臺 128GB 的 Mac Studio 能單機跑 Llama 3.3 70B 和 gpt-oss 120B,這是任何一張消費顯示卡做不到的;但同樣的模型在裝得下的 RTX 卡上,速度是 Mac 的兩到三倍。 截至 2026 年 9 月 5 日,我們的結論是:要跑 100B 以上的 MoE 模型、看重安靜與省電、或者本來就要買 Mac,選 Mac;主力是 8B 到 32B 的稠密模型、追求響應速度和顯示記憶體單價,選 RTX。下面用同一套公式把兩邊放進同一張表。
Mac 統一記憶體跑大模型靠譜嗎?Mac Studio 與 RTX 顯示卡的真實對比(2026)
譯自简体中文版 · 閱讀原文
正文與常見問題中的數字截至 2026年9月5日;表格使用最新已發布價格,各裝置採集時間可能不同。

本文提及的固定價格均以中國二手市場人民幣(CNY)為基準;動態表格則依頁面所選幣別顯示。

統一記憶體和顯示記憶體有什麼區別?
統一記憶體是 CPU 與 GPU 共享的一整塊 LPDDR5X,容量大、頻寬低;顯示記憶體是顯示卡獨佔的 GDDR,容量小、頻寬高。 數字對比:
| 裝置 | 記憶體 / 顯示記憶體 | 頻寬 | 型別 |
|---|---|---|---|
| Mac Studio M4 Max 128GB | 128 GB | 546 GB/s | LPDDR5X 統一記憶體 |
| Mac Studio M5 Max 128GB | 128 GB | 614 GB/s | LPDDR5X 統一記憶體 |
| Mac Studio M3 Ultra 512GB | 512 GB | 819 GB/s | LPDDR5X 統一記憶體 |
| RTX 3090 | 24 GB | 936 GB/s | GDDR6X |
| RTX 4090 | 24 GB | 1,008 GB/s | GDDR6X |
| RTX 5090 | 32 GB | 1,792 GB/s | GDDR7 |
| RTX PRO 6000 Blackwell | 96 GB | 1,792 GB/s | GDDR7 |
大模型解碼是頻寬密集型:每生成一個 token 要把全部啟用權重讀一遍,所以速度 ≈ 頻寬 ÷ 權重體積。容量決定能不能跑,頻寬決定跑多快,兩邊正好互為短板。
同價位能跑的最大模型
四萬元以內,Mac 能跑的最大模型是 70B 稠密或 120B MoE,RTX 能跑的是 32B 稠密;十萬元以上 RTX PRO 6000 才追上 Mac 的容量。 當前二手價格與 4-bit / 8K 下能跑的最大稠密檔位:
| 項目 | Mac Studio M4 Max 128GB | |||
|---|---|---|---|---|
| 顯存 | 128 GB LPDDR5X | 24 GB GDDR6X | 32 GB GDDR7 | 96 GB GDDR7 ECC |
| 頻寬 | 546 GB/s | 1,008 GB/s | 1,792 GB/s | 1,792 GB/s |
| BF16 | — | 330.3 TFLOPS | 419 TFLOPS | 500 TFLOPS |
| INT8 | — | 661 TOPS | 838 TOPS | 1,000 TOPS |
| 功耗 | 480 W | 450 W | 575 W | 600 W |
| 介面 | — | PCIe 4.0 x16 | PCIe 5.0 x16 | PCIe 5.0 x16 |
| 發布日期 | 2025年3月12日 | 2022年10月12日 | 2025年1月30日 | 2025年3月18日 |
| 官方定價 | — | NT$50,590 | NT$63,245 | — |
| 閒魚二手 | NT$178,055 | NT$108,994 | NT$185,807 | NT$573,159 |
| 顯存單價 | NT$1,391 | NT$4,541 | NT$5,807 | NT$5,970 |
| 能跑的最大稠密檔位(4-bit、8K) | 70B | 32B | 32B | 70B |
| Llama 3.3 70B 速度 | 7 t/s | 裝不下 | 裝不下 | 30 t/s |
M4 Max 128GB 的價格與一張 RTX 4090 相當,但 4090 裝不下 70B。要用顯示卡跑 70B 4-bit,最便宜的路是兩張 3090(48GB,約一萬六),見多卡入門。
速度對比:頻寬決定一切
都裝得下的模型上,RTX 4090 的速度是 M4 Max 的兩倍以上;Mac 獨有的大模型上,RTX 走專家卸載後反而比 Mac 慢。 預估解碼速度(4-bit、8K 上下文):
| 型號 | Qwen3 8B | Qwen3.8 27B | Llama 3.3 70B | gpt-oss 120B |
|---|---|---|---|---|
| Mac Studio M4 Max 128GB | 55 | 18 | 7 | 68 |
| Mac Studio M5 Max 128GB | 61 | 20 | 8 | 74 |
| Mac Studio M3 Ultra 512GB | 81 | 26 | 11 | 90 |
| 114 | 38 | 裝不下 | 21* | |
| 122 | 41 | 裝不下 | 21* | |
| 201 | 70 | 裝不下 | 21* | |
| 36 | 11 | 5 | 48 | |
| 24 | 8 | 3 | 35 |
4-bit、8K 上下文、單路解碼的預估速度。帶 * 的是 MoE 模型把專家權重放在系統記憶體裡跑(按 70 GB/s 記憶體頻寬算)。
三個結論:
- 8B 到 27B 稠密模型,Mac 的體感明顯慢:Qwen3.8 27B 在 M4 Max 約 18 tokens/s,4090 約 41 tokens/s。
- gpt-oss 120B 這類大 MoE 是 Mac 的主場:整機放記憶體約 68 tokens/s,4090 只能把專家放系統記憶體,約 21 tokens/s。
- DGX Spark 與 Ryzen AI Max+ 395 的 128GB 是低頻寬版本,同樣的 70B 只有 3 到 5 tokens/s,只適合批處理和開發除錯。
70B 以上模型只有 Mac 能單機跑嗎?
不是,但 Mac 是最省事的一臺機器:顯示卡方案要兩張 24GB 卡或一張 96GB 的 RTX PRO 6000,前者要折騰機箱電源,後者要十幾萬。 70B 4-bit 的各條路:
- 兩張 RTX 3090:48GB,約一萬六,預估 16 tokens/s,是 Mac 的兩倍,但要 1000W 電源、大機箱,噪音和功耗都高。
- RTX 4090 48GB 改裝卡:單卡 48GB,二手約兩萬五,預估 17 tokens/s,無質保。
- RTX PRO 6000 Blackwell 96GB:預估 30 tokens/s,能開 128K 上下文,十二萬。
- Mac Studio M4 Max / M5 Max 128GB:7 到 8 tokens/s,靜音、150W 以內、還能當主力電腦。
- Mac Studio M3 Ultra 512GB:唯一能整機裝下 DeepSeek V4 Flash(155 GB)和 Qwen3.8 Flash Next 的家用機器,前者約 47 tokens/s。
對 200B 以上的 MoE,Mac 512GB 是家用唯一解;對 70B 稠密,兩張 3090 更快更便宜。
軟體生態:MLX、llama.cpp、Ollama 在 Mac 上的現狀
llama.cpp 和 Ollama 在 Mac 上開箱即用,MLX 在 Apple Silicon 上比 llama.cpp 快一到兩成,vLLM 與微調生態仍以 CUDA 為主。
- llama.cpp / Ollama:Metal 後端成熟,GGUF 直接用,
ollama run一條命令。是本文速度估算的口徑。 - MLX:蘋果自家框架,權重用 MLX 格式(Hugging Face 上 mlx-community 有全套),解碼速度普遍比 llama.cpp 高 10% 到 20%,LM Studio 已內建。
- vLLM / SGLang:沒有 Metal 後端,批次服務和高併發場景 Mac 不適用。
- 微調:MLX 能做 LoRA,速度慢於同價位 RTX 數倍;正經微調仍要 CUDA。
- 記憶體上限:macOS 預設只讓 GPU 用約 75% 的統一記憶體,
sudo sysctl iogpu.wired_limit_mb=110000可以把 128GB 機器放開到 110GB。
結論:按需求給答案
跑 70B 以上且接受 10 tokens/s 以內選 Mac;主力 32B 以內、要快、要便宜選 RTX;兩者都要就兩張 3090 加一臺普通 Mac。
- 選 Mac:要跑 gpt-oss 120B、GLM 4.5 Air、DeepSeek V4 Flash 這類大 MoE;辦公室或臥室不能有噪音;本來就要換 Mac。
- 選 RTX:日常用 8B 到 32B 模型,響應速度是第一要求;要做微調、vLLM 服務;預算按顯示記憶體單價算,見預算有限跑本地大模型。
- 不選 DGX Spark / Ryzen AI Max+ 395:除非你需要 CUDA 開發環境(Spark)或 x86 Linux(Strix Halo),否則同樣的錢 M4 Max 快一倍。
- AMD 顯示卡:顯示記憶體單價更低但生態有坑,見 AMD 顯示卡跑本地大模型現狀。
常見問題
Mac 跑大模型比顯示卡慢多少?
同一個模型、都裝得下的情況下,速度比約等於頻寬比再打個折:M4 Max 546 GB/s 對 RTX 4090 1,008 GB/s,Metal 後端效率又略低於 CUDA,Qwen3.8 27B 4-bit 預估 18 對 41 tokens/s,慢一半以上。
128GB 的 Mac 能跑 70B 模型嗎?
能。Llama 3.3 70B 4-bit 加 8K 上下文約 43 GB,128GB 統一記憶體放得下並能開到 128K 上下文,預估 7 到 8 tokens/s,閱讀速度的下限。
Mac 統一記憶體全部能給 GPU 用嗎?
預設不能,macOS 把 GPU 可用上限設在總記憶體的約 75%。用 sysctl iogpu.wired_limit_mb 可以調高,留 8 到 16GB 給系統即可。本站的能跑判斷按總記憶體算,實際留餘量。
DGX Spark 和 Ryzen AI Max+ 395 這類 128GB 迷你主機比 Mac 好嗎?
容量一樣,頻寬差很多:DGX Spark 273 GB/s、Ryzen AI Max+ 395 256 GB/s,只有 M4 Max 的一半,跑 70B 只有 3 到 5 tokens/s。它們的優勢是 CUDA 或 x86 生態與價格,不是速度。