問「AMD 顯示卡能不能跑本地大模型」的人,2026 年得到的答案是能,而且比兩年前省心得多:ROCm 7.2 起 RDNA 3 和 RDNA 4 在 Windows、Linux 上都能直接跑 llama.cpp、Ollama、LM Studio。但「能用」和「值得買」是兩回事。截至 2026 年 9 月 5 日,AMD 卡的優勢只有一個:顯示記憶體單價比同容量 NVIDIA 卡低三成左右;代價是同樣的頻寬下速度低兩到三成,vLLM 與微調仍然吃力。我們的建議:只用 llama.cpp 系工具、能接受偶爾查文件的人,RX 7900 XTX 是 24GB 裡最便宜的選擇;其他人選 NVIDIA。
AMD 顯示卡跑本地大模型現狀:ROCm 能用了嗎,哪些卡值得買(2026)
譯自简体中文版 · 閱讀原文
正文與常見問題中的數字截至 2026年9月5日;表格使用最新已發布價格,各裝置採集時間可能不同。

本文提及的固定價格均以中國二手市場人民幣(CNY)為基準;動態表格則依頁面所選幣別顯示。
ROCm 現在支援哪些卡和哪些框架?
消費卡里 RDNA 3(RX 7900 XTX / XT、W7800 / W7900)和 RDNA 4(RX 9070 XT、R9700)是官方支援清單內的,RX 7800 XT 這類中端 RDNA 3 需要繞一下。 2026 年 9 月的支援狀態:
| 顯示卡 | ROCm 官方支援 | llama.cpp / Ollama / LM Studio | vLLM | Windows |
|---|---|---|---|---|
| RX 7900 XTX / XT | 是(gfx1100) | 開箱即用 | 社群支援,效能一般 | ROCm 或 Vulkan |
| Radeon PRO W7800 / W7900 | 是(gfx1100) | 開箱即用 | 同上 | ROCm 或 Vulkan |
| RX 9070 XT / AI PRO R9700 | 是(gfx1201,ROCm 7.2 起) | 開箱即用 | 社群支援 | ROCm 或 Vulkan |
| RX 7800 XT | 否(gfx1101) | 需設 HSA_OVERRIDE_GFX_VERSION=11.0.0 或用 Vulkan |
不建議 | Vulkan |
| Instinct MI210 / MI100 | 是(CDNA) | 能用 | 是(這是它們的主場) | 否 |
Vulkan 後端是 AMD 使用者的保底方案:llama.cpp 的 Vulkan 後端在 RDNA 3 上速度已達 ROCm 的八到九成,任何 AMD 卡都能用,不需要 ROCm。
AMD 卡的顯示記憶體單價優勢有多大?
同容量對比,AMD 卡的顯示記憶體單價比 NVIDIA 低兩到四成,24GB 檔位的 RX 7900 XTX 是全站顯示記憶體單價最低的消費卡之一。 當前二手價格與單價:
| 型號 | 顯存 GB | 頻寬 GB/s | INT8 TOPS | 功耗 W | 閒魚 | 顯存單價 |
|---|---|---|---|---|---|---|
| 16 | 624 | 75 | 263 | NT$12,21514 筆掛單 | NT$763 | |
| 20 | 800 | 103 | 315 | NT$19,25713 筆掛單 | NT$963 | |
| 24 | 960 | 123 | 355 | NT$27,24911 筆掛單 | NT$1,136 | |
| 64 | 1,638 | 181 | 300 | NT$86,9138 筆掛單 | NT$1,358 | |
| 16 | 640 | 389 | 304 | NT$26,20614 筆掛單 | NT$1,638 | |
| 32 | 640 | 383 | 300 | NT$55,4373 筆掛單 | NT$1,733 | |
| 32 | 576 | 90 | 260 | NT$58,2563 筆掛單 | NT$1,820 | |
| 48 | 864 | 123 | 295 | NT$103,3575 筆掛單 | NT$2,153 |
對照組(NVIDIA 同容量):
| 型號 | 顯存 GB | 頻寬 GB/s | INT8 TOPS | 功耗 W | 閒魚 | 顯存單價 |
|---|---|---|---|---|---|---|
| 24 | 936 | 285 | 350 | NT$37,57913 筆掛單 | NT$1,566 | |
| 16 | 717 | 390 | 320 | NT$35,65810 筆掛單 | NT$2,229 | |
| 32 | 896 | 404 | 200 | NT$121,4448 筆掛單 | NT$3,795 | |
| 16 | 896 | 352 | 300 | NT$65,5378 筆掛單 | NT$4,096 |
RX 7900 XTX 與 RTX 3090 都是 24GB,前者便宜三成、還是 2022 年底的卡,二手成色普遍好於 2020 年的 3090。這是 AMD 全部的價格論據。
AMD 卡比 NVIDIA 慢多少?
頻寬相近時,ROCm 後端的實際速度約為 CUDA 的七成;頻寬本身也普遍低一檔。 預估解碼速度(4-bit、8K 上下文):
| 型號 | Qwen3 8B | gpt-oss 20B | Qwen3.8 27B | DeepSeek R1 Distill Qwen 32B |
|---|---|---|---|---|
| 86 | 115 | 28 | 24 | |
| 72 | 104 | 23 | 裝不下 | |
| 58 | 91 | 裝不下 | 裝不下 | |
| 57 | 90 | 裝不下 | 裝不下 | |
| 58 | 91 | 19 | 16 | |
| 114 | 135 | 38 | 32 | |
| 109 | 132 | 裝不下 | 裝不下 |
4-bit、8K 上下文、單路解碼的預估速度。帶 * 的是 MoE 模型把專家權重放在系統記憶體裡跑(按 70 GB/s 記憶體頻寬算)。
RX 7900 XTX 的 960 GB/s 比 RTX 3090 還高,但 Qwen3 8B 預估 86 對 114 tokens/s,差距就是後端效率。公開實測(llama.cpp、Llama 3.1 8B Q4_K_M)7900 XTX 約 96 tokens/s,與估算一致。RX 9070 XT 的 640 GB/s 讓它在 16GB 檔位裡明顯慢於 RTX 5070 Ti。
會踩哪些坑?
四個坑按遇到的順序:驅動版本、官方列表外的卡、量化格式、多卡。
- 驅動與 ROCm 版本:Linux 上核心、amdgpu 驅動、ROCm 三者版本要對齊,發行版升級後經常要重灌;Windows 上 ROCm 7.2 之後是一個安裝包,問題少得多。
- 列表外的卡:RX 7800 XT、7700 XT 需要
HSA_OVERRIDE_GFX_VERSION假裝成 7900,多數時候能跑,偶爾崩潰;Vulkan 後端更穩。 - 量化格式:GGUF 全部可用;AWQ、GPTQ、FP8 這些 vLLM 生態的格式在 RDNA 上要麼沒有核心要麼很慢。只用 GGUF 就沒有這個問題。
- 多卡:llama.cpp 的層拆分在 ROCm 上可用,張量並行和 NCCL 級別的多卡通訊(RCCL)在消費卡上問題多。兩張 7900 XTX 跑 70B 能跑,但別指望 vLLM。
- Flash Attention:llama.cpp 的
-fa在 ROCm 上已可用,但 RDNA 3 沒有專用矩陣單元,長上下文的 prefill 明顯慢於 NVIDIA。

值得買的 AMD 卡
RX 7900 XTX 是唯一無條件推薦的 AMD 消費卡,R9700 適合要 32GB 的工作站使用者,其餘按場景。
- RX 7900 XTX(24GB,960 GB/s):顯示記憶體單價最低的 24GB 卡,跑 32B 4-bit 約 24 tokens/s,能跑的模型與 3090 完全相同。買它。
- RX 7900 XT(20GB,800 GB/s):比 XTX 少 4GB,正好卡在 32B 4-bit 門檻之下,不如加錢上 XTX。
- RX 9070 XT(16GB,640 GB/s):RDNA 4 有 FP8 和翻倍的矩陣算力,但 640 GB/s 讓它在 16GB 檔裡最慢,只在 Windows + LM Studio 且預算極緊時選。
- Radeon AI PRO R9700(32GB,640 GB/s):32GB 消費級價格,雙槽渦輪,適合工作站裝兩張跑 70B;頻寬低,單卡速度一般。
- Radeon PRO W7900(48GB,864 GB/s):48GB 單卡跑 70B 4-bit 約 10 tokens/s,價格與 4090 48GB 改裝卡相近,但有質保、雙槽。
- Instinct MI210(64GB HBM2e,1.6 TB/s):二手價格合適,跑 70B 約 19 tokens/s,但被動散熱、300W、只能 Linux,是發燒友的卡。
結論:什麼人該買 AMD 卡
Linux 或 Windows 上只用 llama.cpp / Ollama / LM Studio,買 RX 7900 XTX 省三成錢;要 vLLM、微調、影象生成或者不想折騰,買 NVIDIA。
- 24GB 檔位的對比另見二手 3090 還是新 5070 Ti,把 7900 XTX 當第三個選項。
- 按顯示記憶體檔位找最便宜的卡,見預算有限跑本地大模型。
- 統一記憶體路線(含 Strix Halo)見 Mac 統一記憶體 vs 獨立顯示卡。
常見問題
AMD 顯示卡能跑 Ollama 嗎?
能。Ollama 自帶 ROCm 後端,RX 7900 系列和 RX 9070 系列在 Windows 與 Linux 上都能直接識別;RX 7800 XT 這類官方列表外的卡在 Linux 上要設 HSA_OVERRIDE_GFX_VERSION,或者改用 Vulkan 後端的 llama.cpp。
RX 7900 XTX 和 RTX 3090 跑模型哪個好?
能跑的模型完全一樣(都是 24GB),3090 快約三成(頻寬接近,CUDA 效率高)。7900 XTX 便宜三成左右、有質保、功耗相當。願意用 llama.cpp 系工具就買 7900 XTX,要 vLLM、微調或省心就買 3090。
Windows 上 AMD 卡怎麼跑大模型最省事?
LM Studio。它同時帶 ROCm 和 Vulkan 兩個後端,RDNA 3 / 4 自動用 ROCm,其他卡退回 Vulkan,不用裝任何驅動以外的東西。
Instinct MI210 這種二手加速卡值得買嗎?
64GB HBM2e、1.6 TB/s,跑 70B 4-bit 預估 19 tokens/s,比兩張 3090 快。但被動散熱要機箱強制風道、300W、PCIe 4.0、ROCm 對 CDNA2 的支援隨時可能進入維護期,只適合動手能力強的人。