AMD 顯示卡跑本地大模型現狀:ROCm 能用了嗎,哪些卡值得買(2026)

譯自简体中文版 · 閱讀原文

問「AMD 顯示卡能不能跑本地大模型」的人,2026 年得到的答案是能,而且比兩年前省心得多:ROCm 7.2 起 RDNA 3 和 RDNA 4 在 Windows、Linux 上都能直接跑 llama.cpp、Ollama、LM Studio。但「能用」和「值得買」是兩回事。截至 2026 年 9 月 5 日,AMD 卡的優勢只有一個:顯示記憶體單價比同容量 NVIDIA 卡低三成左右;代價是同樣的頻寬下速度低兩到三成,vLLM 與微調仍然吃力。我們的建議:只用 llama.cpp 系工具、能接受偶爾查文件的人,RX 7900 XTX 是 24GB 裡最便宜的選擇;其他人選 NVIDIA。

示意圖:紅色飾條的顯示卡裝在拆開的工作站裡,背景顯示器上是虛化的終端視窗
示意圖 · 紅色飾條的顯示卡裝在拆開的工作站裡,背景顯示器上是虛化的終端視窗

本文提及的固定價格均以中國二手市場人民幣(CNY)為基準;動態表格則依頁面所選幣別顯示。

ROCm 現在支援哪些卡和哪些框架?

消費卡里 RDNA 3(RX 7900 XTX / XT、W7800 / W7900)和 RDNA 4(RX 9070 XTR9700)是官方支援清單內的,RX 7800 XT 這類中端 RDNA 3 需要繞一下。 2026 年 9 月的支援狀態:

顯示卡 ROCm 官方支援 llama.cpp / Ollama / LM Studio vLLM Windows
RX 7900 XTX / XT 是(gfx1100) 開箱即用 社群支援,效能一般 ROCm 或 Vulkan
Radeon PRO W7800 / W7900 是(gfx1100) 開箱即用 同上 ROCm 或 Vulkan
RX 9070 XT / AI PRO R9700 是(gfx1201,ROCm 7.2 起) 開箱即用 社群支援 ROCm 或 Vulkan
RX 7800 XT 否(gfx1101) 需設 HSA_OVERRIDE_GFX_VERSION=11.0.0 或用 Vulkan 不建議 Vulkan
Instinct MI210 / MI100 是(CDNA) 能用 是(這是它們的主場)

Vulkan 後端是 AMD 使用者的保底方案:llama.cpp 的 Vulkan 後端在 RDNA 3 上速度已達 ROCm 的八到九成,任何 AMD 卡都能用,不需要 ROCm。

AMD 卡的顯示記憶體單價優勢有多大?

同容量對比,AMD 卡的顯示記憶體單價比 NVIDIA 低兩到四成,24GB 檔位的 RX 7900 XTX 是全站顯示記憶體單價最低的消費卡之一。 當前二手價格與單價:

型號顯存 GB頻寬 GB/sINT8 TOPS功耗 W閒魚顯存單價
Radeon RX 7800 XT1662475263NT$12,21514 筆掛單NT$763
Radeon RX 7900 XT20800103315NT$19,25713 筆掛單NT$963
Radeon RX 7900 XTX24960123355NT$27,24911 筆掛單NT$1,136
Instinct MI210641,638181300NT$86,9138 筆掛單NT$1,358
Radeon RX 9070 XT16640389304NT$26,20614 筆掛單NT$1,638
Radeon AI PRO R970032640383300NT$55,4373 筆掛單NT$1,733
Radeon PRO W78003257690260NT$58,2563 筆掛單NT$1,820
Radeon PRO W790048864123295NT$103,3575 筆掛單NT$2,153

對照組(NVIDIA 同容量):

型號顯存 GB頻寬 GB/sINT8 TOPS功耗 W閒魚顯存單價
GeForce RTX 309024936285350NT$37,57913 筆掛單NT$1,566
GeForce RTX 408016717390320NT$35,65810 筆掛單NT$2,229
RTX PRO 4500 Blackwell32896404200NT$121,4448 筆掛單NT$3,795
GeForce RTX 5070 Ti16896352300NT$65,5378 筆掛單NT$4,096

RX 7900 XTX 與 RTX 3090 都是 24GB,前者便宜三成、還是 2022 年底的卡,二手成色普遍好於 2020 年的 3090。這是 AMD 全部的價格論據。

AMD 卡比 NVIDIA 慢多少?

頻寬相近時,ROCm 後端的實際速度約為 CUDA 的七成;頻寬本身也普遍低一檔。 預估解碼速度(4-bit、8K 上下文):

型號Qwen3 8Bgpt-oss 20BQwen3.8 27BDeepSeek R1 Distill Qwen 32B
Radeon RX 7900 XTX861152824
Radeon RX 7900 XT7210423裝不下
Radeon RX 9070 XT5891裝不下裝不下
Radeon RX 7800 XT5790裝不下裝不下
Radeon AI PRO R970058911916
GeForce RTX 30901141353832
GeForce RTX 5070 Ti109132裝不下裝不下

4-bit、8K 上下文、單路解碼的預估速度。帶 * 的是 MoE 模型把專家權重放在系統記憶體裡跑(按 70 GB/s 記憶體頻寬算)。

RX 7900 XTX 的 960 GB/s 比 RTX 3090 還高,但 Qwen3 8B 預估 86 對 114 tokens/s,差距就是後端效率。公開實測(llama.cpp、Llama 3.1 8B Q4_K_M)7900 XTX 約 96 tokens/s,與估算一致。RX 9070 XT 的 640 GB/s 讓它在 16GB 檔位裡明顯慢於 RTX 5070 Ti

會踩哪些坑?

四個坑按遇到的順序:驅動版本、官方列表外的卡、量化格式、多卡。

  1. 驅動與 ROCm 版本:Linux 上核心、amdgpu 驅動、ROCm 三者版本要對齊,發行版升級後經常要重灌;Windows 上 ROCm 7.2 之後是一個安裝包,問題少得多。
  2. 列表外的卡:RX 7800 XT、7700 XT 需要 HSA_OVERRIDE_GFX_VERSION 假裝成 7900,多數時候能跑,偶爾崩潰;Vulkan 後端更穩。
  3. 量化格式:GGUF 全部可用;AWQ、GPTQ、FP8 這些 vLLM 生態的格式在 RDNA 上要麼沒有核心要麼很慢。只用 GGUF 就沒有這個問題。
  4. 多卡:llama.cpp 的層拆分在 ROCm 上可用,張量並行和 NCCL 級別的多卡通訊(RCCL)在消費卡上問題多。兩張 7900 XTX 跑 70B 能跑,但別指望 vLLM。
  5. Flash Attention:llama.cpp 的 -fa 在 ROCm 上已可用,但 RDNA 3 沒有專用矩陣單元,長上下文的 prefill 明顯慢於 NVIDIA。
示意圖:紅色飾條顯示卡的擋板與影片輸出介面,放在防靜電袋上
示意圖:紅色飾條顯示卡的擋板與影片輸出介面,放在防靜電袋上

值得買的 AMD 卡

RX 7900 XTX 是唯一無條件推薦的 AMD 消費卡,R9700 適合要 32GB 的工作站使用者,其餘按場景。

  • RX 7900 XTX(24GB,960 GB/s):顯示記憶體單價最低的 24GB 卡,跑 32B 4-bit 約 24 tokens/s,能跑的模型與 3090 完全相同。買它。
  • RX 7900 XT(20GB,800 GB/s):比 XTX 少 4GB,正好卡在 32B 4-bit 門檻之下,不如加錢上 XTX。
  • RX 9070 XT(16GB,640 GB/s):RDNA 4 有 FP8 和翻倍的矩陣算力,但 640 GB/s 讓它在 16GB 檔裡最慢,只在 Windows + LM Studio 且預算極緊時選。
  • Radeon AI PRO R9700(32GB,640 GB/s):32GB 消費級價格,雙槽渦輪,適合工作站裝兩張跑 70B;頻寬低,單卡速度一般。
  • Radeon PRO W7900(48GB,864 GB/s):48GB 單卡跑 70B 4-bit 約 10 tokens/s,價格與 4090 48GB 改裝卡相近,但有質保、雙槽。
  • Instinct MI210(64GB HBM2e,1.6 TB/s):二手價格合適,跑 70B 約 19 tokens/s,但被動散熱、300W、只能 Linux,是發燒友的卡。

結論:什麼人該買 AMD 卡

Linux 或 Windows 上只用 llama.cpp / Ollama / LM Studio,買 RX 7900 XTX 省三成錢;要 vLLM、微調、影象生成或者不想折騰,買 NVIDIA。

常見問題

AMD 顯示卡能跑 Ollama 嗎?

能。Ollama 自帶 ROCm 後端,RX 7900 系列和 RX 9070 系列在 Windows 與 Linux 上都能直接識別;RX 7800 XT 這類官方列表外的卡在 Linux 上要設 HSA_OVERRIDE_GFX_VERSION,或者改用 Vulkan 後端的 llama.cpp。

RX 7900 XTX 和 RTX 3090 跑模型哪個好?

能跑的模型完全一樣(都是 24GB),3090 快約三成(頻寬接近,CUDA 效率高)。7900 XTX 便宜三成左右、有質保、功耗相當。願意用 llama.cpp 系工具就買 7900 XTX,要 vLLM、微調或省心就買 3090。

Windows 上 AMD 卡怎麼跑大模型最省事?

LM Studio。它同時帶 ROCm 和 Vulkan 兩個後端,RDNA 3 / 4 自動用 ROCm,其他卡退回 Vulkan,不用裝任何驅動以外的東西。

Instinct MI210 這種二手加速卡值得買嗎?

64GB HBM2e、1.6 TB/s,跑 70B 4-bit 預估 19 tokens/s,比兩張 3090 快。但被動散熱要機箱強制風道、300W、PCIe 4.0、ROCm 對 CDNA2 的支援隨時可能進入維護期,只適合動手能力強的人。

文中提到的顯示卡

文中提到的模型