问「AMD 显卡能不能跑本地大模型」的人,2026 年得到的答案是能,而且比两年前省心得多:ROCm 7.2 起 RDNA 3 和 RDNA 4 在 Windows、Linux 上都能直接跑 llama.cpp、Ollama、LM Studio。但「能用」和「值得买」是两回事。截至 2026 年 9 月 5 日,AMD 卡的优势只有一个:显存单价比同容量 NVIDIA 卡低三成左右;代价是同样的带宽下速度低两到三成,vLLM 与微调仍然吃力。我们的建议:只用 llama.cpp 系工具、能接受偶尔查文档的人,RX 7900 XTX 是 24GB 里最便宜的选择;其他人选 NVIDIA。
ROCm 现在支持哪些卡和哪些框架?
消费卡里 RDNA 3(RX 7900 XTX / XT、W7800 / W7900)和 RDNA 4(RX 9070 XT、R9700)是官方支持列表内的,RX 7800 XT 这类中端 RDNA 3 需要绕一下。 2026 年 9 月的支持状态:
| 显卡 | ROCm 官方支持 | llama.cpp / Ollama / LM Studio | vLLM | Windows |
|---|---|---|---|---|
| RX 7900 XTX / XT | 是(gfx1100) | 开箱即用 | 社区支持,性能一般 | ROCm 或 Vulkan |
| Radeon PRO W7800 / W7900 | 是(gfx1100) | 开箱即用 | 同上 | ROCm 或 Vulkan |
| RX 9070 XT / AI PRO R9700 | 是(gfx1201,ROCm 7.2 起) | 开箱即用 | 社区支持 | ROCm 或 Vulkan |
| RX 7800 XT | 否(gfx1101) | 需设 HSA_OVERRIDE_GFX_VERSION=11.0.0 或用 Vulkan |
不建议 | Vulkan |
| Instinct MI210 / MI100 | 是(CDNA) | 能用 | 是(这是它们的主场) | 否 |
Vulkan 后端是 AMD 用户的保底方案:llama.cpp 的 Vulkan 后端在 RDNA 3 上速度已达 ROCm 的八到九成,任何 AMD 卡都能用,不需要 ROCm。
AMD 卡的显存单价优势有多大?
同容量对比,AMD 卡的显存单价比 NVIDIA 低两到四成,24GB 档位的 RX 7900 XTX 是全站显存单价最低的消费卡之一。 当前二手价与单价:
| 型号 | 显存 GB | 带宽 GB/s | INT8 TOPS | 功耗 W | 闲鱼 | 显存单价 |
|---|---|---|---|---|---|---|
| 16 | 624 | 75 | 263 | ¥2,60014 条挂单 | ¥163 | |
| 20 | 800 | 103 | 315 | ¥4,10512 条挂单 | ¥205 | |
| 24 | 960 | 123 | 355 | ¥5,70010 条挂单 | ¥238 | |
| 64 | 1,638 | 181 | 300 | ¥18,5008 条挂单 | ¥289 | |
| 16 | 640 | 389 | 304 | ¥5,49314 条挂单 | ¥343 | |
| 32 | 640 | 383 | 300 | ¥11,8504 条挂单 | ¥370 | |
| 32 | 576 | 90 | 260 | ¥12,4003 条挂单 | ¥387 | |
| 48 | 864 | 123 | 295 | ¥22,0005 条挂单 | ¥458 |
对照组(NVIDIA 同容量):
| 型号 | 显存 GB | 带宽 GB/s | INT8 TOPS | 功耗 W | 闲鱼 | 显存单价 |
|---|---|---|---|---|---|---|
| 24 | 936 | 285 | 350 | ¥7,99913 条挂单 | ¥333 | |
| 16 | 717 | 390 | 320 | ¥7,59010 条挂单 | ¥474 | |
| 32 | 896 | 404 | 200 | ¥25,8508 条挂单 | ¥808 | |
| 16 | 896 | 352 | 300 | ¥13,9508 条挂单 | ¥872 |
RX 7900 XTX 与 RTX 3090 都是 24GB,前者便宜三成、还是 2022 年底的卡,二手成色普遍好于 2020 年的 3090。这是 AMD 全部的价格论据。
AMD 卡比 NVIDIA 慢多少?
带宽相近时,ROCm 后端的实际速度约为 CUDA 的七成;带宽本身也普遍低一档。 预估解码速度(4-bit、8K 上下文):
| 型号 | Qwen3 8B | gpt-oss 20B | Qwen3.8 27B | DeepSeek R1 Distill Qwen 32B |
|---|---|---|---|---|
| 86 | 115 | 28 | 24 | |
| 72 | 104 | 23 | 装不下 | |
| 58 | 91 | 装不下 | 装不下 | |
| 57 | 90 | 装不下 | 装不下 | |
| 58 | 91 | 19 | 16 | |
| 114 | 135 | 38 | 32 | |
| 109 | 132 | 装不下 | 装不下 |
4-bit、8K 上下文、单路解码的预估速度。带 * 的是 MoE 模型把专家权重放在系统内存里跑(按 70 GB/s 内存带宽算)。
RX 7900 XTX 的 960 GB/s 比 RTX 3090 还高,但 Qwen3 8B 预估 86 对 114 tokens/s,差距就是后端效率。公开实测(llama.cpp、Llama 3.1 8B Q4_K_M)7900 XTX 约 96 tokens/s,与估算一致。RX 9070 XT 的 640 GB/s 让它在 16GB 档位里明显慢于 RTX 5070 Ti。
会踩哪些坑?
四个坑按遇到的顺序:驱动版本、官方列表外的卡、量化格式、多卡。
- 驱动与 ROCm 版本:Linux 上内核、amdgpu 驱动、ROCm 三者版本要对齐,发行版升级后经常要重装;Windows 上 ROCm 7.2 之后是一个安装包,问题少得多。
- 列表外的卡:RX 7800 XT、7700 XT 需要
HSA_OVERRIDE_GFX_VERSION假装成 7900,多数时候能跑,偶尔崩溃;Vulkan 后端更稳。 - 量化格式:GGUF 全部可用;AWQ、GPTQ、FP8 这些 vLLM 生态的格式在 RDNA 上要么没有内核要么很慢。只用 GGUF 就没有这个问题。
- 多卡:llama.cpp 的层拆分在 ROCm 上可用,张量并行和 NCCL 级别的多卡通信(RCCL)在消费卡上问题多。两张 7900 XTX 跑 70B 能跑,但别指望 vLLM。
- Flash Attention:llama.cpp 的
-fa在 ROCm 上已可用,但 RDNA 3 没有专用矩阵单元,长上下文的 prefill 明显慢于 NVIDIA。

值得买的 AMD 卡
RX 7900 XTX 是唯一无条件推荐的 AMD 消费卡,R9700 适合要 32GB 的工作站用户,其余按场景。
- RX 7900 XTX(24GB,960 GB/s):显存单价最低的 24GB 卡,跑 32B 4-bit 约 24 tokens/s,能跑的模型与 3090 完全相同。买它。
- RX 7900 XT(20GB,800 GB/s):比 XTX 少 4GB,正好卡在 32B 4-bit 门槛之下,不如加钱上 XTX。
- RX 9070 XT(16GB,640 GB/s):RDNA 4 有 FP8 和翻倍的矩阵算力,但 640 GB/s 让它在 16GB 档里最慢,只在 Windows + LM Studio 且预算极紧时选。
- Radeon AI PRO R9700(32GB,640 GB/s):32GB 消费级价格,双槽涡轮,适合工作站装两张跑 70B;带宽低,单卡速度一般。
- Radeon PRO W7900(48GB,864 GB/s):48GB 单卡跑 70B 4-bit 约 10 tokens/s,价格与 4090 48GB 改装卡相近,但有质保、双槽。
- Instinct MI210(64GB HBM2e,1.6 TB/s):二手价合适,跑 70B 约 19 tokens/s,但被动散热、300W、只能 Linux,是发烧友的卡。
结论:什么人该买 AMD 卡
Linux 或 Windows 上只用 llama.cpp / Ollama / LM Studio,买 RX 7900 XTX 省三成钱;要 vLLM、微调、图像生成或者不想折腾,买 NVIDIA。
- 24GB 档位的对比另见二手 3090 还是新 5070 Ti,把 7900 XTX 当第三个选项。
- 按显存档位找最便宜的卡,见预算有限跑本地大模型。
- 统一内存路线(含 Strix Halo)见 Mac 统一内存 vs 独立显卡。
