问「AMD 显卡能不能跑本地大模型」的人,2026 年得到的答案是能,而且比两年前省心得多:ROCm 7.2 起 RDNA 3 和 RDNA 4 在 Windows、Linux 上都能直接跑 llama.cpp、Ollama、LM Studio。但「能用」和「值得买」是两回事。截至 2026 年 9 月 5 日,AMD 卡的优势只有一个:显存单价比同容量 NVIDIA 卡低三成左右;代价是同样的带宽下速度低两到三成,vLLM 与微调仍然吃力。我们的建议:只用 llama.cpp 系工具、能接受偶尔查文档的人,RX 7900 XTX 是 24GB 里最便宜的选择;其他人选 NVIDIA。
AMD 显卡跑本地大模型现状:ROCm 能用了吗,哪些卡值得买(2026)
正文与 FAQ 中的数字截至 2026年9月5日;表格使用最新已发布价格,各设备采集时间可能不同。

ROCm 现在支持哪些卡和哪些框架?
消费卡里 RDNA 3(RX 7900 XTX / XT、W7800 / W7900)和 RDNA 4(RX 9070 XT、R9700)是官方支持列表内的,RX 7800 XT 这类中端 RDNA 3 需要绕一下。 2026 年 9 月的支持状态:
| 显卡 | ROCm 官方支持 | llama.cpp / Ollama / LM Studio | vLLM | Windows |
|---|---|---|---|---|
| RX 7900 XTX / XT | 是(gfx1100) | 开箱即用 | 社区支持,性能一般 | ROCm 或 Vulkan |
| Radeon PRO W7800 / W7900 | 是(gfx1100) | 开箱即用 | 同上 | ROCm 或 Vulkan |
| RX 9070 XT / AI PRO R9700 | 是(gfx1201,ROCm 7.2 起) | 开箱即用 | 社区支持 | ROCm 或 Vulkan |
| RX 7800 XT | 否(gfx1101) | 需设 HSA_OVERRIDE_GFX_VERSION=11.0.0 或用 Vulkan |
不建议 | Vulkan |
| Instinct MI210 / MI100 | 是(CDNA) | 能用 | 是(这是它们的主场) | 否 |
Vulkan 后端是 AMD 用户的保底方案:llama.cpp 的 Vulkan 后端在 RDNA 3 上速度已达 ROCm 的八到九成,任何 AMD 卡都能用,不需要 ROCm。
AMD 卡的显存单价优势有多大?
同容量对比,AMD 卡的显存单价比 NVIDIA 低两到四成,24GB 档位的 RX 7900 XTX 是全站显存单价最低的消费卡之一。 当前二手价与单价:
闲鱼
| 型号 | 显存 GB | 带宽 GB/s | INT8 TOPS | 功耗 W | 闲鱼 | 显存单价 |
|---|---|---|---|---|---|---|
| 32 | 1,024 | 53 | 300 | ¥2,725 | ¥85 | |
| 16 | 576 | 95 | 335 | ¥2,999 | ¥187 | |
| 16 | 624 | 75 | 263 | ¥3,100 | ¥194 | |
| 20 | 800 | 103 | 315 | ¥4,299 | ¥215 | |
| 24 | 960 | 123 | 355 | ¥5,800 | ¥242 | |
| 64 | 1,638 | 181 | 300 | ¥18,500 | ¥289 | |
| 32 | 640 | 383 | 300 | ¥11,050 | ¥345 | |
| 16 | 640 | 389 | 304 | ¥6,100 | ¥381 | |
| 32 | 576 | 90 | 260 | ¥12,400 | ¥388 | |
| 48 | 864 | 123 | 295 | ¥22,000 | ¥458 |
灰色价格为沿用上次报价,近期没有新挂单。
对照组(NVIDIA 同容量):
闲鱼
| 型号 | 显存 GB | 带宽 GB/s | INT8 TOPS | 功耗 W | 闲鱼 | 显存单价 |
|---|---|---|---|---|---|---|
| 24 | 936 | 285 | 350 | ¥8,100 | ¥337 | |
| 16 | 717 | 390 | 320 | ¥7,750 | ¥484 | |
| 16 | 896 | 352 | 300 | ¥9,899 | ¥619 | |
| 32 | 896 | 404 | 200 | ¥25,850 | ¥808 |
灰色价格为沿用上次报价,近期没有新挂单。
RX 7900 XTX 与 RTX 3090 都是 24GB,前者便宜三成、还是 2022 年底的卡,二手成色普遍好于 2020 年的 3090。这是 AMD 全部的价格论据。
AMD 卡比 NVIDIA 慢多少?
带宽相近时,ROCm 后端的实际速度约为 CUDA 的七成;带宽本身也普遍低一档。 预估解码速度(4-bit、8K 上下文):
| 型号 | Qwen3 8B | gpt-oss 20B | Qwen3.8 27B | DeepSeek R1 Distill Qwen 32B |
|---|---|---|---|---|
| 86 | 115 | 28 | 24 | |
| 72 | 104 | 23 | 装不下 | |
| 58 | 91 | 装不下 | 装不下 | |
| 57 | 90 | 装不下 | 装不下 | |
| 58 | 91 | 19 | 16 | |
| 114 | 135 | 38 | 32 | |
| 109 | 132 | 装不下 | 装不下 |
4-bit、8K 上下文、单路解码的预估速度。带 * 的是 MoE 模型把专家权重放在系统内存里跑(按 70 GB/s 内存带宽算)。
RX 7900 XTX 的 960 GB/s 比 RTX 3090 还高,但 Qwen3 8B 预估 86 对 114 tokens/s,差距就是后端效率。公开实测(llama.cpp、Llama 3.1 8B Q4_K_M)7900 XTX 约 96 tokens/s,与估算一致。RX 9070 XT 的 640 GB/s 让它在 16GB 档位里明显慢于 RTX 5070 Ti。
会踩哪些坑?
四个坑按遇到的顺序:驱动版本、官方列表外的卡、量化格式、多卡。
- 驱动与 ROCm 版本:Linux 上内核、amdgpu 驱动、ROCm 三者版本要对齐,发行版升级后经常要重装;Windows 上 ROCm 7.2 之后是一个安装包,问题少得多。
- 列表外的卡:RX 7800 XT、7700 XT 需要
HSA_OVERRIDE_GFX_VERSION假装成 7900,多数时候能跑,偶尔崩溃;Vulkan 后端更稳。 - 量化格式:GGUF 全部可用;AWQ、GPTQ、FP8 这些 vLLM 生态的格式在 RDNA 上要么没有内核要么很慢。只用 GGUF 就没有这个问题。
- 多卡:llama.cpp 的层拆分在 ROCm 上可用,张量并行和 NCCL 级别的多卡通信(RCCL)在消费卡上问题多。两张 7900 XTX 跑 70B 能跑,但别指望 vLLM。
- Flash Attention:llama.cpp 的
-fa在 ROCm 上已可用,但 RDNA 3 没有专用矩阵单元,长上下文的 prefill 明显慢于 NVIDIA。

值得买的 AMD 卡
RX 7900 XTX 是唯一无条件推荐的 AMD 消费卡,R9700 适合要 32GB 的工作站用户,其余按场景。
- RX 7900 XTX(24GB,960 GB/s):显存单价最低的 24GB 卡,跑 32B 4-bit 约 24 tokens/s,能跑的模型与 3090 完全相同。买它。
- RX 7900 XT(20GB,800 GB/s):比 XTX 少 4GB,正好卡在 32B 4-bit 门槛之下,不如加钱上 XTX。
- RX 9070 XT(16GB,640 GB/s):RDNA 4 有 FP8 和翻倍的矩阵算力,但 640 GB/s 让它在 16GB 档里最慢,只在 Windows + LM Studio 且预算极紧时选。
- Radeon AI PRO R9700(32GB,640 GB/s):32GB 消费级价格,双槽涡轮,适合工作站装两张跑 70B;带宽低,单卡速度一般。
- Radeon PRO W7900(48GB,864 GB/s):48GB 单卡跑 70B 4-bit 约 10 tokens/s,价格与 4090 48GB 改装卡相近,但有质保、双槽。
- Instinct MI210(64GB HBM2e,1.6 TB/s):二手价合适,跑 70B 约 19 tokens/s,但被动散热、300W、只能 Linux,是发烧友的卡。
结论:什么人该买 AMD 卡
Linux 或 Windows 上只用 llama.cpp / Ollama / LM Studio,买 RX 7900 XTX 省三成钱;要 vLLM、微调、图像生成或者不想折腾,买 NVIDIA。
- 24GB 档位的对比另见二手 3090 还是新 5070 Ti,把 7900 XTX 当第三个选项。
- 按显存档位找最便宜的卡,见预算有限跑本地大模型。
- 统一内存路线(含 Strix Halo)见 Mac 统一内存 vs 独立显卡。
常见问题
AMD 显卡能跑 Ollama 吗?
能。Ollama 自带 ROCm 后端,RX 7900 系列和 RX 9070 系列在 Windows 与 Linux 上都能直接识别;RX 7800 XT 这类官方列表外的卡在 Linux 上要设 HSA_OVERRIDE_GFX_VERSION,或者改用 Vulkan 后端的 llama.cpp。
RX 7900 XTX 和 RTX 3090 跑模型哪个好?
能跑的模型完全一样(都是 24GB),3090 快约三成(带宽接近,CUDA 效率高)。7900 XTX 便宜三成左右、有质保、功耗相当。愿意用 llama.cpp 系工具就买 7900 XTX,要 vLLM、微调或省心就买 3090。
Windows 上 AMD 卡怎么跑大模型最省事?
LM Studio。它同时带 ROCm 和 Vulkan 两个后端,RDNA 3 / 4 自动用 ROCm,其他卡退回 Vulkan,不用装任何驱动以外的东西。
Instinct MI210 这种二手加速卡值得买吗?
64GB HBM2e、1.6 TB/s,跑 70B 4-bit 预估 19 tokens/s,比两张 3090 快。但被动散热要机箱强制风道、300W、PCIe 4.0、ROCm 对 CDNA2 的支持随时可能进入维护期,只适合动手能力强的人。