问「AMD 显卡能不能跑本地大模型」的人,2026 年得到的答案是能,而且比两年前省心得多:ROCm 7.2 起 RDNA 3 和 RDNA 4 在 Windows、Linux 上都能直接跑 llama.cpp、Ollama、LM Studio。但「能用」和「值得买」是两回事。截至 2026 年 9 月 5 日,AMD 卡的优势只有一个:显存单价比同容量 NVIDIA 卡低三成左右;代价是同样的带宽下速度低两到三成,vLLM 与微调仍然吃力。我们的建议:只用 llama.cpp 系工具、能接受偶尔查文档的人,RX 7900 XTX 是 24GB 里最便宜的选择;其他人选 NVIDIA。

ROCm 现在支持哪些卡和哪些框架?

消费卡里 RDNA 3(RX 7900 XTX / XT、W7800 / W7900)和 RDNA 4(RX 9070 XTR9700)是官方支持列表内的,RX 7800 XT 这类中端 RDNA 3 需要绕一下。 2026 年 9 月的支持状态:

显卡 ROCm 官方支持 llama.cpp / Ollama / LM Studio vLLM Windows
RX 7900 XTX / XT 是(gfx1100) 开箱即用 社区支持,性能一般 ROCm 或 Vulkan
Radeon PRO W7800 / W7900 是(gfx1100) 开箱即用 同上 ROCm 或 Vulkan
RX 9070 XT / AI PRO R9700 是(gfx1201,ROCm 7.2 起) 开箱即用 社区支持 ROCm 或 Vulkan
RX 7800 XT 否(gfx1101) 需设 HSA_OVERRIDE_GFX_VERSION=11.0.0 或用 Vulkan 不建议 Vulkan
Instinct MI210 / MI100 是(CDNA) 能用 是(这是它们的主场)

Vulkan 后端是 AMD 用户的保底方案:llama.cpp 的 Vulkan 后端在 RDNA 3 上速度已达 ROCm 的八到九成,任何 AMD 卡都能用,不需要 ROCm。

AMD 卡的显存单价优势有多大?

同容量对比,AMD 卡的显存单价比 NVIDIA 低两到四成,24GB 档位的 RX 7900 XTX 是全站显存单价最低的消费卡之一。 当前二手价与单价:

型号显存 GB带宽 GB/sINT8 TOPS功耗 W闲鱼显存单价
Radeon RX 7800 XT1662475263¥2,60014 条挂单¥163
Radeon RX 7900 XT20800103315¥4,10512 条挂单¥205
Radeon RX 7900 XTX24960123355¥5,70010 条挂单¥238
Instinct MI210641,638181300¥18,5008 条挂单¥289
Radeon RX 9070 XT16640389304¥5,49314 条挂单¥343
Radeon AI PRO R970032640383300¥11,8504 条挂单¥370
Radeon PRO W78003257690260¥12,4003 条挂单¥387
Radeon PRO W790048864123295¥22,0005 条挂单¥458

对照组(NVIDIA 同容量):

型号显存 GB带宽 GB/sINT8 TOPS功耗 W闲鱼显存单价
GeForce RTX 309024936285350¥7,99913 条挂单¥333
GeForce RTX 408016717390320¥7,59010 条挂单¥474
RTX PRO 4500 Blackwell32896404200¥25,8508 条挂单¥808
GeForce RTX 5070 Ti16896352300¥13,9508 条挂单¥872

RX 7900 XTX 与 RTX 3090 都是 24GB,前者便宜三成、还是 2022 年底的卡,二手成色普遍好于 2020 年的 3090。这是 AMD 全部的价格论据。

AMD 卡比 NVIDIA 慢多少?

带宽相近时,ROCm 后端的实际速度约为 CUDA 的七成;带宽本身也普遍低一档。 预估解码速度(4-bit、8K 上下文):

型号Qwen3 8Bgpt-oss 20BQwen3.8 27BDeepSeek R1 Distill Qwen 32B
Radeon RX 7900 XTX861152824
Radeon RX 7900 XT7210423装不下
Radeon RX 9070 XT5891装不下装不下
Radeon RX 7800 XT5790装不下装不下
Radeon AI PRO R970058911916
GeForce RTX 30901141353832
GeForce RTX 5070 Ti109132装不下装不下

4-bit、8K 上下文、单路解码的预估速度。带 * 的是 MoE 模型把专家权重放在系统内存里跑(按 70 GB/s 内存带宽算)。

RX 7900 XTX 的 960 GB/s 比 RTX 3090 还高,但 Qwen3 8B 预估 86 对 114 tokens/s,差距就是后端效率。公开实测(llama.cpp、Llama 3.1 8B Q4_K_M)7900 XTX 约 96 tokens/s,与估算一致。RX 9070 XT 的 640 GB/s 让它在 16GB 档位里明显慢于 RTX 5070 Ti

会踩哪些坑?

四个坑按遇到的顺序:驱动版本、官方列表外的卡、量化格式、多卡。

  1. 驱动与 ROCm 版本:Linux 上内核、amdgpu 驱动、ROCm 三者版本要对齐,发行版升级后经常要重装;Windows 上 ROCm 7.2 之后是一个安装包,问题少得多。
  2. 列表外的卡:RX 7800 XT、7700 XT 需要 HSA_OVERRIDE_GFX_VERSION 假装成 7900,多数时候能跑,偶尔崩溃;Vulkan 后端更稳。
  3. 量化格式:GGUF 全部可用;AWQ、GPTQ、FP8 这些 vLLM 生态的格式在 RDNA 上要么没有内核要么很慢。只用 GGUF 就没有这个问题。
  4. 多卡:llama.cpp 的层拆分在 ROCm 上可用,张量并行和 NCCL 级别的多卡通信(RCCL)在消费卡上问题多。两张 7900 XTX 跑 70B 能跑,但别指望 vLLM。
  5. Flash Attention:llama.cpp 的 -fa 在 ROCm 上已可用,但 RDNA 3 没有专用矩阵单元,长上下文的 prefill 明显慢于 NVIDIA。
示意图:红色饰条显卡的挡板与视频输出接口,放在防静电袋上
示意图:红色饰条显卡的挡板与视频输出接口,放在防静电袋上

值得买的 AMD 卡

RX 7900 XTX 是唯一无条件推荐的 AMD 消费卡,R9700 适合要 32GB 的工作站用户,其余按场景。

  • RX 7900 XTX(24GB,960 GB/s):显存单价最低的 24GB 卡,跑 32B 4-bit 约 24 tokens/s,能跑的模型与 3090 完全相同。买它。
  • RX 7900 XT(20GB,800 GB/s):比 XTX 少 4GB,正好卡在 32B 4-bit 门槛之下,不如加钱上 XTX。
  • RX 9070 XT(16GB,640 GB/s):RDNA 4 有 FP8 和翻倍的矩阵算力,但 640 GB/s 让它在 16GB 档里最慢,只在 Windows + LM Studio 且预算极紧时选。
  • Radeon AI PRO R9700(32GB,640 GB/s):32GB 消费级价格,双槽涡轮,适合工作站装两张跑 70B;带宽低,单卡速度一般。
  • Radeon PRO W7900(48GB,864 GB/s):48GB 单卡跑 70B 4-bit 约 10 tokens/s,价格与 4090 48GB 改装卡相近,但有质保、双槽。
  • Instinct MI210(64GB HBM2e,1.6 TB/s):二手价合适,跑 70B 约 19 tokens/s,但被动散热、300W、只能 Linux,是发烧友的卡。

结论:什么人该买 AMD 卡

Linux 或 Windows 上只用 llama.cpp / Ollama / LM Studio,买 RX 7900 XTX 省三成钱;要 vLLM、微调、图像生成或者不想折腾,买 NVIDIA。