AMD 显卡跑本地大模型现状:ROCm 能用了吗,哪些卡值得买(2026)

问「AMD 显卡能不能跑本地大模型」的人,2026 年得到的答案是能,而且比两年前省心得多:ROCm 7.2 起 RDNA 3 和 RDNA 4 在 Windows、Linux 上都能直接跑 llama.cpp、Ollama、LM Studio。但「能用」和「值得买」是两回事。截至 2026 年 9 月 5 日,AMD 卡的优势只有一个:显存单价比同容量 NVIDIA 卡低三成左右;代价是同样的带宽下速度低两到三成,vLLM 与微调仍然吃力。我们的建议:只用 llama.cpp 系工具、能接受偶尔查文档的人,RX 7900 XTX 是 24GB 里最便宜的选择;其他人选 NVIDIA。

示意图:红色饰条的显卡装在拆开的工作站里,背景显示器上是虚化的终端窗口
示意图 · 红色饰条的显卡装在拆开的工作站里,背景显示器上是虚化的终端窗口

ROCm 现在支持哪些卡和哪些框架?

消费卡里 RDNA 3(RX 7900 XTX / XT、W7800 / W7900)和 RDNA 4(RX 9070 XTR9700)是官方支持列表内的,RX 7800 XT 这类中端 RDNA 3 需要绕一下。 2026 年 9 月的支持状态:

显卡 ROCm 官方支持 llama.cpp / Ollama / LM Studio vLLM Windows
RX 7900 XTX / XT 是(gfx1100) 开箱即用 社区支持,性能一般 ROCm 或 Vulkan
Radeon PRO W7800 / W7900 是(gfx1100) 开箱即用 同上 ROCm 或 Vulkan
RX 9070 XT / AI PRO R9700 是(gfx1201,ROCm 7.2 起) 开箱即用 社区支持 ROCm 或 Vulkan
RX 7800 XT 否(gfx1101) 需设 HSA_OVERRIDE_GFX_VERSION=11.0.0 或用 Vulkan 不建议 Vulkan
Instinct MI210 / MI100 是(CDNA) 能用 是(这是它们的主场)

Vulkan 后端是 AMD 用户的保底方案:llama.cpp 的 Vulkan 后端在 RDNA 3 上速度已达 ROCm 的八到九成,任何 AMD 卡都能用,不需要 ROCm。

AMD 卡的显存单价优势有多大?

同容量对比,AMD 卡的显存单价比 NVIDIA 低两到四成,24GB 档位的 RX 7900 XTX 是全站显存单价最低的消费卡之一。 当前二手价与单价:

型号显存 GB带宽 GB/sINT8 TOPS功耗 WeBay显存单价
Instinct MI50 32GB321,02453300¥5,165¥161
Instinct MI100321,22992300¥6,719¥210
Radeon RX 6950 XT1657695335¥3,363¥210
Radeon RX 7900 XT20800103315¥4,708¥235
Radeon RX 7800 XT1662475263¥3,820¥239
Radeon RX 7900 XTX24960123355¥6,719¥280
Radeon RX 9070 XT16640389304¥5,347¥334
Radeon PRO W790048864123295¥23,506¥490
Instinct MI210641,638181300¥33,937¥530

灰色价格为沿用上次报价,近期没有新挂单。

对照组(NVIDIA 同容量):

型号显存 GB带宽 GB/sINT8 TOPS功耗 WeBay显存单价
GeForce RTX 309024936285350¥10,425¥434
GeForce RTX 5070 Ti16896352300¥8,071¥504
GeForce RTX 408016717390320¥8,494¥531
RTX PRO 4500 Blackwell32896404200¥28,920¥904

灰色价格为沿用上次报价,近期没有新挂单。

RX 7900 XTX 与 RTX 3090 都是 24GB,前者便宜三成、还是 2022 年底的卡,二手成色普遍好于 2020 年的 3090。这是 AMD 全部的价格论据。

AMD 卡比 NVIDIA 慢多少?

带宽相近时,ROCm 后端的实际速度约为 CUDA 的七成;带宽本身也普遍低一档。 预估解码速度(4-bit、8K 上下文):

型号Qwen3 8Bgpt-oss 20BQwen3.8 27BDeepSeek R1 Distill Qwen 32B
Radeon RX 7900 XTX861152824
Radeon RX 7900 XT7210423装不下
Radeon RX 9070 XT5891装不下装不下
Radeon RX 7800 XT5790装不下装不下
Radeon AI PRO R970058911916
GeForce RTX 30901141353832
GeForce RTX 5070 Ti109132装不下装不下

4-bit、8K 上下文、单路解码的预估速度。带 * 的是 MoE 模型把专家权重放在系统内存里跑(按 70 GB/s 内存带宽算)。

RX 7900 XTX 的 960 GB/s 比 RTX 3090 还高,但 Qwen3 8B 预估 86 对 114 tokens/s,差距就是后端效率。公开实测(llama.cpp、Llama 3.1 8B Q4_K_M)7900 XTX 约 96 tokens/s,与估算一致。RX 9070 XT 的 640 GB/s 让它在 16GB 档位里明显慢于 RTX 5070 Ti

会踩哪些坑?

四个坑按遇到的顺序:驱动版本、官方列表外的卡、量化格式、多卡。

  1. 驱动与 ROCm 版本:Linux 上内核、amdgpu 驱动、ROCm 三者版本要对齐,发行版升级后经常要重装;Windows 上 ROCm 7.2 之后是一个安装包,问题少得多。
  2. 列表外的卡:RX 7800 XT、7700 XT 需要 HSA_OVERRIDE_GFX_VERSION 假装成 7900,多数时候能跑,偶尔崩溃;Vulkan 后端更稳。
  3. 量化格式:GGUF 全部可用;AWQ、GPTQ、FP8 这些 vLLM 生态的格式在 RDNA 上要么没有内核要么很慢。只用 GGUF 就没有这个问题。
  4. 多卡:llama.cpp 的层拆分在 ROCm 上可用,张量并行和 NCCL 级别的多卡通信(RCCL)在消费卡上问题多。两张 7900 XTX 跑 70B 能跑,但别指望 vLLM。
  5. Flash Attention:llama.cpp 的 -fa 在 ROCm 上已可用,但 RDNA 3 没有专用矩阵单元,长上下文的 prefill 明显慢于 NVIDIA。
示意图:红色饰条显卡的挡板与视频输出接口,放在防静电袋上
示意图:红色饰条显卡的挡板与视频输出接口,放在防静电袋上

值得买的 AMD 卡

RX 7900 XTX 是唯一无条件推荐的 AMD 消费卡,R9700 适合要 32GB 的工作站用户,其余按场景。

  • RX 7900 XTX(24GB,960 GB/s):显存单价最低的 24GB 卡,跑 32B 4-bit 约 24 tokens/s,能跑的模型与 3090 完全相同。买它。
  • RX 7900 XT(20GB,800 GB/s):比 XTX 少 4GB,正好卡在 32B 4-bit 门槛之下,不如加钱上 XTX。
  • RX 9070 XT(16GB,640 GB/s):RDNA 4 有 FP8 和翻倍的矩阵算力,但 640 GB/s 让它在 16GB 档里最慢,只在 Windows + LM Studio 且预算极紧时选。
  • Radeon AI PRO R9700(32GB,640 GB/s):32GB 消费级价格,双槽涡轮,适合工作站装两张跑 70B;带宽低,单卡速度一般。
  • Radeon PRO W7900(48GB,864 GB/s):48GB 单卡跑 70B 4-bit 约 10 tokens/s,价格与 4090 48GB 改装卡相近,但有质保、双槽。
  • Instinct MI210(64GB HBM2e,1.6 TB/s):二手价合适,跑 70B 约 19 tokens/s,但被动散热、300W、只能 Linux,是发烧友的卡。

结论:什么人该买 AMD 卡

Linux 或 Windows 上只用 llama.cpp / Ollama / LM Studio,买 RX 7900 XTX 省三成钱;要 vLLM、微调、图像生成或者不想折腾,买 NVIDIA。

常见问题

AMD 显卡能跑 Ollama 吗?

能。Ollama 自带 ROCm 后端,RX 7900 系列和 RX 9070 系列在 Windows 与 Linux 上都能直接识别;RX 7800 XT 这类官方列表外的卡在 Linux 上要设 HSA_OVERRIDE_GFX_VERSION,或者改用 Vulkan 后端的 llama.cpp。

RX 7900 XTX 和 RTX 3090 跑模型哪个好?

能跑的模型完全一样(都是 24GB),3090 快约三成(带宽接近,CUDA 效率高)。7900 XTX 便宜三成左右、有质保、功耗相当。愿意用 llama.cpp 系工具就买 7900 XTX,要 vLLM、微调或省心就买 3090。

Windows 上 AMD 卡怎么跑大模型最省事?

LM Studio。它同时带 ROCm 和 Vulkan 两个后端,RDNA 3 / 4 自动用 ROCm,其他卡退回 Vulkan,不用装任何驱动以外的东西。

Instinct MI210 这种二手加速卡值得买吗?

64GB HBM2e、1.6 TB/s,跑 70B 4-bit 预估 19 tokens/s,比两张 3090 快。但被动散热要机箱强制风道、300W、PCIe 4.0、ROCm 对 CDNA2 的支持随时可能进入维护期,只适合动手能力强的人。

文中提到的显卡

文中提到的模型