一张卡显存大但架构旧,另一张架构新但显存小,价格差不多,做本地 AI 视频该买哪张?答案只看一件事:你现在的工作流是「跑不完」还是「跑得慢」。 报显存不足、必须降分辨率或减帧才能出片,买显存,二手 RTX 3090 的 24GB 是当前最便宜的一档;能出片但每段要等很久,买算力,同价位的 RTX 5070 Ti 有 FP8 张量核心,3090 没有。两个问题同时有,两张卡都解决不了,要看三倍价钱的 RTX 4090 或六倍价钱的 RTX 5090。截至 2026 年 9 月 8 日,闲鱼挂牌中位价 3090 ¥7,699、5070 Ti ¥7,990、4090 ¥22,900、5090 ¥45,000。下面以 Wan 2.2 为例把显存需求、算力差距和整机代价逐项算清。
为了本地视频换显卡,先买大显存还是更快的卡?按 Wan 2.2 算一遍(2026)
正文与 FAQ 中的数字截至 2026年9月8日;表格使用最新已发布价格,各设备采集时间可能不同。

先分清「跑不完」和「跑得慢」
显存不够表现为任务无法完成,算力不够表现为任务完成得慢,两种症状对应两种规格,升级前先确认自己是哪一种。 把当前工作流的模型版本、分辨率、帧数和报错记下来,对照下表:
| 你看到的现象 | 真正的瓶颈 | 升级该买的规格 |
|---|---|---|
| 报 CUDA out of memory,或 ComfyUI 卡在加载模型 | 显存容量 | 更大显存 |
| 降分辨率、减帧数、换更小的模型就能跑完 | 显存容量 | 更大显存 |
| 能跑完,但每一步都在等,任务管理器显示显存已满、系统内存占用很高 | 显存不够触发了卸载 | 更大显存(先解决卸载,速度自然回来) |
| 能跑完,显存有余量,但每段视频等很久 | 算力 | 更高的 FP8 / BF16 算力 |
| 第一次跑很慢,第二次同样设置快很多 | 不是硬件,是模型加载 | 先别买,看第二次的时间 |
| 缺节点、文件选错、版本不配 | 不是硬件 | 先修环境 |

第三行最容易误判。显存刚好不够时,ComfyUI 不报错,而是把放不下的权重留在系统内存分块搬运,任务能完成但每一步都在等 PCIe,看起来像算力不够,实际是显存不够。这时候买更快的卡不解决问题,因为卡在搬运而不是计算,见 显存不够加内存有用吗 里对扩散模型卸载的说明。
视频模型到底要多少显存?以 Wan 2.2 为例
Wan 2.2 的 5B 版本 fp16 权重 10 GB,A14B 版本是高噪、低噪两个模型,fp8 各 14.3 GB,fp16 各 28.6 GB,外加 6.7 GB 的文本编码器。 这些是 ComfyUI 官方重新打包的文件大小(Comfy-Org 仓库),也是显存需求的下限:
| 组件 | 文件 | 大小 |
|---|---|---|
| TI2V-5B 扩散模型 | wan2.2_ti2v_5B_fp16 | 10 GB |
| A14B 高噪模型(fp8) | wan2.2_t2v / i2v_high_noise_14B_fp8_scaled | 14.3 GB |
| A14B 低噪模型(fp8) | wan2.2_t2v / i2v_low_noise_14B_fp8_scaled | 14.3 GB |
| A14B 高噪或低噪模型(fp16) | wan2.2_*_14B_fp16 | 每个 28.6 GB |
| 文本编码器(fp8) | umt5_xxl_fp8_e4m3fn_scaled | 6.7 GB |
| 文本编码器(fp16) | umt5_xxl_fp16 | 11.4 GB |
| VAE | wan2.2_vae / wan_2.1_vae | 2 GB 以内 |
权重只是峰值的一部分。生成过程中的显存峰值由三块叠加:
- 常驻权重。上表的文件大小。ComfyUI 跑 A14B 时高噪和低噪两个模型是先后加载的,不需要同时在显存里,所以 24GB 放得下一个 14.3 GB 的 fp8 模型加运行开销;文本编码器算完提示词就可以让出显存。
- 中间张量。注意力和潜变量的体积随「帧数 × 分辨率」增长。720P 5 秒和 480P 3 秒的权重一样,中间张量差好几倍,这就是为什么降分辨率能救回一次 OOM。
- VAE 解码。最后一步把几十帧潜变量一次解码成像素,峰值可能比生成阶段还高,而且这一步权重很小、张量很大,卸载权重帮不上忙。「生成到最后才爆显存」多半是它,解法是分块解码、减帧或降分辨率。
官方给的门槛要看清前提。ComfyUI 文档说「5B 版本配合 ComfyUI 原生卸载在 8GB 显存上应该能跑」(ComfyUI Wan 2.2 教程),Wan 官方仓库用自己的推理脚本给出的数字是 5B「至少 24GB,例如 RTX 4090」、14B 单卡「至少 80GB」(Wan2.2 仓库)。两边差三倍,差的就是卸载:8GB 是「能出片」,24GB 是「不用搬」。HunyuanVideo 1.5 的 8.3B 模型官方最低要求写的也是「开启卸载 14 GB」(HunyuanVideo 1.5 仓库),口径相同。
按显存档位归纳,截至 2026 年 9 月 8 日:
| 显存 | Wan 2.2 能怎么跑 | 代表显卡与闲鱼中位价 |
|---|---|---|
| 8GB | 5B 靠卸载出片,A14B 不现实 | 旧卡,本站不收录 |
| 12GB | 5B 基本不卸载;A14B fp8 重度卸载 | RTX 5070 ¥6,300 |
| 16GB | 5B 舒服;A14B fp8 单模型勉强常驻、编码器要让位,系统内存 32GB 起 | RTX 5060 Ti 16GB ¥4,500、RTX 4080 ¥7,675、RTX 5070 Ti ¥7,990、RTX 5080 ¥11,500 |
| 24GB | A14B fp8 不卸载,720P 5 秒有余量 | RTX 3090 ¥7,699、RTX 4090 ¥22,900 |
| 32GB | A14B fp8 常驻加更长的镜头,或单个 fp16 模型卸载着跑 | RTX 5090 ¥45,000、RTX 5090 D ¥33,000 |
| 48GB | A14B 两个 fp8 模型加编码器全部常驻,或 fp16 单模型不卸载 | RTX 4090 48GB 改装 ¥26,600 |
| 96GB | A14B fp16 全部常驻,接近官方 80GB 口径 | RTX PRO 6000 Blackwell |
16GB 到 24GB 是视频生成最值的一步:它是 A14B fp8 从「要卸载」到「不用卸载」的分界线。24GB 到 32GB 换来的是镜头长度和余量,32GB 到 48GB 换来的是 fp16 精度,这两步都贵得多。
显存决定能做多大的镜头,算力决定等多久
视频扩散模型的每一步都是大矩阵乘法,等待时间主要由张量核心的 FP8 或 BF16 算力决定,显存带宽的影响远小于大模型解码。 这和跑大模型正好相反:大模型每个 token 只算一点点,瓶颈在读权重的带宽;视频模型每一步要对几万个时空 token 做注意力,瓶颈在算。
所以比视频卡要看算力那一列,而且要看精度对不对得上:
| 显卡 | 显存 | BF16 稠密算力 | FP8 稠密算力 | 带宽 | 标称功耗 |
|---|---|---|---|---|---|
| RTX 5060 Ti 16GB | 16 GB | 95 TFLOPS | 190 TFLOPS | 448 GB/s | 180 W |
| RTX 4080 | 16 GB | 195 TFLOPS | 390 TFLOPS | 717 GB/s | 320 W |
| RTX 5070 Ti | 16 GB | 176 TFLOPS | 352 TFLOPS | 896 GB/s | 300 W |
| RTX 5080 | 16 GB | 225 TFLOPS | 450 TFLOPS | 960 GB/s | 360 W |
| RTX 3090 | 24 GB | 142 TFLOPS | 无 FP8 张量核心 | 936 GB/s | 350 W |
| RTX 4090 | 24 GB | 330 TFLOPS | 661 TFLOPS | 1008 GB/s | 450 W |
| RTX 5090 | 32 GB | 419 TFLOPS | 838 TFLOPS | 1792 GB/s | 575 W |
| RTX 4090 48GB 改装 | 48 GB | 330 TFLOPS | 661 TFLOPS | 1008 GB/s | 450 W |
RTX 3090 那一格是关键。Ampere 架构没有 FP8 张量核心,fp8_scaled 的权重能加载,但计算时要转回 BF16 跑,实际算力就是 142 TFLOPS。RTX 5070 Ti 直接用 FP8 算,352 TFLOPS,是 3090 的两倍半;RTX 4090 是 4.6 倍,RTX 5090 是 5.9 倍。在权重全部常驻、没有卸载的前提下,同一个镜头的等待时间大致按这个比例缩短。本站没有在测试机上实跑这几张卡的 Wan 2.2,上面的倍数是算力比,不是实测;Wan 官方只给了「单张消费级显卡 9 分钟内生成 5 秒 720P」这一个数字。
规格与当前价格的实时表:
| 型号 | 显存 GB | 带宽 GB/s | INT8 TOPS | 功耗 W | 闲鱼 | 显存单价 |
|---|---|---|---|---|---|---|
| 16 | 448 | 190 | 180 | ¥4,6007 条挂单 | ¥287 | |
| 16 | 717 | 390 | 320 | ¥7,7646 条挂单 | ¥485 | |
| 16 | 896 | 352 | 300 | ¥8,1789 条挂单 | ¥511 | |
| 16 | 960 | 450 | 360 | ¥12,3508 条挂单 | ¥772 | |
| 24 | 936 | 285 | 350 | ¥7,69911 条挂单 | ¥321 | |
| 24 | 1,008 | 661 | 450 | ¥22,90015 条挂单 | ¥954 | |
| 32 | 1,792 | 838 | 575 | ¥43,0005 条挂单 | ¥1,344 | |
| 48 | 1,008 | 661 | 450 | ¥26,6003 条挂单 | ¥554 |
表里的 INT8 一列对 3090 显示的是 INT8 TOPS,视频模型不用 INT8 推理,看 3090 请以上一张表的 BF16 为准。RTX 4080 是容易被忽略的一张:16GB、FP8 390 TFLOPS,闲鱼中位价 ¥7,675 比 5070 Ti 还低,缺点是 2022 年的卡、用 12VHPWR 接口、二手风险和 3090 同级。
16GB 升级:二手 RTX 3090 还是 RTX 5070 Ti?
报显存不足选 RTX 3090,等太久选 RTX 5070 Ti,两样都要选 RTX 4090。 三张卡的实时对比:
| 项目 | ||||
|---|---|---|---|---|
| 显存 | 24 GB GDDR6X | 16 GB GDDR7 | 24 GB GDDR6X | 32 GB GDDR7 |
| 带宽 | 936 GB/s | 896 GB/s | 1,008 GB/s | 1,792 GB/s |
| BF16 | 142.3 TFLOPS | 175.8 TFLOPS | 330.3 TFLOPS | 419 TFLOPS |
| INT8 | 285 TOPS | 352 TOPS | 661 TOPS | 838 TOPS |
| 功耗 | 350 W | 300 W | 450 W | 575 W |
| 接口 | PCIe 4.0 x16 | PCIe 5.0 x16 | PCIe 4.0 x16 | PCIe 5.0 x16 |
| 发布日期 | 2020年9月24日 | 2025年2月20日 | 2022年10月12日 | 2025年1月30日 |
| 官方定价 | ¥10,086 | ¥5,039 | ¥10,758 | ¥13,450 |
| 闲鱼二手 | ¥7,699 | ¥8,178 | ¥22,900 | ¥43,000 |
| 显存单价 | ¥321 | ¥511 | ¥954 | ¥1,344 |
| 能跑的最大稠密档位(4-bit、8K) | 32B | 14B | 32B | 32B |
按三种情况给答案,价格截至 2026 年 9 月 8 日:
- 现在用 16GB 卡,A14B 要卸载才能跑,出片慢是因为在搬运。 换 RTX 3090,¥7,699。24GB 让 fp8 模型不再卸载,等待时间的大头直接消失,虽然它的算力还不如你手里的 16GB Blackwell 卡。这一档没有第二个选择:24GB 的下一张卡是 ¥22,900 的 4090。
- 现在用 16GB 卡,5B 或降过分辨率的 A14B 跑得完,就是慢。 换 RTX 5070 Ti ¥7,990 或 RTX 5080 ¥11,500,前提是显存够用这件事不变。从 RTX 5060 Ti 16GB 升到 5070 Ti,FP8 算力 190 到 352;从 3090 换到 5070 Ti,是拿 8GB 显存换两倍半算力,只有确认工作流装得进 16GB 才划算。
- 既装不下又嫌慢。 RTX 4090 ¥22,900,24GB 加 661 TFLOPS FP8,是 3090 价钱的三倍,算力 4.6 倍。RTX 5090 ¥45,000 再加 8GB 和 27% 算力,只有天天出 720P 长镜头才值。RTX 5090 D ¥33,000 有同样的 32GB,但 AI 算力被固件限到标准版七成,按 594 TFLOPS FP8 算仍然接近 4090。
跑大模型时这道题的答案不一样:大模型看带宽,3090 和 5070 Ti 几乎打平,所以 24GB 几乎总是赢,见 3090 与 5070 Ti 跑大模型。做视频的人不能照搬那篇的结论,因为 3090 缺 FP8 这件事在大模型单流推理里几乎不影响速度,在视频生成里影响两倍半。
48GB 改装卡与专业卡值不值?
RTX 4090 48GB 改装卡是 24GB 以上唯一便宜的选择,适合明确要 fp16 精度或整套 A14B 常驻的人;其他人不需要。 截至 2026 年 9 月 8 日闲鱼中位价 ¥26,600,只有 3 条挂单,比 24GB 原版贵 ¥3,700。
它能做到的事:A14B 两个 fp8 模型加文本编码器全部常驻(28.6 + 6.7 GB),换模型不用重新加载;或者单个 fp16 模型 28.6 GB 不卸载地跑。它做不到的事:算力还是 4090 的 661 TFLOPS,不会因为显存翻倍而更快。风险在改装本身:多数是拆公版换涡轮双槽 PCB 加 clamshell 显存,没有 NVIDIA 质保,涡轮噪音大,显存颗粒和 PCB 质量看店家。买前让卖家跑一段把 48GB 占满的显存压力测试并录屏,收货再跑一次。
再往上是 RTX PRO 6000 Blackwell 的 96GB,能把 A14B fp16 两个模型都放进去,接近 Wan 官方脚本的 80GB 口径。它的价格是 5090 的两到三倍,属于工作室采购,不在个人升级的讨论范围。
整机跟着换:电源、接口、机箱
换到 3090 以上的卡,电源、接口和机箱多半要一起换,这笔钱要算进升级成本。 视频生成是几十分钟到整晚的持续满载,不是游戏那种忽高忽低的负载,电源余量要按标称功耗加三成算:
| 显卡 | 标称功耗 | 供电接口 | 体积 | 建议电源 |
|---|---|---|---|---|
| RTX 5070 Ti | 300 W | 16-pin 12V-2x6 | 多数双槽 | 750 W |
| RTX 3090 | 350 W | 公版 12-pin,非公 2 到 3 个 8-pin | 公版三槽、313 mm | 850 W |
| RTX 4090 | 450 W | 16-pin 12VHPWR | 三到四槽 | 1000 W |
| RTX 5090 | 575 W | 16-pin 12V-2x6 | 三到四槽 | 1000 W 以上,ATX 3.1 |
3090 的 GDDR6X 颗粒在背板一侧,长时间满载温度高,二手卡买前要求卖家跑 30 分钟显存压力测试;机箱要给三槽卡留出进风空间,不然整晚排队时会降频。4090 和 5090 的 16-pin 接口要插到底,线不要在插头处硬弯。整机改造通常再花几百到一两千元,从 5070 Ti 升到 4090 的真实差价不是 ¥14,910,要再加这一笔。
用自己的工作量算等待值不值
只有每周反复出现的等待才值得花钱买算力,偶尔跑一次的任务用卸载忍一忍。 算法很简单:
- 记一周里实际生成的镜头数和每段的等待时间,算出每周总等待小时数。
- 按算力比估算换卡后能省下的比例。3090 换 4090,等待大约变成原来的四分之一到五分之一;5060 Ti 16GB 换 5070 Ti,大约减半。
- 省下的小时数乘以你的时薪或这段时间能多接的活,和差价比。
例子:每天出 20 段 5 秒 720P,3090 上假设每段 8 分钟,一天等 160 分钟,一周 5 天约 13 小时。换 4090 按算力比降到 3 小时,一周省 10 小时,差价 ¥15,200 加整机改造,按每小时 100 元算四个月回本;每周只出 10 段的人,同样的差价要三年。这里的每段 8 分钟是假设,用你自己的记录替换。
还要分清单次延迟和整晚吞吐。改镜头时要一段一段看结果,单次延迟决定体验,算力高的卡赢;整晚排队出候选,只关心早上能收多少段,这时候显存大、能不卸载地跑更大的批次反而更重要。
价格走势与什么时候买
四张卡的 30 天走势实时更新,二手 3090 和 5070 Ti 的价差长期在几百元内,决定权在你的瓶颈而不是价格。 走势:
| 型号 | 当前 | 30 天最低 | 30 天最高 | 30 天变化 | 30d 趋势 |
|---|---|---|---|---|---|
| ¥7,699 | ¥7,600 | ¥8,049 | -1.9% | ||
| ¥8,178 | ¥7,800 | ¥8,800 | -4.4% | ||
| ¥22,900 | ¥22,000 | ¥23,500 | +4.1% | ||
| ¥43,000 | ¥34,850 | ¥45,000 | +23.4% |
闲鱼最近 30 天的中位价,每 6 小时一个点;变化是当前中位价相对窗口内最早一点的涨跌。
3090 已经是 2020 年的卡,价格由存量决定,跌得很慢;5070 Ti 和 5080 是在售新卡,二手价跟着零售价走。4090 停产后二手价反而稳在两万出头,因为 24GB 加 FP8 这个组合在 5090 之下没有替代品。想省钱的人盯 3090 的挂单数:样本多的时候中位数更可信,见 方法说明 里对挂牌价口径的解释。
买之前把理由写成一句话:「我要让 A14B fp8 在 720P 5 秒下不卸载」,或者「我要把每段 8 分钟的等待压到 3 分钟」。说得出资源用在哪,就知道该买显存还是算力;说不出来,先用现在的卡把第一段能用的视频跑出来,再回来看这张表。
价格为闲鱼挂牌中位数,截至 2026 年 9 月 8 日;模型文件大小与显存门槛引自 ComfyUI、Wan 与 HunyuanVideo 官方文档;本站未在测试机上实跑 Wan 2.2,文中速度倍数为算力比例估算,不是实测。
常见问题
显存大的显卡一定生成得更快吗?
不一定。视频生成的等待时间主要由算力决定,显存决定的是能不能不卸载地跑完。RTX 3090 有 24GB,但没有 FP8 张量核心,BF16 只有 142 TFLOPS;RTX 5070 Ti 只有 16GB,FP8 却有 352 TFLOPS。同一个能装进 16GB 的工作流,5070 Ti 更快;装不进 16GB 的工作流,3090 才跑得完。
16GB 显存能跑 Wan 2.2 的 14B 版本吗?
能出片,靠 ComfyUI 的卸载。A14B 的 fp8 模型单个 14.3 GB,高噪和低噪两个模型轮流加载,加上文本编码器 6.7 GB,16GB 放不下全部,ComfyUI 会把放不下的部分留在系统内存分块搬运。代价是每一步多等搬运时间,而且系统内存要 32GB 以上。想不卸载地跑,要 24GB。
二手 RTX 3090 和 RTX 5070 Ti 价格差不多,做视频选哪张?
看你现在卡在哪。工作流报显存不足、必须降分辨率或减帧才能跑完,选 3090,多出的 8GB 直接解决问题。工作流能跑完但每段要等很久,选 5070 Ti,FP8 算力是 3090 BF16 的两倍以上,同样的镜头等待时间大约减半。两个问题都有,两张卡都不够,要看 4090。
RTX 4090 48GB 改装卡值得买吗?
只适合明确需要 24GB 以上、又不想花 RTX PRO 6000 那个价钱的人。截至 2026 年 9 月 8 日闲鱼中位价 ¥26,600,只比 24GB 原版贵 ¥3,700,能把 A14B 两个 fp8 模型和文本编码器全部常驻。风险是没有官方质保、涡轮散热噪音大、改装质量参差,买前要求卖家跑满 48GB 的显存压力测试。
换显卡以后电源和机箱要跟着换吗?
多数情况要。RTX 3090 标称 350W、公版三槽 313 mm;RTX 4090 450W、用 12VHPWR 接口;RTX 5090 575W,建议 1000W 以上的 ATX 3.1 电源。视频生成是几十分钟到整晚的持续满载,不是游戏那种波动负载,电源余量按标称功耗加三成算,机箱要能给三槽卡留出进风空间。