为了本地视频换显卡,先买大显存还是更快的卡?按 Wan 2.2 算一遍(2026)

一张卡显存大但架构旧,另一张架构新但显存小,价格差不多,做本地 AI 视频该买哪张?答案只看一件事:你现在的工作流是「跑不完」还是「跑得慢」。 报显存不足、必须降分辨率或减帧才能出片,买显存,二手 RTX 3090 的 24GB 是当前最便宜的一档;能出片但每段要等很久,买算力,同价位的 RTX 5070 Ti 有 FP8 张量核心,3090 没有。两个问题同时有,两张卡都解决不了,要看三倍价钱的 RTX 4090 或六倍价钱的 RTX 5090。截至 2026 年 9 月 8 日,闲鱼挂牌中位价 3090 ¥7,699、5070 Ti ¥7,990、4090 ¥22,900、5090 ¥45,000。下面以 Wan 2.2 为例把显存需求、算力差距和整机代价逐项算清。

示意图:深色工作台上一张旧的三风扇显卡和一张新的双风扇显卡分列两边,中间放着一只黄铜天平,背景是模糊的视频剪辑时间线
示意图 · 深色工作台上一张旧的三风扇显卡和一张新的双风扇显卡分列两边,中间放着一只黄铜天平,背景是模糊的视频剪辑时间线

先分清「跑不完」和「跑得慢」

显存不够表现为任务无法完成,算力不够表现为任务完成得慢,两种症状对应两种规格,升级前先确认自己是哪一种。 把当前工作流的模型版本、分辨率、帧数和报错记下来,对照下表:

你看到的现象 真正的瓶颈 升级该买的规格
报 CUDA out of memory,或 ComfyUI 卡在加载模型 显存容量 更大显存
降分辨率、减帧数、换更小的模型就能跑完 显存容量 更大显存
能跑完,但每一步都在等,任务管理器显示显存已满、系统内存占用很高 显存不够触发了卸载 更大显存(先解决卸载,速度自然回来)
能跑完,显存有余量,但每段视频等很久 算力 更高的 FP8 / BF16 算力
第一次跑很慢,第二次同样设置快很多 不是硬件,是模型加载 先别买,看第二次的时间
缺节点、文件选错、版本不配 不是硬件 先修环境
示意图:左边的小玻璃工作台放不下堆成山的胶片帧,右边的传送带把胶片帧一格一格送过一只秒表
示意图:左边的小玻璃工作台放不下堆成山的胶片帧,右边的传送带把胶片帧一格一格送过一只秒表

第三行最容易误判。显存刚好不够时,ComfyUI 不报错,而是把放不下的权重留在系统内存分块搬运,任务能完成但每一步都在等 PCIe,看起来像算力不够,实际是显存不够。这时候买更快的卡不解决问题,因为卡在搬运而不是计算,见 显存不够加内存有用吗 里对扩散模型卸载的说明。

视频模型到底要多少显存?以 Wan 2.2 为例

Wan 2.2 的 5B 版本 fp16 权重 10 GB,A14B 版本是高噪、低噪两个模型,fp8 各 14.3 GB,fp16 各 28.6 GB,外加 6.7 GB 的文本编码器。 这些是 ComfyUI 官方重新打包的文件大小(Comfy-Org 仓库),也是显存需求的下限:

组件 文件 大小
TI2V-5B 扩散模型 wan2.2_ti2v_5B_fp16 10 GB
A14B 高噪模型(fp8) wan2.2_t2v / i2v_high_noise_14B_fp8_scaled 14.3 GB
A14B 低噪模型(fp8) wan2.2_t2v / i2v_low_noise_14B_fp8_scaled 14.3 GB
A14B 高噪或低噪模型(fp16) wan2.2_*_14B_fp16 每个 28.6 GB
文本编码器(fp8) umt5_xxl_fp8_e4m3fn_scaled 6.7 GB
文本编码器(fp16) umt5_xxl_fp16 11.4 GB
VAE wan2.2_vae / wan_2.1_vae 2 GB 以内

权重只是峰值的一部分。生成过程中的显存峰值由三块叠加:

  1. 常驻权重。上表的文件大小。ComfyUI 跑 A14B 时高噪和低噪两个模型是先后加载的,不需要同时在显存里,所以 24GB 放得下一个 14.3 GB 的 fp8 模型加运行开销;文本编码器算完提示词就可以让出显存。
  2. 中间张量。注意力和潜变量的体积随「帧数 × 分辨率」增长。720P 5 秒和 480P 3 秒的权重一样,中间张量差好几倍,这就是为什么降分辨率能救回一次 OOM。
  3. VAE 解码。最后一步把几十帧潜变量一次解码成像素,峰值可能比生成阶段还高,而且这一步权重很小、张量很大,卸载权重帮不上忙。「生成到最后才爆显存」多半是它,解法是分块解码、减帧或降分辨率。

官方给的门槛要看清前提。ComfyUI 文档说「5B 版本配合 ComfyUI 原生卸载在 8GB 显存上应该能跑」(ComfyUI Wan 2.2 教程),Wan 官方仓库用自己的推理脚本给出的数字是 5B「至少 24GB,例如 RTX 4090」、14B 单卡「至少 80GB」(Wan2.2 仓库)。两边差三倍,差的就是卸载:8GB 是「能出片」,24GB 是「不用搬」。HunyuanVideo 1.5 的 8.3B 模型官方最低要求写的也是「开启卸载 14 GB」(HunyuanVideo 1.5 仓库),口径相同。

按显存档位归纳,截至 2026 年 9 月 8 日:

显存 Wan 2.2 能怎么跑 代表显卡与闲鱼中位价
8GB 5B 靠卸载出片,A14B 不现实 旧卡,本站不收录
12GB 5B 基本不卸载;A14B fp8 重度卸载 RTX 5070 ¥6,300
16GB 5B 舒服;A14B fp8 单模型勉强常驻、编码器要让位,系统内存 32GB 起 RTX 5060 Ti 16GB ¥4,500、RTX 4080 ¥7,675、RTX 5070 Ti ¥7,990、RTX 5080 ¥11,500
24GB A14B fp8 不卸载,720P 5 秒有余量 RTX 3090 ¥7,699、RTX 4090 ¥22,900
32GB A14B fp8 常驻加更长的镜头,或单个 fp16 模型卸载着跑 RTX 5090 ¥45,000、RTX 5090 D ¥33,000
48GB A14B 两个 fp8 模型加编码器全部常驻,或 fp16 单模型不卸载 RTX 4090 48GB 改装 ¥26,600
96GB A14B fp16 全部常驻,接近官方 80GB 口径 RTX PRO 6000 Blackwell

16GB 到 24GB 是视频生成最值的一步:它是 A14B fp8 从「要卸载」到「不用卸载」的分界线。24GB 到 32GB 换来的是镜头长度和余量,32GB 到 48GB 换来的是 fp16 精度,这两步都贵得多。

显存决定能做多大的镜头,算力决定等多久

视频扩散模型的每一步都是大矩阵乘法,等待时间主要由张量核心的 FP8 或 BF16 算力决定,显存带宽的影响远小于大模型解码。 这和跑大模型正好相反:大模型每个 token 只算一点点,瓶颈在读权重的带宽;视频模型每一步要对几万个时空 token 做注意力,瓶颈在算。

所以比视频卡要看算力那一列,而且要看精度对不对得上:

显卡 显存 BF16 稠密算力 FP8 稠密算力 带宽 标称功耗
RTX 5060 Ti 16GB 16 GB 95 TFLOPS 190 TFLOPS 448 GB/s 180 W
RTX 4080 16 GB 195 TFLOPS 390 TFLOPS 717 GB/s 320 W
RTX 5070 Ti 16 GB 176 TFLOPS 352 TFLOPS 896 GB/s 300 W
RTX 5080 16 GB 225 TFLOPS 450 TFLOPS 960 GB/s 360 W
RTX 3090 24 GB 142 TFLOPS 无 FP8 张量核心 936 GB/s 350 W
RTX 4090 24 GB 330 TFLOPS 661 TFLOPS 1008 GB/s 450 W
RTX 5090 32 GB 419 TFLOPS 838 TFLOPS 1792 GB/s 575 W
RTX 4090 48GB 改装 48 GB 330 TFLOPS 661 TFLOPS 1008 GB/s 450 W

RTX 3090 那一格是关键。Ampere 架构没有 FP8 张量核心,fp8_scaled 的权重能加载,但计算时要转回 BF16 跑,实际算力就是 142 TFLOPS。RTX 5070 Ti 直接用 FP8 算,352 TFLOPS,是 3090 的两倍半;RTX 4090 是 4.6 倍,RTX 5090 是 5.9 倍。在权重全部常驻、没有卸载的前提下,同一个镜头的等待时间大致按这个比例缩短。本站没有在测试机上实跑这几张卡的 Wan 2.2,上面的倍数是算力比,不是实测;Wan 官方只给了「单张消费级显卡 9 分钟内生成 5 秒 720P」这一个数字。

规格与当前价格的实时表:

型号显存 GB带宽 GB/sINT8 TOPS功耗 W闲鱼显存单价
GeForce RTX 5060 Ti 16GB16448190180¥4,6007 条挂单¥287
GeForce RTX 408016717390320¥7,7646 条挂单¥485
GeForce RTX 5070 Ti16896352300¥8,1789 条挂单¥511
GeForce RTX 508016960450360¥12,3508 条挂单¥772
GeForce RTX 309024936285350¥7,69911 条挂单¥321
GeForce RTX 4090241,008661450¥22,90015 条挂单¥954
GeForce RTX 5090321,792838575¥43,0005 条挂单¥1,344
GeForce RTX 4090 48GB481,008661450¥26,6003 条挂单¥554

表里的 INT8 一列对 3090 显示的是 INT8 TOPS,视频模型不用 INT8 推理,看 3090 请以上一张表的 BF16 为准。RTX 4080 是容易被忽略的一张:16GB、FP8 390 TFLOPS,闲鱼中位价 ¥7,675 比 5070 Ti 还低,缺点是 2022 年的卡、用 12VHPWR 接口、二手风险和 3090 同级。

16GB 升级:二手 RTX 3090 还是 RTX 5070 Ti?

报显存不足选 RTX 3090,等太久选 RTX 5070 Ti,两样都要选 RTX 4090。 三张卡的实时对比:

项目GeForce RTX 3090GeForce RTX 5070 TiGeForce RTX 4090GeForce RTX 5090
显存24 GB GDDR6X16 GB GDDR724 GB GDDR6X32 GB GDDR7
带宽936 GB/s896 GB/s1,008 GB/s1,792 GB/s
BF16142.3 TFLOPS175.8 TFLOPS330.3 TFLOPS419 TFLOPS
INT8285 TOPS352 TOPS661 TOPS838 TOPS
功耗350 W300 W450 W575 W
接口PCIe 4.0 x16PCIe 5.0 x16PCIe 4.0 x16PCIe 5.0 x16
发布日期2020年9月24日2025年2月20日2022年10月12日2025年1月30日
官方定价¥10,086¥5,039¥10,758¥13,450
闲鱼二手¥7,699¥8,178¥22,900¥43,000
显存单价¥321¥511¥954¥1,344
能跑的最大稠密档位(4-bit、8K)32B14B32B32B

按三种情况给答案,价格截至 2026 年 9 月 8 日:

  • 现在用 16GB 卡,A14B 要卸载才能跑,出片慢是因为在搬运。 换 RTX 3090,¥7,699。24GB 让 fp8 模型不再卸载,等待时间的大头直接消失,虽然它的算力还不如你手里的 16GB Blackwell 卡。这一档没有第二个选择:24GB 的下一张卡是 ¥22,900 的 4090。
  • 现在用 16GB 卡,5B 或降过分辨率的 A14B 跑得完,就是慢。 换 RTX 5070 Ti ¥7,990 或 RTX 5080 ¥11,500,前提是显存够用这件事不变。从 RTX 5060 Ti 16GB 升到 5070 Ti,FP8 算力 190 到 352;从 3090 换到 5070 Ti,是拿 8GB 显存换两倍半算力,只有确认工作流装得进 16GB 才划算。
  • 既装不下又嫌慢。 RTX 4090 ¥22,900,24GB 加 661 TFLOPS FP8,是 3090 价钱的三倍,算力 4.6 倍。RTX 5090 ¥45,000 再加 8GB 和 27% 算力,只有天天出 720P 长镜头才值。RTX 5090 D ¥33,000 有同样的 32GB,但 AI 算力被固件限到标准版七成,按 594 TFLOPS FP8 算仍然接近 4090。

跑大模型时这道题的答案不一样:大模型看带宽,3090 和 5070 Ti 几乎打平,所以 24GB 几乎总是赢,见 3090 与 5070 Ti 跑大模型。做视频的人不能照搬那篇的结论,因为 3090 缺 FP8 这件事在大模型单流推理里几乎不影响速度,在视频生成里影响两倍半。

48GB 改装卡与专业卡值不值?

RTX 4090 48GB 改装卡是 24GB 以上唯一便宜的选择,适合明确要 fp16 精度或整套 A14B 常驻的人;其他人不需要。 截至 2026 年 9 月 8 日闲鱼中位价 ¥26,600,只有 3 条挂单,比 24GB 原版贵 ¥3,700。

它能做到的事:A14B 两个 fp8 模型加文本编码器全部常驻(28.6 + 6.7 GB),换模型不用重新加载;或者单个 fp16 模型 28.6 GB 不卸载地跑。它做不到的事:算力还是 4090 的 661 TFLOPS,不会因为显存翻倍而更快。风险在改装本身:多数是拆公版换涡轮双槽 PCB 加 clamshell 显存,没有 NVIDIA 质保,涡轮噪音大,显存颗粒和 PCB 质量看店家。买前让卖家跑一段把 48GB 占满的显存压力测试并录屏,收货再跑一次。

再往上是 RTX PRO 6000 Blackwell 的 96GB,能把 A14B fp16 两个模型都放进去,接近 Wan 官方脚本的 80GB 口径。它的价格是 5090 的两到三倍,属于工作室采购,不在个人升级的讨论范围。

整机跟着换:电源、接口、机箱

换到 3090 以上的卡,电源、接口和机箱多半要一起换,这笔钱要算进升级成本。 视频生成是几十分钟到整晚的持续满载,不是游戏那种忽高忽低的负载,电源余量要按标称功耗加三成算:

显卡 标称功耗 供电接口 体积 建议电源
RTX 5070 Ti 300 W 16-pin 12V-2x6 多数双槽 750 W
RTX 3090 350 W 公版 12-pin,非公 2 到 3 个 8-pin 公版三槽、313 mm 850 W
RTX 4090 450 W 16-pin 12VHPWR 三到四槽 1000 W
RTX 5090 575 W 16-pin 12V-2x6 三到四槽 1000 W 以上,ATX 3.1

3090 的 GDDR6X 颗粒在背板一侧,长时间满载温度高,二手卡买前要求卖家跑 30 分钟显存压力测试;机箱要给三槽卡留出进风空间,不然整晚排队时会降频。4090 和 5090 的 16-pin 接口要插到底,线不要在插头处硬弯。整机改造通常再花几百到一两千元,从 5070 Ti 升到 4090 的真实差价不是 ¥14,910,要再加这一笔。

用自己的工作量算等待值不值

只有每周反复出现的等待才值得花钱买算力,偶尔跑一次的任务用卸载忍一忍。 算法很简单:

  1. 记一周里实际生成的镜头数和每段的等待时间,算出每周总等待小时数。
  2. 按算力比估算换卡后能省下的比例。3090 换 4090,等待大约变成原来的四分之一到五分之一;5060 Ti 16GB 换 5070 Ti,大约减半。
  3. 省下的小时数乘以你的时薪或这段时间能多接的活,和差价比。

例子:每天出 20 段 5 秒 720P,3090 上假设每段 8 分钟,一天等 160 分钟,一周 5 天约 13 小时。换 4090 按算力比降到 3 小时,一周省 10 小时,差价 ¥15,200 加整机改造,按每小时 100 元算四个月回本;每周只出 10 段的人,同样的差价要三年。这里的每段 8 分钟是假设,用你自己的记录替换。

还要分清单次延迟和整晚吞吐。改镜头时要一段一段看结果,单次延迟决定体验,算力高的卡赢;整晚排队出候选,只关心早上能收多少段,这时候显存大、能不卸载地跑更大的批次反而更重要。

价格走势与什么时候买

四张卡的 30 天走势实时更新,二手 3090 和 5070 Ti 的价差长期在几百元内,决定权在你的瓶颈而不是价格。 走势:

型号当前30 天最低30 天最高30 天变化30d 趋势
GeForce RTX 3090¥7,699¥7,600¥8,049-1.9%
GeForce RTX 5070 Ti¥8,178¥7,800¥8,800-4.4%
GeForce RTX 4090¥22,900¥22,000¥23,500+4.1%
GeForce RTX 5090¥43,000¥34,850¥45,000+23.4%

闲鱼最近 30 天的中位价,每 6 小时一个点;变化是当前中位价相对窗口内最早一点的涨跌。

3090 已经是 2020 年的卡,价格由存量决定,跌得很慢;5070 Ti 和 5080 是在售新卡,二手价跟着零售价走。4090 停产后二手价反而稳在两万出头,因为 24GB 加 FP8 这个组合在 5090 之下没有替代品。想省钱的人盯 3090 的挂单数:样本多的时候中位数更可信,见 方法说明 里对挂牌价口径的解释。

买之前把理由写成一句话:「我要让 A14B fp8 在 720P 5 秒下不卸载」,或者「我要把每段 8 分钟的等待压到 3 分钟」。说得出资源用在哪,就知道该买显存还是算力;说不出来,先用现在的卡把第一段能用的视频跑出来,再回来看这张表。

价格为闲鱼挂牌中位数,截至 2026 年 9 月 8 日;模型文件大小与显存门槛引自 ComfyUI、Wan 与 HunyuanVideo 官方文档;本站未在测试机上实跑 Wan 2.2,文中速度倍数为算力比例估算,不是实测。

常见问题

显存大的显卡一定生成得更快吗?

不一定。视频生成的等待时间主要由算力决定,显存决定的是能不能不卸载地跑完。RTX 3090 有 24GB,但没有 FP8 张量核心,BF16 只有 142 TFLOPS;RTX 5070 Ti 只有 16GB,FP8 却有 352 TFLOPS。同一个能装进 16GB 的工作流,5070 Ti 更快;装不进 16GB 的工作流,3090 才跑得完。

16GB 显存能跑 Wan 2.2 的 14B 版本吗?

能出片,靠 ComfyUI 的卸载。A14B 的 fp8 模型单个 14.3 GB,高噪和低噪两个模型轮流加载,加上文本编码器 6.7 GB,16GB 放不下全部,ComfyUI 会把放不下的部分留在系统内存分块搬运。代价是每一步多等搬运时间,而且系统内存要 32GB 以上。想不卸载地跑,要 24GB。

二手 RTX 3090 和 RTX 5070 Ti 价格差不多,做视频选哪张?

看你现在卡在哪。工作流报显存不足、必须降分辨率或减帧才能跑完,选 3090,多出的 8GB 直接解决问题。工作流能跑完但每段要等很久,选 5070 Ti,FP8 算力是 3090 BF16 的两倍以上,同样的镜头等待时间大约减半。两个问题都有,两张卡都不够,要看 4090。

RTX 4090 48GB 改装卡值得买吗?

只适合明确需要 24GB 以上、又不想花 RTX PRO 6000 那个价钱的人。截至 2026 年 9 月 8 日闲鱼中位价 ¥26,600,只比 24GB 原版贵 ¥3,700,能把 A14B 两个 fp8 模型和文本编码器全部常驻。风险是没有官方质保、涡轮散热噪音大、改装质量参差,买前要求卖家跑满 48GB 的显存压力测试。

换显卡以后电源和机箱要跟着换吗?

多数情况要。RTX 3090 标称 350W、公版三槽 313 mm;RTX 4090 450W、用 12VHPWR 接口;RTX 5090 575W,建议 1000W 以上的 ATX 3.1 电源。视频生成是几十分钟到整晚的持续满载,不是游戏那种波动负载,电源余量按标称功耗加三成算,机箱要能给三槽卡留出进风空间。

文中提到的显卡