為了本地影片換顯示卡,先買大顯示記憶體還是更快的卡?按 Wan 2.2 算一遍(2026)

譯自简体中文版 · 閱讀原文

一張卡顯示記憶體大但架構舊,另一張架構新但顯示記憶體小,價格差不多,做本地 AI 影片該買哪張?答案只看一件事:你現在的工作流程是「跑不完」還是「跑得慢」。 報顯示記憶體不足、必須降解析度或減影格才能出片,買顯示記憶體,二手 RTX 3090 的 24GB 是當前最便宜的一檔;能出片但每段要等很久,買算力,同價位的 RTX 5070 Ti 有 FP8 張量核心,3090 沒有。兩個問題同時有,兩張卡都解決不了,要看三倍價錢的 RTX 4090 或六倍價錢的 RTX 5090。截至 2026 年 9 月 8 日,閒魚掛牌中位數換算 3090 NT$34,500、5070 Ti NT$35,800、4090 NT$102,600、5090 NT$201,600。下面以 Wan 2.2 為例把顯示記憶體需求、算力差距和整機代價逐項算清。

示意圖:深色工作台上一張舊的三風扇顯示卡和一張新的雙風扇顯示卡分列兩邊,中間放著一只黃銅天平,背景是模糊的影片剪輯時間軸
示意圖 · 深色工作台上一張舊的三風扇顯示卡和一張新的雙風扇顯示卡分列兩邊,中間放著一只黃銅天平,背景是模糊的影片剪輯時間軸

本文提及的固定價格為閒魚掛牌中位數按 1 CNY = 4.48 TWD 換算的新台幣,四捨五入到百位;動態表格則依頁面所選幣別顯示。

先分清「跑不完」和「跑得慢」

顯示記憶體不夠表現為任務無法完成,算力不夠表現為任務完成得慢,兩種症狀對應兩種規格,升級前先確認自己是哪一種。 把當前工作流程的模型版本、解析度、影格數和錯誤訊息記下來,對照下表:

你看到的現象 真正的瓶頸 升級該買的規格
報 CUDA out of memory,或 ComfyUI 卡在載入模型 顯示記憶體容量 更大顯示記憶體
降解析度、減影格數、換更小的模型就能跑完 顯示記憶體容量 更大顯示記憶體
能跑完,但每一步都在等,工作管理員顯示顯示記憶體已滿、系統記憶體佔用很高 顯示記憶體不夠觸發了卸載 更大顯示記憶體(先解決卸載,速度自然回來)
能跑完,顯示記憶體有餘量,但每段影片等很久 算力 更高的 FP8 / BF16 算力
第一次跑很慢,第二次同樣設定快很多 不是硬體,是模型載入 先別買,看第二次的時間
缺節點、檔案選錯、版本不配 不是硬體 先修環境
示意圖:左邊的小玻璃工作台放不下堆成山的膠片影格,右邊的輸送帶把影格一格一格送過一只碼錶
示意圖:左邊的小玻璃工作台放不下堆成山的膠片影格,右邊的輸送帶把影格一格一格送過一只碼錶

第三行最容易誤判。顯示記憶體剛好不夠時,ComfyUI 不報錯,而是把放不下的權重留在系統記憶體分塊搬運,任務能完成但每一步都在等 PCIe,看起來像算力不夠,實際是顯示記憶體不夠。這時候買更快的卡不解決問題,因為卡在搬運而不是計算,見 顯示記憶體不夠加記憶體有用嗎 裡對擴散模型卸載的說明。

影片模型到底要多少顯示記憶體?以 Wan 2.2 為例

Wan 2.2 的 5B 版本 fp16 權重 10 GB,A14B 版本是高噪、低噪兩個模型,fp8 各 14.3 GB,fp16 各 28.6 GB,外加 6.7 GB 的文字編碼器。 這些是 ComfyUI 官方重新打包的檔案大小(Comfy-Org 倉庫),也是顯示記憶體需求的下限:

元件 檔案 大小
TI2V-5B 擴散模型 wan2.2_ti2v_5B_fp16 10 GB
A14B 高噪模型(fp8) wan2.2_t2v / i2v_high_noise_14B_fp8_scaled 14.3 GB
A14B 低噪模型(fp8) wan2.2_t2v / i2v_low_noise_14B_fp8_scaled 14.3 GB
A14B 高噪或低噪模型(fp16) wan2.2_*_14B_fp16 每個 28.6 GB
文字編碼器(fp8) umt5_xxl_fp8_e4m3fn_scaled 6.7 GB
文字編碼器(fp16) umt5_xxl_fp16 11.4 GB
VAE wan2.2_vae / wan_2.1_vae 2 GB 以內

權重只是峰值的一部分。生成過程中的顯示記憶體峰值由三塊疊加:

  1. 常駐權重。上表的檔案大小。ComfyUI 跑 A14B 時高噪和低噪兩個模型是先後載入的,不需要同時在顯示記憶體裡,所以 24GB 放得下一個 14.3 GB 的 fp8 模型加執行開銷;文字編碼器算完提示詞就可以讓出顯示記憶體。
  2. 中間張量。注意力和潛變數的體積隨「影格數 × 解析度」增長。720P 5 秒和 480P 3 秒的權重一樣,中間張量差好幾倍,這就是為什麼降解析度能救回一次 OOM。
  3. VAE 解碼。最後一步把幾十影格潛變數一次解碼成像素,峰值可能比生成階段還高,而且這一步權重很小、張量很大,卸載權重幫不上忙。「生成到最後才爆顯示記憶體」多半是它,解法是分塊解碼、減影格或降解析度。

官方給的門檻要看清前提。ComfyUI 文件說「5B 版本配合 ComfyUI 原生卸載在 8GB 顯示記憶體上應該能跑」(ComfyUI Wan 2.2 教學),Wan 官方倉庫用自己的推論指令碼給出的數字是 5B「至少 24GB,例如 RTX 4090」、14B 單卡「至少 80GB」(Wan2.2 倉庫)。兩邊差三倍,差的就是卸載:8GB 是「能出片」,24GB 是「不用搬」。HunyuanVideo 1.5 的 8.3B 模型官方最低要求寫的也是「開啟卸載 14 GB」(HunyuanVideo 1.5 倉庫),口徑相同。

按顯示記憶體檔位歸納,截至 2026 年 9 月 8 日:

顯示記憶體 Wan 2.2 能怎麼跑 代表顯示卡與閒魚中位數換算
8GB 5B 靠卸載出片,A14B 不現實 舊卡,本站不收錄
12GB 5B 基本不卸載;A14B fp8 重度卸載 RTX 5070 NT$28,200
16GB 5B 舒服;A14B fp8 單模型勉強常駐、編碼器要讓位,系統記憶體 32GB 起 RTX 5060 Ti 16GB NT$20,200、RTX 4080 NT$34,400、RTX 5070 Ti NT$35,800、RTX 5080 NT$51,500
24GB A14B fp8 不卸載,720P 5 秒有餘量 RTX 3090 NT$34,500、RTX 4090 NT$102,600
32GB A14B fp8 常駐加更長的鏡頭,或單個 fp16 模型卸載著跑 RTX 5090 NT$201,600、RTX 5090 D NT$147,800
48GB A14B 兩個 fp8 模型加編碼器全部常駐,或 fp16 單模型不卸載 RTX 4090 48GB 改裝 NT$119,100
96GB A14B fp16 全部常駐,接近官方 80GB 口徑 RTX PRO 6000 Blackwell

16GB 到 24GB 是影片生成最值的一步:它是 A14B fp8 從「要卸載」到「不用卸載」的分界線。24GB 到 32GB 換來的是鏡頭長度和餘量,32GB 到 48GB 換來的是 fp16 精度,這兩步都貴得多。

顯示記憶體決定能做多大的鏡頭,算力決定等多久

影片擴散模型的每一步都是大矩陣乘法,等待時間主要由張量核心的 FP8 或 BF16 算力決定,顯示記憶體頻寬的影響遠小於大模型解碼。 這和跑大模型正好相反:大模型每個 token 只算一點點,瓶頸在讀權重的頻寬;影片模型每一步要對幾萬個時空 token 做注意力,瓶頸在算。

所以比影片卡要看算力那一列,而且要看精度對不對得上:

顯示卡 顯示記憶體 BF16 稠密算力 FP8 稠密算力 頻寬 標稱功耗
RTX 5060 Ti 16GB 16 GB 95 TFLOPS 190 TFLOPS 448 GB/s 180 W
RTX 4080 16 GB 195 TFLOPS 390 TFLOPS 717 GB/s 320 W
RTX 5070 Ti 16 GB 176 TFLOPS 352 TFLOPS 896 GB/s 300 W
RTX 5080 16 GB 225 TFLOPS 450 TFLOPS 960 GB/s 360 W
RTX 3090 24 GB 142 TFLOPS 無 FP8 張量核心 936 GB/s 350 W
RTX 4090 24 GB 330 TFLOPS 661 TFLOPS 1008 GB/s 450 W
RTX 5090 32 GB 419 TFLOPS 838 TFLOPS 1792 GB/s 575 W
RTX 4090 48GB 改裝 48 GB 330 TFLOPS 661 TFLOPS 1008 GB/s 450 W

RTX 3090 那一格是關鍵。Ampere 架構沒有 FP8 張量核心,fp8_scaled 的權重能載入,但計算時要轉回 BF16 跑,實際算力就是 142 TFLOPS。RTX 5070 Ti 直接用 FP8 算,352 TFLOPS,是 3090 的兩倍半;RTX 4090 是 4.6 倍,RTX 5090 是 5.9 倍。在權重全部常駐、沒有卸載的前提下,同一個鏡頭的等待時間大致按這個比例縮短。本站沒有在測試機上實跑這幾張卡的 Wan 2.2,上面的倍數是算力比,不是實測;Wan 官方只給了「單張消費級顯示卡 9 分鐘內生成 5 秒 720P」這一個數字。

規格與當前價格的即時表:

型號顯存 GB頻寬 GB/sINT8 TOPS功耗 W閒魚顯存單價
GeForce RTX 5060 Ti 16GB16448190180NT$21,5377 筆掛單NT$1,346
GeForce RTX 408016717390320NT$36,3506 筆掛單NT$2,272
GeForce RTX 5070 Ti16896352300NT$38,2899 筆掛單NT$2,393
GeForce RTX 508016960450360NT$57,8218 筆掛單NT$3,614
GeForce RTX 309024936285350NT$36,04611 筆掛單NT$1,502
GeForce RTX 4090241,008661450NT$107,21515 筆掛單NT$4,467
GeForce RTX 5090321,792838575NT$201,3215 筆掛單NT$6,291
GeForce RTX 4090 48GB481,008661450NT$124,5383 筆掛單NT$2,594

表裡的 INT8 一列對 3090 顯示的是 INT8 TOPS,影片模型不用 INT8 推論,看 3090 請以上一張表的 BF16 為準。RTX 4080 是容易被忽略的一張:16GB、FP8 390 TFLOPS,閒魚中位數換算 NT$34,400 比 5070 Ti 還低,缺點是 2022 年的卡、用 12VHPWR 接頭、二手風險和 3090 同級。

16GB 升級:二手 RTX 3090 還是 RTX 5070 Ti?

報顯示記憶體不足選 RTX 3090,等太久選 RTX 5070 Ti,兩樣都要選 RTX 4090。 三張卡的即時對比:

項目GeForce RTX 3090GeForce RTX 5070 TiGeForce RTX 4090GeForce RTX 5090
顯存24 GB GDDR6X16 GB GDDR724 GB GDDR6X32 GB GDDR7
頻寬936 GB/s896 GB/s1,008 GB/s1,792 GB/s
BF16142.3 TFLOPS175.8 TFLOPS330.3 TFLOPS419 TFLOPS
INT8285 TOPS352 TOPS661 TOPS838 TOPS
功耗350 W300 W450 W575 W
介面PCIe 4.0 x16PCIe 5.0 x16PCIe 4.0 x16PCIe 5.0 x16
發布日期2020年9月24日2025年2月20日2022年10月12日2025年1月30日
官方定價NT$47,220NT$23,594NT$50,370NT$62,970
閒魚二手NT$36,046NT$38,289NT$107,215NT$201,321
顯存單價NT$1,502NT$2,393NT$4,467NT$6,291
能跑的最大稠密檔位(4-bit、8K)32B14B32B32B

按三種情況給答案,價格截至 2026 年 9 月 8 日:

  • 現在用 16GB 卡,A14B 要卸載才能跑,出片慢是因為在搬運。 換 RTX 3090,NT$34,500。24GB 讓 fp8 模型不再卸載,等待時間的大頭直接消失,雖然它的算力還不如你手裡的 16GB Blackwell 卡。這一檔沒有第二個選擇:24GB 的下一張卡是 NT$102,600 的 4090。
  • 現在用 16GB 卡,5B 或降過解析度的 A14B 跑得完,就是慢。 換 RTX 5070 Ti NT$35,800 或 RTX 5080 NT$51,500,前提是顯示記憶體夠用這件事不變。從 RTX 5060 Ti 16GB 升到 5070 Ti,FP8 算力 190 到 352;從 3090 換到 5070 Ti,是拿 8GB 顯示記憶體換兩倍半算力,只有確認工作流程裝得進 16GB 才划算。
  • 既裝不下又嫌慢。 RTX 4090 NT$102,600,24GB 加 661 TFLOPS FP8,是 3090 價錢的三倍,算力 4.6 倍。RTX 5090 NT$201,600 再加 8GB 和 27% 算力,只有天天出 720P 長鏡頭才值。RTX 5090 D NT$147,800 有同樣的 32GB,但 AI 算力被韌體限到標準版七成,按 594 TFLOPS FP8 算仍然接近 4090。

跑大模型時這道題的答案不一樣:大模型看頻寬,3090 和 5070 Ti 幾乎打平,所以 24GB 幾乎總是贏,見 3090 與 5070 Ti 跑大模型。做影片的人不能照搬那篇的結論,因為 3090 缺 FP8 這件事在大模型單流推論裡幾乎不影響速度,在影片生成裡影響兩倍半。

48GB 改裝卡與專業卡值不值?

RTX 4090 48GB 改裝卡是 24GB 以上唯一便宜的選擇,適合明確要 fp16 精度或整套 A14B 常駐的人;其他人不需要。 截至 2026 年 9 月 8 日閒魚掛牌中位數換算 NT$119,100,只有 3 條掛單,比 24GB 原版貴約 NT$16,500。

它能做到的事:A14B 兩個 fp8 模型加文字編碼器全部常駐(28.6 + 6.7 GB),換模型不用重新載入;或者單個 fp16 模型 28.6 GB 不卸載地跑。它做不到的事:算力還是 4090 的 661 TFLOPS,不會因為顯示記憶體翻倍而更快。風險在改裝本身:多數是拆公版換渦輪雙槽 PCB 加 clamshell 顯示記憶體,沒有 NVIDIA 保固,渦輪噪音大,顯示記憶體顆粒和 PCB 品質看店家。買前讓賣家跑一段把 48GB 佔滿的顯示記憶體壓力測試並錄影,收貨再跑一次。

再往上是 RTX PRO 6000 Blackwell 的 96GB,能把 A14B fp16 兩個模型都放進去,接近 Wan 官方指令碼的 80GB 口徑。它的價格是 5090 的兩到三倍,屬於工作室採購,不在個人升級的討論範圍。

整機跟著換:電源供應器、接頭、機殼

換到 3090 以上的卡,電源供應器、接頭和機殼多半要一起換,這筆錢要算進升級成本。 影片生成是幾十分鐘到整晚的持續滿載,不是遊戲那種忽高忽低的負載,電源餘量要按標稱功耗加三成算:

顯示卡 標稱功耗 供電接頭 體積 建議電源供應器
RTX 5070 Ti 300 W 16-pin 12V-2x6 多數雙槽 750 W
RTX 3090 350 W 公版 12-pin,非公 2 到 3 個 8-pin 公版三槽、313 mm 850 W
RTX 4090 450 W 16-pin 12VHPWR 三到四槽 1000 W
RTX 5090 575 W 16-pin 12V-2x6 三到四槽 1000 W 以上,ATX 3.1

3090 的 GDDR6X 顆粒在背板一側,長時間滿載溫度高,二手卡買前要求賣家跑 30 分鐘顯示記憶體壓力測試;機殼要給三槽卡留出進風空間,不然整晚排隊時會降頻。4090 和 5090 的 16-pin 接頭要插到底,線不要在插頭處硬彎。整機改造通常再花數千到近萬元新台幣,從 5070 Ti 升到 4090 的真實差價不是 NT$66,800,要再加這一筆。

用自己的工作量算等待值不值

只有每週反覆出現的等待才值得花錢買算力,偶爾跑一次的任務用卸載忍一忍。 算法很簡單:

  1. 記一週裡實際生成的鏡頭數和每段的等待時間,算出每週總等待小時數。
  2. 按算力比估算換卡後能省下的比例。3090 換 4090,等待大約變成原來的四分之一到五分之一;5060 Ti 16GB 換 5070 Ti,大約減半。
  3. 省下的小時數乘以你的時薪或這段時間能多接的活,和差價比。

例子:每天出 20 段 5 秒 720P,3090 上假設每段 8 分鐘,一天等 160 分鐘,一週 5 天約 13 小時。換 4090 按算力比降到 3 小時,一週省 10 小時,差價 NT$68,100,按每小時 450 元算約三個半月回本,加上整機改造接近四個月;每週只出 10 段的人,同樣的差價要三年。這裡的每段 8 分鐘是假設,用你自己的記錄替換。

還要分清單次延遲和整晚吞吐。改鏡頭時要一段一段看結果,單次延遲決定體驗,算力高的卡贏;整晚排隊出候選,只關心早上能收多少段,這時候顯示記憶體大、能不卸載地跑更大的批次反而更重要。

價格走勢與什麼時候買

四張卡的 30 天走勢即時更新,二手 3090 和 5070 Ti 的價差長期在一兩千元新台幣內,決定權在你的瓶頸而不是價格。 走勢:

型號目前30 天最低30 天最高30 天變化30d 趨勢
GeForce RTX 3090NT$36,046NT$35,582NT$37,685-1.9%
GeForce RTX 5070 TiNT$38,289NT$36,519NT$41,201-4.4%
GeForce RTX 4090NT$107,215NT$103,002NT$110,024+4.1%
GeForce RTX 5090NT$201,321NT$163,164NT$210,685+23.4%

閒魚最近 30 天的中位價,每 6 小時一個點;變化是目前中位價相對視窗內最早一點的漲跌。

3090 已經是 2020 年的卡,價格由存量決定,跌得很慢;5070 Ti 和 5080 是在售新卡,二手價跟著零售價走。4090 停產後二手價反而穩在 10 萬出頭,因為 24GB 加 FP8 這個組合在 5090 之下沒有替代品。想省錢的人盯 3090 的掛單數:樣本多的時候中位數更可信,見 方法說明 裡對掛牌價口徑的解釋。

買之前把理由寫成一句話:「我要讓 A14B fp8 在 720P 5 秒下不卸載」,或者「我要把每段 8 分鐘的等待壓到 3 分鐘」。說得出資源用在哪,就知道該買顯示記憶體還是算力;說不出來,先用現在的卡把第一段能用的影片跑出來,再回來看這張表。

價格為閒魚掛牌中位數換算新台幣,截至 2026 年 9 月 8 日;模型檔案大小與顯示記憶體門檻引自 ComfyUI、Wan 與 HunyuanVideo 官方文件;本站未在測試機上實跑 Wan 2.2,文中速度倍數為算力比例估算,不是實測。

常見問題

顯示記憶體大的顯示卡一定生成得更快嗎?

不一定。影片生成的等待時間主要由算力決定,顯示記憶體決定的是能不能不卸載地跑完。RTX 3090 有 24GB,但沒有 FP8 張量核心,BF16 只有 142 TFLOPS;RTX 5070 Ti 只有 16GB,FP8 卻有 352 TFLOPS。同一個能裝進 16GB 的工作流程,5070 Ti 更快;裝不進 16GB 的工作流程,3090 才跑得完。

16GB 顯示記憶體能跑 Wan 2.2 的 14B 版本嗎?

能出片,靠 ComfyUI 的卸載。A14B 的 fp8 模型單個 14.3 GB,高噪和低噪兩個模型輪流載入,加上文字編碼器 6.7 GB,16GB 放不下全部,ComfyUI 會把放不下的部分留在系統記憶體分塊搬運。代價是每一步多等搬運時間,而且系統記憶體要 32GB 以上。想不卸載地跑,要 24GB。

二手 RTX 3090 和 RTX 5070 Ti 價格差不多,做影片選哪張?

看你現在卡在哪。工作流程報顯示記憶體不足、必須降解析度或減影格才能跑完,選 3090,多出的 8GB 直接解決問題。工作流程能跑完但每段要等很久,選 5070 Ti,FP8 算力是 3090 BF16 的兩倍以上,同樣的鏡頭等待時間大約減半。兩個問題都有,兩張卡都不夠,要看 4090。

RTX 4090 48GB 改裝卡值得買嗎?

只適合明確需要 24GB 以上、又不想花 RTX PRO 6000 那個價錢的人。截至 2026 年 9 月 8 日閒魚掛牌中位數換算 NT$119,100,只比 24GB 原版貴約 NT$16,500,能把 A14B 兩個 fp8 模型和文字編碼器全部常駐。風險是沒有官方保固、渦輪散熱噪音大、改裝品質參差,買前要求賣家跑滿 48GB 的顯示記憶體壓力測試。

換顯示卡以後電源供應器和機殼要跟著換嗎?

多數情況要。RTX 3090 標稱 350W、公版三槽 313 mm;RTX 4090 450W、用 12VHPWR 接頭;RTX 5090 575W,建議 1000W 以上的 ATX 3.1 電源供應器。影片生成是幾十分鐘到整晚的持續滿載,不是遊戲那種波動負載,電源餘量按標稱功耗加三成算,機殼要能給三槽卡留出進風空間。

文中提到的顯示卡