一張卡顯示記憶體大但架構舊,另一張架構新但顯示記憶體小,價格差不多,做本地 AI 影片該買哪張?答案只看一件事:你現在的工作流程是「跑不完」還是「跑得慢」。 報顯示記憶體不足、必須降解析度或減影格才能出片,買顯示記憶體,二手 RTX 3090 的 24GB 是當前最便宜的一檔;能出片但每段要等很久,買算力,同價位的 RTX 5070 Ti 有 FP8 張量核心,3090 沒有。兩個問題同時有,兩張卡都解決不了,要看三倍價錢的 RTX 4090 或六倍價錢的 RTX 5090。截至 2026 年 9 月 8 日,閒魚掛牌中位數換算 3090 NT$34,500、5070 Ti NT$35,800、4090 NT$102,600、5090 NT$201,600。下面以 Wan 2.2 為例把顯示記憶體需求、算力差距和整機代價逐項算清。
為了本地影片換顯示卡,先買大顯示記憶體還是更快的卡?按 Wan 2.2 算一遍(2026)
譯自简体中文版 · 閱讀原文
正文與常見問題中的數字截至 2026年9月8日;表格使用最新已發布價格,各裝置採集時間可能不同。

本文提及的固定價格為閒魚掛牌中位數按 1 CNY = 4.48 TWD 換算的新台幣,四捨五入到百位;動態表格則依頁面所選幣別顯示。
先分清「跑不完」和「跑得慢」
顯示記憶體不夠表現為任務無法完成,算力不夠表現為任務完成得慢,兩種症狀對應兩種規格,升級前先確認自己是哪一種。 把當前工作流程的模型版本、解析度、影格數和錯誤訊息記下來,對照下表:
| 你看到的現象 | 真正的瓶頸 | 升級該買的規格 |
|---|---|---|
| 報 CUDA out of memory,或 ComfyUI 卡在載入模型 | 顯示記憶體容量 | 更大顯示記憶體 |
| 降解析度、減影格數、換更小的模型就能跑完 | 顯示記憶體容量 | 更大顯示記憶體 |
| 能跑完,但每一步都在等,工作管理員顯示顯示記憶體已滿、系統記憶體佔用很高 | 顯示記憶體不夠觸發了卸載 | 更大顯示記憶體(先解決卸載,速度自然回來) |
| 能跑完,顯示記憶體有餘量,但每段影片等很久 | 算力 | 更高的 FP8 / BF16 算力 |
| 第一次跑很慢,第二次同樣設定快很多 | 不是硬體,是模型載入 | 先別買,看第二次的時間 |
| 缺節點、檔案選錯、版本不配 | 不是硬體 | 先修環境 |

第三行最容易誤判。顯示記憶體剛好不夠時,ComfyUI 不報錯,而是把放不下的權重留在系統記憶體分塊搬運,任務能完成但每一步都在等 PCIe,看起來像算力不夠,實際是顯示記憶體不夠。這時候買更快的卡不解決問題,因為卡在搬運而不是計算,見 顯示記憶體不夠加記憶體有用嗎 裡對擴散模型卸載的說明。
影片模型到底要多少顯示記憶體?以 Wan 2.2 為例
Wan 2.2 的 5B 版本 fp16 權重 10 GB,A14B 版本是高噪、低噪兩個模型,fp8 各 14.3 GB,fp16 各 28.6 GB,外加 6.7 GB 的文字編碼器。 這些是 ComfyUI 官方重新打包的檔案大小(Comfy-Org 倉庫),也是顯示記憶體需求的下限:
| 元件 | 檔案 | 大小 |
|---|---|---|
| TI2V-5B 擴散模型 | wan2.2_ti2v_5B_fp16 | 10 GB |
| A14B 高噪模型(fp8) | wan2.2_t2v / i2v_high_noise_14B_fp8_scaled | 14.3 GB |
| A14B 低噪模型(fp8) | wan2.2_t2v / i2v_low_noise_14B_fp8_scaled | 14.3 GB |
| A14B 高噪或低噪模型(fp16) | wan2.2_*_14B_fp16 | 每個 28.6 GB |
| 文字編碼器(fp8) | umt5_xxl_fp8_e4m3fn_scaled | 6.7 GB |
| 文字編碼器(fp16) | umt5_xxl_fp16 | 11.4 GB |
| VAE | wan2.2_vae / wan_2.1_vae | 2 GB 以內 |
權重只是峰值的一部分。生成過程中的顯示記憶體峰值由三塊疊加:
- 常駐權重。上表的檔案大小。ComfyUI 跑 A14B 時高噪和低噪兩個模型是先後載入的,不需要同時在顯示記憶體裡,所以 24GB 放得下一個 14.3 GB 的 fp8 模型加執行開銷;文字編碼器算完提示詞就可以讓出顯示記憶體。
- 中間張量。注意力和潛變數的體積隨「影格數 × 解析度」增長。720P 5 秒和 480P 3 秒的權重一樣,中間張量差好幾倍,這就是為什麼降解析度能救回一次 OOM。
- VAE 解碼。最後一步把幾十影格潛變數一次解碼成像素,峰值可能比生成階段還高,而且這一步權重很小、張量很大,卸載權重幫不上忙。「生成到最後才爆顯示記憶體」多半是它,解法是分塊解碼、減影格或降解析度。
官方給的門檻要看清前提。ComfyUI 文件說「5B 版本配合 ComfyUI 原生卸載在 8GB 顯示記憶體上應該能跑」(ComfyUI Wan 2.2 教學),Wan 官方倉庫用自己的推論指令碼給出的數字是 5B「至少 24GB,例如 RTX 4090」、14B 單卡「至少 80GB」(Wan2.2 倉庫)。兩邊差三倍,差的就是卸載:8GB 是「能出片」,24GB 是「不用搬」。HunyuanVideo 1.5 的 8.3B 模型官方最低要求寫的也是「開啟卸載 14 GB」(HunyuanVideo 1.5 倉庫),口徑相同。
按顯示記憶體檔位歸納,截至 2026 年 9 月 8 日:
| 顯示記憶體 | Wan 2.2 能怎麼跑 | 代表顯示卡與閒魚中位數換算 |
|---|---|---|
| 8GB | 5B 靠卸載出片,A14B 不現實 | 舊卡,本站不收錄 |
| 12GB | 5B 基本不卸載;A14B fp8 重度卸載 | RTX 5070 NT$28,200 |
| 16GB | 5B 舒服;A14B fp8 單模型勉強常駐、編碼器要讓位,系統記憶體 32GB 起 | RTX 5060 Ti 16GB NT$20,200、RTX 4080 NT$34,400、RTX 5070 Ti NT$35,800、RTX 5080 NT$51,500 |
| 24GB | A14B fp8 不卸載,720P 5 秒有餘量 | RTX 3090 NT$34,500、RTX 4090 NT$102,600 |
| 32GB | A14B fp8 常駐加更長的鏡頭,或單個 fp16 模型卸載著跑 | RTX 5090 NT$201,600、RTX 5090 D NT$147,800 |
| 48GB | A14B 兩個 fp8 模型加編碼器全部常駐,或 fp16 單模型不卸載 | RTX 4090 48GB 改裝 NT$119,100 |
| 96GB | A14B fp16 全部常駐,接近官方 80GB 口徑 | RTX PRO 6000 Blackwell |
16GB 到 24GB 是影片生成最值的一步:它是 A14B fp8 從「要卸載」到「不用卸載」的分界線。24GB 到 32GB 換來的是鏡頭長度和餘量,32GB 到 48GB 換來的是 fp16 精度,這兩步都貴得多。
顯示記憶體決定能做多大的鏡頭,算力決定等多久
影片擴散模型的每一步都是大矩陣乘法,等待時間主要由張量核心的 FP8 或 BF16 算力決定,顯示記憶體頻寬的影響遠小於大模型解碼。 這和跑大模型正好相反:大模型每個 token 只算一點點,瓶頸在讀權重的頻寬;影片模型每一步要對幾萬個時空 token 做注意力,瓶頸在算。
所以比影片卡要看算力那一列,而且要看精度對不對得上:
| 顯示卡 | 顯示記憶體 | BF16 稠密算力 | FP8 稠密算力 | 頻寬 | 標稱功耗 |
|---|---|---|---|---|---|
| RTX 5060 Ti 16GB | 16 GB | 95 TFLOPS | 190 TFLOPS | 448 GB/s | 180 W |
| RTX 4080 | 16 GB | 195 TFLOPS | 390 TFLOPS | 717 GB/s | 320 W |
| RTX 5070 Ti | 16 GB | 176 TFLOPS | 352 TFLOPS | 896 GB/s | 300 W |
| RTX 5080 | 16 GB | 225 TFLOPS | 450 TFLOPS | 960 GB/s | 360 W |
| RTX 3090 | 24 GB | 142 TFLOPS | 無 FP8 張量核心 | 936 GB/s | 350 W |
| RTX 4090 | 24 GB | 330 TFLOPS | 661 TFLOPS | 1008 GB/s | 450 W |
| RTX 5090 | 32 GB | 419 TFLOPS | 838 TFLOPS | 1792 GB/s | 575 W |
| RTX 4090 48GB 改裝 | 48 GB | 330 TFLOPS | 661 TFLOPS | 1008 GB/s | 450 W |
RTX 3090 那一格是關鍵。Ampere 架構沒有 FP8 張量核心,fp8_scaled 的權重能載入,但計算時要轉回 BF16 跑,實際算力就是 142 TFLOPS。RTX 5070 Ti 直接用 FP8 算,352 TFLOPS,是 3090 的兩倍半;RTX 4090 是 4.6 倍,RTX 5090 是 5.9 倍。在權重全部常駐、沒有卸載的前提下,同一個鏡頭的等待時間大致按這個比例縮短。本站沒有在測試機上實跑這幾張卡的 Wan 2.2,上面的倍數是算力比,不是實測;Wan 官方只給了「單張消費級顯示卡 9 分鐘內生成 5 秒 720P」這一個數字。
規格與當前價格的即時表:
| 型號 | 顯存 GB | 頻寬 GB/s | INT8 TOPS | 功耗 W | 閒魚 | 顯存單價 |
|---|---|---|---|---|---|---|
| 16 | 448 | 190 | 180 | NT$21,5377 筆掛單 | NT$1,346 | |
| 16 | 717 | 390 | 320 | NT$36,3506 筆掛單 | NT$2,272 | |
| 16 | 896 | 352 | 300 | NT$38,2899 筆掛單 | NT$2,393 | |
| 16 | 960 | 450 | 360 | NT$57,8218 筆掛單 | NT$3,614 | |
| 24 | 936 | 285 | 350 | NT$36,04611 筆掛單 | NT$1,502 | |
| 24 | 1,008 | 661 | 450 | NT$107,21515 筆掛單 | NT$4,467 | |
| 32 | 1,792 | 838 | 575 | NT$201,3215 筆掛單 | NT$6,291 | |
| 48 | 1,008 | 661 | 450 | NT$124,5383 筆掛單 | NT$2,594 |
表裡的 INT8 一列對 3090 顯示的是 INT8 TOPS,影片模型不用 INT8 推論,看 3090 請以上一張表的 BF16 為準。RTX 4080 是容易被忽略的一張:16GB、FP8 390 TFLOPS,閒魚中位數換算 NT$34,400 比 5070 Ti 還低,缺點是 2022 年的卡、用 12VHPWR 接頭、二手風險和 3090 同級。
16GB 升級:二手 RTX 3090 還是 RTX 5070 Ti?
報顯示記憶體不足選 RTX 3090,等太久選 RTX 5070 Ti,兩樣都要選 RTX 4090。 三張卡的即時對比:
| 項目 | ||||
|---|---|---|---|---|
| 顯存 | 24 GB GDDR6X | 16 GB GDDR7 | 24 GB GDDR6X | 32 GB GDDR7 |
| 頻寬 | 936 GB/s | 896 GB/s | 1,008 GB/s | 1,792 GB/s |
| BF16 | 142.3 TFLOPS | 175.8 TFLOPS | 330.3 TFLOPS | 419 TFLOPS |
| INT8 | 285 TOPS | 352 TOPS | 661 TOPS | 838 TOPS |
| 功耗 | 350 W | 300 W | 450 W | 575 W |
| 介面 | PCIe 4.0 x16 | PCIe 5.0 x16 | PCIe 4.0 x16 | PCIe 5.0 x16 |
| 發布日期 | 2020年9月24日 | 2025年2月20日 | 2022年10月12日 | 2025年1月30日 |
| 官方定價 | NT$47,220 | NT$23,594 | NT$50,370 | NT$62,970 |
| 閒魚二手 | NT$36,046 | NT$38,289 | NT$107,215 | NT$201,321 |
| 顯存單價 | NT$1,502 | NT$2,393 | NT$4,467 | NT$6,291 |
| 能跑的最大稠密檔位(4-bit、8K) | 32B | 14B | 32B | 32B |
按三種情況給答案,價格截至 2026 年 9 月 8 日:
- 現在用 16GB 卡,A14B 要卸載才能跑,出片慢是因為在搬運。 換 RTX 3090,NT$34,500。24GB 讓 fp8 模型不再卸載,等待時間的大頭直接消失,雖然它的算力還不如你手裡的 16GB Blackwell 卡。這一檔沒有第二個選擇:24GB 的下一張卡是 NT$102,600 的 4090。
- 現在用 16GB 卡,5B 或降過解析度的 A14B 跑得完,就是慢。 換 RTX 5070 Ti NT$35,800 或 RTX 5080 NT$51,500,前提是顯示記憶體夠用這件事不變。從 RTX 5060 Ti 16GB 升到 5070 Ti,FP8 算力 190 到 352;從 3090 換到 5070 Ti,是拿 8GB 顯示記憶體換兩倍半算力,只有確認工作流程裝得進 16GB 才划算。
- 既裝不下又嫌慢。 RTX 4090 NT$102,600,24GB 加 661 TFLOPS FP8,是 3090 價錢的三倍,算力 4.6 倍。RTX 5090 NT$201,600 再加 8GB 和 27% 算力,只有天天出 720P 長鏡頭才值。RTX 5090 D NT$147,800 有同樣的 32GB,但 AI 算力被韌體限到標準版七成,按 594 TFLOPS FP8 算仍然接近 4090。
跑大模型時這道題的答案不一樣:大模型看頻寬,3090 和 5070 Ti 幾乎打平,所以 24GB 幾乎總是贏,見 3090 與 5070 Ti 跑大模型。做影片的人不能照搬那篇的結論,因為 3090 缺 FP8 這件事在大模型單流推論裡幾乎不影響速度,在影片生成裡影響兩倍半。
48GB 改裝卡與專業卡值不值?
RTX 4090 48GB 改裝卡是 24GB 以上唯一便宜的選擇,適合明確要 fp16 精度或整套 A14B 常駐的人;其他人不需要。 截至 2026 年 9 月 8 日閒魚掛牌中位數換算 NT$119,100,只有 3 條掛單,比 24GB 原版貴約 NT$16,500。
它能做到的事:A14B 兩個 fp8 模型加文字編碼器全部常駐(28.6 + 6.7 GB),換模型不用重新載入;或者單個 fp16 模型 28.6 GB 不卸載地跑。它做不到的事:算力還是 4090 的 661 TFLOPS,不會因為顯示記憶體翻倍而更快。風險在改裝本身:多數是拆公版換渦輪雙槽 PCB 加 clamshell 顯示記憶體,沒有 NVIDIA 保固,渦輪噪音大,顯示記憶體顆粒和 PCB 品質看店家。買前讓賣家跑一段把 48GB 佔滿的顯示記憶體壓力測試並錄影,收貨再跑一次。
再往上是 RTX PRO 6000 Blackwell 的 96GB,能把 A14B fp16 兩個模型都放進去,接近 Wan 官方指令碼的 80GB 口徑。它的價格是 5090 的兩到三倍,屬於工作室採購,不在個人升級的討論範圍。
整機跟著換:電源供應器、接頭、機殼
換到 3090 以上的卡,電源供應器、接頭和機殼多半要一起換,這筆錢要算進升級成本。 影片生成是幾十分鐘到整晚的持續滿載,不是遊戲那種忽高忽低的負載,電源餘量要按標稱功耗加三成算:
| 顯示卡 | 標稱功耗 | 供電接頭 | 體積 | 建議電源供應器 |
|---|---|---|---|---|
| RTX 5070 Ti | 300 W | 16-pin 12V-2x6 | 多數雙槽 | 750 W |
| RTX 3090 | 350 W | 公版 12-pin,非公 2 到 3 個 8-pin | 公版三槽、313 mm | 850 W |
| RTX 4090 | 450 W | 16-pin 12VHPWR | 三到四槽 | 1000 W |
| RTX 5090 | 575 W | 16-pin 12V-2x6 | 三到四槽 | 1000 W 以上,ATX 3.1 |
3090 的 GDDR6X 顆粒在背板一側,長時間滿載溫度高,二手卡買前要求賣家跑 30 分鐘顯示記憶體壓力測試;機殼要給三槽卡留出進風空間,不然整晚排隊時會降頻。4090 和 5090 的 16-pin 接頭要插到底,線不要在插頭處硬彎。整機改造通常再花數千到近萬元新台幣,從 5070 Ti 升到 4090 的真實差價不是 NT$66,800,要再加這一筆。
用自己的工作量算等待值不值
只有每週反覆出現的等待才值得花錢買算力,偶爾跑一次的任務用卸載忍一忍。 算法很簡單:
- 記一週裡實際生成的鏡頭數和每段的等待時間,算出每週總等待小時數。
- 按算力比估算換卡後能省下的比例。3090 換 4090,等待大約變成原來的四分之一到五分之一;5060 Ti 16GB 換 5070 Ti,大約減半。
- 省下的小時數乘以你的時薪或這段時間能多接的活,和差價比。
例子:每天出 20 段 5 秒 720P,3090 上假設每段 8 分鐘,一天等 160 分鐘,一週 5 天約 13 小時。換 4090 按算力比降到 3 小時,一週省 10 小時,差價 NT$68,100,按每小時 450 元算約三個半月回本,加上整機改造接近四個月;每週只出 10 段的人,同樣的差價要三年。這裡的每段 8 分鐘是假設,用你自己的記錄替換。
還要分清單次延遲和整晚吞吐。改鏡頭時要一段一段看結果,單次延遲決定體驗,算力高的卡贏;整晚排隊出候選,只關心早上能收多少段,這時候顯示記憶體大、能不卸載地跑更大的批次反而更重要。
價格走勢與什麼時候買
四張卡的 30 天走勢即時更新,二手 3090 和 5070 Ti 的價差長期在一兩千元新台幣內,決定權在你的瓶頸而不是價格。 走勢:
| 型號 | 目前 | 30 天最低 | 30 天最高 | 30 天變化 | 30d 趨勢 |
|---|---|---|---|---|---|
| NT$36,046 | NT$35,582 | NT$37,685 | -1.9% | ||
| NT$38,289 | NT$36,519 | NT$41,201 | -4.4% | ||
| NT$107,215 | NT$103,002 | NT$110,024 | +4.1% | ||
| NT$201,321 | NT$163,164 | NT$210,685 | +23.4% |
閒魚最近 30 天的中位價,每 6 小時一個點;變化是目前中位價相對視窗內最早一點的漲跌。
3090 已經是 2020 年的卡,價格由存量決定,跌得很慢;5070 Ti 和 5080 是在售新卡,二手價跟著零售價走。4090 停產後二手價反而穩在 10 萬出頭,因為 24GB 加 FP8 這個組合在 5090 之下沒有替代品。想省錢的人盯 3090 的掛單數:樣本多的時候中位數更可信,見 方法說明 裡對掛牌價口徑的解釋。
買之前把理由寫成一句話:「我要讓 A14B fp8 在 720P 5 秒下不卸載」,或者「我要把每段 8 分鐘的等待壓到 3 分鐘」。說得出資源用在哪,就知道該買顯示記憶體還是算力;說不出來,先用現在的卡把第一段能用的影片跑出來,再回來看這張表。
價格為閒魚掛牌中位數換算新台幣,截至 2026 年 9 月 8 日;模型檔案大小與顯示記憶體門檻引自 ComfyUI、Wan 與 HunyuanVideo 官方文件;本站未在測試機上實跑 Wan 2.2,文中速度倍數為算力比例估算,不是實測。
常見問題
顯示記憶體大的顯示卡一定生成得更快嗎?
不一定。影片生成的等待時間主要由算力決定,顯示記憶體決定的是能不能不卸載地跑完。RTX 3090 有 24GB,但沒有 FP8 張量核心,BF16 只有 142 TFLOPS;RTX 5070 Ti 只有 16GB,FP8 卻有 352 TFLOPS。同一個能裝進 16GB 的工作流程,5070 Ti 更快;裝不進 16GB 的工作流程,3090 才跑得完。
16GB 顯示記憶體能跑 Wan 2.2 的 14B 版本嗎?
能出片,靠 ComfyUI 的卸載。A14B 的 fp8 模型單個 14.3 GB,高噪和低噪兩個模型輪流載入,加上文字編碼器 6.7 GB,16GB 放不下全部,ComfyUI 會把放不下的部分留在系統記憶體分塊搬運。代價是每一步多等搬運時間,而且系統記憶體要 32GB 以上。想不卸載地跑,要 24GB。
二手 RTX 3090 和 RTX 5070 Ti 價格差不多,做影片選哪張?
看你現在卡在哪。工作流程報顯示記憶體不足、必須降解析度或減影格才能跑完,選 3090,多出的 8GB 直接解決問題。工作流程能跑完但每段要等很久,選 5070 Ti,FP8 算力是 3090 BF16 的兩倍以上,同樣的鏡頭等待時間大約減半。兩個問題都有,兩張卡都不夠,要看 4090。
RTX 4090 48GB 改裝卡值得買嗎?
只適合明確需要 24GB 以上、又不想花 RTX PRO 6000 那個價錢的人。截至 2026 年 9 月 8 日閒魚掛牌中位數換算 NT$119,100,只比 24GB 原版貴約 NT$16,500,能把 A14B 兩個 fp8 模型和文字編碼器全部常駐。風險是沒有官方保固、渦輪散熱噪音大、改裝品質參差,買前要求賣家跑滿 48GB 的顯示記憶體壓力測試。
換顯示卡以後電源供應器和機殼要跟著換嗎?
多數情況要。RTX 3090 標稱 350W、公版三槽 313 mm;RTX 4090 450W、用 12VHPWR 接頭;RTX 5090 575W,建議 1000W 以上的 ATX 3.1 電源供應器。影片生成是幾十分鐘到整晚的持續滿載,不是遊戲那種波動負載,電源餘量按標稱功耗加三成算,機殼要能給三槽卡留出進風空間。