L40S 價格與中古行情:能部署哪些大型語言模型?
到價提醒
閒魚價格到達你設定的價位時,寄信通知你。
L40S 有 48GB GDDR6 顯存,頻寬 864 GB/s。暫無價資料。4-bit 量化、8K 上下文下最大能裝約 79B 參數的稠密模型,預估 13 tokens/s。
閒魚
L40S 價格走勢
閒魚
購買連結可能含聯盟標記,不影響你支付的價格。
L40S 完整規格
- 顯存48 GB · GDDR6
- 頻寬864 GB/s
- FP16 / BF16362.1 TFLOPS
- FP8 / INT8733 / 733 TOPS
- 位寬
- 384-bit
- 架構
- Ada Lovelace (AD102)
- 核心
- 18,176
- 張量核心
- 568
- 生態
- CUDA
- 介面
- PCIe 4.0 x16
- NVLink
- 不支援
- 功耗
- 350 W
- 供電介面
- 16-pin
- 槽位
- 2
- 長度
- 267 mm
- 類型
- 資料中心
- 發布日期
- 2023年8月8日
L40S 能跑哪些模型?
單張 L40S 能跑哪些 50B 參數以內的模型,只列 2026 年起發布的版本
| 模型 | 大小 | 能否執行 | 速度 t/s | 最大上下文 |
|---|---|---|---|---|
| 3.8 GB | 能跑 | 144.9 | 128K | |
| 4.1 GB | 能跑 | 134 | 256K | |
| 4.7 GB | 能跑 | 116.8 | 256K | |
| 10.5 GB | 能跑 | 147.4 | 256K | |
| 11.8 GB | 能跑 | 50.5 | 256K | |
| 9.8 GB | 能跑 | 60.1 | 256K | |
| 11.9 GB | 能跑 | 160.9 | 198K | |
| 11.8 GB | 能跑 | 48.7 | 256K | |
| 12.3 GB | 能跑 | 174 | 256K |
| 模型 | 大小 | 能否執行 | 速度 t/s | 最大上下文 |
|---|---|---|---|---|
| 5 GB | 能跑 | 113.7 | 128K | |
| 5.7 GB | 能跑 | 100.2 | 256K | |
| 7.1 GB | 能跑 | 81 | 256K | |
| 16.9 GB | 能跑 | 120.4 | 256K | |
| 16.8 GB | 能跑 | 36.1 | 256K | |
| 16.5 GB | 能跑 | 36.8 | 256K | |
| 18.3 GB | 能跑 | 138.4 | 198K | |
| 18.3 GB | 能跑 | 32.5 | 256K | |
| 22.1 GB | 能跑 | 142.2 | 256K |
| 模型 | 大小 | 能否執行 | 速度 t/s | 最大上下文 |
|---|---|---|---|---|
| 8.2 GB | 能跑 | 72.3 | 128K | |
| 9.5 GB | 能跑 | 62.6 | 256K | |
| 12.7 GB | 能跑 | 47.3 | 256K | |
| 26.9 GB | 能跑 | 93.6 | 256K | |
| 28.6 GB | 能跑 | 21.6 | 256K | |
| 29 GB | 能跑 | 21.3 | 256K | |
| 31.8 GB | 能跑 | 107 | 198K | |
| 32.6 GB | 能跑 | 18.8 | 202K | |
| 36.9 GB | 能跑 | 111.4 | 256K |
能跑權重、KV 快取和執行開銷都裝得進顯存,速度按顯存頻寬估算。
需卸載到記憶體僅 MoE 模型:專家權重放進記憶體,速度按記憶體頻寬 70 GB/s 估算。
跑不了這一檔量化下單卡放不下,借記憶體也不行。
雙卡、四卡、八卡 L40S 能跑哪些大型語言模型?
2026 年起發布的 50B 以上模型,按 vLLM 張量並行、32K 上下文要幾張卡才裝得下
| 模型 | 大小 | 需要幾張 | 總價 | 總顯示記憶體 | 速度 t/s | 總功耗 |
|---|---|---|---|---|---|---|
| 78.9 GB | 2 張 | 暫無 | 96 GB | 112.9 | 700 W | |
| 96.8 GB | 4 張 | 暫無 | 192 GB | 90 | 1,400 W | |
| 107.2 GB | 4 張 | 暫無 | 192 GB | 41.2 | 1,400 W | |
| 108.7 GB | 4 張 | 暫無 | 192 GB | 71.9 | 1,400 W | |
| 253.9 GB | 8 張 | 暫無 | 384 GB | 36 | 2,800 W | |
| 286.1 GB估 | 8 張 | 暫無 | 384 GB | 27 | 2,800 W | |
| 339.5 GB | 8 張 | 暫無 | 384 GB | 43.7 | 2,800 W |
| 模型 | 大小 | 需要幾張 | 總價 | 總顯示記憶體 | 速度 t/s | 總功耗 |
|---|---|---|---|---|---|---|
| 111.3 GB | 4 張 | 暫無 | 192 GB | 94.4 | 1,400 W | |
| 155.1 GB | 4 張 | 暫無 | 192 GB | 65.3 | 1,400 W | |
| 182.2 GB | 8 張 | 暫無 | 384 GB | 30.6 | 2,800 W | |
| 199.7 GB | 8 張 | 暫無 | 384 GB | 45.5 | 2,800 W |
| 模型 | 大小 | 需要幾張 | 總價 | 總顯示記憶體 | 速度 t/s | 總功耗 |
|---|---|---|---|---|---|---|
| 161.9 GB | 4 張 | 暫無 | 192 GB | 63.3 | 1,400 W | |
| 188.2 GB | 8 張 | 暫無 | 384 GB | 67.9 | 2,800 W | |
| 317.7 GB | 8 張 | 暫無 | 384 GB | 20.9 | 2,800 W | |
| 341 GB | 8 張 | 暫無 | 384 GB | 29 | 2,800 W |
張數取 1 / 2 / 4 / 8 張,每張按 90% 顯存計;速度按單卡頻寬估算,總價只算顯示卡。不支援 NVLink,卡間走 PCIe。能否實際執行還要看 vLLM 是否支援。
L40S 租用價格
L40S 隨需租用每小時 NT$25.1 起(RunPod),每天用 8 小時約 NT$6,115/月。買一張(eBay 中位價 NT$285,477)每天用 4、8、24 小時,分別約 8.1 年、4.1 年、1.4 年回本。
| 方案 | 價格 | 每天 4 小時 | 每天 8 小時 | 每天 24 小時 | 去查看 |
|---|---|---|---|---|---|
| NT$25.1/小時 | NT$3,058/月 | NT$6,115/月 | NT$18,346/月 | 去租 | |
| NT$25.5/小時 | NT$3,102/月 | NT$6,204/月 | NT$18,612/月 | 去租 | |
| NT$285,477 | 約 8.1 年回本電費 NT$122/月 | 約 4.1 年回本電費 NT$244/月 | 約 1.4 年回本電費 NT$733/月 | 去買 |
回本依台灣住宅平均電價(每度 NT$2.87)和 350 W 額定功耗估算,不計殘值和整機其他部分。
其他市場價格
購買連結可能含聯盟標記,不影響你支付的價格。
常見問題
L40S 能跑多大的模型?
單張 L40S 有 48GB GDDR6 顯示記憶體,在 4-bit 量化、8K 上下文下最大能裝約 79B 參數的稠密模型,8-bit 下約 43B。
L40S 能跑 70B 模型嗎?
能。在 4-bit 量化、8K 上下文下,70B 稠密模型約需 43GB,L40S 的 48GB 裝得下。
L40S 適合跑哪些大型語言模型?
2026 年發布的模型中,4-bit 下能完整放進顯示記憶體的最大稠密模型是 Gemma 4 31B,預估 32.5 tokens/s。MoE 模型中 Qwen3.6 35B A3B 最快,約 142.2 tokens/s。完整列表見上方「能跑哪些模型」表格。
L40S 跑大型語言模型每秒多少 token?
按顯示記憶體頻寬估算,4-bit、8K 上下文下:8B 稠密模型約 109.1 tokens/s、14B 稠密模型約 66 tokens/s、32B 稠密模型約 30.7 tokens/s、70B 稠密模型約 14.5 tokens/s。MoE 模型每個 token 只讀取啟用參數,會快很多。實測通常在估算值的 70%–100%。
雙卡 L40S 能跑哪些大型語言模型?
按 vLLM 張量並行、4-bit、32K 上下文,兩張 L40S 裝不下 2026 年發布的 50B 以上模型。4-bit、32K 上下文下最少要 4 張,能跑 Qwen3.8 Flash Next、DeepSeek V4 Flash。
L40S 多少錢?
截至 2026年9月29日,eBay 中位價 NT$285,477(18 筆掛單)。取自平台掛單價的中位數,每 6 小時更新。
L40S 租一小時多少錢?
截至 2026年9月29日,RunPod 每小時 NT$25.1、Vast.ai 每小時 NT$25.5。皆為單卡隨需價格,不含儲存空間和流量。
每天用 8 小時,L40S 買還是租划算?
以 eBay 中位價 NT$285,477、電價每度 NT$2.87 計算,每天用 8 小時,買卡約 4.1 年回本(對比 RunPod 每小時 NT$25.1)。打算用超過 4.1 年就買,用不到就租。
L40S 和 RTX 6000 Ada 跑大型語言模型怎麼選?
RTX 6000 Ada 有 48GB 顯示記憶體、960 GB/s 頻寬,L40S 是 48GB、864 GB/s。跑 70B 稠密模型(4-bit)預估 L40S 約 14.5 tokens/s,RTX 6000 Ada 約 16.1 tokens/s。