收录显卡56价格追踪27 天近 24h 价格数据34,228 条24h 降价最多A100 80GB PCIe-20.0%24h 涨价最多RTX PRO 5000 48GB+17.5%更新于
¥ CNY
简体中文

L40S 价格与二手行情:能部署哪些大模型?

L40S 有 48GB GDDR6 显存,带宽 864 GB/s。暂无价数据。4-bit 量化、8K 上下文下最大能装约 79B 参数的稠密模型,预估 13 tokens/s。

L40S 价格走势

价格更新于 —

数据不足,暂无法生成走势

积累足够的有效报价后,将展示中位价走势。

购买链接可能含联盟标记,不影响你支付的价格。

L40S 完整规格

  • 显存48 GB · GDDR6
  • 带宽864 GB/s
  • FP16 / BF16362.1 TFLOPS
  • FP8 / INT8733 / 733 TOPS
位宽
384-bit
架构
Ada Lovelace (AD102)
核心
18,176
张量核心
568
生态
CUDA
接口
PCIe 4.0 x16
NVLink
不支持
功耗
350 W
供电接口
16-pin
槽位
2
长度
267 mm
类型
数据中心
发布日期
2023年8月8日

L40S 能跑哪些模型?

单张 L40S 能跑哪些 50B 参数以内的模型,只列 2026 年起发布的版本

模型大小能否运行速度 t/s最大上下文
Gemma 4 E4B8B5 GB能跑113.7128K
Qwen3.5 9B9.7B5.7 GB能跑100.2256K
Gemma 4 12B12B7.1 GB能跑81256K
Gemma 4 26B A4B25.2B(激活 3.8B)16.9 GB能跑120.4256K
Qwen3.6 27B27.8B16.8 GB能跑36.1256K
Qwen3.8 27B27.8B16.5 GB能跑36.8256K
GLM 4.7 Flash30B(激活 3B)18.3 GB能跑138.4198K
Gemma 4 31B30.7B18.3 GB能跑32.5256K
Qwen3.6 35B A3B36B(激活 3B)22.1 GB能跑142.2256K

能跑权重、KV 缓存和运行开销都装得进显存,速度按显存带宽估算。

需卸载到内存仅 MoE 模型:专家权重放进内存,速度按内存带宽 70 GB/s 估算。

跑不了这一档量化下单卡装不下,借内存也不行。

双卡、四卡、八卡 L40S 能跑哪些大模型?

2026 年起发布的 50B 以上模型,按 vLLM 张量并行、32K 上下文要几张卡才装得下

模型大小需要几张总价总显存速度 t/s总功耗
Qwen3.8 Flash Next176B(激活 6B)111.3 GB4 张暂无192 GB94.41,400 W
DeepSeek V4 Flash284B(激活 13B)155.1 GB4 张暂无192 GB65.31,400 W
Hy3295B(激活 21B)182.2 GB8 张暂无384 GB30.62,800 W
GLM 5.3 Flash320B(激活 18B)199.7 GB8 张暂无384 GB45.52,800 W

张数取 1 / 2 / 4 / 8 张,每张按 90% 显存计;速度按单卡带宽估算,总价只算显卡。不支持 NVLink,卡间走 PCIe。能否实际运行还要看 vLLM 是否支持。

L40S 租用价格

L40S 按需租用每小时 ¥5.3 起(RunPod),每天用 8 小时约 ¥1,292/月。买一张(eBay 中位价 ¥60,319)每天用 4、8、24 小时,分别约 8.1 年、4.1 年、1.4 年回本。

方案价格每天 4 小时每天 8 小时每天 24 小时去查看
RunPod租用46分钟前更新¥5.3/小时¥646/月¥1,292/月¥3,876/月去租
Vast.ai租用46分钟前更新¥5.4/小时¥661/月¥1,323/月¥3,969/月去租
eBay3小时前更新¥60,319约 8.1 年回本电费 ¥28/月约 4.1 年回本电费 ¥56/月约 1.4 年回本电费 ¥169/月去买

回本按中国大陆居民电价(每度 ¥0.66)和 350 W 额定功耗估算,不计残值和整机其他部分。

其他市场价格

eBay · 美国
¥60,319
18 条挂单
去查看
Amazon.jp · 日本
暂无
暂无挂单
去查看

购买链接可能含联盟标记,不影响你支付的价格。

常见问题

L40S 能跑多大的模型?

单张 L40S 有 48GB GDDR6 显存,在 4-bit 量化、8K 上下文下最大能装约 79B 参数的稠密模型,8-bit 下约 43B。

L40S 能跑 70B 模型吗?

能。在 4-bit 量化、8K 上下文下,70B 稠密模型约需 43GB,L40S 的 48GB 装得下。

L40S 适合跑哪些大模型?

2026 年发布的模型里,4-bit 下能整个放进显存的最大稠密模型是 Gemma 4 31B,预估 32.5 tokens/s。MoE 模型里 Qwen3.6 35B A3B 最快,约 142.2 tokens/s。完整列表见上方「能跑哪些模型」表。

L40S 跑大模型每秒多少 token?

按显存带宽估算,4-bit、8K 上下文下:8B 稠密模型约 109.1 tokens/s、14B 稠密模型约 66 tokens/s、32B 稠密模型约 30.7 tokens/s、70B 稠密模型约 14.5 tokens/s。MoE 模型每个 token 只读激活参数,会快很多。实测通常在估算值的 70%–100%。

双卡 L40S 能跑哪些大模型?

按 vLLM 张量并行、4-bit、32K 上下文,两张 L40S 装不下 2026 年发布的 50B 以上模型。4-bit、32K 上下文下最少要 4 张,能跑 Qwen3.8 Flash Next、DeepSeek V4 Flash。

L40S 多少钱?

截至 2026年9月29日,eBay 中位价 ¥60,319(18 条挂单)。取自平台挂单价的中位数,每 6 小时更新。

L40S 租一小时多少钱?

截至 2026年9月29日,RunPod 每小时 ¥5.3、Vast.ai 每小时 ¥5.4。都是单卡按需价,不含存储和流量。

每天用 8 小时,L40S 买还是租划算?

按 eBay 中位价 ¥60,319、电价每度 ¥0.66 算,每天用 8 小时,买卡约 4.1 年回本(对比 RunPod 每小时 ¥5.3)。打算用超过 4.1 年就买,用不到就租。

L40S 和 RTX 6000 Ada 跑大模型怎么选?

RTX 6000 Ada 有 48GB 显存、960 GB/s 带宽,L40S 是 48GB、864 GB/s。跑 70B 稠密模型(4-bit)预估 L40S 约 14.5 tokens/s,RTX 6000 Ada 约 16.1 tokens/s。