收录显卡56价格追踪27 天近 24h 价格数据34,228 条24h 降价最多GeForce RTX 4060 Ti 16GB-16.4%24h 涨价最多Radeon RX 7800 XT+19.1%更新于
¥ CNY
简体中文

Tesla P40 价格与二手行情:能部署哪些大模型?

Tesla P40 有 24GB GDDR5 显存,带宽 347 GB/s。暂无价数据。4-bit 量化、8K 上下文下最大能装约 37B 参数的稠密模型,预估 11 tokens/s。

Tesla P40 价格走势

价格更新于 —

数据不足,暂无法生成走势

积累足够的有效报价后,将展示中位价走势。

购买链接可能含联盟标记,不影响你支付的价格。

Tesla P40 完整规格

  • 显存24 GB · GDDR5
  • 带宽347 GB/s
  • INT847 TOPS
位宽
384-bit
架构
Pascal (GP102)
核心
3,840
生态
CUDA
接口
PCIe 3.0 x16
NVLink
不支持
功耗
250 W
供电接口
8-pin CPU (EPS-12V)
槽位
2
长度
267 mm
类型
数据中心
发布日期
2016年9月13日

Tesla P40 能跑哪些模型?

单张 Tesla P40 能跑哪些 50B 参数以内的模型,只列 2026 年起发布的版本

模型大小能否运行速度 t/s最大上下文
Gemma 4 E4B8B5 GB能跑48.3128K
Qwen3.5 9B9.7B5.7 GB能跑42.3256K
Gemma 4 12B12B7.1 GB能跑33.9256K
Gemma 4 26B A4B25.2B(激活 3.8B)16.9 GB能跑68256K
Qwen3.6 27B27.8B16.8 GB能跑14.8117K
Qwen3.8 27B27.8B16.5 GB能跑15122K
GLM 4.7 Flash30B(激活 3B)18.3 GB能跑83.2115K
Gemma 4 31B30.7B18.3 GB能跑13.366K
Qwen3.6 35B A3B36B(激活 3B)22.1 GB能跑86.6123K

能跑权重、KV 缓存和运行开销都装得进显存,速度按显存带宽估算。

需卸载到内存仅 MoE 模型:专家权重放进内存,速度按内存带宽 70 GB/s 估算。

跑不了这一档量化下单卡装不下,借内存也不行。

双卡、四卡、八卡 Tesla P40 能跑哪些大模型?

2026 年起发布的 50B 以上模型,按 vLLM 张量并行、32K 上下文要几张卡才装得下

模型大小需要几张总价总显存速度 t/s总功耗
Qwen3.8 Flash Next176B(激活 6B)111.3 GB8 张暂无192 GB492,000 W
DeepSeek V4 Flash284B(激活 13B)155.1 GB8 张暂无192 GB31.12,000 W

张数取 1 / 2 / 4 / 8 张,每张按 90% 显存计;速度按单卡带宽估算,总价只算显卡。不支持 NVLink,卡间走 PCIe。能否实际运行还要看 vLLM 是否支持。

Tesla P40 租用价格

Tesla P40 在优云智算按需租用每小时 ¥0.38,每天用 8 小时约 ¥92/月。买一张(eBay 中位价 ¥2,668)每天用 4、8、24 小时,分别约 8.5 年、4.3 年、1.4 年回本。

方案价格每天 4 小时每天 8 小时每天 24 小时去查看
优云智算租用37分钟前更新¥0.38/小时¥46/月¥92/月¥277/月去租
eBay2小时前更新¥2,668约 8.5 年回本电费 ¥20/月约 4.3 年回本电费 ¥40/月约 1.4 年回本电费 ¥120/月去买

回本按中国大陆居民电价(每度 ¥0.66)和 250 W 额定功耗估算,不计残值和整机其他部分。

其他市场价格

eBay · 美国
¥2,668
16 条挂单
去查看
闲鱼 · 中国大陆
¥1,200
13 条挂单
去查看

购买链接可能含联盟标记,不影响你支付的价格。

常见问题

Tesla P40 能跑多大的模型?

单张 Tesla P40 有 24GB GDDR5 显存,在 4-bit 量化、8K 上下文下最大能装约 37B 参数的稠密模型,8-bit 下约 20B。

Tesla P40 能跑 70B 模型吗?

单卡跑不了。在 4-bit 量化、8K 上下文下,70B 稠密模型约需 43GB,超过 Tesla P40 的 24GB。用 llama.cpp 按层拆到 2 张卡上(合计 48GB)就能跑。

Tesla P40 适合跑哪些大模型?

2026 年发布的模型里,4-bit 下能整个放进显存的最大稠密模型是 Gemma 4 31B,预估 13.3 tokens/s。MoE 模型里 Qwen3.6 35B A3B 最快,约 86.6 tokens/s。完整列表见上方「能跑哪些模型」表。

Tesla P40 跑大模型每秒多少 token?

按显存带宽估算,4-bit、8K 上下文下:8B 稠密模型约 46.2 tokens/s、14B 稠密模型约 27.4 tokens/s、32B 稠密模型约 12.5 tokens/s。MoE 模型每个 token 只读激活参数,会快很多。实测通常在估算值的 70%–100%。

双卡 Tesla P40 能跑哪些大模型?

按 vLLM 张量并行、4-bit、32K 上下文,两张 Tesla P40 装不下 2026 年发布的 50B 以上模型。4-bit、32K 上下文下最少要 8 张,能跑 Qwen3.8 Flash Next、DeepSeek V4 Flash。

Tesla P40 多少钱?

截至 2026年9月29日,eBay 中位价 ¥2,668(16 条挂单)、闲鱼中位价 ¥1,200(13 条挂单)。取自平台挂单价的中位数,每 6 小时更新。

Tesla P40 租一小时多少钱?

截至 2026年9月29日,优云智算每小时 ¥0.38。都是单卡按需价,不含存储和流量。

每天用 8 小时,Tesla P40 买还是租划算?

按 eBay 中位价 ¥2,668、电价每度 ¥0.66 算,每天用 8 小时,买卡约 4.3 年回本(对比优云智算每小时 ¥0.38)。打算用超过 4.3 年就买,用不到就租。

Tesla P40 和 Arc Pro B60 跑大模型怎么选?

Arc Pro B60 有 24GB 显存、456 GB/s 带宽,Tesla P40 是 24GB、347 GB/s。跑 32B 稠密模型(4-bit)预估 Tesla P40 约 12.5 tokens/s,Arc Pro B60 约 10.6 tokens/s。