先给结论:只按钱算,本地部署赢不了 API。截至 2026 年 9 月 5 日,一台二手 RTX 3090 主机三年总成本约一万三千元;这笔钱在 DeepSeek V4 Flash 的 API 上能买九十多亿 token,一张 3090 三年满负荷也产不出这么多。对标 Claude Sonnet 5、GPT-5.6 terra 这类每百万输出 token 十美元上下的前沿模型,盈亏平衡点在日均 30 到 50 万 token,重度用户能达到。买卡的理由从来是隐私、离线、微调和已有的游戏需求,本文把三笔账逐项算给你看。

示意图:墙插上的电量计,粗电源线接到虚化的机箱
示意图:墙插上的电量计,粗电源线接到虚化的机箱

本地部署的成本项有哪些?

四项:显卡、整机其余部分、电费、折旧,其中显卡占六成以上。

  • 显卡:二手价见站内实时数据,本文以 RTX 3090(入门 24GB)、RTX 4090(主流)、RTX PRO 6000 Blackwell(96GB 高端)三档为例,另列 Mac Studio M4 Max 128GB 作整机对照。
  • 整机其余部分:CPU、主板、32GB 内存、850W 电源、机箱,2026 年一套约 ¥4,700($700)。跑 MoE 专家卸载要 128GB 内存,再加 ¥2,000 左右。已有台式机的话这项为零。
  • 电费:显卡标称功耗 × 实际负载系数 × 使用时长 × 电价。推理负载通常只到标称的 50% 到 70%,我们按 60%、每天 8 小时、居民电价算。
  • 折旧:显卡三年后大约还值三到四成,3090 这种老卡跌得慢。下表没有扣残值,实际成本比表里低一到两成。

三套配置的三年总成本

入门 3090 主机三年约一万三,4090 主机约两万九,RTX PRO 6000 主机超过十三万。 显卡价格实时取当前二手中位价:

型号闲鱼整机其余部分3 年电费3 年总计折合每天
GeForce RTX 3090¥7,999¥4,714¥1,1041,840 kWh¥13,817¥13
GeForce RTX 4090¥23,500¥4,714¥1,4192,365 kWh¥29,633¥27
RTX PRO 6000 Blackwell¥122,000¥4,714¥1,8923,154 kWh¥128,606¥117
Mac Studio M4 Max 128GB¥38,500¥0¥1,5142,523 kWh¥40,014¥37

电价按 ¥1/kWh,每天 8 小时、按显卡标称功耗的 60% 计。「整机其余部分」是 CPU、主板、内存、电源、机箱一口价 ¥4,714;统一内存整机本身就是完整设备,记 0。不计残值。

Mac Studio 是整机,「整机其余部分」记零;它 480W 的标称功耗实际跑推理只有一百多瓦,电费一项被高估,但也改变不了它在这张表里的位置。

同等用量走 API 要花多少?

API 的价差比硬件大得多:同样一百万输出 token,DeepSeek V4 Flash 收 $0.28,Claude Sonnet 5 收 $10,差 35 倍。 2026 年 9 月各家官网标价(每百万 token,输入 / 输出):

模型 输入 输出 对应的本地档位
DeepSeek V4 Flash $0.14 $0.28 32B 稠密或 30B 级 MoE
DeepSeek V4 Pro $0.435 $0.87 无家用对应
GPT-5.6 luna $0.20 $1.20 32B 级
GPT-5.6 terra $2.00 $12.00 无家用对应
Claude Sonnet 5 $2.00 $10.00 无家用对应

按输入输出各半估算,三档典型用量的三年 API 花费:

日均 token 三年总量 DeepSeek V4 Flash GPT-5.6 luna Claude Sonnet 5
5 万(轻度个人) 5,500 万 $12 $39 $330
30 万(重度个人 / 小团队) 3.3 亿 $69 $231 $1,970
100 万(批处理 / 产品接入) 11 亿 $231 $770 $6,570

盈亏平衡点在哪?

盈亏平衡日均 token 数 = 本地三年总成本 ÷ API 单价 ÷ 1,095 天。 以 3090 主机三年 $1,950 计:

  • 对 DeepSeek V4 Flash(均价 $0.21 / 百万):需要日均 850 万 token。一张 3090 跑 32B 4-bit 约 32 tokens/s,每天 8 小时上限 90 万 token,永远追不上
  • 对 GPT-5.6 luna(均价 $0.70 / 百万):需要日均 250 万 token,同样超出单卡产能。
  • 对 Claude Sonnet 5(均价 $6 / 百万):需要日均 30 万 token,8 小时跑 3 小时就够,重度用户能达到

但注意第三条的前提:你愿意用 32B 级的本地模型替代 Sonnet 5。多数场景下这是能力降级,省下的钱要用返工时间去换。

什么情况下本地一定划算?

四种情况下不用算账,直接买:数据不能出本机、需要离线、要微调、要跑大批量。

  1. 数据不能出本机:法务文书、病历、未公开代码、财务数据。合规成本一次就超过显卡钱。
  2. 离线:车间、船上、无外网的办公环境。
  3. 微调:LoRA 微调一个 8B 到 14B 模型在 24GB 卡上几小时完成,API 微调按 token 收费且不给权重。
  4. 大批量:几十万条文档分类、嵌入、摘要,一张 3090 一晚上跑完,API 的账单和限速都会变成问题。
  5. 本来就要买游戏卡:显卡钱已经花了,边际成本只剩电费,这时本地推理接近免费。

什么情况下别买卡?

日均一万 token 以内的个人使用、只用最强模型、以及没有台式机的人,都不该为大模型买卡。

  • 每天聊几十轮、写几封邮件,全年 API 花费不到一张显卡电费。
  • 要的是 Sonnet 5、V4 Pro 这一档的能力,本地没有对应物,买卡也解决不了。
  • 没有台式机:整机加显卡的一次性投入要翻倍,而 Mac Studio 的性价比见 Mac 统一内存 vs 独立显卡
  • 预算有限又确定要买:先看每个显存档位最省钱的显卡