本地部署大模型要花多少錢?硬體、電費和 API 三年總賬(2026)

譯自简体中文版 · 閱讀原文

先給結論:只按錢算,本地部署贏不了 API。截至 2026 年 9 月 5 日,一臺二手 RTX 3090 主機三年總成本約一萬三千元;這筆錢在 DeepSeek V4 Flash 的 API 上能買九十多億 token,一張 3090 三年滿負荷也產不出這麼多。對標 Claude Sonnet 5、GPT-5.6 terra 這類每百萬輸出 token 十美元上下的前沿模型,盈虧平衡點在日均 30 到 50 萬 token,重度使用者能達到。買卡的理由從來是隱私、離線、微調和已有的遊戲需求,本文把三筆賬逐項算給你看。

示意圖:傍晚的家庭辦公桌,桌下主機亮著燈,牆插上接著電量計
示意圖 · 傍晚的家庭辦公桌,桌下主機亮著燈,牆插上接著電量計

本文提及的固定價格均以中國二手市場人民幣(CNY)為基準;動態表格則依頁面所選幣別顯示。

示意圖:牆插上的電量計,粗電源線接到虛化的機箱
示意圖:牆插上的電量計,粗電源線接到虛化的機箱

本地部署的成本項有哪些?

四項:顯示卡、整機其餘部分、電費、折舊,其中顯示卡佔六成以上。

  • 顯示卡:二手價格見站內即時資料,本文以 RTX 3090(入門 24GB)、RTX 4090(主流)、RTX PRO 6000 Blackwell(96GB 高階)三檔為例,另列 Mac Studio M4 Max 128GB 作整機對照。
  • 整機其餘部分:CPU、主機板、32GB 記憶體、850W 電源、機箱,2026 年一套約 ¥4,700($700)。跑 MoE 專家卸載要 128GB 記憶體,再加 ¥2,000 左右。已有桌上型電腦的話這項為零。
  • 電費:顯示卡標稱功耗 × 實際負載係數 × 使用時長 × 電價。推論負載通常只到標稱的 50% 到 70%,我們按 60%、每天 8 小時、居民電價算。
  • 折舊:顯示卡三年後大約還值三到四成,3090 這種老卡跌得慢。下表沒有扣殘值,實際成本比表裡低一到兩成。

三套配置的三年總成本

入門 3090 主機三年約一萬三,4090 主機約兩萬九,RTX PRO 6000 主機超過十三萬。 顯示卡價格即時取當前二手中位價:

型號閒魚整機其餘部分3 年電費3 年總計折合每天
GeForce RTX 3090NT$37,579NT$22,147NT$7,3581,840 kWhNT$67,085NT$61
GeForce RTX 4090NT$108,994NT$22,147NT$9,4612,365 kWhNT$140,602NT$128
RTX PRO 6000 BlackwellNT$573,159NT$22,147NT$12,6143,154 kWhNT$607,920NT$555
Mac Studio M4 Max 128GBNT$178,055NT$0NT$10,0922,523 kWhNT$188,147NT$172

電價按 NT$4/kWh,每天 8 小時、按顯示卡標稱功耗的 60% 計。「整機其餘部分」是 CPU、主機板、記憶體、電源、機殼一口價 NT$22,147;統一記憶體整機本身就是完整設備,記 0。不計殘值。

Mac Studio 是整機,「整機其餘部分」記零;它 480W 的標稱功耗實際跑推論只有一百多瓦,電費一項被高估,但也改變不了它在這張表裡的位置。

同等用量走 API 要花多少?

API 的價差比硬體大得多:同樣一百萬輸出 token,DeepSeek V4 Flash 收 $0.28,Claude Sonnet 5 收 $10,差 35 倍。 2026 年 9 月各家官網標價(每百萬 token,輸入 / 輸出):

模型 輸入 輸出 對應的本地檔位
DeepSeek V4 Flash $0.14 $0.28 32B 稠密或 30B 級 MoE
DeepSeek V4 Pro $0.435 $0.87 無家用對應
GPT-5.6 luna $0.20 $1.20 32B 級
GPT-5.6 terra $2.00 $12.00 無家用對應
Claude Sonnet 5 $2.00 $10.00 無家用對應

按輸入輸出各半估算,三檔典型用量的三年 API 花費:

日均 token 三年總量 DeepSeek V4 Flash GPT-5.6 luna Claude Sonnet 5
5 萬(輕度個人) 5,500 萬 $12 $39 $330
30 萬(重度個人 / 小團隊) 3.3 億 $69 $231 $1,970
100 萬(批處理 / 產品接入) 11 億 $231 $770 $6,570

盈虧平衡點在哪?

盈虧平衡日均 token 數 = 本地三年總成本 ÷ API 單價 ÷ 1,095 天。 以 3090 主機三年 $1,950 計:

  • 對 DeepSeek V4 Flash(均價 $0.21 / 百萬):需要日均 850 萬 token。一張 3090 跑 32B 4-bit 約 32 tokens/s,每天 8 小時上限 90 萬 token,永遠追不上
  • 對 GPT-5.6 luna(均價 $0.70 / 百萬):需要日均 250 萬 token,同樣超出單卡產能。
  • 對 Claude Sonnet 5(均價 $6 / 百萬):需要日均 30 萬 token,8 小時跑 3 小時就夠,重度使用者能達到

但注意第三條的前提:你願意用 32B 級的本地模型替代 Sonnet 5。多數場景下這是能力降級,省下的錢要用返工時間去換。

什麼情況下本地一定划算?

四種情況下不用算賬,直接買:資料不能出本機、需要離線、要微調、要跑大批次。

  1. 資料不能出本機:法務文書、病歷、未公開程式碼、財務資料。合規成本一次就超過顯示卡錢。
  2. 離線:車間、船上、無外網的辦公環境。
  3. 微調:LoRA 微調一個 8B 到 14B 模型在 24GB 卡上幾小時完成,API 微調按 token 收費且不給權重。
  4. 大批次:幾十萬條文件分類、嵌入、摘要,一張 3090 一晚上跑完,API 的賬單和限速都會變成問題。
  5. 本來就要買遊戲卡:顯示卡錢已經花了,邊際成本只剩電費,這時本地推論接近免費。

什麼情況下別買卡?

日均一萬 token 以內的個人使用、只用最強模型、以及沒有桌上型電腦的人,都不該為大模型買卡。

常見問題

本地跑大模型一年電費多少?

RTX 3090 標稱 350W,按 60% 負載、每天 8 小時、人民幣 ¥0.6/kWh 算,一年約人民幣 ¥370;RTX 4090 的 450W 約人民幣 ¥470。電費不是大頭,顯示卡折舊才是。

多少用量本地才比 API 便宜?

看對標哪個 API。對標 DeepSeek V4 Flash(輸出 $0.28 / 百萬 token),一張 3090 三年的錢能買 90 多億 token,本地跑不出這個量,永遠不划算;對標 Claude Sonnet 5 或 GPT-5.6 terra 這類 $10 到 $12 / 百萬輸出 token 的模型,日均 30 到 50 萬 token 以上本地開始便宜。

本地模型和 API 模型能力一樣嗎?

不一樣。一張 24GB 卡能跑的是 32B 級模型,能力大致對應 API 上的輕量檔(DeepSeek V4 Flash、GPT-5.6 luna),夠不到 Sonnet 5 和 V4 Pro。用前沿 API 的價格給本地算賬會高估本地的價值。

什麼情況下應該買卡?

資料不能出本機(法務、醫療、內部程式碼)、需要離線、要做 LoRA 微調或跑幾十萬條批處理、或者本來就要一張遊戲卡。純為省 API 錢買卡,多數人算不過來。

文中提到的顯示卡

文中提到的模型