先給結論:只按錢算,本地部署贏不了 API。截至 2026 年 9 月 5 日,一臺二手 RTX 3090 主機三年總成本約一萬三千元;這筆錢在 DeepSeek V4 Flash 的 API 上能買九十多億 token,一張 3090 三年滿負荷也產不出這麼多。對標 Claude Sonnet 5、GPT-5.6 terra 這類每百萬輸出 token 十美元上下的前沿模型,盈虧平衡點在日均 30 到 50 萬 token,重度使用者能達到。買卡的理由從來是隱私、離線、微調和已有的遊戲需求,本文把三筆賬逐項算給你看。
本地部署大模型要花多少錢?硬體、電費和 API 三年總賬(2026)
譯自简体中文版 · 閱讀原文
正文與常見問題中的數字截至 2026年9月5日;表格使用最新已發布價格,各裝置採集時間可能不同。

本文提及的固定價格均以中國二手市場人民幣(CNY)為基準;動態表格則依頁面所選幣別顯示。

本地部署的成本項有哪些?
四項:顯示卡、整機其餘部分、電費、折舊,其中顯示卡佔六成以上。
- 顯示卡:二手價格見站內即時資料,本文以 RTX 3090(入門 24GB)、RTX 4090(主流)、RTX PRO 6000 Blackwell(96GB 高階)三檔為例,另列 Mac Studio M4 Max 128GB 作整機對照。
- 整機其餘部分:CPU、主機板、32GB 記憶體、850W 電源、機箱,2026 年一套約 ¥4,700($700)。跑 MoE 專家卸載要 128GB 記憶體,再加 ¥2,000 左右。已有桌上型電腦的話這項為零。
- 電費:顯示卡標稱功耗 × 實際負載係數 × 使用時長 × 電價。推論負載通常只到標稱的 50% 到 70%,我們按 60%、每天 8 小時、居民電價算。
- 折舊:顯示卡三年後大約還值三到四成,3090 這種老卡跌得慢。下表沒有扣殘值,實際成本比表裡低一到兩成。
三套配置的三年總成本
入門 3090 主機三年約一萬三,4090 主機約兩萬九,RTX PRO 6000 主機超過十三萬。 顯示卡價格即時取當前二手中位價:
| 型號 | 閒魚 | 整機其餘部分 | 3 年電費 | 3 年總計 | 折合每天 |
|---|---|---|---|---|---|
| NT$37,579 | NT$22,147 | NT$7,3581,840 kWh | NT$67,085 | NT$61 | |
| NT$108,994 | NT$22,147 | NT$9,4612,365 kWh | NT$140,602 | NT$128 | |
| NT$573,159 | NT$22,147 | NT$12,6143,154 kWh | NT$607,920 | NT$555 | |
| Mac Studio M4 Max 128GB | NT$178,055 | NT$0 | NT$10,0922,523 kWh | NT$188,147 | NT$172 |
電價按 NT$4/kWh,每天 8 小時、按顯示卡標稱功耗的 60% 計。「整機其餘部分」是 CPU、主機板、記憶體、電源、機殼一口價 NT$22,147;統一記憶體整機本身就是完整設備,記 0。不計殘值。
Mac Studio 是整機,「整機其餘部分」記零;它 480W 的標稱功耗實際跑推論只有一百多瓦,電費一項被高估,但也改變不了它在這張表裡的位置。
同等用量走 API 要花多少?
API 的價差比硬體大得多:同樣一百萬輸出 token,DeepSeek V4 Flash 收 $0.28,Claude Sonnet 5 收 $10,差 35 倍。 2026 年 9 月各家官網標價(每百萬 token,輸入 / 輸出):
| 模型 | 輸入 | 輸出 | 對應的本地檔位 |
|---|---|---|---|
| DeepSeek V4 Flash | $0.14 | $0.28 | 32B 稠密或 30B 級 MoE |
| DeepSeek V4 Pro | $0.435 | $0.87 | 無家用對應 |
| GPT-5.6 luna | $0.20 | $1.20 | 32B 級 |
| GPT-5.6 terra | $2.00 | $12.00 | 無家用對應 |
| Claude Sonnet 5 | $2.00 | $10.00 | 無家用對應 |
按輸入輸出各半估算,三檔典型用量的三年 API 花費:
| 日均 token | 三年總量 | DeepSeek V4 Flash | GPT-5.6 luna | Claude Sonnet 5 |
|---|---|---|---|---|
| 5 萬(輕度個人) | 5,500 萬 | $12 | $39 | $330 |
| 30 萬(重度個人 / 小團隊) | 3.3 億 | $69 | $231 | $1,970 |
| 100 萬(批處理 / 產品接入) | 11 億 | $231 | $770 | $6,570 |
盈虧平衡點在哪?
盈虧平衡日均 token 數 = 本地三年總成本 ÷ API 單價 ÷ 1,095 天。 以 3090 主機三年 $1,950 計:
- 對 DeepSeek V4 Flash(均價 $0.21 / 百萬):需要日均 850 萬 token。一張 3090 跑 32B 4-bit 約 32 tokens/s,每天 8 小時上限 90 萬 token,永遠追不上。
- 對 GPT-5.6 luna(均價 $0.70 / 百萬):需要日均 250 萬 token,同樣超出單卡產能。
- 對 Claude Sonnet 5(均價 $6 / 百萬):需要日均 30 萬 token,8 小時跑 3 小時就夠,重度使用者能達到。
但注意第三條的前提:你願意用 32B 級的本地模型替代 Sonnet 5。多數場景下這是能力降級,省下的錢要用返工時間去換。
什麼情況下本地一定划算?
四種情況下不用算賬,直接買:資料不能出本機、需要離線、要微調、要跑大批次。
- 資料不能出本機:法務文書、病歷、未公開程式碼、財務資料。合規成本一次就超過顯示卡錢。
- 離線:車間、船上、無外網的辦公環境。
- 微調:LoRA 微調一個 8B 到 14B 模型在 24GB 卡上幾小時完成,API 微調按 token 收費且不給權重。
- 大批次:幾十萬條文件分類、嵌入、摘要,一張 3090 一晚上跑完,API 的賬單和限速都會變成問題。
- 本來就要買遊戲卡:顯示卡錢已經花了,邊際成本只剩電費,這時本地推論接近免費。
什麼情況下別買卡?
日均一萬 token 以內的個人使用、只用最強模型、以及沒有桌上型電腦的人,都不該為大模型買卡。
- 每天聊幾十輪、寫幾封郵件,全年 API 花費不到一張顯示卡電費。
- 要的是 Sonnet 5、V4 Pro 這一檔的能力,本地沒有對應物,買卡也解決不了。
- 沒有桌上型電腦:整機加顯示卡的一次性投入要翻倍,而 Mac Studio 的性價比見 Mac 統一記憶體 vs 獨立顯示卡。
- 預算有限又確定要買:先看每個顯示記憶體檔位最省錢的顯示卡。
常見問題
本地跑大模型一年電費多少?
RTX 3090 標稱 350W,按 60% 負載、每天 8 小時、人民幣 ¥0.6/kWh 算,一年約人民幣 ¥370;RTX 4090 的 450W 約人民幣 ¥470。電費不是大頭,顯示卡折舊才是。
多少用量本地才比 API 便宜?
看對標哪個 API。對標 DeepSeek V4 Flash(輸出 $0.28 / 百萬 token),一張 3090 三年的錢能買 90 多億 token,本地跑不出這個量,永遠不划算;對標 Claude Sonnet 5 或 GPT-5.6 terra 這類 $10 到 $12 / 百萬輸出 token 的模型,日均 30 到 50 萬 token 以上本地開始便宜。
本地模型和 API 模型能力一樣嗎?
不一樣。一張 24GB 卡能跑的是 32B 級模型,能力大致對應 API 上的輕量檔(DeepSeek V4 Flash、GPT-5.6 luna),夠不到 Sonnet 5 和 V4 Pro。用前沿 API 的價格給本地算賬會高估本地的價值。
什麼情況下應該買卡?
資料不能出本機(法務、醫療、內部程式碼)、需要離線、要做 LoRA 微調或跑幾十萬條批處理、或者本來就要一張遊戲卡。純為省 API 錢買卡,多數人算不過來。