以經濟實惠方式處理每月 300 億 token 的 AI 需求

, ,

不要再增加 Claude Max 或 ChatGPT Pro 帳號。

每月 300 億 token 已經不是「個人訂閱額度不足」,而是推論基礎設施與 Agent 架構問題。最經濟、可持續的做法是:

保留少量 frontier subscription 做規劃與驗收,所有大量執行工作改走 DeepSeek V4 Flash 第一方 API,並把 cache hit 提升到 90% 以上。

你不需要支付 OpenAI 或 Anthropic 官方 API,但不可能完全不支付任何 API 費用,仍穩定取得每月 300 億個高品質 coding token。


300 億 token 的真實成本

DeepSeek V4 Flash 目前第一方 API 價格為:

  • Cache miss input:$0.14/1M token
  • Cache hit input:$0.0028/1M token
  • Output:$0.28/1M token
  • Context caching 預設自動開啟
  • 支援 OpenAI、Anthropic API 格式與 Tool Calls turn724196search5turn724196search6turn724196search4

假設每月 300 億 token 中,90% 是 input、10% 是 output:

Cache 狀況 每月約略成本
完全沒有 cache US$4,620
80% input cache hit US$1,656
95% input cache hit US$1,101

Coding Agent 通常 input 比例更高。若是 98% input、2% output:

Cache 狀況 每月約略成本
完全沒有 cache US$4,284
80% input cache hit US$1,057
95% input cache hit US$452

因此,真正需要確認的不是「總 token」,而是:

prompt_cache_hit_tokens
prompt_cache_miss_tokens
completion_tokens
reasoning tokens
tool output tokens

OpenCode 公開的實際使用資料中,GLM-5.2 coding session 平均 cache ratio 約 82%,Kimi K3 約 93%。這表示 Agent 顯示的數十億 raw tokens,大部分可能只是重複讀取已快取的 repo、工具定義與 conversation prefix,並不等於相同數量的完整推論成本。turn562413search18turn562413search24


最適合你的架構

Claude Max / ChatGPT Pro
        │
        ├── Architecture
        ├── Planning
        ├── Difficult debugging
        └── Final review
                 │
                 ▼
Claude Code Router 或 LiteLLM
                 │
        ┌────────┼─────────┐
        ▼        ▼         ▼
DeepSeek V4   GLM/Kimi   Local model
Flash         fallback   background

第一層:只保留兩個 frontier 帳號

建議保留:

  • 一個 Claude Max:複雜架構、長時間 coding、困難除錯。
  • 一個 ChatGPT Pro:獨立審查、視覺、Browser、第二意見。

其他兩個重複帳號的 US$400 預算,改投入真正能量化、能監控 cache 的執行層。

Consumer subscription 的限制本來就會受到 session、weekly cap、conversation length、model、effort level 與工具使用影響;Anthropic 也明確保留調整其他 weekly、monthly 或 model caps 的權利。它不適合拿來當固定容量的推論後端。turn231306search0turn231306search1turn231306search5


第二層:DeepSeek V4 Flash 直接連第一方 API

不要把 OpenRouter 當 DeepSeek 的主要長期入口。

OpenRouter 適合:

  • 測試不同模型
  • 臨時 fallback
  • 比較 providers
  • 需要 Zero Data Retention routing

但固定的長時間 coding session,直接連 DeepSeek 第一方 API 能減少 provider routing 變數,並取得目前確認過最低的 $0.0028/M cache-hit input 價格。DeepSeek 已提供 Anthropic-compatible endpoint,可直接接入 Claude Code,並建議 sub-agent 使用 V4 Flash。turn724196search4turn724196search10

OpenRouter 若繼續使用,必須固定 session_id,避免同一個 Agent session 被分配到不同 provider,造成 cache 重建。OpenRouter 已支援 sticky routing,但手動指定 provider order 可能讓 sticky routing 失效。turn307412search0turn307412search1


第三層:只增加一個 coding subscription

目前值得考慮的只有兩種。

GLM Coding Plan Max

Max 月繳為 US$160;年繳折算約 US$112/月,額度是 Lite 的 20 倍,支援 Claude Code 等多種 coding tools。turn797393search2

適合作為:

  • DeepSeek 無法完成時的第二模型
  • 中大型 repo 規劃
  • Agentic coding
  • DeepSeek implementation 的 reviewer

Kimi Code Vivace

年繳折算約 US$159/月,使用 Kimi K2.7 Code,定位為大型 repo 與高強度開發。Kimi Code 能透過 CLI、VS Code 和第三方工具使用,但有 weekly quota 與 rolling five-hour limit,所有裝置和 API Key 共用同一份額度。turn375906search21turn797393search3turn275576search7

兩者選一即可。它們都是品質 fallback,不是 300 億 token 的主要供應來源。


OpenCode Go 只能當便宜備援

OpenCode Go 每月 US$10,包含:

  • Five-hour allowance:US$12
  • Weekly allowance:US$30
  • Monthly allowance:US$60

並可在 OpenCode 或其他 Agent 使用。turn562413search0turn562413search1

以 DeepSeek V4 Flash、90% input/10% output 粗略計算,US$60 約等於 3.9 億個未快取混合 token。

要支撐 300 億 token,相當於約 77 份 monthly allowance。這證明它是很高性價比的備援方案,但不是你的主力容量解法。


社群實際採用的方法

Reddit 上目前最常見的組合不是「所有工作都交給最強模型」,而是:

Claude / GLM / Kimi:制定詳細 implementation plan
DeepSeek V4 Flash:大量執行
原始規劃模型:最後 review

OpenCode 社群中的重度使用者也描述了相同流程:以 GLM 或 Claude 規劃,再讓 DeepSeek Flash sub-agents 執行;只有失敗或複雜任務才升級模型。turn521277search6

另一個反覆出現的經驗是:長 session 使用 DeepSeek 時,直接使用第一方 API,並避免 Flash、Pro、不同 provider 間頻繁切換。切換模型可能分別建立兩份 cache,抵消低價模型帶來的節省。turn521277search5

對於 self-host,LocalLLaMA 社群的普遍判斷是:只有 GPU 能長期保持約 60%–80% 以上利用率時,自架才比較容易超越 API 經濟性;閒置 GPU 通常比 serverless API 更貴。turn726442search25turn521277search9

X 上則大量推廣 GLM Coding Plan、Kimi Code 與 DeepSeek V4 Flash,但多數內容偏宣傳。官方文件確實證實這些產品能接入 Claude Code 與其他 coding tools,但全部仍有 quota、rolling limit 或服務容量限制,不能把「subscription」理解成真正 unlimited inference。turn983503search1turn983503search2turn983503search26


你現在最需要修改的 Agent 設計

300 億 token 很可能來自:

Sub-agent 數量
× 每個 Agent 收到的完整 context
× Agent turns
× 每次重送的 tool output

例如:

10 個 agents
× 150,000 context tokens
× 20 turns
= 單一任務 3,000 萬 input tokens

應直接採用以下限制:

  1. Sub-agent 不取得完整主對話,只取得 task brief、相關檔案、diff、測試結果。
  2. 每個任務先建立 repo map,不把整個 repo 重複塞入 context。
  3. System prompt、tool schema、rules、repo map 固定放在 prefix。
  4. 動態內容、最新 diff、錯誤訊息放在 prompt 最後。
  5. 同一工作階段不得切換 provider 或任意重排 tools。
  6. Sub-agent 預設最多 8–12 turns。
  7. 連續兩次測試失敗才升級至 GLM、Kimi、Claude 或 ChatGPT。
  8. 禁止 Agent 把完整 build log、node_modules、lockfile、generated code 反覆送回模型。
  9. 每次任務記錄 cache-hit、cache-miss、output 與失敗重試 token。
  10. Cache hit 低於 80% 時停止增加流量,先修正 prompt ordering。

Claude Code Router 可統一管理 Claude Code、Codex、OpenCode、Kimi CLI 與不同 provider;LiteLLM 則適合作為中央 gateway、成本追蹤、fallback 與 routing 層。兩者都是開源方案。turn361292search0turn361292search1


Self-host 是否值得

300 億 token/月相當於平均約 11,574 token/秒的總流量。

單臺 RTX 4090、5090 或 Mac Studio 不可能承擔這種總量。即使 raw token 大多是 input,仍需要高吞吐 batching、prefix caching 與多 GPU serving。

Self-host 比較合理的用途是:

  • Repo map 生成
  • 文件摘要
  • Log classification
  • 測試案例生成
  • Lint/formatting 修正
  • 簡單 CRUD
  • 重複性 code migration
  • Embedding 與 reranking

可使用 27B–35B 級模型搭配 vLLM 或 SGLang。兩者都支援 continuous batching、prefix caching、quantization;SGLang 另外提供 RadixAttention。turn361292search3turn361292search6

不建議為了取代 DeepSeek V4 Flash 而自行建立大型 GPU cluster。DeepSeek 已將 output 壓到 $0.28/M,第一方 cache input 壓到 $0.0028/M;在沒有既有 GPU、機房與高利用率負載的情況下,很難靠購買硬體擊敗這個價格。


建議預算重組

你目前每月固定支出約 US$800。

較合理的配置:

Claude Max × 1             US$200
ChatGPT Pro × 1            US$200
GLM Coding Max 年繳折算    US$112
OpenCode Go                US$10
DeepSeek 第一方 API 預算   US$278
────────────────────────────────
合計                        US$800

或將 GLM 換成 Kimi Vivace:

Claude Max × 1             US$200
ChatGPT Pro × 1            US$200
Kimi Vivace 年繳折算       US$159
OpenCode Go                US$10
DeepSeek 第一方 API 預算   US$231
────────────────────────────────
合計                        US$800

在 cache hit 達到 95%、input 比例接近 98% 的情況下,DeepSeek 每月 300 億 raw tokens 的推算成本約 US$452。此時你的總成本約 US$850–1,000,而不是繼續增加到六個或八個 consumer accounts。


不存在的「Hack」

以下方法不是可持續方案:

  • 大量建立帳號輪替 quota
  • 擷取或轉售 consumer OAuth/session token
  • 共享訂閱帳號
  • VPN/地區價格套利
  • 自動輪替 free-tier accounts
  • 利用學生、教育或試用帳號作商業推論
  • 把 consumer web subscription 包裝成未授權 API

OpenAI 現行條款明確禁止繞過 rate limits、restrictions、usage limits 或 protective measures。這類方法除了封號風險,也會讓 cache、帳務、程式碼隱私與服務穩定性完全不可控。turn275576search0turn275576search3

真正有效的 workaround 是:

利用訂閱方案處理高價值判斷,利用 DeepSeek 第一方 cache 處理大量執行,再用嚴格 context engineering 把 300 億 raw tokens 轉換成少量 cache-miss 與 output tokens。