不要再增加 Claude Max 或 ChatGPT Pro 帳號。
每月 300 億 token 已經不是「個人訂閱額度不足」,而是推論基礎設施與 Agent 架構問題。最經濟、可持續的做法是:
保留少量 frontier subscription 做規劃與驗收,所有大量執行工作改走 DeepSeek V4 Flash 第一方 API,並把 cache hit 提升到 90% 以上。
你不需要支付 OpenAI 或 Anthropic 官方 API,但不可能完全不支付任何 API 費用,仍穩定取得每月 300 億個高品質 coding token。
300 億 token 的真實成本
DeepSeek V4 Flash 目前第一方 API 價格為:
- Cache miss input:$0.14/1M token
- Cache hit input:$0.0028/1M token
- Output:$0.28/1M token
- Context caching 預設自動開啟
- 支援 OpenAI、Anthropic API 格式與 Tool Calls turn724196search5turn724196search6turn724196search4
假設每月 300 億 token 中,90% 是 input、10% 是 output:
| Cache 狀況 | 每月約略成本 |
|---|---|
| 完全沒有 cache | US$4,620 |
| 80% input cache hit | US$1,656 |
| 95% input cache hit | US$1,101 |
Coding Agent 通常 input 比例更高。若是 98% input、2% output:
| Cache 狀況 | 每月約略成本 |
|---|---|
| 完全沒有 cache | US$4,284 |
| 80% input cache hit | US$1,057 |
| 95% input cache hit | US$452 |
因此,真正需要確認的不是「總 token」,而是:
prompt_cache_hit_tokens
prompt_cache_miss_tokens
completion_tokens
reasoning tokens
tool output tokens
OpenCode 公開的實際使用資料中,GLM-5.2 coding session 平均 cache ratio 約 82%,Kimi K3 約 93%。這表示 Agent 顯示的數十億 raw tokens,大部分可能只是重複讀取已快取的 repo、工具定義與 conversation prefix,並不等於相同數量的完整推論成本。turn562413search18turn562413search24
最適合你的架構
Claude Max / ChatGPT Pro
│
├── Architecture
├── Planning
├── Difficult debugging
└── Final review
│
▼
Claude Code Router 或 LiteLLM
│
┌────────┼─────────┐
▼ ▼ ▼
DeepSeek V4 GLM/Kimi Local model
Flash fallback background
第一層:只保留兩個 frontier 帳號
建議保留:
- 一個 Claude Max:複雜架構、長時間 coding、困難除錯。
- 一個 ChatGPT Pro:獨立審查、視覺、Browser、第二意見。
其他兩個重複帳號的 US$400 預算,改投入真正能量化、能監控 cache 的執行層。
Consumer subscription 的限制本來就會受到 session、weekly cap、conversation length、model、effort level 與工具使用影響;Anthropic 也明確保留調整其他 weekly、monthly 或 model caps 的權利。它不適合拿來當固定容量的推論後端。turn231306search0turn231306search1turn231306search5
第二層:DeepSeek V4 Flash 直接連第一方 API
不要把 OpenRouter 當 DeepSeek 的主要長期入口。
OpenRouter 適合:
- 測試不同模型
- 臨時 fallback
- 比較 providers
- 需要 Zero Data Retention routing
但固定的長時間 coding session,直接連 DeepSeek 第一方 API 能減少 provider routing 變數,並取得目前確認過最低的 $0.0028/M cache-hit input 價格。DeepSeek 已提供 Anthropic-compatible endpoint,可直接接入 Claude Code,並建議 sub-agent 使用 V4 Flash。turn724196search4turn724196search10
OpenRouter 若繼續使用,必須固定 session_id,避免同一個 Agent session 被分配到不同 provider,造成 cache 重建。OpenRouter 已支援 sticky routing,但手動指定 provider order 可能讓 sticky routing 失效。turn307412search0turn307412search1
第三層:只增加一個 coding subscription
目前值得考慮的只有兩種。
GLM Coding Plan Max
Max 月繳為 US$160;年繳折算約 US$112/月,額度是 Lite 的 20 倍,支援 Claude Code 等多種 coding tools。turn797393search2
適合作為:
- DeepSeek 無法完成時的第二模型
- 中大型 repo 規劃
- Agentic coding
- DeepSeek implementation 的 reviewer
Kimi Code Vivace
年繳折算約 US$159/月,使用 Kimi K2.7 Code,定位為大型 repo 與高強度開發。Kimi Code 能透過 CLI、VS Code 和第三方工具使用,但有 weekly quota 與 rolling five-hour limit,所有裝置和 API Key 共用同一份額度。turn375906search21turn797393search3turn275576search7
兩者選一即可。它們都是品質 fallback,不是 300 億 token 的主要供應來源。
OpenCode Go 只能當便宜備援
OpenCode Go 每月 US$10,包含:
- Five-hour allowance:US$12
- Weekly allowance:US$30
- Monthly allowance:US$60
並可在 OpenCode 或其他 Agent 使用。turn562413search0turn562413search1
以 DeepSeek V4 Flash、90% input/10% output 粗略計算,US$60 約等於 3.9 億個未快取混合 token。
要支撐 300 億 token,相當於約 77 份 monthly allowance。這證明它是很高性價比的備援方案,但不是你的主力容量解法。
社群實際採用的方法
Reddit 上目前最常見的組合不是「所有工作都交給最強模型」,而是:
Claude / GLM / Kimi:制定詳細 implementation plan
DeepSeek V4 Flash:大量執行
原始規劃模型:最後 review
OpenCode 社群中的重度使用者也描述了相同流程:以 GLM 或 Claude 規劃,再讓 DeepSeek Flash sub-agents 執行;只有失敗或複雜任務才升級模型。turn521277search6
另一個反覆出現的經驗是:長 session 使用 DeepSeek 時,直接使用第一方 API,並避免 Flash、Pro、不同 provider 間頻繁切換。切換模型可能分別建立兩份 cache,抵消低價模型帶來的節省。turn521277search5
對於 self-host,LocalLLaMA 社群的普遍判斷是:只有 GPU 能長期保持約 60%–80% 以上利用率時,自架才比較容易超越 API 經濟性;閒置 GPU 通常比 serverless API 更貴。turn726442search25turn521277search9
X 上則大量推廣 GLM Coding Plan、Kimi Code 與 DeepSeek V4 Flash,但多數內容偏宣傳。官方文件確實證實這些產品能接入 Claude Code 與其他 coding tools,但全部仍有 quota、rolling limit 或服務容量限制,不能把「subscription」理解成真正 unlimited inference。turn983503search1turn983503search2turn983503search26
你現在最需要修改的 Agent 設計
300 億 token 很可能來自:
Sub-agent 數量
× 每個 Agent 收到的完整 context
× Agent turns
× 每次重送的 tool output
例如:
10 個 agents
× 150,000 context tokens
× 20 turns
= 單一任務 3,000 萬 input tokens
應直接採用以下限制:
- Sub-agent 不取得完整主對話,只取得 task brief、相關檔案、diff、測試結果。
- 每個任務先建立 repo map,不把整個 repo 重複塞入 context。
- System prompt、tool schema、rules、repo map 固定放在 prefix。
- 動態內容、最新 diff、錯誤訊息放在 prompt 最後。
- 同一工作階段不得切換 provider 或任意重排 tools。
- Sub-agent 預設最多 8–12 turns。
- 連續兩次測試失敗才升級至 GLM、Kimi、Claude 或 ChatGPT。
- 禁止 Agent 把完整 build log、
node_modules、lockfile、generated code 反覆送回模型。 - 每次任務記錄 cache-hit、cache-miss、output 與失敗重試 token。
- Cache hit 低於 80% 時停止增加流量,先修正 prompt ordering。
Claude Code Router 可統一管理 Claude Code、Codex、OpenCode、Kimi CLI 與不同 provider;LiteLLM 則適合作為中央 gateway、成本追蹤、fallback 與 routing 層。兩者都是開源方案。turn361292search0turn361292search1
Self-host 是否值得
300 億 token/月相當於平均約 11,574 token/秒的總流量。
單臺 RTX 4090、5090 或 Mac Studio 不可能承擔這種總量。即使 raw token 大多是 input,仍需要高吞吐 batching、prefix caching 與多 GPU serving。
Self-host 比較合理的用途是:
- Repo map 生成
- 文件摘要
- Log classification
- 測試案例生成
- Lint/formatting 修正
- 簡單 CRUD
- 重複性 code migration
- Embedding 與 reranking
可使用 27B–35B 級模型搭配 vLLM 或 SGLang。兩者都支援 continuous batching、prefix caching、quantization;SGLang 另外提供 RadixAttention。turn361292search3turn361292search6
不建議為了取代 DeepSeek V4 Flash 而自行建立大型 GPU cluster。DeepSeek 已將 output 壓到 $0.28/M,第一方 cache input 壓到 $0.0028/M;在沒有既有 GPU、機房與高利用率負載的情況下,很難靠購買硬體擊敗這個價格。
建議預算重組
你目前每月固定支出約 US$800。
較合理的配置:
Claude Max × 1 US$200
ChatGPT Pro × 1 US$200
GLM Coding Max 年繳折算 US$112
OpenCode Go US$10
DeepSeek 第一方 API 預算 US$278
────────────────────────────────
合計 US$800
或將 GLM 換成 Kimi Vivace:
Claude Max × 1 US$200
ChatGPT Pro × 1 US$200
Kimi Vivace 年繳折算 US$159
OpenCode Go US$10
DeepSeek 第一方 API 預算 US$231
────────────────────────────────
合計 US$800
在 cache hit 達到 95%、input 比例接近 98% 的情況下,DeepSeek 每月 300 億 raw tokens 的推算成本約 US$452。此時你的總成本約 US$850–1,000,而不是繼續增加到六個或八個 consumer accounts。
不存在的「Hack」
以下方法不是可持續方案:
- 大量建立帳號輪替 quota
- 擷取或轉售 consumer OAuth/session token
- 共享訂閱帳號
- VPN/地區價格套利
- 自動輪替 free-tier accounts
- 利用學生、教育或試用帳號作商業推論
- 把 consumer web subscription 包裝成未授權 API
OpenAI 現行條款明確禁止繞過 rate limits、restrictions、usage limits 或 protective measures。這類方法除了封號風險,也會讓 cache、帳務、程式碼隱私與服務穩定性完全不可控。turn275576search0turn275576search3
真正有效的 workaround 是:
利用訂閱方案處理高價值判斷,利用 DeepSeek 第一方 cache 處理大量執行,再用嚴格 context engineering 把 300 億 raw tokens 轉換成少量 cache-miss 與 output tokens。