每月 300 億 Token 成本優化:DeepSeek V4 Flash 混合架構實戰

解決每月 300 億 token 編碼需求的低成本方案:保留少量前沿訂閱做規劃,主力改用 DeepSeek V4 Flash 第一方 API 並將快取命中率推至 95% 以上,附完整架構圖、成本試算與 Agent 內容工程清單。

核心結論:別再堆訂閱帳號,改建混合推論管線

每月 300 億 token 已超出「個人訂閱額度不足」的範疇,屬於推論基礎設施與 Agent 架構問題。最經濟、可持續的做法是:

保留少量前沿訂閱(Claude Max、ChatGPT Pro)負責規劃與驗收,所有大量執行工作改走 DeepSeek V4 Flash 第一方 API,並將快取命中率提升至 90% 以上。

你不需支付 OpenAI 或 Anthropic 官方 API 費用,但必須接受支付 DeepSeek 第一方 API 費用,才能穩定獲得每月 300 億高品質 coding token。


300 億 Token 的真實成本試算

DeepSeek V4 Flash 第一方 API 現行價格(含自動開啟的 Context Caching):

項目 價格 (USD / 1M token)
Cache miss input $0.14
Cache hit input $0.0028
Output $0.28

假設每月 300 億 token 中 90% 為 input、10% 為 output

快取狀況 每月約略成本
完全無快取 US$4,620
80% input cache hit US$1,656
95% input cache hit US$1,101

若 coding agent 實際為 98% input、2% output(常見於重複讀取 repo、工具定義、對話前綴):

快取狀況 每月約略成本
完全無快取 US$4,284
80% input cache hit US$1,057
95% input cache hit US$452

關鍵指標不是「總 token」,而是實際計費的四欄:

prompt_cache_hit_tokens
prompt_cache_miss_tokens
completion_tokens
reasoning tokens / tool output tokens

OpenCode 公開資料顯示:GLM-5.2 平均 cache ratio 約 82%,Kimi K3 約 93%。這說明 Agent 顯示的數十億 raw tokens,大多為重複快取內容,並不等同完整推論成本。


建議三層混合架構

Claude Max / ChatGPT Pro
        │
        ├── Architecture
        ├── Planning
        ├── Difficult debugging
        └── Final review
                 │
                 ▼
Claude Code Router 或 LiteLLM (統一閘道、成本追蹤、fallback)
                 │
        ┌────────┼─────────┐
        ▼        ▼         ▼
DeepSeek V4   GLM/Kimi   Local model
Flash         fallback   background

第一層:只保留兩個前沿帳號

  • Claude Max ×1:複雜架構、長時程 coding、困難除錯。
  • ChatGPT Pro ×1:獨立審查、視覺、Browser、第二意見。

其餘重複帳號的 US$400/月預算,轉投入可監控快取的執行層。Consumer 訂閱受 session、weekly cap、conversation length、model、effort level 等多重限制,Anthropic 保留調整 caps 權利,不適合作為固定容量的推論後端

第二層:DeepSeek V4 Flash 直連第一方 API

  • 不要以 OpenRouter 作為長期主要入口。OpenRouter 適合測試、臨時 fallback、比較 providers、需 Zero Data Retention 時。
  • 直連第一方 API 可減少 routing 變數,並鎖定 $0.0028/M cache-hit input 的最低價格。
  • DeepSeek 已提供 Anthropic-compatible endpoint,可直接接入 Claude Code,官方建議 sub-agent 使用 V4 Flash。
  • 若仍用 OpenRouter,必須固定 session_id 避免同一 agent session 被分配到不同 provider 導致快取重建。

第三層:只增加一個 coding 訂閱作為品質 fallback

方案 年繳折算月費 定位
GLM Coding Plan Max ~US$112 DeepSeek 失敗時的第二模型、中大型 repo 規劃、Agentic coding、DeepSeek 實作的 reviewer
Kimi Code Vivace ~US$159 大型 repo 與高強度開發,支援 CLI/VS Code/第三方工具,有 weekly quota 與 rolling 5-hr limit

二選一即可;它們是品質備援,非 300 億 token 主力來源。

OpenCode Go 僅作廉價備援

  • US$10/月含:5-hr allowance (US$12)、weekly allowance (US$30)、monthly allowance (US$60)。
  • 以 DeepSeek V4 Flash、90/10 input/output 估算,US$60 ≈ 3.9 億未快取混合 token。
  • 支撐 300 億 token 需 ~77 份 monthly allowance → 高性價比備援,非主力容量解法

社群實際採用的工作流

Reddit / OpenCode 社群共識:

Claude / GLM / Kimi → 制定詳細 implementation plan
DeepSeek V4 Flash   → 大量執行 sub-agent 任務
原始規劃模型       → 最後 review

重度使用者描述:以 GLM 或 Claude 規劃,再讓 DeepSeek Flash sub-agents 執行;只有失敗或複雜任務才升級模型。

關鍵經驗:長 session 使用 DeepSeek 時,直接用第一方 API,避免 Flash/Pro/不同 provider 頻繁切換。切換模型會分別建立快取,抵消低價模型節省。

Self-host 方面,LocalLLaMA 共識:只有 GPU 長期維持 60–80% 以上利用率,自架才可能超越 API 經濟性;閒置 GPU 通常比 serverless API 更貴。


你必須修正的 Agent 設計(將 300 億 raw token 轉為少量計費 token)

300 億 token 多來自:

Sub-agent 數量 × 每個 Agent 完整 context × Agent turns × 重送的 tool output

直接採用以下 10 項限制

  1. Sub-agent 不取得完整主對話,僅取得 task brief、相關檔案、diff、測試結果。
  2. 每任務先建立 repo map,不把整個 repo 重複塞入 context。
  3. System prompt、tool schema、rules、repo map 固定放在 prefix(利用 prefix caching)。
  4. 動態內容、最新 diff、錯誤訊息放在 prompt 最後
  5. 同一工作階段 不得切換 provider 或任意重排 tools
  6. Sub-agent 預設 最多 8–12 turns
  7. 連續兩次測試失敗才升級至 GLM、Kimi、Claude 或 ChatGPT。
  8. 禁止 Agent 把完整 build log、node_modules、lockfile、generated code 反覆送回模型。
  9. 每次任務 記錄 cache-hit、cache-miss、output 與失敗重試 token
  10. Cache hit 低於 80% 時停止增加流量,先修正 prompt ordering

工具選擇:

  • Claude Code Router:統一管理 Claude Code、Codex、OpenCode、Kimi CLI 與不同 provider。
  • LiteLLM:中央 gateway、成本追蹤、fallback 與 routing 層。
    兩者皆開源。

Self-host 是否值得?

300 億 token/月 ≈ 平均 11,574 token/秒 總流量。單張 RTX 4090/5090 或 Mac Studio 無法承擔。即使 raw token 多為 input,仍需高吞吐 batching、prefix caching、多 GPU serving。

Self-host 較合理用途(用 27B–35B 模型 + vLLM/SGLang):

  • Repo map 生成、文件摘要、Log 分類、測試案例生成
  • Lint/formatting 修正、簡單 CRUD、重複性 code migration
  • Embedding 與 reranking

不建議為取代 DeepSeek V4 Flash 而自建大型 GPU cluster。DeepSeek 已將 output 壓至 $0.28/M、第一方 cache input 壓至 $0.0028/M;無既有 GPU、機房與高利用率負載下,難以靠購買硬體擊敗此價格。


建議預算重組(維持 US$800/月)

方案 A:GLM Coding Max

Claude Max × 1             US$200
ChatGPT Pro × 1            US$200
GLM Coding Max (年繳)      US$112
OpenCode Go                US$10
DeepSeek 第一方 API 預算   US$278
────────────────────────────────
合計                        US$800

方案 B:Kimi Vivace

Claude Max × 1             US$200
ChatGPT Pro × 1            US$200
Kimi Vivace (年繳)         US$159
OpenCode Go                US$10
DeepSeek 第一方 API 預算   US$231
────────────────────────────────
合計                        US$800

cache hit 95%、input 比例 98% 下,DeepSeek 每月 300 億 raw tokens 推算成本約 US$452。總成本約 US$850–1,000,遠低於繼續堆疊 6–8 個 consumer 帳號。


不存在的「Hack」與真正有效的 Workaround

以下方法不可持續、風險極高

  • 大量建立帳號輪替 quota
  • 擷取/轉售 consumer OAuth/session token
  • 共享訂閱帳號、VPN 地區價格套利
  • 自動輪替 free-tier accounts
  • 利用學生/教育/試用帳號作商業推論
  • 將 consumer web subscription 包裝成未授權 API

OpenAI 條款明確禁止繞過 rate limits、usage limits 或 protective measures。這類手段除封號風險外,會讓快取、帳務、程式碼隱私與服務穩定性完全不可控。

真正有效的 workaround

利用訂閱方案處理高價值判斷,利用 DeepSeek 第一方快取處理大量執行,再用嚴格內容工程把 300 億 raw tokens 轉換成少量 cache-miss 與 output tokens。


總結

階段 行動 預期效果
1. 精簡訂閱 保留 Claude Max + ChatGPT Pro 各 1 個 釋放 US$400/月
2. 主力遷移 Sub-agent 全面改用 DeepSeek V4 Flash 第一方 API 單位成本降至 $0.0028/M (cache hit)
3. 加裝閘道 部署 LiteLLM 或 Claude Code Router 統一 routing、成本可觀測、自動 fallback
4. 內容工程 實施 10 項 Agent 限制,將 cache hit 推至 95%+ 300 億 raw token 實際計費 < US$500/月
5. 品質備援 加購 GLM Coding Max Kimi Vivace 複雜任務有第二模型兜底
6. 廉價備援 開通 OpenCode Go 邊緣任務、測試、背景作業

一句話行動指南

停止購買消費級訂閱,開始建立「前沿規劃+快取優化執行」的混合推論管線。