比較 Mac Studio M5 Ultra 256GB 與雙 RTX PRO 6000 Blackwell 在本地 LLM 部署的成本、速度與適用場景,並提供明確採購建議。
在本地部署大型語言模型(LLM)時,硬體選擇往往決定開發體驗與營運成本。本文以實際可查到的價格與實測資料為基礎,比較 Mac Studio M5 Ultra 256 GB 與 雙 RTX PRO 6000 Blackwell 96 GB 兩套方案,涵蓋成本、輸出速度、功耗與適用場景,最後給出明確的採購建議。
核心結論
- 追求安靜、低維護、單機開發與長上下文:選 Mac Studio M5 Ultra 256 GB。
- 追求最高單路吞吐、多人 API、並行 Agent:選 2× RTX PRO 6000 Blackwell 96 GB。
- 若只跑單一 Qwen3.8-Flash-Next-Uncensored oQ5e,Mac Studio 的 CP 值明顯較高。
- 若要同時服務多個使用者或跑多個模型,雙 RTX PRO 6000 才有合理性。
成本估算
方案 A:Mac Studio M5 Ultra 256 GB
以跑 oQ5e、長上下文與本地 Agent 為目標,建議配置如下:
| 項目 | 估算 |
|---|---|
| Mac Studio M5 Ultra 256 GB、1 TB SSD | NT$330,000~370,000 |
| 升級至 2 TB/4 TB SSD | +NT$15,000~40,000 |
| 外接高速 Thunderbolt/USB4 SSD 4 TB | NT$12,000~25,000 |
| UPS 或穩壓設備 | NT$5,000~15,000 |
| 總建議預算 | NT$350,000~430,000 |
如果直接買 Apple 官方高階 16 TB 配置,價格會跳到約 NT$647,900,但單純為了跑模型,不建議把大量預算花在 Apple 內建 SSD;把模型、cache、log 放到高速外接 SSD,通常比較划算。
方案 B:雙 RTX PRO 6000 Blackwell
建議不要只計算兩張 GPU,完整工作站還需要:
| 項目 | 估算 |
|---|---|
| 2× RTX PRO 6000 Blackwell 96 GB | NT$560,000~1,100,000 |
| Threadripper Pro/Xeon 工作站平台 | NT$100,000~180,000 |
| 256~512 GB ECC RAM | NT$50,000~120,000 |
| 主機板、PCIe riser、電源、機箱 | NT$80,000~180,000 |
| NVMe SSD 4~8 TB | NT$20,000~50,000 |
| 散熱、組裝、保固 | NT$30,000~80,000 |
| 總建議預算 | NT$840,000~1,700,000 |
雙卡總功耗要特別注意。RTX PRO 6000 Blackwell Workstation Edition 約 600 W/張,兩張卡本身就可能吃掉約 1,200 W;加上 CPU、記憶體、風扇與 SSD,建議配置 2,000~2,400 W 等級電源與專用散熱。因此它不是「買兩張卡插進普通桌機」的方案。
預期輸出速度
目前較有參考價值的資料包括:
- M5 Ultra 256 GB 上的 Qwen3.8-Flash-Next,短上下文約 90~110 tokens/s。
- 16K context 約 88 tokens/s。
- 64K context 約 84 tokens/s。
- 128K context 約 61 tokens/s。
- 256K context 約 75 tokens/s 的特定測試結果,但實際會受 MTP、模型量化、runtime 和 cache 狀態影響。
- M3 Ultra 256 GB 使用類似模型與 MTP,在 context depth 0 約 42 tokens/s,32K 約 30 tokens/s,131K 約 17 tokens/s,260K 約 11 tokens/s;這顯示長上下文速度變化非常大,不能只看短 prompt benchmark。
- M5 Max 128 GB 使用最佳化 MTP 工具,在短任務曾出現 79~126 tokens/s,但這屬於特定 runtime、cache 與 prompt 條件,不能直接等同於一般冷啟動速度。
Mac Studio M5 Ultra 256 GB
以下區間做實際採購估算:
| 使用情境 | 預估速度 |
|---|---|
| 短 prompt、thinking off、MTP 開啟 | 80~110 tok/s |
| 一般 Coding/Agent,8K~16K context | 70~95 tok/s |
| 32K~64K context | 55~85 tok/s |
| 128K context | 40~65 tok/s |
| 200K~262K context | 25~55 tok/s |
| thinking/長推理 | 實際有效輸出約 30~75 tok/s |
| Prefill,短 prompt | 約 2,000~3,500 tok/s |
| Prefill,接近 256K | 約 2,000~2,800 tok/s |
這裡的「輸出速度」是 decode throughput,不是使用者感受到的整體回應時間。當 context 很長時,最先遇到的瓶頸通常不是生成,而是讀取與處理 prompt;例如 128K~256K context 可能需要數十秒到超過一分鐘才開始穩定輸出。
雙 RTX PRO 6000 Blackwell
目前公開資料對「Qwen3.8-Flash-Next-Uncensored oQ5e、雙 RTX PRO 6000、特定 runtime」的直接實測仍不足,因此以下是保守估算,不應視為已驗證 benchmark。
若使用適合 NVIDIA 的 Q4/Q5 GGUF、NVFP4 或其他 CUDA 量化:
| 使用情境 | 預估速度 |
|---|---|
| 短 prompt、單請求、MTP/speculative decoding | 100~180 tok/s |
| 一般 8K~16K context | 80~150 tok/s |
| 32K~64K context | 60~120 tok/s |
| 128K context | 35~90 tok/s |
| 256K context | 20~70 tok/s |
| 2~4 個並行請求總吞吐 | 150~350 tok/s |
| Prefill | 通常高於 Mac,視 backend 與量化而定 |
RTX PRO 6000 單卡在其他 Qwen 模型上的公開實測可達約 77~80 tokens/s,但那不是 Qwen3.8-Flash-Next,因此只能作為 CUDA 平台的參考基準,而不能直接當成目標模型成績。
雙卡的效能不會自動等於單卡的兩倍。原因包括:
- Expert routing 不一定平均分散。
- Tensor parallel 會產生 PCIe/NVLink/主機板拓撲成本。
- 某些 runtime 會把 n-gram table 或 KV cache 放在單卡或 CPU RAM。
- 兩張卡的主要價值常常是「裝得下」與「同時跑多個請求」,不是單一請求線性加速。
若目標是單一使用者、單一長對話,雙 RTX PRO 6000 可能只比 M5 Ultra 快約 1.3~2 倍;若是多人並行服務,雙卡總吞吐才可能達到 Mac Studio 的 2~4 倍。
成本效益比較
| 指標 | Mac Studio M5 Ultra 256 GB | 2× RTX PRO 6000 |
|---|---|---|
| 初始設備成本 | NT$350,000~430,000 | NT$840,000~1,700,000 |
| 單路短上下文 | 80~110 tok/s | 100~180 tok/s |
| 長上下文穩定性 | 很好,統一記憶體簡單 | 取決於 backend 與 offload |
| 多人並行 | 普通~良好 | 優秀 |
| 功耗 | 約 200~400 W 級距 | 約 1,500~2,000 W 整機 |
| 噪音 | 低 | 高,需工作站級散熱 |
| 維護難度 | 低 | 高 |
| 軟體相容性 | MLX/oMLX 最佳 | CUDA/vLLM 選擇多 |
| 每 100 tok/s 的資本成本 | 約 NT$320,000~540,000 | 約 NT$470,000~1,700,000 |
| CP 值 | 較高 | 適合商用併發 |
電力與三年持有成本
假設每天運作 12 小時、每 kWh 以 NT$4 計算:
| 系統 | 估計平均功耗 | 三年電費 |
|---|---|---|
| M5 Ultra Mac Studio | 250~350 W | 約 NT$13,000~18,000 |
| 雙 RTX PRO 6000 工作站 | 1,300~1,800 W | 約 NT$68,000~95,000 |
若全天候 24/7 運作,三年電費大約會變成:
- Mac Studio:NT$26,000~36,000。
- 雙 RTX 工作站:NT$136,000~190,000。
這還沒有包含空調、UPS 電池、維修、風扇與機房散熱成本。對台灣辦公室而言,雙 RTX 工作站的實際能源成本通常會比單看 GPU TDP 更高。
我的建議
選 Mac Studio 的情況
Mac Studio M5 Ultra 256 GB 是比較適合你的方案,如果主要用途是:
- 自己使用的 AI Coding Agent。
- 長上下文文件分析。
- 本地測試 Uncensored 模型。
- 需要安靜、低維護的工作站。
- 一次 1~3 個並行請求。
- 使用 MLX/oMLX 快速測試不同模型。
建議採購:
M5 Ultra 36-core CPU/80-core GPU、256 GB unified memory、1 TB 或 2 TB 內建 SSD,加一顆 4 TB Thunderbolt 5 SSD。
不要優先買 16 TB 內建 SSD;除非你需要大量本地資料庫、影片與模型同時常駐,否則外接 SSD 的成本效益更好。
選雙 RTX PRO 6000 的情況
雙卡工作站只有在以下情況才值得:
- 要提供 OpenAI-compatible API 給團隊或客戶。
- 同時服務 4 個以上 Agent session。
- 需要跑 embedding、reranker、vision、LLM 等多個模型。
- 需要 CUDA、vLLM、SGLang 或自訂 PyTorch pipeline。
- 願意接受約百萬台幣級距的設備成本與電力。
- 需要未來部署其他大型模型,而不只是 Qwen3.8。
最合理的企業架構
如果是 Tenten AI 內部研發與展示用途,我會建議分兩階段:
- 先買 M5 Ultra 256 GB,用 oQ5e-mtp、oMLX、MTP 建立本地基準與 Agent workflow。
- 確認實際並發量與客戶需求後,再建立 NVIDIA GPU server,而不是一開始直接買雙 RTX PRO 6000。
以目前估算,Mac Studio 約用 NT$400,000 就能得到 70~100 tok/s 的單路體驗;雙 RTX PRO 6000 可能花 NT$1,000,000 以上,單路只增加到約 100~180 tok/s,但多人並行吞吐與 CUDA 生態會明顯更強。若不是要做商業 API 服務,雙卡的資本報酬率不如 Mac Studio。
結論
選擇本地 LLM 部署硬體,關鍵在於釐清使用情境。若以單機開發、長上下文與低維護為優先,Mac Studio M5 Ultra 256 GB 是 CP 值最高的選擇;若目標是多人並行服務、需要 CUDA 生態或未來擴充大型模型,雙 RTX PRO 6000 工作站才值得投資。先以 Mac Studio 建立基準,再依實際需求評估是否升級 GPU server,是較穩健的企業部署策略。