Mac Studio M5 Ultra vs 雙 RTX PRO 6000:本地 LLM 部署硬體怎麼選?

,

比較 Mac Studio M5 Ultra 256GB 與雙 RTX PRO 6000 Blackwell 在本地 LLM 部署的成本、速度與適用場景,並提供明確採購建議。

在本地部署大型語言模型(LLM)時,硬體選擇往往決定開發體驗與營運成本。本文以實際可查到的價格與實測資料為基礎,比較 Mac Studio M5 Ultra 256 GB 與 雙 RTX PRO 6000 Blackwell 96 GB 兩套方案,涵蓋成本、輸出速度、功耗與適用場景,最後給出明確的採購建議。

核心結論

  • 追求安靜、低維護、單機開發與長上下文:選 Mac Studio M5 Ultra 256 GB。
  • 追求最高單路吞吐、多人 API、並行 Agent:選 2× RTX PRO 6000 Blackwell 96 GB。
  • 若只跑單一 Qwen3.8-Flash-Next-Uncensored oQ5e,Mac Studio 的 CP 值明顯較高。
  • 若要同時服務多個使用者或跑多個模型,雙 RTX PRO 6000 才有合理性。

成本估算

方案 A:Mac Studio M5 Ultra 256 GB

以跑 oQ5e、長上下文與本地 Agent 為目標,建議配置如下:

項目 估算
Mac Studio M5 Ultra 256 GB、1 TB SSD NT$330,000~370,000
升級至 2 TB/4 TB SSD +NT$15,000~40,000
外接高速 Thunderbolt/USB4 SSD 4 TB NT$12,000~25,000
UPS 或穩壓設備 NT$5,000~15,000
總建議預算 NT$350,000~430,000

如果直接買 Apple 官方高階 16 TB 配置,價格會跳到約 NT$647,900,但單純為了跑模型,不建議把大量預算花在 Apple 內建 SSD;把模型、cache、log 放到高速外接 SSD,通常比較划算。

方案 B:雙 RTX PRO 6000 Blackwell

建議不要只計算兩張 GPU,完整工作站還需要:

項目 估算
2× RTX PRO 6000 Blackwell 96 GB NT$560,000~1,100,000
Threadripper Pro/Xeon 工作站平台 NT$100,000~180,000
256~512 GB ECC RAM NT$50,000~120,000
主機板、PCIe riser、電源、機箱 NT$80,000~180,000
NVMe SSD 4~8 TB NT$20,000~50,000
散熱、組裝、保固 NT$30,000~80,000
總建議預算 NT$840,000~1,700,000

雙卡總功耗要特別注意。RTX PRO 6000 Blackwell Workstation Edition 約 600 W/張,兩張卡本身就可能吃掉約 1,200 W;加上 CPU、記憶體、風扇與 SSD,建議配置 2,000~2,400 W 等級電源與專用散熱。因此它不是「買兩張卡插進普通桌機」的方案。

預期輸出速度

目前較有參考價值的資料包括:

  • M5 Ultra 256 GB 上的 Qwen3.8-Flash-Next,短上下文約 90~110 tokens/s。
  • 16K context 約 88 tokens/s。
  • 64K context 約 84 tokens/s。
  • 128K context 約 61 tokens/s。
  • 256K context 約 75 tokens/s 的特定測試結果,但實際會受 MTP、模型量化、runtime 和 cache 狀態影響。
  • M3 Ultra 256 GB 使用類似模型與 MTP,在 context depth 0 約 42 tokens/s,32K 約 30 tokens/s,131K 約 17 tokens/s,260K 約 11 tokens/s;這顯示長上下文速度變化非常大,不能只看短 prompt benchmark。
  • M5 Max 128 GB 使用最佳化 MTP 工具,在短任務曾出現 79~126 tokens/s,但這屬於特定 runtime、cache 與 prompt 條件,不能直接等同於一般冷啟動速度。

Mac Studio M5 Ultra 256 GB

以下區間做實際採購估算:

使用情境 預估速度
短 prompt、thinking off、MTP 開啟 80~110 tok/s
一般 Coding/Agent,8K~16K context 70~95 tok/s
32K~64K context 55~85 tok/s
128K context 40~65 tok/s
200K~262K context 25~55 tok/s
thinking/長推理 實際有效輸出約 30~75 tok/s
Prefill,短 prompt 約 2,000~3,500 tok/s
Prefill,接近 256K 約 2,000~2,800 tok/s

這裡的「輸出速度」是 decode throughput,不是使用者感受到的整體回應時間。當 context 很長時,最先遇到的瓶頸通常不是生成,而是讀取與處理 prompt;例如 128K~256K context 可能需要數十秒到超過一分鐘才開始穩定輸出。

雙 RTX PRO 6000 Blackwell

目前公開資料對「Qwen3.8-Flash-Next-Uncensored oQ5e、雙 RTX PRO 6000、特定 runtime」的直接實測仍不足,因此以下是保守估算,不應視為已驗證 benchmark。

若使用適合 NVIDIA 的 Q4/Q5 GGUF、NVFP4 或其他 CUDA 量化:

使用情境 預估速度
短 prompt、單請求、MTP/speculative decoding 100~180 tok/s
一般 8K~16K context 80~150 tok/s
32K~64K context 60~120 tok/s
128K context 35~90 tok/s
256K context 20~70 tok/s
2~4 個並行請求總吞吐 150~350 tok/s
Prefill 通常高於 Mac,視 backend 與量化而定

RTX PRO 6000 單卡在其他 Qwen 模型上的公開實測可達約 77~80 tokens/s,但那不是 Qwen3.8-Flash-Next,因此只能作為 CUDA 平台的參考基準,而不能直接當成目標模型成績。

雙卡的效能不會自動等於單卡的兩倍。原因包括:

  • Expert routing 不一定平均分散。
  • Tensor parallel 會產生 PCIe/NVLink/主機板拓撲成本。
  • 某些 runtime 會把 n-gram table 或 KV cache 放在單卡或 CPU RAM。
  • 兩張卡的主要價值常常是「裝得下」與「同時跑多個請求」,不是單一請求線性加速。

若目標是單一使用者、單一長對話,雙 RTX PRO 6000 可能只比 M5 Ultra 快約 1.3~2 倍;若是多人並行服務,雙卡總吞吐才可能達到 Mac Studio 的 2~4 倍。

成本效益比較

指標 Mac Studio M5 Ultra 256 GB 2× RTX PRO 6000
初始設備成本 NT$350,000~430,000 NT$840,000~1,700,000
單路短上下文 80~110 tok/s 100~180 tok/s
長上下文穩定性 很好,統一記憶體簡單 取決於 backend 與 offload
多人並行 普通~良好 優秀
功耗 約 200~400 W 級距 約 1,500~2,000 W 整機
噪音 低 高,需工作站級散熱
維護難度 低 高
軟體相容性 MLX/oMLX 最佳 CUDA/vLLM 選擇多
每 100 tok/s 的資本成本 約 NT$320,000~540,000 約 NT$470,000~1,700,000
CP 值 較高 適合商用併發

電力與三年持有成本

假設每天運作 12 小時、每 kWh 以 NT$4 計算:

系統 估計平均功耗 三年電費
M5 Ultra Mac Studio 250~350 W 約 NT$13,000~18,000
雙 RTX PRO 6000 工作站 1,300~1,800 W 約 NT$68,000~95,000

若全天候 24/7 運作,三年電費大約會變成:

  • Mac Studio:NT$26,000~36,000。
  • 雙 RTX 工作站:NT$136,000~190,000。

這還沒有包含空調、UPS 電池、維修、風扇與機房散熱成本。對台灣辦公室而言,雙 RTX 工作站的實際能源成本通常會比單看 GPU TDP 更高。

我的建議

選 Mac Studio 的情況

Mac Studio M5 Ultra 256 GB 是比較適合你的方案,如果主要用途是:

  • 自己使用的 AI Coding Agent。
  • 長上下文文件分析。
  • 本地測試 Uncensored 模型。
  • 需要安靜、低維護的工作站。
  • 一次 1~3 個並行請求。
  • 使用 MLX/oMLX 快速測試不同模型。

建議採購:

M5 Ultra 36-core CPU/80-core GPU、256 GB unified memory、1 TB 或 2 TB 內建 SSD,加一顆 4 TB Thunderbolt 5 SSD。

不要優先買 16 TB 內建 SSD;除非你需要大量本地資料庫、影片與模型同時常駐,否則外接 SSD 的成本效益更好。

選雙 RTX PRO 6000 的情況

雙卡工作站只有在以下情況才值得:

  • 要提供 OpenAI-compatible API 給團隊或客戶。
  • 同時服務 4 個以上 Agent session。
  • 需要跑 embedding、reranker、vision、LLM 等多個模型。
  • 需要 CUDA、vLLM、SGLang 或自訂 PyTorch pipeline。
  • 願意接受約百萬台幣級距的設備成本與電力。
  • 需要未來部署其他大型模型,而不只是 Qwen3.8。

最合理的企業架構

如果是 Tenten AI 內部研發與展示用途,我會建議分兩階段:

  1. 先買 M5 Ultra 256 GB,用 oQ5e-mtp、oMLX、MTP 建立本地基準與 Agent workflow。
  2. 確認實際並發量與客戶需求後,再建立 NVIDIA GPU server,而不是一開始直接買雙 RTX PRO 6000。

以目前估算,Mac Studio 約用 NT$400,000 就能得到 70~100 tok/s 的單路體驗;雙 RTX PRO 6000 可能花 NT$1,000,000 以上,單路只增加到約 100~180 tok/s,但多人並行吞吐與 CUDA 生態會明顯更強。若不是要做商業 API 服務,雙卡的資本報酬率不如 Mac Studio。

結論

選擇本地 LLM 部署硬體,關鍵在於釐清使用情境。若以單機開發、長上下文與低維護為優先,Mac Studio M5 Ultra 256 GB 是 CP 值最高的選擇;若目標是多人並行服務、需要 CUDA 生態或未來擴充大型模型,雙 RTX PRO 6000 工作站才值得投資。先以 Mac Studio 建立基準,再依實際需求評估是否升級 GPU server,是較穩健的企業部署策略。