本文實測 Mac Studio M5 Ultra 256G 運行 Qwen 3.8、Qwen Image 2.1 與 MiniMax H3 的效能數據,並提供代理商與開發者的應用建議。
Mac Studio M5 Ultra 256G 是近年來少見能同時勝任本地 AI 代理、多模態生成與長上下文 RAG 的單機配置。本文整理社群實測數據,聚焦三個代表性模型:文字(Qwen 3.8)、圖片(Qwen Image 2.1 與同級生圖模型)、影片(MiniMax H3),說明這台機器實際能跑什麼、效能如何,以及哪些工作流最適合落地。
文字模型:Qwen 3.8 的本地應用
Qwen 3.8 家族(含 27B、Flash、Next 變體)在 M5 Ultra 256G 上表現相當出色,特別適合需要長上下文與多代理協作的場景。
效能數據
- 生成速度:約 55–115 tok/s,視量化等級與提示長度而定。輕量設定(Flash-Next)可達 115 tok/s,27B 4-bit 約 42.6 tok/s。
- 提示讀取:相較 M3 Ultra 提升約 3.9 倍,長提示下 TTFT(首字延遲)可從 4 分鐘縮短至約 100 秒。
- 長上下文:64K–256K token 下仍維持 60–85 tok/s 生成速度,256K 冷緩存 TTFT 約 101.5 秒。
- 多代理並發:三請求並發時總吞吐比單請求高 23%,256GB 記憶體可同時運行多個 Flash-Next 會話。
典型用途
- 本地 AI Agent / 個人助理:日常任務編排、文件整理、會議紀錄轉寫,可完全離線運行,雲端成本為零。
- 長上下文 RAG / 文件分析:合約、規格書、技術文件批量分析,PRD 自動摘要,客服知識庫問答。
- 程式輔助 / Code Agent:搭配 MCP 工具呼叫,進行自動重構、測試生成、文件生成。
- 多代理協作:主代理+子代理分工(研究、寫作、程式、審核),適合複雜專案流程。
圖片模型:Qwen Image 2.1 與生圖模型
圖片部分需區分兩類:多模態理解(Qwen Image 2.1)與實際生圖(Stable Diffusion / FLUX.2 / Z-Image Turbo 等)。
影像理解(Qwen Image 2.1 / Qwen3-VL)
- 效能:1 分鐘影片素材約 23.5 秒完成描述(Qwen3-VL 32B 實測),但內容可能只涵蓋前 29 秒,需人工核對。
- 用途:產品影片自動標籤、素材庫自動描述、短影片內容摘要、視覺 RAG。
生圖模型
- 效能:M5 Ultra 生圖速度約為 M3 Ultra 的 2–3 倍;單張生成約 10–30 秒(視模型與解析度)。實測 Qwen-Image-2.1 生成一張圖約 180 秒,峰值記憶體約 78GB。
- 用途:電商產品圖、廣告素材、社群貼文圖、多版本 A/B 測試圖、內部提案 mockup。
影片模型:MiniMax H3 的實驗性應用
MiniMax H3 是本地影片生成模型,在 M5 Ultra 256G 上「能跑,但很慢」。
- 效能:一條影片生成約 1 小時,RAM 峰值約 146GB。256GB 配置可運行,但同時多條會很快吃滿記憶體,需排隊或分批。
- 用途:內部 demo、客戶提案樣片、UGC 概念片、社群短影片草稿。不適合高頻即時產出,較適合離線批次。
- 工作流整合:文字 Agent 寫腳本 → 生圖模型產分鏡 → MiniMax H3 產短影片 → 剪輯後製。
效能總表
| 模型類型 | 代表模型 | 產出時間(M5 Ultra 256G) | 資源佔用 | 效益評估 |
|---|---|---|---|---|
| 文字 | Qwen 3.8(27B / Flash / Next) | 55–115 tok/s;長提示 TTFT ~100 秒 | 27B 4-bit 約數十 GB;可並行多會話 | 非常適合主力本地文字模型,長上下文與多代理優勢明顯 |
| 圖片(理解) | Qwen Image 2.1 / Qwen3-VL | 1 分鐘影片描述約 23.5 秒 | 依模型而異 | 速度足夠,輸出需人工核對,適合輔助流程 |
| 圖片(生圖) | SD / FLUX / Z-Image Turbo | 單張 10–30 秒;比 M3 Ultra 快 2–3 倍 | 峰值可達 78GB | 對代理商實用,降低雲端成本並提高迭代速度 |
| 影片 | MiniMax H3 | 一條約 1 小時 | 峰值 RAM 約 146GB | 能做但耗時,適合離線批次與內部使用 |
採購建議:誰適合買 Mac Studio M5 Ultra 256G?
適合的情境
- 本地文字 Agent 主力機:需要文件分析、程式輔助、多代理流程,重視資料在地與成本可控。
- 內部生圖素材工廠:快速迭代電商與廣告素材,減少對雲端生圖服務的依賴。
- 影片生成實驗床:測試本地影片流程,為客戶提供「在地運算、資料不出境」的解決方案。
- 長上下文 RAG 需求:64K–256K token 的文件分析體驗明顯優於前代。
可能不划算的情境
- 高頻影片生成:每天需大量產出短影片且對時間敏感,MiniMax H3 一條 1 小時會限制產能,建議搭配雲端或專用 GPU 伺服器。
- 僅需單一輕量模型:若無長上下文與多代理需求,較低規格的 Mac Studio 或其他本地推理機更經濟。
結論
Mac Studio M5 Ultra 256G 對「本地 AI 代理+多模態生成」是明顯夠用且體驗很好的配置。文字與圖片工作流已相當成熟,影片則屬於「可實驗、可展示」的等級。若你的核心痛點是大量快速影片產出,建議採用混合架構:Mac Studio 負責文字、圖片與實驗,影片大批量部分仍交由雲端或專用 GPU 伺服器。