Mac Studio M5 Ultra 256G 本地 AI 模型實測:文字、圖片、影片用途

本文實測 Mac Studio M5 Ultra 256G 運行 Qwen 3.8、Qwen Image 2.1 與 MiniMax H3 的效能數據,並提供代理商與開發者的應用建議。

Mac Studio M5 Ultra 256G 是近年來少見能同時勝任本地 AI 代理、多模態生成與長上下文 RAG 的單機配置。本文整理社群實測數據,聚焦三個代表性模型:文字(Qwen 3.8)、圖片(Qwen Image 2.1 與同級生圖模型)、影片(MiniMax H3),說明這台機器實際能跑什麼、效能如何,以及哪些工作流最適合落地。

文字模型:Qwen 3.8 的本地應用

Qwen 3.8 家族(含 27B、Flash、Next 變體)在 M5 Ultra 256G 上表現相當出色,特別適合需要長上下文與多代理協作的場景。

效能數據

  • 生成速度:約 55–115 tok/s,視量化等級與提示長度而定。輕量設定(Flash-Next)可達 115 tok/s,27B 4-bit 約 42.6 tok/s。
  • 提示讀取:相較 M3 Ultra 提升約 3.9 倍,長提示下 TTFT(首字延遲)可從 4 分鐘縮短至約 100 秒。
  • 長上下文:64K–256K token 下仍維持 60–85 tok/s 生成速度,256K 冷緩存 TTFT 約 101.5 秒。
  • 多代理並發:三請求並發時總吞吐比單請求高 23%,256GB 記憶體可同時運行多個 Flash-Next 會話。

典型用途

  • 本地 AI Agent / 個人助理:日常任務編排、文件整理、會議紀錄轉寫,可完全離線運行,雲端成本為零。
  • 長上下文 RAG / 文件分析:合約、規格書、技術文件批量分析,PRD 自動摘要,客服知識庫問答。
  • 程式輔助 / Code Agent:搭配 MCP 工具呼叫,進行自動重構、測試生成、文件生成。
  • 多代理協作:主代理+子代理分工(研究、寫作、程式、審核),適合複雜專案流程。

圖片模型:Qwen Image 2.1 與生圖模型

圖片部分需區分兩類:多模態理解(Qwen Image 2.1)與實際生圖(Stable Diffusion / FLUX.2 / Z-Image Turbo 等)。

影像理解(Qwen Image 2.1 / Qwen3-VL)

  • 效能:1 分鐘影片素材約 23.5 秒完成描述(Qwen3-VL 32B 實測),但內容可能只涵蓋前 29 秒,需人工核對。
  • 用途:產品影片自動標籤、素材庫自動描述、短影片內容摘要、視覺 RAG。

生圖模型

  • 效能:M5 Ultra 生圖速度約為 M3 Ultra 的 2–3 倍;單張生成約 10–30 秒(視模型與解析度)。實測 Qwen-Image-2.1 生成一張圖約 180 秒,峰值記憶體約 78GB。
  • 用途:電商產品圖、廣告素材、社群貼文圖、多版本 A/B 測試圖、內部提案 mockup。

影片模型:MiniMax H3 的實驗性應用

MiniMax H3 是本地影片生成模型,在 M5 Ultra 256G 上「能跑,但很慢」。

  • 效能:一條影片生成約 1 小時,RAM 峰值約 146GB。256GB 配置可運行,但同時多條會很快吃滿記憶體,需排隊或分批。
  • 用途:內部 demo、客戶提案樣片、UGC 概念片、社群短影片草稿。不適合高頻即時產出,較適合離線批次。
  • 工作流整合:文字 Agent 寫腳本 → 生圖模型產分鏡 → MiniMax H3 產短影片 → 剪輯後製。

效能總表

模型類型 代表模型 產出時間(M5 Ultra 256G) 資源佔用 效益評估
文字 Qwen 3.8(27B / Flash / Next) 55–115 tok/s;長提示 TTFT ~100 秒 27B 4-bit 約數十 GB;可並行多會話 非常適合主力本地文字模型,長上下文與多代理優勢明顯
圖片(理解) Qwen Image 2.1 / Qwen3-VL 1 分鐘影片描述約 23.5 秒 依模型而異 速度足夠,輸出需人工核對,適合輔助流程
圖片(生圖) SD / FLUX / Z-Image Turbo 單張 10–30 秒;比 M3 Ultra 快 2–3 倍 峰值可達 78GB 對代理商實用,降低雲端成本並提高迭代速度
影片 MiniMax H3 一條約 1 小時 峰值 RAM 約 146GB 能做但耗時,適合離線批次與內部使用

採購建議:誰適合買 Mac Studio M5 Ultra 256G?

適合的情境

  • 本地文字 Agent 主力機:需要文件分析、程式輔助、多代理流程,重視資料在地與成本可控。
  • 內部生圖素材工廠:快速迭代電商與廣告素材,減少對雲端生圖服務的依賴。
  • 影片生成實驗床:測試本地影片流程,為客戶提供「在地運算、資料不出境」的解決方案。
  • 長上下文 RAG 需求:64K–256K token 的文件分析體驗明顯優於前代。

可能不划算的情境

  • 高頻影片生成:每天需大量產出短影片且對時間敏感,MiniMax H3 一條 1 小時會限制產能,建議搭配雲端或專用 GPU 伺服器。
  • 僅需單一輕量模型:若無長上下文與多代理需求,較低規格的 Mac Studio 或其他本地推理機更經濟。

結論

Mac Studio M5 Ultra 256G 對「本地 AI 代理+多模態生成」是明顯夠用且體驗很好的配置。文字與圖片工作流已相當成熟,影片則屬於「可實驗、可展示」的等級。若你的核心痛點是大量快速影片產出,建議採用混合架構:Mac Studio 負責文字、圖片與實驗,影片大批量部分仍交由雲端或專用 GPU 伺服器。