M5 Max 128GB 跑本地 LLM:Qwen3.5 122B、235B 與 DeepSeek-R1 MLX 量化版本完整測評

MacBook Pro M5 Max 128GB 能跑多大的模型?實測 Qwen3.5-122B 4-bit、Qwen3-235B 混合量化、DeepSeek-R1 3-bit 等 MLX 版本,含記憶體試算、安裝指令與適用場景對照表,助你找到最佳本地主力模型。

核心結論

MacBook Pro M5 Max 128GB 統一記憶體足以運行遠超 27B 參數的模型。目前最值得升級測試的順序為:

  1. Qwen3.5-122B-A10B 4-bit MLX(約 64.9 GB)——綜合能力、速度與記憶體平衡的首選
  2. Qwen3-235B-A22B mixed 3–4-bit MLX(約 70–85 GB)——極限文字能力,犧牲速度與穩定性
  3. DeepSeek-R1-0528 3-bit MLX(約 100 GB)——數學、邏輯推理專用
  4. Qwen3-VL-235B-A22B 3-bit MLX——需視覺能力時的選擇
  5. Qwen3.5-35B-A3B 4-bit/6-bit MLX——長時間 Agent、Coding 循環的最佳平衡

:warning: 圖片中的 qwen3.8-27b-aeon-ultimate-uncensored-mlx 疑為第三方 fine-tune 或 merge 版本,非 Qwen 官方釋出的 Qwen3.5-27B。官方已提供 Apple Silicon 專用的 mlx-lm / mlx-vlm 支援。


適配 128GB M5 Max 的模型完整對照表

以下按「整體能力上限」排序,而非單純參數量。能否啟動仍受 context length、macOS 版本、MLX 版本、量化格式與背景程式佔用影響。

排名 模型 量化/預估大小 128GB 可行性 相對 27B 現有模型的意義 官方下載連結
1 Qwen3.5-122B-A10B-Text-mxfp4-mlx 4-bit,約 64.9 GB :white_check_mark: 最推薦 MoE 架構,總參數 122B、每 token 約 10B active,推理與知識能力預期明顯高於 27B dense Hugging Face
2 Qwen3.5-122B-A10B-Text-qx64-hi-mlx 約 6-bit,85–95 GB :white_check_mark: 需關閉大型程式 接近原始權重品質,適合長文本、推理與 coding Hugging Face
3 Qwen3-235B-A22B-mixed-3-6bit mixed 3–6-bit,90–115 GB :warning: 勉強可用 更大模型容量,適合複雜推理;速度與穩定性不如 Qwen3.5-122B Hugging Face
4 Qwen3-235B-A22B-mixed-3-4bit mixed 3–4-bit,70–85 GB :white_check_mark: 較實際的 235B 選項 品質通常高於 27B,但可能不如 Qwen3.5 122B 新架構 Hugging Face
5 Qwen3-235B-A22B-3bit 3-bit,75–90 GB :white_check_mark: 可用 推理與知識容量極高,但 3-bit 可能導致細節與格式遵循下降 Hugging Face
6 DeepSeek-R1-0528-3bit 671B MoE,3-bit,約 100 GB :white_check_mark: 可嘗試 專注數學、推理、分析與複雜問題;一般聊天、速度、Agent 指令未必勝過 Qwen3.5 Hugging Face
7 DeepSeek-R1-3bit 671B MoE,3-bit :white_check_mark: 可嘗試 強推理模型,但世代較舊,建議優先用 0528 版本 Hugging Face
8 Qwen3-VL-235B-A22B-Instruct-3bit 3-bit :white_check_mark: 可嘗試 需讀圖、文件、UI、產品照片或 OCR 時的最佳選擇 Hugging Face Collection
9 Qwen3-VL-235B-A22B-Thinking-3bit 3-bit :white_check_mark: 可嘗試 視覺推理更強,但速度、記憶體與穩定性要求更高 Hugging Face Collection
10 Qwen3.5-35B-A3B-Text-qx64-hi-mlx 約 6-bit,25–35 GB :white_check_mark: 非常適合 速度、品質、Agent 與 coding 的最佳平衡之一 Hugging Face
11 Qwen3.5-35B-A3B-Text-mxfp4-mlx 4-bit :white_check_mark: 非常適合 比 122B 快很多,適合長時間 Agent、coding loop 與本機 API service Hugging Face
12 Qwen3.5-27B 官方 MLX 量化版 4–8-bit :white_check_mark: 非常適合 官方基礎模型,比未驗證的 uncensored merge 更穩定,適合基準線 Qwen 官方
13 Brooooooklyn/Qwen3.5-27B-unsloth-mlx 3-bit 約 18.7 GB :white_check_mark: 非常適合 速度快、記憶體低,適合與現有模型做公平 benchmark Hugging Face
14 gemma-3-27b-it-4bit 4-bit,約 16.9 GB :white_check_mark: 非常適合 具視覺輸入,文件理解與圖片問答實用,但純文字推理未必勝過 Qwen3.5 Hugging Face

三大首選模型深度解析

1. Qwen3.5-122B-A10B 4-bit —— 主力模型首選

為何推薦:總參數 122B 的 MoE 架構,每次前向傳播僅啟用約 10B active parameters,使推理速度與記憶體需求遠優於同參數量的 dense 模型。MLX 版本約 64.9 GB,在 128 GB 統一記憶體下仍保留充足空間給 KV cache、macOS 系統與背景應用。

適合場景:

  • 複雜 coding 與軟體架構設計
  • Agent planning 與多步驟任務分解
  • 長文件分析與多語言(含繁體中文)處理
  • SEO、GEO、研究報告與內容生成
  • 取代現有 27B 模型作為主要本機模型

快速測試指令:

pip install -U mlx-lm

mlx_lm.generate \
  --model nightmedia/Qwen3.5-122B-A10B-Text-mxfp4-mlx \
  --prompt "請分析以下軟體架構,提出可實作的改善方案:" \
  --max-tokens 2048

若使用 MLX GUI(如 LM Studio、Ollama、Jan 等),直接搜尋 Qwen3.5-122B-A10B,優先選擇 mxfp4-mlx 或官方 mlx-community 版本,避免無 README、無量化說明的 re-upload 版本。

2. Qwen3-235B-A22B mixed 3–4-bit —— 極限文字能力備選

定位:「用更多模型容量換取更高品質」的離線研究模型,而非日常主力。

三大缺點:

  • 對 128 GB 餘裕極小(模型檔 70–85 GB + 系統開銷)
  • 3-bit 量化品質損失可能大於 Qwen3.5 的 4-bit
  • 輸出速度明顯低於 Qwen3.5-122B-A10B

建議用途:需要極大模型容量的複雜推理、長文本綜合、離線深度研究任務。

3. DeepSeek-R1-0528 3-bit —— 推理專用模型

適用場景:

  • 數學證明與競賽級問題
  • 邏輯推理鏈條長的技術研究
  • 程式除錯與複雜規劃
  • 需要模型展開完整思考過程(CoT)的工作

不適合場景:一般聊天、簡潔回覆、工具呼叫、格式控制、中文內容創作、長時間 Agent 服務。DeepSeek-R1 類模型通常較慢、輸出冗長思考內容,且在指令遵循與工具使用上不如 Qwen3.5 系列方便。


依主要用途的選型決策表

主要用途 建議模型 核心理由
全方位本機主力模型 Qwen3.5-122B-A10B 4-bit 品質、速度、記憶體與新架構的最佳平衡
最高文字能力極限 Qwen3-235B-A22B mixed 3–6-bit 模型容量最大,但速度慢、相容性挑剔
數學與深度推理 DeepSeek-R1-0528-3bit 針對 reasoning 最值得測試
圖片、PDF、UI、產品圖理解 Qwen3-VL-235B-A22B-Instruct-3bit 具備 vision-language 能力
快速 Coding Agent / 長循環 Qwen3.5-35B-A3B 4-bit/6-bit 速度快、記憶體餘裕大,適合長時間運作
Uncensored / 低限制對話 Qwen3.5-122B 或 35B 的 uncensored fine-tune 需逐一檢查模型來源與實際行為
穩定本機 API 服務 Qwen3.5-35B-A3B 4-bit 記憶體餘裕較大,長時間運作穩定

128GB 統一記憶體的實際限制與試算

「模型檔案 < 128 GB」≠「舒適運作」。必須預留:

  • macOS 系統與背景程式:8–15 GB
  • KV cache:context 越長佔用越高(32k context 可能佔數 GB)
  • MLX 暫存緩衝區
  • GUI、瀏覽器、IDE、Docker、本機資料庫等
  • 多模型同時載入的額外開銷

實際可用區間建議

模型檔案大小 實際建議
15–35 GB 非常舒適,適合日常主力使用
40–70 GB 適合長期使用,保有合理 context 空間
70–90 GB 可運作,但應關閉大型應用程式(瀏覽器、IDE、Docker)
90–110 GB 僅適合測試或短 context(< 8k)
> 110 GB 不建議在 128GB M5 Max 上使用

:warning: 已知問題:GitHub Issue #1641 記錄在 M5 Max 128GB 上執行 Qwen3.5-122B 時,長生成可能因 MLX Metal buffer object 累積導致程序終止。這屬於 mlx-lm pipeline 實作問題,非單純硬體 RAM 不足。建議長文本任務分批處理或監控記憶體壓力。


建議安裝順序與驗證流程

針對你的用途——本機模型測試、AI Agent、coding、企業導入、內容與網站自動化——建議依序安裝驗證:

  1. 主力模型:nightmedia/Qwen3.5-122B-A10B-Text-mxfp4-mlx
  2. 高品質研究模型:mlx-community/Qwen3-235B-A22B-mixed-3-4bit
  3. 推理專用模型:mlx-community/DeepSeek-R1-0528-3bit
  4. 快速 Agent 模型:nightmedia/Qwen3.5-35B-A3B-Text-qx64-hi-mlx
  5. 視覺模型:mlx-community/Qwen3-VL-235B-A22B-Instruct-3bit
  6. 公平基準線:官方 Qwen3.5-27B MLX 4-bit 或 6-bit 版本

驗證腳本範例(可存為 benchmark.py)

import time
import psutil
from mlx_lm import load, generate

MODELS = [
    "nightmedia/Qwen3.5-122B-A10B-Text-mxfp4-mlx",
    "mlx-community/Qwen3-235B-A22B-mixed-3-4bit",
    "nightmedia/Qwen3.5-35B-A3B-Text-qx64-hi-mlx",
]

PROMPT = "請用繁體中文撰寫一份技術部落格大綱,主題為『RAG 系統在企業知識庫的落地挑戰與解決方案』,包含架構圖說明、向量資料庫選型、檢索策略優化、評估指標四大章節。"

for model_id in MODELS:
    print(f"\n=== Loading {model_id} ===")
    start = time.time()
    model, tokenizer = load(model_id)
    load_time = time.time() - start
    
    mem = psutil.virtual_memory()
    print(f"Load time: {load_time:.1f}s | RAM used: {mem.used/1024**3:.1f}GB / {mem.total/1024**3:.1f}GB")
    
    start = time.time()
    output = generate(model, tokenizer, prompt=PROMPT, max_tokens=1024, verbose=False)
    gen_time = time.time() - start
    tokens = len(tokenizer.encode(output))
    print(f"Generation: {gen_time:.1f}s | {tokens} tokens | {tokens/gen_time:.1f} tok/s")
    print(f"Output preview: {output[:200]}...")

執行後可獲得載入時間、記憶體佔用、生成速度與輸出品質的量化比較。


關鍵取捨總結

你的目標 先測這個模型
綜合能力超越目前 27B uncensored 模型 Qwen3.5-122B-A10B 4-bit
更快、更適合長時間 Agent / Coding 循環 Qwen3.5-35B-A3B 4-bit/6-bit
極限 reasoning、數學、邏輯證明 DeepSeek-R1-0528 3-bit
需要讀圖、OCR、UI 分析 Qwen3-VL-235B-A22B-Instruct-3bit

最終建議:先跑 Qwen3.5-122B-A10B 4-bit 一週作為主力,若滿足 90% 需求即可定案;剩餘模型按專項需求按需載入。128GB M5 Max 的真正優勢在於可同時保留多個不同專長的模型,依任務動態切換,而非單一追求最大參數量。