Qwen3.8-27B Abliterated MLX 在 M5 Max 128GB 的效能比較與安裝指南

,

比較 Qwen3.8-27B Abliterated MLX 的 4-bit、6-bit、8-bit 等版本在 M5 Max 128GB 的記憶體與速度,提供 4-bit 首選建議、安裝步驟與風險評估。

在 Apple Silicon 上執行大型語言模型時,量化版本的選擇直接影響記憶體占用、生成速度與輸出品質。本文整理 Qwen3.8-27B Abliterated MLX 各量化版本在 MacBook Pro M5 Max 128GB 上的實測數據,並提供安裝步驟與風險評估,協助你選擇最適合本機開發、coding agent 或研究用途的版本。

模型背景與重要定義

「Qwen3.8-27B Abliterated MLX」是基於 Qwen3.8-27B 的 MLX 轉換版本,透過 abliteration 技術抑制模型的拒答行為。需要特別注意的是,這類模型並非保證在所有情境下都會服從指令,而是僅在特定測試集上未出現明確拒答。因此,更精確的稱呼是 refusal-suppressed / abliterated,而非「已 jailbreak」。

Abliteration 只改變拒答行為,不代表模型更聰明、更準確、不會產生幻覺,或一定不會拒答。該模型的測試僅使用 phrase-based explicit-refusal detector,且多數回答碰到 128-token 上限,因此不能證明普遍的 jailbreak 或 universal compliance。

各量化版本效能比較

以下數據來自模型作者在 Apple M5 Max、128GB unified memory、mlx==0.32.0mlx-vlm==0.6.8、batch size 1 的單機測試,不能視為你本機的保證效能。

版本 下載容量 實測峰值記憶體 生成速度 建議
4-bit 約 14.98 GiB 21.80 GB 33.2 tok/s 首選:速度、品質、穩定性最佳平衡
6-bit 約 21.24 GiB 29.54 GB 24.7 tok/s 需要更高精度時使用
8-bit 約 27.50 GiB 37.27 GB 18.7 tok/s 品質優先,但速度較慢
BF16 約 50.98 GiB 58.29 GB 9.0 tok/s 研究、評測、LoRA,不建議日常使用
2-bit AWQ 約 10.28 GiB 16.00 GB 25.2 tok/s 不建議:工具呼叫與品質測試較弱

建議結論:4-bit 為首選

對於 MacBook Pro M5 Max 128GB,建議直接使用:

text
PocketAiHub/Qwen3.8-27B-Abliterated-MLX
variant: 4bit

理由如下:

  • 記憶體寬裕:21.8GB 峰值記憶體,對 128GB unified memory 非常寬裕。
  • 速度最快:約 33.2 tok/s,明顯比 6-bit、8-bit、BF16 快。
  • 品質驗證通過:該版本的模型卡宣稱通過 12/12 deterministic quality checks、8/8 native tool-call checks,以及文字、影像、影片 smoke tests。
  • 多模態支援:4-bit 仍保留 vision tower,因此比純文字 mlx-lm 轉換版本更適合多模態工作流。
  • 可並行執行:可以保留大量上下文、工具服務、embedding、瀏覽器或其他 agent process 同時執行。

如果你要做 coding agent、長上下文 agent orchestration 或工具呼叫,建議選 4-bit;如果你要做嚴格 benchmark、模型行為分析或品質優先的離線研究,才升級到 6-bit 或 8-bit

安裝與執行步驟

1. 建立環境

bash
python3 -m venv .venv
source .venv/bin/activate

python -m pip install -U pip
python -m pip install “mlx==0.32.0” “mlx-vlm==0.6.8” huggingface_hub

2. 只下載 4-bit

python
from pathlib import Path
from huggingface_hub import snapshot_download

repo_id = “PocketAiHub/Qwen3.8-27B-Abliterated-MLX”

snapshot = Path(
snapshot_download(
repo_id,
allow_patterns=[“4bit/*”],
)
)

print(snapshot / “4bit”)

3. 直接推理

python
from pathlib import Path
from mlx_vlm import generate, load
from mlx_vlm.prompt_utils import apply_chat_template

model_path = str(Path(snapshot) / “4bit”)

model, processor = load(model_path)

prompt = apply_chat_template(
processor,
model.config,
“請分析這段 TypeScript 程式碼的效能瓶頸,並提出可直接實作的修改方案。”,
num_images=0,
enable_thinking=False,
)

result = generate(
model,
processor,
prompt,
max_tokens=2048,
temperature=0.2,
enable_thinking=False,
)

print(result.text)

若你要啟用 Qwen3.8 的 reasoning,將 enable_thinking=True,但長上下文與推理模式會增加 token 消耗與延遲。

其他官方 MLX 版本

官方社群也提供一整組 Qwen3.8 MLX 轉換版本,包括 4-bit、8-bit、BF16、MXFP4、MXFP8、NVFP4,以及 MTP speculative decoding 權重。其中較值得注意的是:

  • mlx-community/Qwen3.8-27B-4bit:官方模型的 MLX 4-bit image-text 版本。
  • mlx-community/Qwen3.8-27B-8bit:官方模型的 MLX 8-bit 版本。
  • mlx-community/Qwen3.8-27B-OptiQ-4bit:混合精度 4-bit,支援 image-text、mixed-precision KV cache、LoRA 與 OpenAI/Anthropic-compatible server。
  • mlx-community/Qwen3.8-27B-MTP-4bit:搭配 MTP speculative decoding 使用,不是獨立的完整主模型。

這些官方 MLX 版本是較乾淨、較容易信任的基礎模型,但沒有套用「降低拒答」的修改。若目標是本機 coding、agent、研究與工具呼叫,應先用官方 4-bit 建立 baseline,再與 abliterated 4-bit 做同一套測試比較。

風險評估與驗證建議

Abliteration 只改變模型的拒答行為,不代表:

  • 模型更聰明。
  • 模型更準確。
  • 模型不會產生幻覺。
  • 模型真的能回答所有問題。
  • 模型一定不會拒答。
  • 模型輸出適合直接接到 production agent。

建議在你的環境建立三組測試:

text

  1. 一般 coding prompts
  2. 工具呼叫與 JSON schema prompts
  3. 你自己的 refusal / instruction-following benchmark

並比較:

text
官方 Qwen3.8-27B MLX 4-bit
PocketAiHub Qwen3.8-27B Abliterated MLX 4-bit
PocketAiHub Qwen3.8-27B Abliterated MLX 6-bit

最終推薦排序:

  1. 日常使用:Abliterated MLX 4-bit
  2. 品質優先:Abliterated MLX 6-bit
  3. 官方基準:mlx-community Qwen3.8-27B-4bit
  4. 極致精度研究:Abliterated MLX 8-bit
  5. 避免使用:2-bit AWQ,因為目前工具呼叫與品質驗證結果較差。

結論

Qwen3.8-27B Abliterated MLX 4-bit 是 MacBook Pro M5 Max 128GB 上日常使用的最佳平衡點,提供 33.2 tok/s 的生成速度與 21.8GB 的記憶體占用。若需要更高品質輸出,可升級至 6-bit 或 8-bit;若進行嚴格研究,則建議以官方 4-bit 作為 baseline 進行比較。無論選擇哪個版本,都應先在自己的環境中建立測試集,驗證模型是否符合實際需求。