Qwen3.8-27B Abliterated MLX 下載與安裝:Mac 本機 Uncensored 指南

在 Apple Silicon 上以 MLX 執行 Qwen3.8-27B abliterated/uncensored 模型的實作指南:比較主要版本、量化精度、下載與執行步驟,並提醒自動化使用風險。

先弄清楚:你要的其實是 abliterated/uncensored MLX

在 Apple Silicon 上用 MLX 跑「比較不會拒答」的 Qwen3.8-27B 時,通常不是指一個用 prompt 觸發的 jailbreak 模型,而是原始 Qwen3.8-27B 先經過 abliteration(移除 refusal direction)處理,再轉成 MLX 量化格式。更精準的名稱是 abliterateduncensoredrefusal-removedno-refusal

一般社群轉換的 mlx-community/Qwen3.8-27B-4bitmlx-community/Qwen3.8-27B-8bit 只有把原始模型量化成 Apple Silicon 可用格式,不會改變拒答行為,也不是 jailbreak/uncensored 模型。

兩個最符合需求的 MLX 模型

模型 類型 Apple Silicon 適用性 建議
orcarouter/Qwen3.8-27B-Uncensored-MLX Abliterated/refusal-removed MLX 提供 2/4/6/8-bit,支援 mlx-vlm,文字與圖片皆可 最直接符合需求
PocketAiHub/Qwen3.8-27B-Abliterated-MLX Abliterated MLX 衍伸版 提供 2/4/6/8-bit、BF16,保留 vision tower 適合比較不同量化版本
huihui-ai/Huihui-Qwen3.8-27B-abliterated 上游 abliterated 原始模型 不是預先轉好的 MLX 版本 可作為自行轉換的上游來源
mlx-community/Qwen3.8-27B-4bit8bit 原始模型的標準 MLX 量化 Apple Silicon 可執行,但不是 uncensored 只想保留原始安全行為時使用

其中 orcarouter/Qwen3.8-27B-Uncensored-MLX 的官方說明包含:

  • 4-bit 約 15 GB
  • 6-bit 約 22 GB
  • 8-bit 約 27.5 GB
  • 2-bit 約 8.7 GB,品質下降明顯,不建議實際工作用
  • 保留 normalization layers 與 convolution layers 為 BF16
  • 4/6/8-bit 均保留圖片理解能力
  • 需要 mlx-vlm >= 0.6.13mlx >= 0.32

在 Mac 上安裝與執行

建議先更新 Python 套件:

python -m pip install -U 'mlx-vlm>=0.6.13' 'mlx>=0.32'

下載 orcarouter 的 4-bit 分割:

hf download orcarouter/Qwen3.8-27B-Uncensored-MLX --include '4-bit/*' --local-dir ./Qwen3.8-27B-Uncensored-MLX

跑文字生成:

python -m mlx_vlm generate --model ./Qwen3.8-27B-Uncensored-MLX/4-bit --prompt 'Explain the architecture of a PostgreSQL vector database.' --max-tokens 512

跑圖片描述:

python -m mlx_vlm generate --model ./Qwen3.8-27B-Uncensored-MLX/4-bit --image ./image.png --prompt 'Describe this image in detail.' --max-tokens 512

其他 MLX 版本的注意事項

mlx-lm 的純文字實作有時會移除 vision encoder 與 MTP drafter。例如某些 Qwen3.8-27B-MLX-4bit 版本只支援文字,不接受圖片或影片。如果你要保留 Qwen3.8-27B 的多模態能力,優先選用使用 mlx-vlm 的版本,例如:

  • orcarouter/Qwen3.8-27B-Uncensored-MLX
  • PocketAiHub/Qwen3.8-27B-Abliterated-MLX
  • mlx-community/Qwen3.8-27B-4bit

想要更完整比較:PocketAiHub 版本

PocketAiHub/Qwen3.8-27B-Abliterated-MLX 把多種量化放進同一個 repository:

2bit/
4bit/
6bit/
8bit/
bf16/

該模型卡記錄了 abliteration 的來源與測試方式:

  • 以 256 組 harmful/harmless prompts 計算 refusal direction
  • 修改第 24 至 63 層的 residual-output matrices
  • 4-bit、6-bit、8-bit、BF16 均通過文字、圖片、工具呼叫與 4K context smoke tests
  • 4-bit 約 15 GB,8-bit 約 27.5 GB,BF16 約 51 GB

官方測試中,M5 Max 128 GB 單機上的速度約為 4-bit 33.2 tok/s、8-bit 18.7 tok/s。這是作者的本機測試,不代表所有 Mac 的實際速度。

量化精度怎麼選

如果你的 Mac 是 M5 Max 128 GB,可以這樣選:

用途 建議版本 原因
日常 coding、agent、文字任務 4-bit 速度與品質平衡最好
中文、程式碼品質優先 6-bit 比 4-bit 更保守,記憶體仍充足
想接近原始模型品質 8-bit 品質較穩定,但速度與記憶體成本較高
測試原始權重 BF16 約 51 GB,128 GB Mac 可以跑
不建議 2-bit 壓縮過度,可能出現重複、亂碼與不穩定輸出

記憶體足夠時:27B 還是 70B?

128 GB Blobin Memory 的機器不只能跑 27B;但「跑得動」與「適合長 context、agent、MCP 工作流」不同。一般參考:

模型規模 建議精度 Mac 場合
27B 6/8-bit/BF16 非常舒服,可保留大量 context
32–35B MoE 4/6-bit 速度與品質的最佳平衡點之一
70–72B dense 4/5-bit 可以實用,但速度明顯較慢
70–72B dense 8-bit 可載入,但 context 餘裕變小
100B 以上 2/3-bit 技術上可跑,實務上通常不值得拿來當日常模型

如果主要用途是類 Agent、MCP 與本機自動化,很多情境下 27B 的高精度版本會比 70B 的極低 bit 版本更穩定。

建議的模型組合

主力模型:Qwen3.8-27B-Abliterated-MLX 4-bit
高品質模型:Qwen3.8-27B 8-bit 或 BF16
大型 reasoning 模型:Qwen 70B/72B Q4/Q5 或 DeepSeek-R1-Distill-Llama-70B Q4
長文件與英文分析:Llama 3.3 70B Instruct Q4
圖片/截圖/鑑UI:Qwen3.8-27B MLX 6/8-bit
工作類型 建議
日常 coding、彼此問答、agent Qwen3.8-27B Abliterated MLX 4/6-bit
高品質 coding、複雜語構 Qwen3.8-27B 8-bit 或 BF16
深度 reasoning、架構設計 Qwen 70B/72B 4/5-bit
長文件與英文文本 Llama 3.3 70B Instruct Q4
數學、規劃、深度推理 DeepSeek-R1-Distill-Llama-70B Q4
圖片、截圖、文件 OCR Qwen3.8-27B MLX 6/8-bit
背景快速 worker Qwen3.8-27B 4-bit

安全與整合注意事項

abliterated 模型的 refusal 被刻意調整,但「比較不拒答」不等於「比較準」或「比較聰明」。可能更容易輸出錯誤、危險或不適當內容;若是接到底層與智慧 agent、Claude Code、MCP 或 browser agent,務必在模型外層加入:

  • 權限控管
  • 工具白公名單
  • 輸出審核
  • 最終批准機制

另外,部分 70B uncensored MLX 模型可能出現 instruction-following 退化,或 tokenizer、chat template、工具呼叫相容性不一致。不要把「能載入」當成「適合直接上生產環境」。

最終建議

如果只要一個可直接下載的 MLX uncensored 版本,優先試 orcarouter/Qwen3.8-27B-Uncensored-MLX 的 4-bit;需要完整量化組合或可追溯的 abliteration manifest 時,改用 PocketAiHub/Qwen3.8-27B-Abliterated-MLX;若你只要原始模型且不希望修改拒答行為,就用標準的 mlx-community/Qwen3.8-27B-4bit