在 Apple Silicon 上以 MLX 執行 Qwen3.8-27B abliterated/uncensored 模型的實作指南:比較主要版本、量化精度、下載與執行步驟,並提醒自動化使用風險。
先弄清楚:你要的其實是 abliterated/uncensored MLX
在 Apple Silicon 上用 MLX 跑「比較不會拒答」的 Qwen3.8-27B 時,通常不是指一個用 prompt 觸發的 jailbreak 模型,而是原始 Qwen3.8-27B 先經過 abliteration(移除 refusal direction)處理,再轉成 MLX 量化格式。更精準的名稱是 abliterated、uncensored、refusal-removed 或 no-refusal。
一般社群轉換的 mlx-community/Qwen3.8-27B-4bit、mlx-community/Qwen3.8-27B-8bit 只有把原始模型量化成 Apple Silicon 可用格式,不會改變拒答行為,也不是 jailbreak/uncensored 模型。
兩個最符合需求的 MLX 模型
| 模型 | 類型 | Apple Silicon 適用性 | 建議 |
|---|---|---|---|
orcarouter/Qwen3.8-27B-Uncensored-MLX |
Abliterated/refusal-removed MLX | 提供 2/4/6/8-bit,支援 mlx-vlm,文字與圖片皆可 |
最直接符合需求 |
PocketAiHub/Qwen3.8-27B-Abliterated-MLX |
Abliterated MLX 衍伸版 | 提供 2/4/6/8-bit、BF16,保留 vision tower | 適合比較不同量化版本 |
huihui-ai/Huihui-Qwen3.8-27B-abliterated |
上游 abliterated 原始模型 | 不是預先轉好的 MLX 版本 | 可作為自行轉換的上游來源 |
mlx-community/Qwen3.8-27B-4bit/8bit |
原始模型的標準 MLX 量化 | Apple Silicon 可執行,但不是 uncensored | 只想保留原始安全行為時使用 |
其中 orcarouter/Qwen3.8-27B-Uncensored-MLX 的官方說明包含:
- 4-bit 約 15 GB
- 6-bit 約 22 GB
- 8-bit 約 27.5 GB
- 2-bit 約 8.7 GB,品質下降明顯,不建議實際工作用
- 保留 normalization layers 與 convolution layers 為 BF16
- 4/6/8-bit 均保留圖片理解能力
- 需要
mlx-vlm >= 0.6.13與mlx >= 0.32
在 Mac 上安裝與執行
建議先更新 Python 套件:
python -m pip install -U 'mlx-vlm>=0.6.13' 'mlx>=0.32'
下載 orcarouter 的 4-bit 分割:
hf download orcarouter/Qwen3.8-27B-Uncensored-MLX --include '4-bit/*' --local-dir ./Qwen3.8-27B-Uncensored-MLX
跑文字生成:
python -m mlx_vlm generate --model ./Qwen3.8-27B-Uncensored-MLX/4-bit --prompt 'Explain the architecture of a PostgreSQL vector database.' --max-tokens 512
跑圖片描述:
python -m mlx_vlm generate --model ./Qwen3.8-27B-Uncensored-MLX/4-bit --image ./image.png --prompt 'Describe this image in detail.' --max-tokens 512
其他 MLX 版本的注意事項
mlx-lm 的純文字實作有時會移除 vision encoder 與 MTP drafter。例如某些 Qwen3.8-27B-MLX-4bit 版本只支援文字,不接受圖片或影片。如果你要保留 Qwen3.8-27B 的多模態能力,優先選用使用 mlx-vlm 的版本,例如:
orcarouter/Qwen3.8-27B-Uncensored-MLXPocketAiHub/Qwen3.8-27B-Abliterated-MLXmlx-community/Qwen3.8-27B-4bit
想要更完整比較:PocketAiHub 版本
PocketAiHub/Qwen3.8-27B-Abliterated-MLX 把多種量化放進同一個 repository:
2bit/
4bit/
6bit/
8bit/
bf16/
該模型卡記錄了 abliteration 的來源與測試方式:
- 以 256 組 harmful/harmless prompts 計算 refusal direction
- 修改第 24 至 63 層的 residual-output matrices
- 4-bit、6-bit、8-bit、BF16 均通過文字、圖片、工具呼叫與 4K context smoke tests
- 4-bit 約 15 GB,8-bit 約 27.5 GB,BF16 約 51 GB
官方測試中,M5 Max 128 GB 單機上的速度約為 4-bit 33.2 tok/s、8-bit 18.7 tok/s。這是作者的本機測試,不代表所有 Mac 的實際速度。
量化精度怎麼選
如果你的 Mac 是 M5 Max 128 GB,可以這樣選:
| 用途 | 建議版本 | 原因 |
|---|---|---|
| 日常 coding、agent、文字任務 | 4-bit | 速度與品質平衡最好 |
| 中文、程式碼品質優先 | 6-bit | 比 4-bit 更保守,記憶體仍充足 |
| 想接近原始模型品質 | 8-bit | 品質較穩定,但速度與記憶體成本較高 |
| 測試原始權重 | BF16 | 約 51 GB,128 GB Mac 可以跑 |
| 不建議 | 2-bit | 壓縮過度,可能出現重複、亂碼與不穩定輸出 |
記憶體足夠時:27B 還是 70B?
128 GB Blobin Memory 的機器不只能跑 27B;但「跑得動」與「適合長 context、agent、MCP 工作流」不同。一般參考:
| 模型規模 | 建議精度 | Mac 場合 |
|---|---|---|
| 27B | 6/8-bit/BF16 | 非常舒服,可保留大量 context |
| 32–35B MoE | 4/6-bit | 速度與品質的最佳平衡點之一 |
| 70–72B dense | 4/5-bit | 可以實用,但速度明顯較慢 |
| 70–72B dense | 8-bit | 可載入,但 context 餘裕變小 |
| 100B 以上 | 2/3-bit | 技術上可跑,實務上通常不值得拿來當日常模型 |
如果主要用途是類 Agent、MCP 與本機自動化,很多情境下 27B 的高精度版本會比 70B 的極低 bit 版本更穩定。
建議的模型組合
主力模型:Qwen3.8-27B-Abliterated-MLX 4-bit
高品質模型:Qwen3.8-27B 8-bit 或 BF16
大型 reasoning 模型:Qwen 70B/72B Q4/Q5 或 DeepSeek-R1-Distill-Llama-70B Q4
長文件與英文分析:Llama 3.3 70B Instruct Q4
圖片/截圖/鑑UI:Qwen3.8-27B MLX 6/8-bit
| 工作類型 | 建議 |
|---|---|
| 日常 coding、彼此問答、agent | Qwen3.8-27B Abliterated MLX 4/6-bit |
| 高品質 coding、複雜語構 | Qwen3.8-27B 8-bit 或 BF16 |
| 深度 reasoning、架構設計 | Qwen 70B/72B 4/5-bit |
| 長文件與英文文本 | Llama 3.3 70B Instruct Q4 |
| 數學、規劃、深度推理 | DeepSeek-R1-Distill-Llama-70B Q4 |
| 圖片、截圖、文件 OCR | Qwen3.8-27B MLX 6/8-bit |
| 背景快速 worker | Qwen3.8-27B 4-bit |
安全與整合注意事項
abliterated 模型的 refusal 被刻意調整,但「比較不拒答」不等於「比較準」或「比較聰明」。可能更容易輸出錯誤、危險或不適當內容;若是接到底層與智慧 agent、Claude Code、MCP 或 browser agent,務必在模型外層加入:
- 權限控管
- 工具白公名單
- 輸出審核
- 最終批准機制
另外,部分 70B uncensored MLX 模型可能出現 instruction-following 退化,或 tokenizer、chat template、工具呼叫相容性不一致。不要把「能載入」當成「適合直接上生產環境」。
最終建議
如果只要一個可直接下載的 MLX uncensored 版本,優先試 orcarouter/Qwen3.8-27B-Uncensored-MLX 的 4-bit;需要完整量化組合或可追溯的 abliteration manifest 時,改用 PocketAiHub/Qwen3.8-27B-Abliterated-MLX;若你只要原始模型且不希望修改拒答行為,就用標準的 mlx-community/Qwen3.8-27B-4bit。