了解 Qwen3.6-35B-A3B 在 MacBook Pro M5 Max 128GB 與 NVIDIA 5090/5070 筆電上的推理速度、記憶體需求與實際體驗,幫助你選擇最佳硬體部署方案。
Qwen3.6-35B-A3B 在不同硬體上的效能概覽
Qwen3.6-35B-A3B 是一款 350 億參數的 MoE(Mixture of Experts)模型,實際啟用參數僅約 30 億。其大規模結構與稀疏激活特性,使得在具備足夠記憶體與頻寬的硬體上能夠達到相當可觀的推理速度。以下整理了目前社群與媒體在 2026 年 4‑7 月間的實測資料,並提供實際部署建議。
1. 模型概述
| 參數 | 350 億 | 啟用參數 | 約 30 億 |
|---|---|---|---|
| 量化 | Q4_K_M、Q5_K_S、Q3_K_M 等 | 取決於實際需求 | 取決於實際需求 |
| 主要優勢 | MoE 使得實際運算負擔較輕 | 只需 20‑25 GB RAM (Q4) | 需要 8‑12 GB VRAM (Q4) |
注意:MoE 使得即使模型體積大,實際運算量相對較低,這是 24‑GB VRAM 顯卡能跑得不錯的原因。
2. MacBook Pro M5 Max 128GB
| 推理引擎 | 速度 (tok/s) | 首 token 延遲 | 主要觀察 |
|---|---|---|---|
| MLX (Apple 官方) | ~55 | 0.6 s | 受記憶體頻寬約 614 GB/s 限制 |
| llama.cpp (Metal) | ~95 | 0.4 s | 取決於 prompt 長度與 context size |
| LMStudio 8‑bit | 43‑44 | 0.7 s | 目前效能最強的工具 |
| oMLX | 22 | 0.9 s | 速度較慢 |
實際部署步驟
- 安裝 MLX:
brew install mlx。 - 下載 Qwen3.6-35B-A3B:使用官方或社群提供的量化檔案(Q4_K_M)。
- 執行推理:
mlx run --model qwen3.6-35b-a3b-q4_k_m。 - 優化:若使用 llama.cpp,請確保
--metal參數已啟用,並調整--context大小以避免記憶體溢位。
小技巧:在 128GB 記憶體下,您可以自由調整 context size,甚至一次載入多個 prompt,因為記憶體壓力不大。
3. NVIDIA 5090 筆電版
| GPU | VRAM / 頻寬 | 速度 (tok/s) | 主要觀察 |
|---|---|---|---|
| RTX 5090 筆電版 | 24 GB GDDR7, ~896 GB/s | 110‑140 | 速度約桌機版的一半,因頻寬減半 |
| RTX 5090 桌上型 | 32 GB GDDR7, 1.79 TB/s | 187‑240 | 最高速度,頻寬遠超筆電版 |
實際部署步驟
- 安裝 CUDA Toolkit:
sudo apt install nvidia-cuda-toolkit。 - 下載 Qwen3.6-35B-A3B:使用 Q4_K_M 或 Q5_K_S 量化檔案。
- 執行推理:
python -m transformers --model qwen3.6-35b-a3b-q4_k_m --device cuda。 - 優化:若 VRAM 仍不足,可使用
--offload參數將部分參數 offload 到 CPU。
小技巧:在筆電版 5090 上,將 context size 限制在 8k‑16k token 內,可避免頻寬瓶頸。
4. NVIDIA 5070 筆電版
| GPU | VRAM / 頻寬 | 速度 (tok/s) | 主要觀察 |
|---|---|---|---|
| RTX 5070 筆電版 | 8 GB GDDR7, 384 GB/s | 1‑10 | 需大量 CPU offload,體驗卡頓 |
| RTX 5070 桌上型 | 12 GB GDDR7, 672 GB/s | 12 (Q3_K_M) | 仍需 offload,速度較慢 |
實際部署建議
- 不建議:直接在 8 GB VRAM 上跑 35B 模型。
- 可行方案:
- 使用更小的 Qwen3.6 版本(27B 或 9B)。
- 進一步量化至 4‑bit 或 3‑bit,並啟用
--offload。 - 只在需要時載入模型,並盡量減少 context 大小。
小技巧:若必須使用 5070,建議先將模型切成多個小塊,分批推理,再合併結果。
5. 社群實際體感
| 觀察 | 內容 |
|---|---|
| MoE 影響 | 只啟用 3B 參數,減輕算力負擔 |
| llama.cpp vs Ollama | llama.cpp 速度可達 2.4 倍,需確保量化設定一致 |
| MTP (Multi‑Token Prediction) | 在 24 GB 顯卡上可將速度提升至 249 tok/s |
| SWE‑bench 表現 | 在程式碼任務上表現接近 Claude,適合開發者使用 |
6. 實際部署建議
| 需求 | 推薦硬體 | 量化設定 | 其他建議 |
|---|---|---|---|
| 高推理速度 | NVIDIA 5090 桌上型 | Q5_K_S | 直接使用 GPU,無需 offload |
| 本地開發 | MacBook Pro M5 Max 128GB | Q4_K_M | 充分利用統一記憶體,調整 context 大小 |
| 筆電環境 | NVIDIA 5090 筆電版 | Q4_K_M 或 Q5_K_S | 限制 context,使用 offload |
| 低成本筆電 | NVIDIA 5070 筆電版 | 4‑bit 量化,或改用 27B/9B | 需大量 offload,體驗較差 |
7. 結論
- M5 Max 128GB:記憶體容量足夠,能跑完整模型,但速度受限於統一記憶體頻寬。適合需要長 context 或多任務的本地開發。
- NVIDIA 5090 筆電版:雖然 VRAM 只有 24 GB,但頻寬仍優於 Apple,速度比 M5 Max 高。若需更快推理,建議使用桌上型 5090。
- NVIDIA 5070 筆電版:VRAM 與頻寬不足,除非使用更小模型或極端量化,否則不建議跑 35B 模型。
- 總體:MoE 讓 35B 模型在 24‑32 GB VRAM 上可行,且在 128 GB 記憶體的 MacBook 上也能順利運行。選擇硬體時,請先評估記憶體容量、頻寬與實際使用情境。
備註:以上數據來自社群實測,實際速度會因 prompt 長度、context 大小、量化設定與推理引擎差異而有所變化。建議在正式部署前先進行小規模測試。