了解 Qwen3.6‑35B‑A3B 在編碼、agentic 任務與多模態 benchmark 上的表現,並與 OpenAI GPT‑5.x 及 Claude Sonnet 4.5 做比較,掌握其市場定位與實際效能。
Qwen3.6‑35B‑A3B:與 OpenAI GPT‑5.x 與 Claude Sonnet 的實際對比
1. 模型概述
- Qwen3.6‑35B‑A3B:由阿里巴巴開發的 35B 參數模型,實際啟用約 3B 參數,採用稀疏 MoE(Mixture‑of‑Experts)架構。
- 目標定位:提供可本地部署、低成本的高效能模型,特別適合程式編碼與 agentic 任務。
2. benchmark 比較
| 項目 | Qwen3.6‑35B‑A3B | Claude Sonnet 4.5 |
|---|---|---|
| SWE‑bench(真實程式修復) | 73.4 % | 近乎平衡(差距已縮小) |
| MMMU(多模態理解) | 81.7 | 79.6 |
| MMMU‑Pro | 75.3 | 68.4 |
| Mathvista | 86.4 | 79.8 |
| RealWorldQA | 85.3 | 70.3 |
說明:上述數據來自社群測試與公開 benchmark。RealWorldQA 的差距較大,尚待第三方驗證。
3. 用戶實測心得
- 編碼任務:多位開發者在本地端(如 MacBook Pro M5 Max)以 8‑bit 量化執行 Qwen3.6‑35B‑A3B,表現與 Claude 相當,甚至在 SVG 生成任務上超越 Claude Opus 4.7。
- 對話品質:在一般助理式對話與偏好任務上,仍略遜於 Claude Sonnet 4.5;但在純程式編碼(如修 GitHub issue)上差距已非常接近。
4. 市場定位
| 參考模型 | 主要優勢 | Qwen3.6‑35B‑A3B 的對應位置 |
|---|---|---|
| Claude Sonnet 4.5 | 中階編碼與 agentic 工具整合 | 近乎相同,部分 benchmark 甚至超越 |
| OpenAI GPT‑5.x mini / 中階系列 | 可本地部署、低成本(約 0.29 USD / 百萬 token) | 性價比相近,遠離旗艙版 GPT‑5 Pro |
結論:Qwen3.6‑35B‑A3B 雖只啟用 3B 參數,但在多項 benchmark 上逼近甚至超越 Claude Sonnet 4.5,並在成本與部署靈活性上與 OpenAI 中階 API 競爭。它不太可能直接匹敵 Claude Opus 或 GPT‑5 Pro 的通用對話品質與安全對齊,但已成為 2026 年上半年最具亮眼的開源釋出之一。
5. 參考
- 社群測試報告與 benchmark 數據(來源於公開討論與社群分享)。
6. 相關標籤
- ai
- ai‑coding
- ai‑tools
- 4p
- 24sèvres