以 GPT-5.x 與 Claude Opus 為基準,這篇 Qwen3.8-Flash-Next 評測拆解一般任務與 Agent 工作流的真實能力邊界,並提供低成本自架模型搭配頂級閉源模型審核的分層架構建議。
把 GPT-5.x 與 Claude Opus 的當代 frontier 能力當作 100 分基準,Qwen3.8-Flash-Next-Uncensored-oQ5e 大致落在:一般聊天、摘要、翻譯、寫作與一般程式開發 75–90 分;複雜推理、長鏈 Agent 與可靠性 60–80 分;某些 Coding benchmark 可以接近甚至超過舊一代 Claude,但整體穩定性仍低於最新 GPT/Claude。它不像「本地版 GPT-5.5 或 Claude Opus」,比較像一個能力很強、成本極低、可自架、但輸出較囉嗦,且 Agent 細節仍有明顯差距的開放權重模型。
先認識這個模型
這個模型不是阿里巴巴官方原始模型,而是三層衍生:官方的 Qwen/Qwen3.8-Flash-Next → 經 abliteration 去除拒答傾向的 Uncensored 權重 → 再轉成適合 Apple Silicon 的 oQ5e 量化版本。原始模型是約 180B 總參數、6B active parameters 的 MoE 架構,搭配大型 N-gram embedding;原生 context 約 262K tokens。oQ5e 版本在 128GB Apple Silicon Mac 上約需 88–92GB process allocation,並使用 SSD N-gram Offload。
Uncensored 的定位
模型卡把這個版本定位為「大幅降低原版模型拒答行為」的研究/創作取向版本。它不會讓模型變得更聰明,也不保證更好的事實正確性;對 Agent 而言,遇到 prompt injection 時也比較不會主動拒絕或警告。因此它比較適合研究、創作、內部工具與可控環境,不適合直接暴露給不可信使用者或未加防護的自動化 Agent。
Benchmark 對照:官方分數與獨立指標
先看 Qwen 官方公布的數字,再補上 Artificial Analysis 等第三方評測的獨立指標。官方數據與第三方測試不是同一套測試,以下表格應視為「能力範圍」,而不是絕對排名。
| 能力 | Qwen3.8-Flash-Next 官方結果 | OpenAI 參考值 | Claude 參考值 | 實際解讀 |
|---|---|---|---|---|
| SWE-bench Pro | 62.5 | GPT-5.2 Thinking:55.6;GPT-5.4:約 57.7 | Claude Opus 4.6 官方約 81.42(測試條件不同) | 表面非常強,但不同 harness、取樣與提示詞不可直接比較 |
| SWE-bench Verified | 官方未列同一欄 | GPT-5:74.9;GPT-5.2:80.0 | Opus 4.6 官方曾報 81.42 | GPT/Claude 在成熟軟體工程流程通常更穩 |
| GPQA Diamond | 91.7 | GPT-5.2 Thinking:92.4 | Claude Opus 4.6:90.8 | 高難度科學題已進入同一區間 |
| LiveCodeBench v6 | 91.9 | 無完全同條件的公開可比數字 | 無完全同條件的公開可比數字 | 演算法與競賽式 coding 很強 |
| Toolathlon Verified | 73.5 | 缺乏同條件數據 | Claude Opus 4.6:70.3 | 工具調用能力具有競爭力 |
| CoWorkBench | 73.9 | 缺乏同條件數據 | Claude Opus 4.6:45.1 | 官方自建 benchmark 顯示長流程辦公任務很強 |
| Humanity’s Last Exam | 35.9 | GPT-5.x 需視版本與設定 | Claude Opus 4.6 官方比較高,約 40 | 最難的跨領域研究型任務仍非強項 |
| Artificial Analysis Intelligence Index | 40 | GPT/Claude 最新版本約在更高區間 | Opus 4.7 約 40–41;更新版本更高 | 第三方綜合指標下仍有距離 |
Qwen 官方報告的 SWE-bench Pro 62.5、GPQA 91.7、LiveCodeBench 91.9、Toolathlon 73.5 等分數確實很亮眼;但官方也明確使用特定 harness、temperature、context 與評測流程,不能單純拿 62.5 對比另一家 55.6 就宣稱一定比較強。Artificial Analysis 的獨立 Intelligence Index 給 Qwen3.8-Flash-Next 約 40 分,在同類模型中屬於高水準,但仍低於最新 GPT 與 Claude frontier 模型。該模型速度約 54.6 tokens/s,且在評測中產生約 240M output tokens,顯示它容易進入長思考與高輸出量模式。
以 GPT-5.x 與 Claude Opus 為基準的體感等級
Benchmark 之外,以下用「體感等級」表達,更接近實際使用。
| 使用情境 | Qwen3.8-Flash-Next-Uncensored-oQ5e | GPT-5.x | Claude Opus/Sonnet 最新世代 |
|---|---|---|---|
| 一般問答 | 約 80–90% | 95–100% | 95–100% |
| 中英日翻譯 | 約 85–95% | 95–100% | 95–100% |
| SEO、文章、行銷文案 | 約 75–90% | 約 90–95% | 約 90–98% |
| 長文摘要 | 約 80–90% | 約 90–98% | 約 90–98% |
| 一般 Python/JavaScript | 約 80–90% | 約 90–98% | 約 90–98% |
| Repo-level coding | 約 65–85% | 約 85–95% | 約 85–98% |
| 複雜 Debug | 約 65–80% | 約 85–95% | 約 85–95% |
| Tool calling | 約 70–85% | 約 90–98% | 約 90–98% |
| 長時間自主 Agent | 約 60–80% | 約 85–95% | 約 85–98% |
| 視覺理解 | 約 75–90% | 約 90–98% | 約 90–98% |
| 拒答控制 | 幾乎不主動拒答 | 有完整安全層 | 有完整安全層 |
| 輸出簡潔度 | 通常較差、容易冗長 | 通常較好 | 通常最好 |
| 成本/可自架性 | 非常強 | API 為主 | API 為主 |
這張表不是宣稱每一項都有精確百分比,而是把 benchmark、架構特性與實際使用回饋,轉換成工程決策容易理解的尺度。
實際使用時會感受到的差異
一般任務:差距比想像中小
以下工作,Qwen3.8-Flash-Next-oQ5e 通常已經「夠像高階模型」:
- 技術文件摘要。
- Markdown、JSON、SQL、正規表示式。
- WordPress、Shopify、Ghost 的一般程式碼。
- API schema 產生。
- SEO title、meta description、FAQ、schema markup。
- 多語言內容初稿。
- 讀取截圖、表格與一般圖片。
- 內部知識庫問答。
- 快速產生 boilerplate code。
如果工作是「人類會審稿、程式有測試、Agent 不會直接執行危險操作」,它的實用性可能已達 GPT/Claude 的八成左右。
複雜程式工作:差距會突然放大
當任務變成:
- 需要理解大型既有 repository。
- 同時修改多個 package。
- 需要自行定位根因,而不是修表面錯誤。
- 需要反覆執行 test、讀 log、修改、重試。
- 要保持 API 相容性。
- 要避免破壞既有資料庫 migration。
- 要在長對話中維持正確的 architecture decision。
這時候 Qwen 的問題通常不是「完全不會寫 code」,而是:
- 容易過早認定根因。
- 會產生看似合理但未驗證的修正。
- 需要更多 retry。
- 對工具回傳錯誤的處理不如 Claude/GPT 穩。
- 長流程中比較容易偏離原始目標。
- 產生大量 reasoning token,卻未必轉換成更高的成功率。
如果 Claude Opus 是一位能獨立完成複雜 ticket 的資深工程師,Qwen oQ5e 更像是:一位能力很強、速度不錯、需要人工 code review,且需要更嚴格 harness 管理的中高階工程師。
輸出風格:Qwen 會更囉嗦
第三方評測觀察到 Qwen3.8-Flash-Next 的 output tokens 明顯偏多(約 240M),高於比較基準中位數。代表你會比較常看到:
- 很長的 reasoning。
- 重複檢查同一件事情。
- 已經找到答案後仍持續分析。
- Agent 執行步驟偏多。
- 簡單問題也可能進入較長思考。
因此它的「單次 token 價格」很便宜,但在 Agent workflow 中,實際成本與時間不一定只由 input/output 單價決定。
Uncensored 不等於能力提升
Uncensored 對下列情境可能有幫助:
- 角色扮演。
- 成人或黑暗題材創作。
- 安全研究。
- Red-team 測試。
- 不希望模型頻繁拒答的內部工作流。
但它不會直接提升:
- factuality。
- planning。
- coding correctness。
- tool-call reliability。
- long-horizon memory。
- instruction following。
甚至可能讓產品部署更危險。它不會像 Claude 或 OpenAI 模型一樣主動拒絕危險請求、提示風險或抵抗惡意輸入;模型卡同樣警告,不應在沒有自建 safeguards 的情況下暴露給 untrusted input。
整體定位:介於 frontier 與中階開放模型之間
Claude Opus / GPT-5.x frontier
│
│ 複雜推理、Agent 穩定性、可靠性仍有差距
▼
Qwen3.8-Flash-Next-Uncensored-oQ5e
│
│ 明顯高於一般 7B~32B 開放模型
▼
多數中型 open-weight model
更精確地說:
- 知識與數學題:已經接近 frontier。
- 競賽 coding:可能接近或超過部分閉源模型。
- 一般應用開發:很有競爭力。
- 大型 repo 與自主 Agent:仍較依賴 harness 和人工監督。
- 可靠性、簡潔度、遵循複雜規格:通常輸給 GPT/Claude。
- 成本、隱私、自架、客製化:明顯勝過 GPT/Claude。
對工程團隊的工作流建議
適合交給 Qwen oQ5e
- 內部 coding copilot。
- 初版網站與 CMS 程式碼。
- Shopify/WordPress/Ghost boilerplate。
- SEO 內容批量產生。
- 大量文件分類與摘要。
- 本地 RAG。
- 多模態文件解析。
- 客戶資料不宜送到第三方 API 的場景。
- Red-team、prompt robustness、模型行為研究。
- 低成本 sub-agent。
不建議單獨交給它
- 直接修改 production database。
- 自動部署 production infrastructure。
- 沒有測試的自主 repo-level refactor。
- 付款、退款、刪除資料等不可逆動作。
- 需要高可靠法律、醫療、財務判斷的流程。
- 對外直接回覆客戶且沒有 validation layer 的客服 Agent。
把 Qwen 當成低成本第一層
最好的架構不是讓它取代 GPT/Claude,而是讓它成為低成本的第一層:
Qwen oQ5e:大量產生、初步分析、分類、草稿、local/private work
↓
Validator / Tests / Structured checks
↓
GPT-5.x 或 Claude:複雜審核、最終決策、關鍵輸出
例如在 coding Agent 中,可以讓 Qwen 負責:
- 掃描 repository。
- 找出可能相關檔案。
- 提出修改方案。
- 產生第一版 patch。
- 執行測試並整理錯誤。
再由 GPT/Claude 負責:
- 審查 architecture。
- 檢查 edge cases。
- 決定是否接受 patch。
- 產生最終 PR description。
- 判斷是否可以部署。
結論:以 frontier 為 100 分的基準感受
如果把 Claude Opus/GPT-5.x 視為 100 分,Qwen oQ5e 的體感大致如下:
| 項目 | Qwen3.8-Flash-Next-Uncensored-oQ5e 的大致體感 |
|---|---|
| 普通聊天 | 85 |
| 寫作與摘要 | 80–90 |
| 一般程式碼 | 80–90 |
| 複雜推理 | 70–85 |
| Agent tool use | 70–85 |
| 大型 repo coding | 65–80 |
| 自主長流程 | 60–80 |
| 多模態理解 | 75–90 |
| 輸出控制與簡潔度 | 65–80 |
| 成本/隱私/自架價值 | 120–200 |
總結:Qwen3.8-Flash-Next-Uncensored-oQ5e 已經不是「只能玩玩的小模型」,而是可作為企業內部與自架 Agent 的強力工作馬;但如果你的標準是 Claude Opus 或 GPT-5.x 在複雜、長時間、不可出錯的實際工作流程中的穩定性,它大概仍落後一個明顯但不是壓倒性的世代。