Qwen3.8-Flash-Next 評測:貼近 GPT 與 Claude,也仍有差距

以 GPT-5.x 與 Claude Opus 為基準,這篇 Qwen3.8-Flash-Next 評測拆解一般任務與 Agent 工作流的真實能力邊界,並提供低成本自架模型搭配頂級閉源模型審核的分層架構建議。

把 GPT-5.x 與 Claude Opus 的當代 frontier 能力當作 100 分基準,Qwen3.8-Flash-Next-Uncensored-oQ5e 大致落在:一般聊天、摘要、翻譯、寫作與一般程式開發 75–90 分;複雜推理、長鏈 Agent 與可靠性 60–80 分;某些 Coding benchmark 可以接近甚至超過舊一代 Claude,但整體穩定性仍低於最新 GPT/Claude。它不像「本地版 GPT-5.5 或 Claude Opus」,比較像一個能力很強、成本極低、可自架、但輸出較囉嗦,且 Agent 細節仍有明顯差距的開放權重模型。

先認識這個模型

這個模型不是阿里巴巴官方原始模型,而是三層衍生:官方的 Qwen/Qwen3.8-Flash-Next → 經 abliteration 去除拒答傾向的 Uncensored 權重 → 再轉成適合 Apple Silicon 的 oQ5e 量化版本。原始模型是約 180B 總參數、6B active parameters 的 MoE 架構,搭配大型 N-gram embedding;原生 context 約 262K tokens。oQ5e 版本在 128GB Apple Silicon Mac 上約需 88–92GB process allocation,並使用 SSD N-gram Offload。

Uncensored 的定位

模型卡把這個版本定位為「大幅降低原版模型拒答行為」的研究/創作取向版本。它不會讓模型變得更聰明,也不保證更好的事實正確性;對 Agent 而言,遇到 prompt injection 時也比較不會主動拒絕或警告。因此它比較適合研究、創作、內部工具與可控環境,不適合直接暴露給不可信使用者或未加防護的自動化 Agent。

Benchmark 對照:官方分數與獨立指標

先看 Qwen 官方公布的數字,再補上 Artificial Analysis 等第三方評測的獨立指標。官方數據與第三方測試不是同一套測試,以下表格應視為「能力範圍」,而不是絕對排名。

能力 Qwen3.8-Flash-Next 官方結果 OpenAI 參考值 Claude 參考值 實際解讀
SWE-bench Pro 62.5 GPT-5.2 Thinking:55.6;GPT-5.4:約 57.7 Claude Opus 4.6 官方約 81.42(測試條件不同) 表面非常強,但不同 harness、取樣與提示詞不可直接比較
SWE-bench Verified 官方未列同一欄 GPT-5:74.9;GPT-5.2:80.0 Opus 4.6 官方曾報 81.42 GPT/Claude 在成熟軟體工程流程通常更穩
GPQA Diamond 91.7 GPT-5.2 Thinking:92.4 Claude Opus 4.6:90.8 高難度科學題已進入同一區間
LiveCodeBench v6 91.9 無完全同條件的公開可比數字 無完全同條件的公開可比數字 演算法與競賽式 coding 很強
Toolathlon Verified 73.5 缺乏同條件數據 Claude Opus 4.6:70.3 工具調用能力具有競爭力
CoWorkBench 73.9 缺乏同條件數據 Claude Opus 4.6:45.1 官方自建 benchmark 顯示長流程辦公任務很強
Humanity’s Last Exam 35.9 GPT-5.x 需視版本與設定 Claude Opus 4.6 官方比較高,約 40 最難的跨領域研究型任務仍非強項
Artificial Analysis Intelligence Index 40 GPT/Claude 最新版本約在更高區間 Opus 4.7 約 40–41;更新版本更高 第三方綜合指標下仍有距離

Qwen 官方報告的 SWE-bench Pro 62.5、GPQA 91.7、LiveCodeBench 91.9、Toolathlon 73.5 等分數確實很亮眼;但官方也明確使用特定 harness、temperature、context 與評測流程,不能單純拿 62.5 對比另一家 55.6 就宣稱一定比較強。Artificial Analysis 的獨立 Intelligence Index 給 Qwen3.8-Flash-Next 約 40 分,在同類模型中屬於高水準,但仍低於最新 GPT 與 Claude frontier 模型。該模型速度約 54.6 tokens/s,且在評測中產生約 240M output tokens,顯示它容易進入長思考與高輸出量模式。

以 GPT-5.x 與 Claude Opus 為基準的體感等級

Benchmark 之外,以下用「體感等級」表達,更接近實際使用。

使用情境 Qwen3.8-Flash-Next-Uncensored-oQ5e GPT-5.x Claude Opus/Sonnet 最新世代
一般問答 約 80–90% 95–100% 95–100%
中英日翻譯 約 85–95% 95–100% 95–100%
SEO、文章、行銷文案 約 75–90% 約 90–95% 約 90–98%
長文摘要 約 80–90% 約 90–98% 約 90–98%
一般 Python/JavaScript 約 80–90% 約 90–98% 約 90–98%
Repo-level coding 約 65–85% 約 85–95% 約 85–98%
複雜 Debug 約 65–80% 約 85–95% 約 85–95%
Tool calling 約 70–85% 約 90–98% 約 90–98%
長時間自主 Agent 約 60–80% 約 85–95% 約 85–98%
視覺理解 約 75–90% 約 90–98% 約 90–98%
拒答控制 幾乎不主動拒答 有完整安全層 有完整安全層
輸出簡潔度 通常較差、容易冗長 通常較好 通常最好
成本/可自架性 非常強 API 為主 API 為主

這張表不是宣稱每一項都有精確百分比,而是把 benchmark、架構特性與實際使用回饋,轉換成工程決策容易理解的尺度。

實際使用時會感受到的差異

一般任務:差距比想像中小

以下工作,Qwen3.8-Flash-Next-oQ5e 通常已經「夠像高階模型」:

  • 技術文件摘要。
  • Markdown、JSON、SQL、正規表示式。
  • WordPress、Shopify、Ghost 的一般程式碼。
  • API schema 產生。
  • SEO title、meta description、FAQ、schema markup。
  • 多語言內容初稿。
  • 讀取截圖、表格與一般圖片。
  • 內部知識庫問答。
  • 快速產生 boilerplate code。

如果工作是「人類會審稿、程式有測試、Agent 不會直接執行危險操作」,它的實用性可能已達 GPT/Claude 的八成左右。

複雜程式工作:差距會突然放大

當任務變成:

  • 需要理解大型既有 repository。
  • 同時修改多個 package。
  • 需要自行定位根因,而不是修表面錯誤。
  • 需要反覆執行 test、讀 log、修改、重試。
  • 要保持 API 相容性。
  • 要避免破壞既有資料庫 migration。
  • 要在長對話中維持正確的 architecture decision。

這時候 Qwen 的問題通常不是「完全不會寫 code」,而是:

  • 容易過早認定根因。
  • 會產生看似合理但未驗證的修正。
  • 需要更多 retry。
  • 對工具回傳錯誤的處理不如 Claude/GPT 穩。
  • 長流程中比較容易偏離原始目標。
  • 產生大量 reasoning token,卻未必轉換成更高的成功率。

如果 Claude Opus 是一位能獨立完成複雜 ticket 的資深工程師,Qwen oQ5e 更像是:一位能力很強、速度不錯、需要人工 code review,且需要更嚴格 harness 管理的中高階工程師。

輸出風格:Qwen 會更囉嗦

第三方評測觀察到 Qwen3.8-Flash-Next 的 output tokens 明顯偏多(約 240M),高於比較基準中位數。代表你會比較常看到:

  • 很長的 reasoning。
  • 重複檢查同一件事情。
  • 已經找到答案後仍持續分析。
  • Agent 執行步驟偏多。
  • 簡單問題也可能進入較長思考。

因此它的「單次 token 價格」很便宜,但在 Agent workflow 中,實際成本與時間不一定只由 input/output 單價決定。

Uncensored 不等於能力提升

Uncensored 對下列情境可能有幫助:

  • 角色扮演。
  • 成人或黑暗題材創作。
  • 安全研究。
  • Red-team 測試。
  • 不希望模型頻繁拒答的內部工作流。

但它不會直接提升:

  • factuality。
  • planning。
  • coding correctness。
  • tool-call reliability。
  • long-horizon memory。
  • instruction following。

甚至可能讓產品部署更危險。它不會像 Claude 或 OpenAI 模型一樣主動拒絕危險請求、提示風險或抵抗惡意輸入;模型卡同樣警告,不應在沒有自建 safeguards 的情況下暴露給 untrusted input。

整體定位:介於 frontier 與中階開放模型之間

Claude Opus / GPT-5.x frontier
        │
        │  複雜推理、Agent 穩定性、可靠性仍有差距
        ▼
Qwen3.8-Flash-Next-Uncensored-oQ5e
        │
        │  明顯高於一般 7B~32B 開放模型
        ▼
多數中型 open-weight model

更精確地說:

  • 知識與數學題:已經接近 frontier。
  • 競賽 coding:可能接近或超過部分閉源模型。
  • 一般應用開發:很有競爭力。
  • 大型 repo 與自主 Agent:仍較依賴 harness 和人工監督。
  • 可靠性、簡潔度、遵循複雜規格:通常輸給 GPT/Claude。
  • 成本、隱私、自架、客製化:明顯勝過 GPT/Claude。

對工程團隊的工作流建議

適合交給 Qwen oQ5e

  • 內部 coding copilot。
  • 初版網站與 CMS 程式碼。
  • Shopify/WordPress/Ghost boilerplate。
  • SEO 內容批量產生。
  • 大量文件分類與摘要。
  • 本地 RAG。
  • 多模態文件解析。
  • 客戶資料不宜送到第三方 API 的場景。
  • Red-team、prompt robustness、模型行為研究。
  • 低成本 sub-agent。

不建議單獨交給它

  • 直接修改 production database。
  • 自動部署 production infrastructure。
  • 沒有測試的自主 repo-level refactor。
  • 付款、退款、刪除資料等不可逆動作。
  • 需要高可靠法律、醫療、財務判斷的流程。
  • 對外直接回覆客戶且沒有 validation layer 的客服 Agent。

把 Qwen 當成低成本第一層

最好的架構不是讓它取代 GPT/Claude,而是讓它成為低成本的第一層:

Qwen oQ5e:大量產生、初步分析、分類、草稿、local/private work
        ↓
Validator / Tests / Structured checks
        ↓
GPT-5.x 或 Claude:複雜審核、最終決策、關鍵輸出

例如在 coding Agent 中,可以讓 Qwen 負責:

  1. 掃描 repository。
  2. 找出可能相關檔案。
  3. 提出修改方案。
  4. 產生第一版 patch。
  5. 執行測試並整理錯誤。

再由 GPT/Claude 負責:

  1. 審查 architecture。
  2. 檢查 edge cases。
  3. 決定是否接受 patch。
  4. 產生最終 PR description。
  5. 判斷是否可以部署。

結論:以 frontier 為 100 分的基準感受

如果把 Claude Opus/GPT-5.x 視為 100 分,Qwen oQ5e 的體感大致如下:

項目 Qwen3.8-Flash-Next-Uncensored-oQ5e 的大致體感
普通聊天 85
寫作與摘要 80–90
一般程式碼 80–90
複雜推理 70–85
Agent tool use 70–85
大型 repo coding 65–80
自主長流程 60–80
多模態理解 75–90
輸出控制與簡潔度 65–80
成本/隱私/自架價值 120–200

總結:Qwen3.8-Flash-Next-Uncensored-oQ5e 已經不是「只能玩玩的小模型」,而是可作為企業內部與自架 Agent 的強力工作馬;但如果你的標準是 Claude Opus 或 GPT-5.x 在複雜、長時間、不可出錯的實際工作流程中的穩定性,它大概仍落後一個明顯但不是壓倒性的世代。