2026 年 8 月 15 日,阿里巴巴旗下 Qwen 團隊 在 Hugging Face 上正式發布 Qwen3.8-27B,這是 Qwen 開源模型家族迄今最強大的成員。該模型採用 Apache 2.0 授權,參數量為 27B,定位為「輕量級可部署的密集模型」,內建視覺理解能力,在代理任務與程式碼生成上展現出令人矚目的表現。
核心能力亮點
Qwen3.8-27B 在數個關鍵面向實現了重大升級:
- 代理執行(Agent Execution):更強的自動規劃能力與環境反饋處理,端到端任務完成可靠性顯著提升
- 彈性思考控制(Flexible Thinking Control):思考模式預設開啟,可按請求關閉;推理深度可透過
reasoning_effort參數調整 - 原生視覺語言理解:支援圖片與影片理解,從 STEM 圖表、文檔到小時級影片皆可處理
- 上下文長度:原生支援 262,144 tokens,可擴展至 1,000,000 tokens
- 生態相容性:相容 Hugging Face Transformers、vLLM、SGLang、TokenSpeed 等主流框架
基準測試:全面超越同級對手
Qwen3.8-27B 的基準測試成績顯示其在代理任務與程式碼生成領域具有明顯優勢:
代理任務表現
| 基準測試 | Qwen3.8-27B | Qwen3.6-27B | Muse Glimmer 30B | Opus 4.6 Max |
|---|---|---|---|---|
| Terminal Bench 2.1 | 73.0 | 63.4 | 51.7 | 78.2 |
| SWE-bench Pro | 61.7 | 53.5 | 51.2 | 53.4 |
| DeepSWE 1.1 | 42.2 | 13.3 | — | — |
| QwenSWEBench | 79.0 | 49.3 | — | 63.8 |
| CoWorkBench | 70.7 | 61.0 | — | 68.2 |
| Agents’ Last Exam (Score) | 42.9 | 27.3 | — | — |
關鍵觀察
- Terminal Bench 2.1(終端代理編碼):Qwen3.8 得分 73.0,較前代 Qwen3.6 的 63.4 提升 15%,更大幅超越 Meta 同期發布的 Muse Glimmer 30B(51.7)
- SWE-bench Pro:61.7 的成績不僅領先 Muse Glimmer(51.2),也超過 Anthropic 的 Opus 4.6 Max(53.4)——這在同尺寸開源模型中極為罕見
- DeepSWE 1.1:42.2 較前代的 13.3 實現了 3 倍以上的飛躍,顯示訓練方法取得了質的突破
通用能力
在通用基準測試上同樣表現強勁:
- GPQA Diamond(科學推理):89.2
- IFBench(指令遵循):79.5
- JobBench(專業任務):33.4,遠高於 Qwen3.6 的 21.8
架構設計
Qwen3.8-27B 基於 Qwen3.5 的架構基礎,採用混合解碼器設計:
- Gated DeltaNet:每層包含 3 個線性注意力層(48 個 V 頭 + 16 個 QK 頭),提升效率與長序列處理能力
- Gated Attention:每 4 層插入 1 個完整注意力層(24 個 Q 頭 + 4 個 KV 頭),確保複雜推理品質
- 多 Token 預測(MTP):訓練階段使用多步預測策略,提升生成品質
這種設計在效率(DeltaNet 的線性注意力優勢)與品質(完整注意力的精確度)之間取得了平衡,使 27B 模型能夠在消費級硬體上運行,同時保持競爭力。
對開源生態的意義
Qwen3.8-27B 的發布傳遞了幾個明確信號:
- 中尺寸模型的黃金時代:27-30B 參數區間的模型正在成為「可本地部署 + 能力夠用」的甜蜜點,Qwen3.8 的成績證明這個尺寸已能勝任複雜代理任務
- 中國開源模型的持續追趕:從 Qwen3.6 到 Qwen3.8 的跨代提升幅度(某些任務翻倍),顯示阿里巴巴在開源路線上的投入力度不減
- Apache 2.0 授權標準化:繼 Meta 的 Muse Glimmer 之後,Qwen3.8 也採用 Apache 2.0——這正在成為開源 LLM 的事實標準許可證
- 代理能力成核心競爭維度:基準測試的重點已從傳統的問答/推理轉向自主任務完成,這反映了產業對 AI 代理的迫切需求
Qwen3.8-27B 已上架 Hugging Face,支援直接下載權重,並將透過 Qwen Cloud 提供托管服務(預設 1M 上下文長度,內建工具支援)。
本文信息來源:Hugging Face / Qwen Cloud。