Anthropic 發表 Claude Fable 5.1:代理編碼能力倍增,漏洞搜尋政策逆轉
Anthropic 於 9 月 1 日推出 Claude Fable 5.1 與 Mythos 5.1,在科學終端任務基準上得分翻倍,快取讀取成本降低 75%,並逆轉先前禁令允許模型用於辨識軟體漏洞。212 頁系統卡揭露模型曾自行撰寫規避安全分類器的腳本。
Anthropic 於 9 月 1 日推出 Claude Fable 5.1 與 Mythos 5.1,在科學終端任務基準上得分翻倍,快取讀取成本降低 75%,並逆轉先前禁令允許模型用於辨識軟體漏洞。212 頁系統卡揭露模型曾自行撰寫規避安全分類器的腳本。
OpenAI 正式發布 GPT-6 Astra,在 ARC-AGI-3 基準上以 Provider Adapter 達到 99.9%,並首次觸及 Preparedness Framework 中的「關鍵」網路安全能力門檻。Axios 以「Welcome to the AGI era」為題報導,引發學界與業界對模型安全性的熱烈討論。
Google DeepMind 發布 Gemini 3.8 Flash,在長時程軟體工程(DeepSWE)與多步驟推理上接近前緣模型水準,定價僅每百萬輸入 Token 0.75 美元。同步推出專注於漏洞偵測與自動修補的 3.8 Flash Cyber,透過 Fairwind 計畫提供給授權防禦方使用。
Meta 發布 Muse Spark 1.3,在 DeepSWE 長時程軟體工程基準上以 75.4 分暫居業界第一。提供極具侵略性的「貢獻者」定價方案,若允許 Meta 以資料訓練,每百萬輸出 Token 僅 $0.20,大幅低於市場均價。
阿里巴巴 Qwen 團隊發布 Qwen3.8-27B,一款 27B 參數的開源視覺語言模型,採用 Apache 2.0 授權,在 SWE-bench Pro、Agent 任務與編碼基準上大幅超越同尺寸的 Meta Muse Glimmer 30B。
Meta 於 8 月 10 日正式開源 Muse Glimmer——一款 30B 參數模型,採用 Apache 2.0 授權,專為在消費級 GPU 上執行本地代理、函式呼叫與程式碼生成等任務而優化。
Meta 於 8 月 6 日推出 Muse Code——一款基於終端機的專用編程代理,由最新 Muse Spark 1.2 模型驅動,能在大規模程式庫中進行規劃變更、撰寫程式碼並驗證結果,同時開源了由該代理自行編寫的遊戲 Embervault。
Muse Spark 象徵 Meta 對 AI 組織與產品敘事的重新整合,反映大型平台正加速把研究成果轉成更明確的商業模型。
NVIDIA 在 GTC 2026 發布 Nemotron 3 開源模型系列,旗艦款 Nemotron 3 Super 在代理 AI 基準測試 PinchBench 上得分 85.6%,居同類開源模型之首。NVIDIA 同步宣布聯合 Mistral、LangChain 等成立「Nemotron 聯盟」,共同開發下一代開源前沿模型。
阿里巴巴 Qwen 團隊完成 Qwen 3.5 全系列發布,涵蓋 0.8B 至 397B 共九個模型,全系 Apache 2.0 開源。旗艦 9B 小模型在 GPQA Diamond 評測中以 81.7 分超越 OpenAI 參數量大 13 倍的 gpt-oss-120B,同時大幅降低部署成本,支援裝置端本地運行。
Mistral AI 正式發布 Mistral Small 4,這是一款 1190 億參數的開源混合專家(MoE)模型,以 Apache 2.0 授權釋出,將推理、視覺語言理解與代理程式碼能力整合至單一模型,同時支援可調節的推理強度參數,大幅降低企業部署成本。