2026 年 8 月 10 日,Meta 旗下 Meta Superintelligence Labs 正式發布 Muse Glimmer,一款 30B 參數的開源模型,以 Apache 2.0 許可證釋出權重。這是 Meta 重返開放權重策略的最新信號——此前 Llama 系列使用自定義授權條款,而 Muse Glimmer 的回歸 Apache 2.0 代表 Meta 在開放性上的重大轉向。
定位:為本地代理而生
Muse Glimmer 的核心設計目標是**「始終在線的本地代理」**。其 30B 參數量可在配備單張消費級 GPU(如 RTX 5090)的 Mac 或 PC 上運行,無需依賴雲端基礎設施與網路連線。Meta 在官方公告中指出,模型經過量化壓縮後僅需 17–20 GB 記憶體,可在 24 GB 或 32 GB 的消費級 GPU 上完整運行。
訓練架構與技術亮點
Muse Glimmer 的訓練流程分為三個階段:
| 階段 | 方法 | 重點 |
|---|---|---|
| 預訓練 | 基於 Muse Spark 教師模型的 logit 蒸餾 | 繼承教師模型的知識分佈 |
| 中期訓練 | 長上下文、代理密集型資料與有機資料混合 | 強化推理軌跡與工具調用 |
| 後訓練 | 監督微調 + 在策略蒸餾 + 強化學習 | 整合通用、推理、編碼與代理領域 |
推論加速:DFlash 投機解碼
Muse Glimmer 內建基於 DFlash 的輕量級「起草模型」,可一次性提出整塊 token 候選,再由主模型並行驗證。測量結果顯示:
- RTX 5090:解碼速度提升 3.1 倍
- Apple M5 Max:提升 1.8 倍
- Apple M4 Max:提升 1.5 倍
這使得模型能夠勝任即時對話與代理互動,實現「本地運行、互動流暢」的使用者體驗。
基準測試表現
Meta 將 Muse Glimmer 與同尺寸競爭模型進行了比較,重點評估代理任務能力:
- DeepSearch QA:端到端代理任務完成率
- MCP-Atlas:工具調用精確度
- 𝛕-Bench:多輪任務協調
- SWE-Bench:程式碼除錯與修復
- 多模態能力:透過專用感知編碼器,支援圖文交錯輸入
相較於 Gemma4-31B 與 Qwen3.6-27B,Muse Glimmer 在代理相關基準測試中展現出競爭力。
生態系統與可用性
Muse Glimmer 已上架 Hugging Face 供直接下載權重。Meta 同時宣布將在近期內支援以下生態整合:
- 本地運行:Ollama、LM Studio、Unsloth
- 邊緣框架:llama.cpp、ExecuTorch、MLX
- 規模化部署:vLLM、SGLang
- 雲端合作夥伴:Together AI、Fireworks AI、OpenRouter
硬體合作方面,Meta 正與 AMD、Arm、Dell、Intel、NVIDIA 合作優化跨裝置性能。開發者亦可透過 PyTorch 的 TorchTitan 功能對模型進行自定義微調。
為何重要
Muse Glimmer 的發布傳遞了幾個關鍵信號:
- 開放權重回歸:從 Llama 的自定義授權回到 Apache 2.0,Meta 明確擁抱開源社群價值
- 代理為核心:模型設計從推理優先轉向代理能力優先——函式調用、失敗恢復、多步驟推理成為一等公民
- 本地運算可行:量化 + 投機解碼使 30B 模型在消費級硬體上「可感回應」,邊緣 AI 代理首次具備實用性
Simon Willison 在實測後評論:「這個大小的模型非常理想——如果你的機器有 32 GB 以上記憶體(我的有 128 GB),它還能留出足夠空間同時運行其他應用程式。」
本文信息來源:Meta AI Blog。