研究突破

DeepGrove 開源 Maple-Preview:原生三元權重 20B-A1B 推理模型,於 Mac mini 上以 218 tok/s 運行

DeepGrove 於 8 月 5 日開源 Maple-Preview,一個原生訓練的 20B-A1B 三元權重推理模型,在同級參數中達 SOTA 甚至可與更大模型競爭,能在 Mac mini M4 上以 218 tok/s 運行、檢查點僅 5.31 GB,並解決 IMO 等級的數學問題。

DeepGrove 於 2026 年 8 月 5 日開源 Maple-Preview,一個 20B-A1B(總參數 20.2B、活躍 1.49B)的三元權重(ternary-weight)推理模型。官方宣稱它在同級參數中達到 SOTA,並可與更大模型競爭,能在 Mac mini M4 上以 218 tokens/s 運行、檢查點僅 5.31 GB、支援 131,072 token 的上下文。

什麼發生了:原生低精度,而非事後量化

Maple-Preview 最關鍵的設計主張是:「模型運行的精度,就應該是它學習時的精度」(the precision a model runs at should be the precision it learns at)。以往的極低精度做法多半是「先以全精度訓練,再轉換到低位寬」,DeepGrove 認為這會同時限制效能與效率;Maple 相反,是從一開始就以三元權重原生訓練的網路。

  • 架構:DeepGrove 以硬體感知方式設計,從 30 層、224 專家的初始設定,調校為 24 層、256 專家的組合;並採用滑動視窗與全域注意力混合,以限制 KV-cache 增長。
  • 效率來源:在極低位寬下,矩陣乘法可被加法取代,大幅降低推論所需的算術工作量;客製硬體更能同時受惠於記憶體與算術效率。
  • 效能:可在 MacBook Pro(M5 Pro)上以 281.5 tokens/s 解出 IMO 2024 P1(滿分 7/7);在 iPhone 上以 127 tokens/s 運行,宣稱比 1-bit Bonsai 27B 快約 13 倍

為什麼重要:設備端推理的下一哩路

DeepGrove 的願景是從「單一巨型雲端模型」轉向「常駐、自適應的設備端助理」。他們認為,超低精度與推理感知的架構設計,是讓模型能在一般筆電與手機上「同時訓練並運行」的關鍵。Maple 的開源釋出,代表這條路線首次出現具備頂尖數學推理能力、卻可塞進消費級設備的模型。

在基準上,Maple-Preview 於 LCBv6 75.1、AIME 2026 87.5、HMMT 2026 78.8、GPQA-D 73.5(平均 78.7),在多數項目上與 Qwen3.5 35B-A3B、GLM 4.7 Flash 等更大模型互有勝負。DeepGrove 也誠實指出,此預覽版聚焦於純推理能力,在 agentic 基準上可能表現遜色,並計畫在正式版前以延長訓練補強。

對開發者與研究社群的意涵

  • 隱私與延遲:設備端推理讓敏感資料無需上雲,對重視資料駐留的香港企業與金融、醫療應用格外有意義。
  • 成本結構:5.31 GB 的檢查點與單一 Mac mini 即可運行,大幅降低推理的硬體與能源開銷。
  • 研究啟示:Maple 以「效能與效率同時優化」為核心,而非先做高效能再補效率,可能引導開源社群重新思考低精度訓練的典範。

本文信息來源:DeepGrove。

返回 AI 資訊