模型發布

Inception 發布 Mercury 2.5:擴散式 LLM 實現每秒 1,100 Tokens,推理速度刷新行業記錄

總部位於加州的 AI 初創公司 Inception 於 9 月 8 日推出 Mercury 2.5,採用擴散式語言模型(dLLM)架構,生產環境下推理速度突破每秒 1,100 tokens。不同於傳統自回歸模型的逐 token 生成方式,擴散式架構以並行方式逐步精煉整段文字,從根本上改變了推理吞吐量的計算經濟學。

2026 年 9 月 8 日,加州 AI 初創公司 Inception 正式發布 Mercury 2.5——目前市場上最快的生產級推理語言模型。該公司宣稱,Mercury 2.5 在真實部署環境中達到 每秒超過 1,100 個 tokens 的吞吐量,遠超傳統自回歸(autoregressive)模型的典型速度。

這一數字本身即是戰略信號——在 2026 年 9 月密集的模型發布潮中,Mercury 2.5 選擇以架構差異化推理成本作為競爭切入點,而非單純追求參數規模或基準分數。

擴散式語言模型:從「逐詞預測」到「並行精煉」

Mercury 2.5 的核心差異在於其擴散式架構(dLLM),從根本上改變了文字生成的計算流程:

特性傳統自回歸模型(GPT、Claude、Gemini)擴散式模型(Mercury 2.5)
生成方式逐 token 順序預測整段文字並行精煉
推理瓶頸序列依賴,無法平行化可高度平行化
吞吐量上限受限於 token 序列長度理論上可大幅提升
典型應用長文本推理、法律文件、數學證明高吞吐場景、即時編碼輔助、客服

擴散式模型借鑑了 Stable Diffusion 等圖像生成技術的思路:從一個帶噪聲或遮罩的完整回應出發,透過多次迭代逐步去噪,最終形成清晰的文字輸出。這一機制天然有利於平行計算,這也是 Mercury 2.5 能達到 1,100 tokens/sec 的結構性原因。

同步推出 Mercury Voice 與 Mercury Router

Inception 在發布主模型之餘,還推出了兩款預覽級產品:

  • Mercury Voice:將擴散式架構應用於語音互動場景的產品原型
  • Mercury Router:任務級模型調度層,可根據請求特性自動選擇最適合的 Mercury 變體執行

Mercury Router 的設計思路尤其值得關注——它暗示 Inception 的策略不僅是賣一個模型,而是提供一套推理成本優化層。高吞吐、低延遲的 Mercury 2.5 處理常規任務,複雜推理則交給更重的模型後端。這一「路由即產品」的定位,精準對應了 2026 年企業 AI 基礎設施團隊最頭痛的算力成本管控問題。

2026 年 9 月第一週:模型發布的密集交鋒

Mercury 2.5 並非孤例。2026 年 9 月的第一週經歷了年度最密集的基礎模型發布:

日期發布方模型核心差異點
9 月 1 日AnthropicClaude Fable 5.1 / Mythos 5.1雙安全層級機制,快取讀取降價 75%
9 月 2 日GoogleGemini 3.8 Flash入門級定價,Cyber 安全變體
9 月 3 日IFMK2 Horizon(六款全開源模型)0.9B 至 375B 參數,完整開放權重
9 月 3 日OpenAIGPT-6 Astra通用推理旗艦,100K GPU 訓練
9 月 7 日iFlytekSpark X2.5(293B)代碼生成與代理工作流專注
9 月 8 日InceptionMercury 2.5(dLLM)擴散式架構,1,100+ tokens/sec

這一密集度反映出行業格局的深刻變化:頂尖實驗室仍佔據通用推理的話語權,但中規模實驗室正逐步以特定維度(開源、專精任務、架構創新)建立差異化壁壘。Inception 選擇的「架構 × 速度」路線,正是這一趨勢的典型代表。

企業採用:從「更聰明」到「更便宜、更快」

Mercury 2.5 的潛在影響不在於取代 GPT-6 Astra 或 Claude,而在於改變企業對推理成本的計算方式。

對於高吞吐量、低延遲敏感的場景——即時客服、編輯器內編碼補全、語音助理——一個能以數倍吞吐量完成推理任務的模型,直接影響 GPU 時數 / 每次回應的經濟帳。在 2026 年 AI 算力成本仍是產品擴張最大瓶頸的背景下,這一定位對平台團隊與 FinOps 團隊具有強烈吸引力。

然而需要指出的是,Inception 的 1,100 tokens/sec 數字目前為廠商自報數據,尚未有第三方在統一硬件與提示詞條件下進行獨立驗證。擴散式模型在長篇幅連貫性與多步推理任務上與自回歸模型的差距,仍需更多基準測試來釐清。

Mercury 2.5 的 API 定價、上下文窗口大小及雲平台可用性(目前尚未登陸 AWS/GCP/Azure Marketplace)亦有待公布。這些因素將直接影響其實際落地速度。


本文信息來源:Inception Business Wire 公告、Shattered.io 分析報導。

返回 AI 資訊