2026 年 9 月 3 日,Microsoft AI(MAI) 正式發表 MAI-Transcribe-2,這款號稱「速度最快、最準確、最便宜」的語音辨識模型,在多個關鍵指標上展現出對競爭對手的壓倒性優勢,並以 每小時僅 0.10 美元 的價格重塑語音轉錄市場的定價基準。
核心技術指標
| 指標 | 數據 | 比較基準 |
|---|---|---|
| FLEURS 詞錯誤率(WER) | 5.2% | 60 種語言平均,排名第一 |
| 推論速度 vs GPT-Transcribe | 快 10 倍 | OpenAI |
| 推論速度 vs ScribeV2 | 快 7 倍 | ElevenLabs |
| 推論速度 vs Gemini 3.5 Transcribe | 快 5 倍 | Google DeepMind |
| 價格 | $0.10/小時 | 限期優惠至 2026 年底 |
與微軟 AI 生態的整合
MAI-Transcribe-2 是微軟 AI 模型系列的最新成員,與近期相繼發布的 MAI-Thinking-1(推理模型)、MAI-Code-1.1-Flash(代碼模型)、MAI-Image-2.6(圖像生成) 及 MAI-Voice-2(語音合成) 共同構成完整的模型生態。該模型可透過 Microsoft Foundry、MAI Playground 及 Open Router 使用。
新增功能亮點
相比前一代模型,MAI-Transcribe-2 帶來了多項貼近實際應用場景的新功能:
- 說話者辨識(Speaker Diarization):自動區分並標註錄音中的不同說話者,適用於會議記錄、訪談分析等場景
- 詞級時間戳(Word-Level Timestamps):為每個詞提供精確時間定位,支援精確搜尋、導航和編輯
- 關鍵詞偏置(Keyword Biasing):幫助模型辨識領域特定術語、縮寫、人名及其他難以從上下文區分的詞彙
- 可配置轉錄風格:提供「逐字稿(verbatim)」模式保留填充詞和口誤,適用於合規與分析;「清理版(clean)」模式移除填充詞,適合字幕與公開文稿
- 語碼轉換(Code Switching):支援混合語言對話,如印地英語(Hinglish)和西班牙英語(Spanglish)
- 自動語言識別:無需預先指定語言,模型自動辨識並處理 60 種語言
- 雜訊環境穩健性:在非控制錄音環境中仍保持高品質轉錄
與競品的全面比較
根據 Artificial Analysis 的獨立評估,MAI-Transcribe-2 在 準確度與延遲的 Pareto 前沿上領先所有主流模型。這意味著它在不犧牲轉錄品質的前提下,實現了業界最快的處理速度。
在 FLEURS 多語言基準測試中,MAI-Transcribe-2 以 5.2% 的平均詞錯誤率 排名第一,涵蓋 60 種語言,且在不同語言間的表現高度一致。開發者無需為不同語言部署多個模型,大幅降低了營運複雜度。
價格衝擊:語音 API 市場的轉折點
MAI-Transcribe-2 的定價策略極具侵略性。每小時 0.10 美元 的限期價格,對比 OpenAI GPT-Transcribe 的收費水準,節省幅度高達 72%。對於年處理 10 萬小時音訊的大型企業——例如大型銀行或電信公司的客服中心——這意味著年度費用從 36,000 美元降至 10,000 美元。
正如 VentureBeat 的評論所言,在這樣的價格水準下,「轉錄不再是任何人在意的成本項目」。
產業 Implications
MAI-Transcribe-2 的發布對 AI 產業產生以下深遠影響:
- AI 價格戰進入新階段:在推理、代碼生成之後,語音辨識成為最新被大幅降價的 AI 服務類別。OpenAI、Google 與 ElevenLabs 面臨直接壓力
- 多模型策略的成功驗證:微軟 AI 在一系列細分模型上的密集推出(Transcribe、Code、Image、Voice、Thinking)顯示其採取「分散式專業模型」而非「單一通用模型」的策略,與 OpenAI 的 GPT-6 Astra 旗艦路線形成鮮明對比
- 語音辨識的商品化:當準確度突破 95% 且價格降至每小時 0.10 美元,語音轉錄從「高價值 AI 服務」轉變為「基礎設施級商品」,將推動更多整合應用的爆發
- 企業 API 決策的改變:價格不再是選用語音服務的主要考量——速度和準確度的綜合 Pareto 優勢讓企業可以在單一供應商處獲得最佳組合
本文信息來源:Microsoft AI 官方部落格、VentureBeat 報導及 Artificial Analysis 獨立評測。