產業動態

GitHub Copilot 推出 Project HydraFusion:多模型運行時協調架構,編碼成本最高降低 67%

GitHub 於 9 月 4 日發布 Project HydraFusion 研究預覽版,透過運行時多模型協調為每個編碼任務動態建構執行計劃,在 TerminalBench 2.1 上實現 67% 成本降低同時品質提升 4.9 個百分點。

2026 年 9 月 4 日,GitHub 正式推出 Project HydraFusion 研究預覽版,這是一項針對 GitHub Copilot CLI 的運行時多模型協調(runtime multi-model orchestration)功能。不同於傳統單一模型固定選擇的方式,HydraFusion 根據每個編碼任務的特性,動態建構跨供應商的多模型執行計劃,在維持或提升輸出品質的同時,大幅降低推論成本。

從「選模型」到「設計工作流」

HydraFusion 是 GitHub 今年稍早推出的 Auto Model Selection 功能的進化版本。後者僅根據任務類型匹配合適的單一模型,而 HydraFusion 則將工作流選擇視為最佳化問題——系統讀取提示中的能力信號(多步推理、程式碼生成、除錯、工具使用),然後選擇預期能通過品質門檻的最簡化執行路徑。

HydraFusion 目前支援三種執行模式:

  • Single(單一模式):當一個模型具備足夠能力獨立解決任務時,直接執行,追求最低延遲。
  • Cascade(串聯模式):先用高效模型生成初始方案,經由品質閘(quality gate)評估——若結果達標則直接輸出,否則升級至更強模型重新處理。
  • Critique(評論模式):起草模型先產生方案草稿,再由來自不同模型家族、無工具執行權限的唯讀審閱模型進行評估(類似「橡皮鴨除錯法」的自動化版本),最後由原起草模型根據審閱意見進行一次結構化修改。

基準測試成績

GitHub 公布了在三項代理編碼(agentic coding)基準上的離線評估結果,以 Claude Opus 5 為基線對照:

基準估算成本 vs Opus 5驗證任務品質 vs Opus 5
TerminalBench 2.1降低 67%+4.9 百分點
DeepSWE降低 36%−1.5 百分點
CheckpointBench(內部基準)降低 65%−0.1 百分點

CheckpointBench 是 GitHub 從真實 Copilot 代理編碼會話中整理的內部多輪基準,錨定於具體公開倉庫與不可變提交。在該基準上,HydraFusion 的工作階段分數與 Opus 5 基線幾乎持平(僅差 0.1 百分點),成本卻降低近三分之二。

五大架構原則

GitHub 為 HydraFusion 訂立了五項作業原則:

  • 完整計費(Complete Accounting):記錄每個工作流環節(起草、審閱、修改、升級、重試、備援)的 token 成本與用量。
  • 有界執行(Bounded Execution):嚴格的超時控制與取消機制。
  • 隔離審閱(Isolated Review):審閱模型在無工具修改權限的環境中運行。
  • 故障安全應用(Fail-safe Application):若驗證失敗或執行被取消,則拒絕應用補丁。
  • 路由驗證(Validated Routing):在執行前預先檢查模型可用性與綁定狀態。

產業意義

HydraFusion 的推出反映了生成式 AI 編碼工具的重大範式轉移:競爭焦點從模型本身的基準分數,轉向模型協調架構的效率與智慧。在 2026 年,開發團隊面對的不再是「哪個模型最好」的單一選擇題,而是如何組合不同模型以最大化成本效益的系統設計問題。

對於企業用戶而言,HydraFusion 最直接的價值在於:無需人工判斷何時該換模型或請求二次審閱。系統在後台自動完成路由決策,每次請求都使用最低必要成本獲取可接受品質的結果。對於每日處理大量代理編碼會話的團隊,這直接轉化為可預測的算力成本下降。

HydraFusion 目前透過 GitHub Copilot CLI 的 /experimental 配置向所有付費方案用戶開放。啟動方式為:執行 /experimental on,然後在 /model 選擇介面中選取 HydraFusion。使用收費按所調用模型的標準 token 價格計費。


本文信息來源:InfoQ、MarkTechPost、Pondero.ai。

返回 AI 資訊