2026 年 8 月 21 日,Nvidia 發表了一項顛覆性的研究成果,直接挑戰業界對 AI 代理效能的核心假設。研究發現,在處理長期任務(Long-horizon Tasks)時,AI 模型的軟體封裝層(Harness,挽具)——包括工具、記憶體管理與執行規則——其重要性遠超底層模型本身。
100% 與 30% 的鴻溝
Nvidia 研究團隊打造了一個名為 AVO(Agentic Variation Operators,代理變異運算子) 的自訂框架,並在其中加入了「監督代理」(Supervisor Agent)元件。在 ARC-AGI-3 基準測試中,搭載 AVO 框架的 Claude Opus 5 取得了 100% 的完美分數——這是一組無說明文件的 2D 遊戲,模型必須像人類一樣自行探索規則並贏得遊戲。
然而,同一模型在不使用 AVO 框架的情況下,得分僅為 30%。所有受測模型中,無框架的最高分也僅止於 30%。這個差距不僅僅是量變,而是質的飛躍。
何謂「挽具」(Harness)
Nvidia AI 部門產品副總裁 Adel El Hallak 向 TechCrunch 解釋:「一般人將 AI 代理理解為模型的 API。但代理實際上是——模型本身、圍繞模型的框架(我們稱之為挽具,即它使用的工具集)、運行時環境,以及它能夠存取的所有技能和函式庫。」
長期任務(Long-horizon Tasks)指的是需要串聯大量決策、有時耗時數天才能完成的工作。這與 AI 單純回覆提示詞截然不同。如何在漫長的任務鏈中讓 AI 保持專注、不偏離軌道,是代理研究中最艱難的課題之一。
監督代理:CEO 式的管理機制
最關鍵的突破來自 監督代理 的引入。El Hallak 描述道:「當主要代理偏離方向、開始探索可能走入死胡同的路徑,或者重新探索已經走過的舊路時,監督代理會像 CEO 一樣將其推回正軌。」
這種架構並非全新的概念,但大多數現有的代理系統僅使用單一層次的框架——如 Claude Code、Codex 或 Hermes Agent。Nvidia 的研究率先展示了雙層架構在 ARC-AGI-3 這類高難度互動推理任務上的壓倒性優勢。
業界共鳴:框架而非模型決定成本與效能
Nvidia 的發現並非孤例。2026 年 7 月,Databricks 發表的研究同樣顯示,框架的選擇對 AI 成本的影響遠超模型本身。Databricks CEO Ali Ghodsi 指出:「你可以選擇同樣的模型,但不同的框架,成本可能相差兩倍。」
此前 OpenAI 因其模型在 ARC-AGI-3 上的表現不佳(低於 10%),於 7 月自行展開研究,同樣發現僅調整框架的兩個設置就能讓分數翻三倍。但即便是 OpenAI,也未能達到 100% 的滿分。
產業啟示
| 面向 | 傳統認知 | Nvidia 研究的啟示 |
|---|---|---|
| 效能關鍵 | 模型大小與架構 | 框架設計與監督機制 |
| 成本控制 | 選擇較便宜的模型 | 選擇正確的框架更關鍵 |
| 代理開發 | 專注提示工程 | 專注工具鏈、記憶體與執行規則 |
| 開源策略 | 開源模型 vs 閉源模型 | 開源框架同樣重要 |
Nvidia 強調,這項研究的目的不是推出新產品,而是展示開源框架的生態價值。該公司透過 Nemo 品牌提供了大量開源的框架構建模組。Nvidia 的立場是:「我們相信擁有開放代理堆疊——讓你在框架、基礎設施和運行時各層級都能掌控——是推動生態系統安全前進的關鍵。」
本文信息來源:TechCrunch(Julie Bort 報導)、Nvidia 研究報告,2026 年 8 月 21 日。