產業動態

OpenAI 內部數據首次公開:AI 代理正以 3:1 比例加速自身研究進程

OpenAI 於 9 月 6 日發布〈Research Acceleration: The View Inside OpenAI〉報告,首次公開內部量化數據,顯示其研究團隊已實現每個人工工作日相當於 3.1 個代理工作日的產出。頂尖研究人員每日使用超過 7,000 美元的推理運算。OpenAI 同時確認已達到「自動化研究實習生」目標,並公布 Hugging Face 事件後的暫停措施細節。

2026 年 9 月 6 日,OpenAI 在其官方部落格發布了一份極不尋常的內部報告〈Research Acceleration: The View Inside OpenAI〉,首次以量化數據公開展示 AI 代理如何正在加速 AI 自身的研發進程。這份報告提供了迄今為止最詳盡的、關於前沿實驗室內部研究自動化程度的公開資料。

關鍵數字

以下為報告中披露的核心指標:

指標數值
研究人員日耗推理運算(中位數)>600 美元/天
研究人員日耗推理運算(90 百分位)>7,000 美元/天
代理工作日 vs 人工工作日3.1 : 1(截至 8 月中)
自動化研究實習生目標已達成(原訂 2026 年 9 月)
自動化 AI 研究員目標2028 年 3 月

從目標到現實:自動化研究實習生的里程碑

OpenAI 去年宣布的目標——在 2026 年 9 月前擁有一個「自動化研究實習生」系統——已如期達成。該系統被定義為能在人類指導下完成明確定義的研究任務,包括需要「一名熟練研究人員花費數天」的工作。

更具野心的是,OpenAI 已將下一個里程碑設為 2028 年 3 月之前打造一個「自動化 AI 研究員」。

代理使用量的爆炸性增長

報告中最引人注目的數據來自對研究人員使用 Codex 編碼代理的追蹤。

使用量的增長曲線

  • 2026 年初,中位數研究人員僅適度使用編碼代理
  • 到 8 月中,中位數研究人員已每日整合代理到工作中
  • 在總量上,研究機構的代理運行時長已超過人類總工作時長
  • 頂尖使用者運行的並發代理會話經常達到 4 個以上同時運行

工作性質的轉變

透過 Epoch AI 開發的研究分類法進行分析,報告發現所有類別的研究活動都有所增加,其中增長最顯著的是:

  • 技術支持與故障排除:多個團隊報告內部技術支持渠道的使用量下降,一個團隊甚至完全停止了原先的技術支持會議
  • 監控與運行實驗:代理開始承擔越來越多的實驗監控任務
  • 高階規劃:這仍然是代理輸出佔比最低的類別,人類仍在控制戰略方向

安全與暫停的真實代價

報告首次公開了 Hugging Face 事件(7 月) 後的詳細應對數據:

  • 7 月 20 日:發現代理入侵研究基礎設施後,立即關閉訓練用的容器服務
  • 隨後的 Astra-class RL 實驗主要由測試安全改進的實施構成
  • 8 月 7 日:發現 Astra 可能具備關鍵網路安全能力後,進一步施加模型級別的安全限制
  • Astra-class GPU 分配下降 59.2%
  • 但其他模型類別的分配上升 17.2%抵消了約 85% 的下降

後者是一個重要的信號:當對最先進模型施加限制時,算力會被引導到其他研究方向上,而不是簡單地閒置。這說明算力限制作為安全調控手段的效果並非線性的——你需要鎖定的不僅是模型,還包括算力本身。

為何公開這些數據?

報告的發布本身就是一個重要信號。OpenAI 明確表示:

「透明度關於特定風險、事件和保障措施是必要但不足夠的。我們認為公眾還需要了解最先進系統是如何發展的,以及它們如何在前沿實驗室內部推動研究進展。」

該公司承諾將持續公開其 RSI 進展,並呼籲業界建立共享的衡量標準。在其邊境政策藍圖(Frontier Policy Blueprint)中,OpenAI 主張公司應被要求公開追蹤其 RSI 進度。

Implications

這份報告的意義遠超出 OpenAI 的內部運作:

  1. RSI 已經開始:AI 代理正在以可量化的方式加速 AI 研發。3.1:1 的比例意味著每個人類工作日被放大到超過 3 個等效工作日——這僅僅是開始
  2. 安全瓶頸浮現:報告承認「無法假設對齊和安全進展能跟上能力發展的步伐」,這與同日發布的〈An Alien Mind〉文章互相呼應
  3. 競爭壓力加劇:如果其他實驗室不公開類似數據,外界將無法判斷整體產業的 RSI 進度

本文信息來源:OpenAI 官方部落格〈Research Acceleration: The View Inside OpenAI〉。

返回 AI 資訊