Sakana AI 於 2026 年 9 月正式宣布,旗下全自動 AI 研究系統 「The AI Scientist」 的論文已獲 《Nature》 期刊以開放存取形式發表。該系統由 Sakana AI 與英屬哥倫比亞大學(UBC)、Vector Institute 及牛津大學合作開發,展示了 AI 如何端到端執行機器學習研究的完整生命周期,並首次證明全自動生成的論文能夠通過嚴格的人類同儕審查。
系統架構:從構想到論文的全自動流程
AI Scientist 的工作流程涵蓋了學術研究的每一個關鍵環節:
- 構想生成:系統在給定廣泛研究方向後,能自主產生新穎的研究想法
- 文獻回顧:自動搜尋並閱讀相關文獻
- 實驗設計與執行:透過並行化的代理樹狀搜尋(agentic tree search)設計、編程並進行實驗
- 論文撰寫:使用 LaTeX 格式撰寫完整論文,並透過具視覺能力的基礎模型反饋修正圖表
- 同儕審查:內建自動審稿人(Automated Reviewer)對論文進行評分
每篇論文的生成成本約為 15 美元,遠低於傳統研究模式。
Automated Reviewer:逼近人類審稿水準
為了在無需耗費人類審稿人的情況下大規模評估 AI 生成的科學論文,研究團隊建立了一個 Automated Reviewer,設計為模擬 Area Chair 角色,將五份獨立審查結果集結成基於 NeurIPS 官方指南的最終決定。
| 指標 | Automated Reviewer | 人類審稿人之間(NeurIPS 2021) |
|---|---|---|
| 平衡準確率 | 69% | 約 65–70% |
| F1 分數 | 超越人類間一致性 | 基準對照 |
在對 ICLR 頂級會議論文的測試中,Automated Reviewer 的判斷與人類審稿人的一致程度不僅可與人類匹敵,更在 F1 分數上超越了著名的 NeurIPS 2021 一致性實驗中人類之間的 Agreement 水準。
規模定律:更好的模型產生更好的科學
最關鍵的發現之一是:AI 生成的論文品質與其底層基礎模型的能力呈現明確的規模定律。研究團隊使用 Automated Reviewer 評分不同基礎模型驅動下產出的論文,發現隨著基礎模型能力提升,論文品質呈單調上升趨勢。
這意味著隨著計算成本持續下降、模型能力指數級增長,未來版本的 AI Scientist 將具備更強大的研究能力——這是 AI 驅動科學發現中一個深具預測意義的發現。
里程碑:通過盲審的 AI 論文
AI Scientist-v2 的論文曾提交至 ICLR 2025 “I Can’t Believe It’s Not Better”(ICBINB)研討會進行盲審,獲得 6.33/10 的平均分數(個別評分為 6、7、6),超過了人類論文的平均接受門檻,並勝過 55% 的人類投稿。論文在確定被接受前已自願撤回。
當前限制與挑戰
儘管達成了里程碑,研究團隊坦承系統仍存在明顯限制:
- 構想品質參差:偶爾產生幼稚或不成熟的研究想法
- 方法學深度不足:在嚴謹的方法論和複雜程式實作上仍有困難
- 幻覺與錯誤:容易出現虛假引用、附錄中重複圖表等明顯錯誤
- 領域侷限:目前僅限於計算實驗,尚未擴展至物理實驗室場景
倫理與影響
AI 生成論文的自動化能力引發了深刻的倫理問題:從淹沒同儕審查系統到人為膨脹研究資歷。Sakana AI 採取了多項負責任的措施——主動撤回已接受的 AI 提交論文、取得 IRB 批准,並為所有 AI 生成論文加上浮水印。
該團隊呼籲學術界建立明確的規範來處理 AI 生成的研究成果,並強調透明揭露是維持科學誠信的關鍵。
產業意義
此研究發表於《Nature》標誌著自動化科學發現從概念驗證階段正式進入主流學術話語體系。對於期刊、會議和研究機構而言,這帶來了迫切的實務問題:如何評估 AI 生成的研究?如何在確保方法嚴謹性的同時整合自動化系統?如果觀察到的規模定律成立,未來的 AI Scientist 將能以超越人類團隊可行規模的速度生成並測試假說——特別是在計算實驗可行的領域。
本文信息來源:Sakana AI 官方部落格及《Nature》期刊論文(DOI: 10.1038/s41586-026-10265-5)。