2026 年 10 月 5 日,Reka 發布 Rho-1 的研究預覽——一個從零訓練的 19B 參數全知推理模型(omni-reasoning model)。不同於當前主流 AI 系統依賴的多模型流水線(一個 LLM 規劃 + 專用影像模型生成 + 專用影片模型動畫 + 專用檢測模型定位),Rho-1 將文字、影像、影片與機器人動作統一為同一上下文視窗中的 token,由單一神經網路處理整個迴圈。
核心概念:坍塌多模態堆疊
Reka 用一個比喻說明 Rho-1 的架構定位:當前 AI 系統是多層「代理流水線」——一個中央模型計劃任務,然後逐一委派給模態專用的專家模型。每次委派都增加延遲,每個專家只看到狹窄的請求,而非完整上下文。Rho-1 將整個堆疊坍塌為一層——文字、視覺與機器人動作全部在同一個 token 空間中表示。
| 維度 | 傳統多模型流水線 | Rho-1 統一架構 |
|---|---|---|
| 模型數量 | 3–5 個專用模型 | 1 個模型 |
| 上下文傳遞 | 每步重新編碼,語境丟失 | 同一 KV cache 持續累積 |
| 延遲 | 多次序列調用累加 | 單一模型端到端推理 |
| 最佳化 | 各模型獨立,無法聯合最佳化 | 端到端可微分 |
| 推理一致性 | 每次編碼損失語義 | 生成即記憶,無需重新編碼 |
示範:五輪對話中的世界狀態
Reka 發布的示範展示了 Rho-1 的核心能力——一段五輪持續對話:
- 生成靜態場景:使用者要求「繪製一個低角度俯瞰的紅白條紋燈塔」,Rho-1 先以文字推理 shot plan,然後生成相符的影像
- 定位物體:使用者要求「框出燈塔」。Rho-1 直接在影像的 KV 表示上發出邊界框坐標 token——無需第二個檢測模型
- 動畫化:使用者要求「讓無人機緩慢飛向燈塔」。Rho-1 將靜態影像作為起始幀,生成第一幀即保持物件標識一致的影片
- 編輯影片:使用者要求「改成暴風雪場景,自然色彩」。Rho-1 以同一場景生成暴風雪版影片,燈塔、小屋、鏡頭移動完全一致
- 理解變化:使用者問「兩段影片有什麼不同?」。Rho-1 直接從生成狀態中回答,無需事後對匯出幀做 captioning
關鍵洞察:整個對話中模型從未中斷上下文。KV cache 作為持續的世界狀態,每一次生成(文字、影像、影片)都讀寫同一狀態。燈塔的幾何、位置、材質在第一輪生成後即存在於上下文中,後續所有操作都基於這個內在表徵。
架構設計
Rho-1 的內部結構包含兩個平行的計算流:
- 理解流(Understanding stream):處理使用者的文字 token 以及自身生成的視覺 token,負責推理、規劃與世界狀態追蹤
- 生成流(Generation stream):包含文字解碼頭(predicts the next token)與擴散解碼頭(Diffusion head, predicts the way back to clean),後者負責將潛在表徵解碼為影像或影片
兩者在每個 transformer block 中透過共享注意力實現資訊交換,形成一個理解↔生成的雙向通道。對於文字輸出,模型使用標準的自回歸解碼;對於視覺輸出,使用 8 步蒸蒸蒸擴散(distilled diffusion),生成品質與 99 步全擴散接近,但速度大幅提升。
速度優勢
Reka 報告了 Rho-1 的端到端延遲數據:
| 任務 | Rho-1 | 對比模型 / 流水線 |
|---|---|---|
| 首次影片幀(中位數) | ~7 秒 | 多模型流水線 ~13.8 秒 |
| 即時生成倍率 | 0.79× 實時(中位數) | — |
| 首個文字 token 延遲 | 最快之一 | 專用文字模型基準 |
| 靜態影像生成 | 與最快專用影像模型相當 | 專用影像模型 |
| 蒸蒸蒸影片(5.3 秒片段) | ~1 秒生成 | 其他影片模型顯著更慢 |
Rho-1 的蒸蒸蒸變體將擴散步數從 99 步縮減至 8 步,品質損失極小,將系統推向即時互動的邊界。
能力範圍
Rho-1 的示範影片展示了一系列模擬與生成能力:
- 影片遊戲世界:從農場拖拉機、鬼屋、中世紀村落到霓虹夜街等多種風格的遊戲場景模擬
- 機器人學:以機器人第一視角模擬倉庫車輛、四足機器人、行星漫遊車與工業焊接手臂的操作環境
- 航拍模擬:峽谷河流、城市天際線、冰川、港口等無人機視角的場景生成
- 自然現象:北極光、珊瑚礁、瀑布、野生動物等動態自然場景
- 天氣模擬:超級暴風雪、暴風雪、沙塵暴、海浪與霧等極端天氣動畫
- 工業場景:鑄造廠、資料中心、礦場、發電風機的工業流程模擬
- 室內空間:圖書館、廚房、走廊、大教堂等內部空間的一致性走動模擬
產業意義:從多模型到統一模型
Rho-1 的發布不僅是技術展示,更代表了一種架構理念的轉折。目前主流 AI 系統的設計是功能分治——一個模型負責一件事。這種架構的結構性代價包括:
- 語境丟失:影像傳給專用模型時,需重新編碼為該模型能理解的表示,原始語義必然受損
- 無法端到端最佳化:各模型獨立訓練,聯合行為只能透過 prompt engineering 和手動調度來協調
- 推理不一致:定位模型的邊界框不一定與生成模型的場景幾何一致
- 延遲累加:每次模型間調用增加網路與排隊延遲
Rho-1 透過「單一上下文中的統一表示」從根本上消除了這些問題。Reka 團隊明確表示:「這不是用工具調用的代理系統。沒有第二個模型。文字、邊界框、影像與影片都是讀寫自同一狀態的 token。」
結語
Rho-1 並非一個立即投入生產的產品——它目前是研究預覽,Reka 正在尋求合作夥伴將其應用於邊際機器人學、互動式模擬環境與閉環視覺-動作系統。然而,作為一個架構宣言,它的訊息清晰而有力:AI 的未來可能不在於更大、更多模型的組合,而在於更少、更統一的模型。當一個 19B 模型可以在單一對話中生成場景、定位物體、動畫化、編輯場景並回答關於場景的問題——且在每步之間不丟棄上下文——這暗示著一條通往真正「世界模型」的道路。
本文信息來源:Reka AI 官方部落格、Reka Research Labs。