研究突破

Reka 推出 Rho-1:19B 全知推理模型統一文字、影像與影片生成

Reka 於 10 月 5 日發布 Rho-1 研究預覽——一款從零訓練的 19B 全知推理模型(omni-reasoning model),在單一神經網路中統一文字理解、影像生成、影片動畫與機器人動作,無需任何外部工具或專用模型協作。此架構代表 AI 從「多模型流水線」邁向「統一世界模型」的重要方向轉折。

2026 年 10 月 5 日,Reka 發布 Rho-1 的研究預覽——一個從零訓練的 19B 參數全知推理模型(omni-reasoning model)。不同於當前主流 AI 系統依賴的多模型流水線(一個 LLM 規劃 + 專用影像模型生成 + 專用影片模型動畫 + 專用檢測模型定位),Rho-1 將文字、影像、影片與機器人動作統一為同一上下文視窗中的 token,由單一神經網路處理整個迴圈。

核心概念:坍塌多模態堆疊

Reka 用一個比喻說明 Rho-1 的架構定位:當前 AI 系統是多層「代理流水線」——一個中央模型計劃任務,然後逐一委派給模態專用的專家模型。每次委派都增加延遲,每個專家只看到狹窄的請求,而非完整上下文。Rho-1 將整個堆疊坍塌為一層——文字、視覺與機器人動作全部在同一個 token 空間中表示。

維度傳統多模型流水線Rho-1 統一架構
模型數量3–5 個專用模型1 個模型
上下文傳遞每步重新編碼,語境丟失同一 KV cache 持續累積
延遲多次序列調用累加單一模型端到端推理
最佳化各模型獨立,無法聯合最佳化端到端可微分
推理一致性每次編碼損失語義生成即記憶,無需重新編碼

示範:五輪對話中的世界狀態

Reka 發布的示範展示了 Rho-1 的核心能力——一段五輪持續對話:

  1. 生成靜態場景:使用者要求「繪製一個低角度俯瞰的紅白條紋燈塔」,Rho-1 先以文字推理 shot plan,然後生成相符的影像
  2. 定位物體:使用者要求「框出燈塔」。Rho-1 直接在影像的 KV 表示上發出邊界框坐標 token——無需第二個檢測模型
  3. 動畫化:使用者要求「讓無人機緩慢飛向燈塔」。Rho-1 將靜態影像作為起始幀,生成第一幀即保持物件標識一致的影片
  4. 編輯影片:使用者要求「改成暴風雪場景,自然色彩」。Rho-1 以同一場景生成暴風雪版影片,燈塔、小屋、鏡頭移動完全一致
  5. 理解變化:使用者問「兩段影片有什麼不同?」。Rho-1 直接從生成狀態中回答,無需事後對匯出幀做 captioning

關鍵洞察:整個對話中模型從未中斷上下文。KV cache 作為持續的世界狀態,每一次生成(文字、影像、影片)都讀寫同一狀態。燈塔的幾何、位置、材質在第一輪生成後即存在於上下文中,後續所有操作都基於這個內在表徵。

架構設計

Rho-1 的內部結構包含兩個平行的計算流:

  • 理解流(Understanding stream):處理使用者的文字 token 以及自身生成的視覺 token,負責推理、規劃與世界狀態追蹤
  • 生成流(Generation stream):包含文字解碼頭(predicts the next token)與擴散解碼頭(Diffusion head, predicts the way back to clean),後者負責將潛在表徵解碼為影像或影片

兩者在每個 transformer block 中透過共享注意力實現資訊交換,形成一個理解↔生成的雙向通道。對於文字輸出,模型使用標準的自回歸解碼;對於視覺輸出,使用 8 步蒸蒸蒸擴散(distilled diffusion),生成品質與 99 步全擴散接近,但速度大幅提升。

速度優勢

Reka 報告了 Rho-1 的端到端延遲數據:

任務Rho-1對比模型 / 流水線
首次影片幀(中位數)~7 秒多模型流水線 ~13.8 秒
即時生成倍率0.79× 實時(中位數)—
首個文字 token 延遲最快之一專用文字模型基準
靜態影像生成與最快專用影像模型相當專用影像模型
蒸蒸蒸影片(5.3 秒片段)~1 秒生成其他影片模型顯著更慢

Rho-1 的蒸蒸蒸變體將擴散步數從 99 步縮減至 8 步,品質損失極小,將系統推向即時互動的邊界。

能力範圍

Rho-1 的示範影片展示了一系列模擬與生成能力:

  • 影片遊戲世界:從農場拖拉機、鬼屋、中世紀村落到霓虹夜街等多種風格的遊戲場景模擬
  • 機器人學:以機器人第一視角模擬倉庫車輛、四足機器人、行星漫遊車與工業焊接手臂的操作環境
  • 航拍模擬:峽谷河流、城市天際線、冰川、港口等無人機視角的場景生成
  • 自然現象:北極光、珊瑚礁、瀑布、野生動物等動態自然場景
  • 天氣模擬:超級暴風雪、暴風雪、沙塵暴、海浪與霧等極端天氣動畫
  • 工業場景:鑄造廠、資料中心、礦場、發電風機的工業流程模擬
  • 室內空間:圖書館、廚房、走廊、大教堂等內部空間的一致性走動模擬

產業意義:從多模型到統一模型

Rho-1 的發布不僅是技術展示,更代表了一種架構理念的轉折。目前主流 AI 系統的設計是功能分治——一個模型負責一件事。這種架構的結構性代價包括:

  1. 語境丟失:影像傳給專用模型時,需重新編碼為該模型能理解的表示,原始語義必然受損
  2. 無法端到端最佳化:各模型獨立訓練,聯合行為只能透過 prompt engineering 和手動調度來協調
  3. 推理不一致:定位模型的邊界框不一定與生成模型的場景幾何一致
  4. 延遲累加:每次模型間調用增加網路與排隊延遲

Rho-1 透過「單一上下文中的統一表示」從根本上消除了這些問題。Reka 團隊明確表示:「這不是用工具調用的代理系統。沒有第二個模型。文字、邊界框、影像與影片都是讀寫自同一狀態的 token。」

結語

Rho-1 並非一個立即投入生產的產品——它目前是研究預覽,Reka 正在尋求合作夥伴將其應用於邊際機器人學、互動式模擬環境與閉環視覺-動作系統。然而,作為一個架構宣言,它的訊息清晰而有力:AI 的未來可能不在於更大、更多模型的組合,而在於更少、更統一的模型。當一個 19B 模型可以在單一對話中生成場景、定位物體、動畫化、編輯場景並回答關於場景的問題——且在每步之間不丟棄上下文——這暗示著一條通往真正「世界模型」的道路。


本文信息來源:Reka AI 官方部落格、Reka Research Labs。

返回 AI 資訊