模型發布

Reflection AI 發布 Beam:501B 開放權重 MoE 模型挑戰中國開源前緣

Nvidia 支持的 Reflection AI 於 10 月 5 日正式推出首款開放權重模型 Beam——501B 總參數、23B 活躍參數的稀疏 MoE 模型,以 Apache 2.0 授權發布。Beam 在推理、編程與代理任務上匹配 GLM-5.2 水準,但推論計算成本僅為後者的 1/3 至 1/4,標誌著西方開放權重陣營對中國開源模型的一次重要回應。

2026 年 10 月 5 日,位於布魯克林的 AI 初創 Reflection AI 正式發布其首款開放權重模型 Beam,終結了數月來的傳聞與推遲。Beam 是一個稀疏 MoE(Mixture-of-Experts)模型,總參數 501B,每次推論僅激活 23B 參數,支援 1M token 的上下文視窗。Reflection 聲稱 Beam 在進階推理基準上可匹敵 Z.ai 的 GLM-5.2,但推論計算量僅為後者的 1/3 至 1/4——這在西方開放權重模型追赶中國開源生態的競賽中,是一個極具衝擊力的定位。

模型架構與訓練規模

Beam 的架構選擇以效率為核心設計目標:

  • MoE 路由:每層使用細粒度路由專家,採用 DeepSeek-V3 風格的 auxiliary-loss-free 負載平衡,加上餘弦退火的專家偏差更新。訓練結束時,最繁忙的專家僅達平均負載的 1.04 倍
  • 深度穩定:跨 52 層的殘差範數通過深度比例縮放、SandwichNorm、注意力門控及 FP32 殘差累積保持穩定
  • 預訓練:23.8T token(網路、公開資料及授權數據),經嚴格的品質過濾——約 95% 的原始網路 token 被移除,同時保留了約 1.8T 常規過濾器會丟棄的高品質 token
  • 硬體:6,144 張 Nvidia GB300 NVL72 GPU,4 週內完成預訓練,末期 goodput(有效計算佔比)達 92.3%,僅發生 9 次半自動回退
  • 中間訓練:將有效上下文擴展至 1M token

強化學習:Beam 的核心擴展軸

Reflection 將強化學習置於 Beam 能力的中心,其規模在開放權重模型中前所未見:

維度數值
RL 用 GPU10,500 張 Nvidia GB300
訓練時長4 週
生成 rollout超過 1 億次
最大 rollout 上下文256K token
訓練與評分 sandbox約 1.3 億個
涵蓋環境近 100 萬個(編碼、代理、STEM)

Reflection 採用完全非同步策略梯度(fully asynchronous policy gradients):每個 token 都帶有產生它的策略版本標記。新演算法即使在策略滯後一天(107 個權重版本)的情況下仍能保持訓練穩定。基礎設施方面,系統維持平均 110K 並發 rollout,新權重中位數約 12 秒內送達推理集群,整個 RL 過程中處理了 71 次推理事故而未中斷訓練。

可控長度懲罰機制使 Beam 學會用更少的 token 解決任務。值得注意的是,瀏覽技能在未納入 RL 混合訓練的情況下自然改進——暗示代理領域間的跨域遷移。

基準測試表現

Beam 在 Reflection 公布的基準上展現了競爭力:

基準BeamGLM-5.2Kimi K3Nemotron 3 UltraDeepSeek V4.1 Flash
SWE-bench Verified80.9——70.7—
Terminal Bench v2.180.181.088.356.490.6
Humanity’s Last Exam (no tools)36.240.546.9——
GPQA Diamond90.591.293.5——
SWE-Bench Pro v165.562.1——54.3
AIME 202697.8————

數值來源:Reflection 官方公告及第三方彙整。獨立驗證尚未完成。

從表中可見,Beam 在數項基準上接近或超越 GLM-5.2,特別是在 SWE-Bench Pro v1 上以 65.5 領先 GLM-5.2 的 62.1。然而在 Terminal Bench v2.1 上,DeepSeek V4.1 Flash(90.6)和 Kimi K3(88.3)仍保持明顯優勢。Reflection 坦承 Kimi K3 在原始能力上仍然領先——Beam 的核心論述是推理效率而非絕對能力極限。

安全與對齊

Reflection 從預訓練 checkpoint 分別訓練了安全/對齊教師模型,然後透過多教師在線蒸蒸蒸(multi-teacher on-policy distillation)將其與 RL 教師合併。安全訓練使用 deliberative alignment 方法。詳細安全評測結果將在後續技術報告中公布。

發布策略與產業意義

Beam 的權重計畫於 2026 年 10 月底以 Apache 2.0 授權發布,屆時將附帶模型卡、技術文檔及完整的運行、評測、微調工具鏈。目前早期存取透過 waitlist 提供,仍在進行最終的 red-teaming。

Beam 的發布具有多重戰略意義:

  • 西方開放權重的回應:在 DeepSeek、Qwen、GLM 等中國開放模型持續佔據 Hugging Face 排行榜之際,Beam 代表了 Nvidia 支持的西方開放權重陣營的直接回應
  • 效率而非規模:Beam 的核心命題是「更少的活躍參數 × 同等的推理能力」——23B 活躍參數的設計使其推論成本遠低於 GLM-5.2 的 40B 或 Kimi K3 的 104B
  • AI 工廠概念:Reflection 的最終產品是「AI 工廠」——讓企業與主權國家以自有數據訓練客製化的本地 AI 系統,Beam 是此基礎模型的基石

結語

Beam 的發布標誌著西方開放權重 AI 生態在 2026 年末的一次重要博弈。501B 參數、23B 活躍、1M 上下文——這些數字本身並不新奇;真正值得注意的是價格定位:在 GLM-5.2 仍領先的領域中,Beam 以 1/3 至 1/4 的推論成本提供接近的表現。對於企業與開發者而言,Beam 的 Apache 2.0 權重將在月底落地,屆時獨立評測將給出最終判斷。現在可以確定的只有一件事:開放權重模型的前緣之爭,在 2026 年第四季才剛剛升溫。


本文信息來源:Reflection AI 官方部落格、TechCrunch、Reuters、MarkTechPost、Axios。

返回 AI 資訊