2026 年 10 月 5 日,位於布魯克林的 AI 初創 Reflection AI 正式發布其首款開放權重模型 Beam,終結了數月來的傳聞與推遲。Beam 是一個稀疏 MoE(Mixture-of-Experts)模型,總參數 501B,每次推論僅激活 23B 參數,支援 1M token 的上下文視窗。Reflection 聲稱 Beam 在進階推理基準上可匹敵 Z.ai 的 GLM-5.2,但推論計算量僅為後者的 1/3 至 1/4——這在西方開放權重模型追赶中國開源生態的競賽中,是一個極具衝擊力的定位。
模型架構與訓練規模
Beam 的架構選擇以效率為核心設計目標:
- MoE 路由:每層使用細粒度路由專家,採用 DeepSeek-V3 風格的 auxiliary-loss-free 負載平衡,加上餘弦退火的專家偏差更新。訓練結束時,最繁忙的專家僅達平均負載的 1.04 倍
- 深度穩定:跨 52 層的殘差範數通過深度比例縮放、SandwichNorm、注意力門控及 FP32 殘差累積保持穩定
- 預訓練:23.8T token(網路、公開資料及授權數據),經嚴格的品質過濾——約 95% 的原始網路 token 被移除,同時保留了約 1.8T 常規過濾器會丟棄的高品質 token
- 硬體:6,144 張 Nvidia GB300 NVL72 GPU,4 週內完成預訓練,末期 goodput(有效計算佔比)達 92.3%,僅發生 9 次半自動回退
- 中間訓練:將有效上下文擴展至 1M token
強化學習:Beam 的核心擴展軸
Reflection 將強化學習置於 Beam 能力的中心,其規模在開放權重模型中前所未見:
| 維度 | 數值 |
|---|---|
| RL 用 GPU | 10,500 張 Nvidia GB300 |
| 訓練時長 | 4 週 |
| 生成 rollout | 超過 1 億次 |
| 最大 rollout 上下文 | 256K token |
| 訓練與評分 sandbox | 約 1.3 億個 |
| 涵蓋環境 | 近 100 萬個(編碼、代理、STEM) |
Reflection 採用完全非同步策略梯度(fully asynchronous policy gradients):每個 token 都帶有產生它的策略版本標記。新演算法即使在策略滯後一天(107 個權重版本)的情況下仍能保持訓練穩定。基礎設施方面,系統維持平均 110K 並發 rollout,新權重中位數約 12 秒內送達推理集群,整個 RL 過程中處理了 71 次推理事故而未中斷訓練。
可控長度懲罰機制使 Beam 學會用更少的 token 解決任務。值得注意的是,瀏覽技能在未納入 RL 混合訓練的情況下自然改進——暗示代理領域間的跨域遷移。
基準測試表現
Beam 在 Reflection 公布的基準上展現了競爭力:
| 基準 | Beam | GLM-5.2 | Kimi K3 | Nemotron 3 Ultra | DeepSeek V4.1 Flash |
|---|---|---|---|---|---|
| SWE-bench Verified | 80.9 | — | — | 70.7 | — |
| Terminal Bench v2.1 | 80.1 | 81.0 | 88.3 | 56.4 | 90.6 |
| Humanity’s Last Exam (no tools) | 36.2 | 40.5 | 46.9 | — | — |
| GPQA Diamond | 90.5 | 91.2 | 93.5 | — | — |
| SWE-Bench Pro v1 | 65.5 | 62.1 | — | — | 54.3 |
| AIME 2026 | 97.8 | — | — | — | — |
數值來源:Reflection 官方公告及第三方彙整。獨立驗證尚未完成。
從表中可見,Beam 在數項基準上接近或超越 GLM-5.2,特別是在 SWE-Bench Pro v1 上以 65.5 領先 GLM-5.2 的 62.1。然而在 Terminal Bench v2.1 上,DeepSeek V4.1 Flash(90.6)和 Kimi K3(88.3)仍保持明顯優勢。Reflection 坦承 Kimi K3 在原始能力上仍然領先——Beam 的核心論述是推理效率而非絕對能力極限。
安全與對齊
Reflection 從預訓練 checkpoint 分別訓練了安全/對齊教師模型,然後透過多教師在線蒸蒸蒸(multi-teacher on-policy distillation)將其與 RL 教師合併。安全訓練使用 deliberative alignment 方法。詳細安全評測結果將在後續技術報告中公布。
發布策略與產業意義
Beam 的權重計畫於 2026 年 10 月底以 Apache 2.0 授權發布,屆時將附帶模型卡、技術文檔及完整的運行、評測、微調工具鏈。目前早期存取透過 waitlist 提供,仍在進行最終的 red-teaming。
Beam 的發布具有多重戰略意義:
- 西方開放權重的回應:在 DeepSeek、Qwen、GLM 等中國開放模型持續佔據 Hugging Face 排行榜之際,Beam 代表了 Nvidia 支持的西方開放權重陣營的直接回應
- 效率而非規模:Beam 的核心命題是「更少的活躍參數 × 同等的推理能力」——23B 活躍參數的設計使其推論成本遠低於 GLM-5.2 的 40B 或 Kimi K3 的 104B
- AI 工廠概念:Reflection 的最終產品是「AI 工廠」——讓企業與主權國家以自有數據訓練客製化的本地 AI 系統,Beam 是此基礎模型的基石
結語
Beam 的發布標誌著西方開放權重 AI 生態在 2026 年末的一次重要博弈。501B 參數、23B 活躍、1M 上下文——這些數字本身並不新奇;真正值得注意的是價格定位:在 GLM-5.2 仍領先的領域中,Beam 以 1/3 至 1/4 的推論成本提供接近的表現。對於企業與開發者而言,Beam 的 Apache 2.0 權重將在月底落地,屆時獨立評測將給出最終判斷。現在可以確定的只有一件事:開放權重模型的前緣之爭,在 2026 年第四季才剛剛升溫。
本文信息來源:Reflection AI 官方部落格、TechCrunch、Reuters、MarkTechPost、Axios。