Beam:Reflection 的 501B 開源權重模型
Beam: Reflection's 501B open-weight model
Beam 是 Reflection 推出的首個 501B 引數、稀疏 MoE 開源權重模型,專為編碼、推理與代理任務設計。
- 引數規模:總 501B,活躍 23B,採用稀疏 MoE 架構。
Beam 501B 的高效推理與稀疏 MoE 架構,為開源程式設計與代理任務提供更低成本、強大能力的新選擇。
我們推出 Beam,Reflection 首款開放權重模型。Beam 是一個稀疏多專家模型,擁有 501 億總引數,其中 23 億為活躍引數,專為編碼、推理與代理工作負載打造。
Beam 的能力源於在預訓練與強化學習(RL)上的重大投入。我們在來自網路及專有授權資料集的 23.8 兆個多樣、精心策劃、優質 tokens 上進行預訓練,達到或超越同等規模的開放基礎模型。同步地,我們開發了支援高算力 RL 的演算法、訓練環境與基礎設施。高算力 RL 執行期間,在 10.5K NVIDIA GB300 GPU 上,4 週訓練產生超過 1 億次 rollouts。
綜合上述努力,產生了具備前沿推理算力效率的競爭性開放權重表現。
Beam 正在進行最後的紅隊測試與評估。您可於 此處 註冊,提前獲取模型。權重、技術報告、模型卡與開發者資料將於本月稍後發布。
模型能力
我們以編碼與代理效能為重點訓練 Beam。Beam 推進了西方開放權重前沿,並在編碼與代理任務上與更大型的開放模型(如 GLM 5.2)競爭,且逼近 Qwen 3.8‑Max。儘管前沿開放模型如 Kimi K3 在原始能力上仍佔優,Beam 的優勢在於推理時的高效能。
下圖顯示 Beam 在編碼、代理、推理與 STEM 基準測試中的表現。NR 表示未報告的分數。
| 行標籤 | Beam | Inkling | Nemotron 3 Ultra | GLM 5.2 | GLM 5.3 | Kimi K3 | Qwen 3.8 Max | DeepSeek V4.1 Flash |
|---|---|---|---|---|---|---|---|---|
| DeepSWE v1.1 | 44.4 | NR | NR | 44.0 | 61.0 | 68.0 | 51.0 | 74.2 |
| SWE Bench Pro v2-Hard | 77.2 | 56.9 | NR | NR | 84.3 | 88.2 | NR | NR |
| SWE Bench Pro v1 | 65.5 | 54.3 | 46.4 | 62.1 | NR | NR | 67.7 | NR |
| Terminal Bench v2.1 | 80.1 | 63.8 | 56.4 | 81.0 | 88.2 | 88.3 | 86.6 | 90.6 |
| SWE Atlas Codebase QnA | 34.6 | NR | NR | NR | 61.0 | 68.0 | NR | NR |
| SWEBench Multilingual | 78.0 | NR | 67.7 | NR | NR | NR | NR | NR |
| SWEBench Verified | 80.9 | 77.6 | 70.7 | NR | NR | NR | NR | NR |
Beam 將編碼與代理能力與高效推理結合。於進階推理基準測試中,其分數與 GLM‑5.2 相近,且推理算力使用量降低 3–4 倍。與 2T+ 引數族模型(如 Qwen 3.8‑Max)相比,效率提升更為顯著,後者每個 token 需要顯著更多的推理算力。
這些結果意味著每個 token 的智慧量更高,在降低成本的同時提供強大的模型能力,使 Beam 成為企業編碼與代理工作負載的強力工作馬。


高算力強化學習
我們將高算力強化學習作為 Beam 的核心擴充套件軸,投入 RL 科學、資料與基礎建設,將更多算力轉化為更強的能力。擴充套件 RL 允許更廣泛探索問題解決策略,而更長的回合支援多步推理、工具使用及對環境回饋的適應。
為擴充套件強化學習,我們部署了 10.5K 臺 NVIDIA GB300 GPU,持續四週,產生超過 1 億次回合,最大上下文長度為 256K 個 token。訓練與評分使用了約 13 億個沙盒。為維持如此規模的執行,我們採購了 100 萬個高品質的編碼、代理和 STEM 環境。我們相信這是迄今為止任何開源實驗室進行的最大規模 RL 執行之一。在我們的評估套件中,隨著 RL 計算量增加,能力持續提升,未見平臺期。

我們使用非同步策略梯度訓練 Beam。在大規模情況下,策略陳舊成為這些方法的不穩定主要來源。長時間回合包含由多個模型檢查點產生的 token,較早的 token 與當前策略相比越來越陳舊。訓練與推理引擎之間的數值不匹配進一步加劇了這一挑戰。
我們開發了新演算法,在這些條件下保持學習穩定,同時系統性地減少整個流程中的訓練–推理不匹配。這些進展使得在大規模下完全非同步 RL 仍能保持穩定,即使學習來自超過一天前產生的互動。

高效推理學習
我們用可控長度懲罰訓練 Beam,該懲罰在獎勵成功解決方案的同時,抑制不必要的 token。RL 初期,雖然完成長度下降,但效能仍提升:模型學會以更少的推理完成任務。後來,隨著 Beam 具備更強的代理能力,完成長度再次增加,但這些額外 token 仍促進效能提升。整個訓練過程中,RL 改善了能力與 token 使用之間的權衡。

使用者可透過 Beam 的推理努力引數調整此權衡:較低設定偏好短回應,較高設定則允許更長的推理以提升對高需求任務的效能。這使使用者能靈活將推理努力與其任務與算力預算相匹配。
RL 如何促進行為泛化
我們設計 Beam 的強化學習訓練,以培養能超越訓練任務的推理與代理能力。在推理、軟體工程與終端任務的訓練階段,儘管 RL 混合中沒有瀏覽任務,我們仍觀察到瀏覽能力持續提升。這種轉移表明 Beam 正在學習更廣泛的代理能力,能跨領域泛化。給予網路存取後,它自然學會搜尋並查詢其他大型語言模型,並使用 OCR API 讀取檔案。
以下示範展示 Beam 在研究、應用程式開發、遊戲玩法與機器學習工作流程中運用這些能力。範例從使用公開資料建立即時 NYC 地鐵儀錶板,到打造互動式應用程式與準備模型微調筆記本。雖然 Beam 僅以文字為輸入,但當其他模態的資訊以文字形式呈現時,它亦能處理。另在一個分佈外領域,Beam 亦為最新且最小的 Gemma‑4 模型在 Text2SQL 任務上建立了微調筆記本。
這些示範共同說明 Beam 透過結合推理、編碼與工具使用,能處理的任務範圍之廣。每個範例都包含初始請求與產生的輸出,以及相關設定與使用者迭代。
擴充強化學習環境
前沿規模的強化學習需要大量困難且高品質的任務。我們建立了近一百萬個環境的池,主要透過合成資料管線構建,並以專有供應商資料與開源來源補充。
我們大量依賴迭代式策展流程。首先,我們在軟體工程、終端使用、競賽程式設計、STEM、網路搜尋、工具使用與一般知識工作等廣泛領域合成或採集環境。其次,我們對任務的難度進行嚴格篩選(確保既不總是可解,也不對模型而言不可解),並對品質進行篩選(例如不應該是未明確、誤導、可猜測、可被利用或其他破損或噪聲)。第三,我們透過 RL 測試任務,藉此識別進一步的品質或難度問題,並為下一輪來源與篩選提供資訊。
在 Beam 的開發過程中,我們發現資料品質的妥協會導致能力停滯與其他訓練問題。對任務品質的系統性提升對於在整個訓練期間維持能力增長至關重要,且最終結束時並未出現飽和跡象。
前沿 RL 基礎建設
高算力代理 RL 需要在大規模產生回放、執行工具、評估結果並更新模型。我們構建了一個非同步平臺,使這些流程能獨立運作,同時協調經驗與模型更新的流程。
在 Beam 的訓練期間,我們維持平均 110K 個併發回放。七項功能使其可行:
完全非同步執行: 代理在訓練者學習並發布新模型版本時生成回放。每個 token 都被標記為產生它的版本,讓訓練演算法能在完成回放流入訓練時考慮政策陳舊。
彈性計算配置:隨著工作負載演變,我們調整了推論與訓練之間的平衡,推論對訓練的 GPU 比例從 3.9:1 調整至 5.4:1。我們亦在同一訓練世代內,於五種 GPU 網格配置中重新調整訓練器尺寸,且未失去訓練狀態。
快速模型更新:新權重以約 12 秒的中位數抵達推論車隊。分層分發透過 RoCE 在機架間傳輸權重,然後在 NVLink 上本地共享。與每個副本直接拉取權重相比,這降低了 75% 的機架間流量,並使車隊範圍內的新權重採用速度提升 2.2 倍。
對推論失敗的韌性:執行期間,71 起推論事件被處理而未終止訓練工作。推論容量以 8 分鐘為中位數恢復,失去的容量僅佔已經耗用的服務 GPU 分鐘的 0.02%。
大規模環境:我們在執行期間支援多達 170K 個併發沙盒。在整個平臺上,我們處理了超過十億個沙盒建立請求,覆蓋 20 多個叢集、兩個雲端與四個區域。90% 的新沙盒在 10 秒內準備就緒。
高效訓練器封裝:動態封裝使訓練批次平均保持 99.99% 的填充率,並在平均回放長度增長近 70% 的同時,維持每 GPU 訓練器吞吐量在 1.5% 以內。
可觀測性與獎勵完整性:逐字記錄使得在每一步都能進行訓練與推論之間的數值一致性檢查。獨立評審重新檢視通過的解答以防止驗證器利用,而可重播的記錄則使獎勵及其在訓練中的使用可檢查。
綜合上述能力,我們得以在更長的互動與更苛刻的環境中訓練,同時保持吞吐量、從失敗中恢復,以及檢查學習過程的完整性。
為推理預訓練基礎
強化學習建立在堅實的基礎模型之上。為促進推理,我們確保 Beam 的基礎具備豐富的程式碼領域知識、可被放大之內在代理能力,以及穩定的 MoE 最佳化動態。
在開發 Beam 的過程中,我們預訓練了一系列逐步增大的模型,以建立並驗證我們的規模配方。要使其效能可預測,需要仔細設計模型層級、策劃多樣化的內部程式碼與網頁驗證集,並對所有訓練資料進行積極去汙染。規模效應成立;最終的 Beam Base 與其預測效能相符,且同時與可取得的同等規模開源基礎模型相匹配或超越。

穩定且平衡的 MoE 最佳化
Beam 架構與最佳化配方強調數值健康的基礎,以支撐持續的下游 RL。它結合交錯的區域性與全域注意力、細粒度路由專家、受控殘差流以及多種負載平衡方式,以確保專家利用的穩定與平衡,以及通過殘差的訊號健康傳播。
為了提升專家使用率,我們在無輔助損失的負載平衡(DeepSeek-AI et al., 2024)上進行改進,採用專家偏差更新的餘弦衰減,以減少訓練後期的路由擾動。序列級平衡進一步促進在預訓練分佈之外的資料上實現專家使用均衡,為模型適應下游 RL 的分佈變化做準備。結果,最終的預訓練基礎模型幾乎完美均衡利用率,確保所有專家都能被用於學習推理。

對於殘差流,我們開發了基於深度的縮放方法,抵消子層輸出累積時的啟用增長,協助在模型深度增加時保持殘差範數穩定。結合 SandwichNorm、逐元注意力門控以及 FP32 殘差累積(在向流中加入小更新時減少四捨五入誤差),此方案控制啟用增長與離群值,確保 Beam 所有層的訊號傳遞健康。此穩定性在預訓練、強化學習與對齊過程中持續。

以品質為中心的資料策展
Beam 在 23.8 兆個多樣且高品質的 token 上進行預訓練,來源包括網路、公開資料與專有授權資料集。我們的資料流程設計為為 Beam 提供下游代理式編碼的基礎:原始碼、技術說明,以及數學與科學知識,並在每個策展階段保持完整。我們訓練時使用幾乎所有公開且無限制授權的程式碼與程式碼檔案。
我們為網路、程式碼及 STEM 內容訓練了自己的品質分類器,將資料分為細緻品質層級,並將訓練重點放在較高品質的素材。經過大量科學迭代,我們將資料策展的精準度與召回率最佳化,遠超現代 OSS 資料框架所使用的傳統網路篩選。從一方面來看,約 95% 的原始網際網路 token 透過解析、去重與策展被剔除;另一方面,我們發現傳統技術會錯過約 1.8 兆高品質 token,而我們保留其中,包含 87% 的已策展網路程式碼 token。
程式碼建模需要專屬的策展以達到最高效能。對於每種語言,我們套用個別調校的過濾器,移除低品質的自動產生與無法學習的內容,並訓練分類器以辨識可能破壞訓練穩定性的損壞內容或程式碼。過度代表的語言與檔案型別則被重新平衡,以進一步擴大曝光範圍。
我們亦開發了高通量的 PDF 處理管線,確保 Beam 基礎模型涵蓋廣泛 STEM 主題。它整合了視覺‑語言 OCR 模型、內部品質分類器與檔案偵測器,能捕捉錯誤重建,並分佈至數千 GPU 以處理數 PB 的技術資料。
我們多次重複程式碼與技術內容,以在訓練期間提升模型的曝光度。這需要對模糊去重、打包演算法以及過度訓練科學的細緻關注,確保每個重複的資料來源都能協助而非削弱一般化能力。
前沿級預訓練基礎設施
Beam 在不到四週的時間內於 6,144 臺 NVIDIA GB300 NVL72 GPU 的叢集上完成端到端預訓練。為了實現訓練 Beam 所需的可靠性、效能與開發速度,我們幾乎自行構建了整個基礎設施堆疊。這包括跨叢集的全新拓撲感知、基於 Kubernetes 的排程器;一套內部節點生命週期系統,配備持續健康監控與警報;以及一個能進行半自動回滾與重啟的靜默資料腐敗(SDC)偵測系統。這些系統共同為我們提供了訓練自家前沿模型所需的效能與運營控制,實現了更高效且更穩定的訓練。
由於在訓練配方穩定性、基礎設施與資料品質上進行了大量投資,整體預訓練流程完成時呈現極為平滑的進度。我們在整個訓練過程中共執行了九次半自動回滾,原因或為非決定性梯度範數突升,或為可疑的 SDC。除此之外,訓練的有效產出率(goodput,即在最終模型中保留的訓練步驟佔實際時間的比例)在結束前達到 92.3%,這得益於檢點、故障偵測與節點健康管理的改進。

在中訓練階段為 RL 構建強大先驗
我們的中訓練階段專為高算力 RL 設計,培養 Beam 能夠從更具挑戰性的任務中學習的知識、推理與工具使用能力。
我們構建了多階段資料策展管道,既能捕捉真實世界任務的結構與複雜性,又能擴大難以僅從原始資料學習的能力覆蓋範圍。從精心挑選的真實案例開始,這些管道將資料轉換、結合並擴充,生成旨在教授特定能力的訓練資料。其內容包含長篇、富含推理的檔案,讓模型接觸延伸的邏輯鏈。
中訓練亦將 Beam 的有效上下文長度延伸至 1M 個 token。我們結合結構化程式碼倉庫、長期目標任務與高品質長篇檔案,教導模型在長序列中識別、保留並連結相關資訊。
綜合上述能力,為 RL 提供了更強的起點,使 Beam 能探索更複雜的解決方案、處理更長的互動,並從本來難以觸及的任務中學習。
安全與對齊
我們的安全與對齊工作包括從預訓練檢點訓練第二個模型,使用獨立的 SFT 與 RL 管道,並以專門針對模型應遵循原則的資料為基礎。透過多教師即時策略蒸餾(MOPD),我們將兩位教師的能力——大規模 RL 教師與專門的安全與對齊教師——結合。
我們將 Beam 的安全與對齊原則分為三層:
(1) Beam 不應違反的規則:遵守我們的安全政策並保持其作為 AI 代理的身份。
(2) Beam 應持續滿足的品質,例如:使用所給的上下文、作出準確主張、承認不確定性,並透明地遵循使用者的要求。
(3) Beam 互動的預設風格:直接、徹底、效率高,且主動預測使用者接下來可能需要的內容。

我們在對齊階段設計了 RL 環境,以激勵 Beam 遵循這些原則。許多環境使用由生成式獎勵模型評估的非可驗證獎勵,然而我們仍能利用它們可預測地塑造模型行為。在執行 RL 之前預測獎勵如何影響不同行為,我們能比單純使用 Best‑of‑N 上限(r = 0.79 對比 r = 0.46)更準確預測 RL 獲益。這使我們能迭代評分標準與獎勵設計,抑制像幻覺與過度格式化等行為,並提升 Beam 的整體互動品質。
我們的安全訓練採用了深思熟慮對齊(Guan et al., 2024)技術,將安全政策直接融入模型推理。資料集以對抗性方式迭代構建:每一輪我們訓練模型,產生能誘發有害或過度拒絕行為的提示,並將成功的攻擊回饋至 SFT 混合模型以進行下一輪。對於安全 RL,我們亦採集單回合、多回合、越獄與代理場景,模擬對手逼迫使用工具的模型採取不安全行動,從而同時降低過度拒絕與有害服從。
我們將在模型技術報告中公佈安全評估結果,並將內部開發與使用的安全評估開源,以建立一個可共享、可檢查的標準,讓開放生態系統可以測試並貢獻。
未來之路
此預覽展示了 Beam 今日的能力。我們將此早期版本提供給少數使用者;您可在 此處 註冊等待名單。
我們希望 Beam 能廣泛可用且易於擴充。本月,我們將以 Apache 2.0 授權發布權重,並提供檔案與完整堆疊,供執行、評估與微調模型使用。我們將與多個分發合作夥伴共同推出 Beam,並整合多種開源庫與工具,讓開發者能在現有開源工作流程中使用 Beam。
Beam 是系列中的首個模型,也是我們致力建構的開放智慧的首度示範。我們已在訓練下一個模型,目標是讓開放前沿隨著每一次發布,越來越接近智慧前沿。
來源:hackernews100 · reflection.ai