跳到正文
Hugging Face Blog·· 2026-07-06AI 評分47

PRX 第 4 部分:資料策略

PRX Part 4: Our Data Strategy

AI 導讀

PRX 團隊公開了 7B 模型的預訓練資料策略,詳細闡述了結合公共與內部資料集、利用 VLM 重新加長文本標註以及通過 Mosaic Streaming(MDS)和 Lance 格式進行分散式訓練的完整資料流水線。

該團隊放棄了預計算文本潛變數,轉而在訓練迴圈中動態執行 Qwen3-VL 文本編碼器,僅帶來約 3-4% 的吞吐量成本。

來源:Hugging Face Blog · huggingface.co