Hugging Face Blog·· 2026-07-06AI 評分47
PRX 第 4 部分:資料策略
PRX Part 4: Our Data Strategy
AI 導讀
PRX 團隊公開了 7B 模型的預訓練資料策略,詳細闡述了結合公共與內部資料集、利用 VLM 重新加長文本標註以及通過 Mosaic Streaming(MDS)和 Lance 格式進行分散式訓練的完整資料流水線。
該團隊放棄了預計算文本潛變數,轉而在訓練迴圈中動態執行 Qwen3-VL 文本編碼器,僅帶來約 3-4% 的吞吐量成本。
來源:Hugging Face Blog · huggingface.co