熱點事件持續更新
Dust 無需反向傳播的 Transformer 預訓練
1 篇報導1 個報導來源8 小時前更新
先了解這件事
AI 綜述
2026-10-06 05:15,hackernews100 報導 Dust 為一種利用啟用空間零階最佳化的預訓練方法,能在不使用反向傳播的情況下訓練 Transformer。
- 實驗顯示,在 1M 至 20M tokens 的範圍內,Dust 在相同計算量下可與或優於傳統反向傳播。
- 特別是在 10M tokens 時,隨 population 增大,其效能趨近於 backprop。此報導為首次公開此技術,未提及之前相關報導。
AI 根據報導生成 · 2 小時前更新
最新進展10月6日 05:15
Dust 在 10M tokens 時效能趨近於傳統反向傳播。報導時間線
沿著報導,瞭解事件的不同面向。
10月6日
- hackernews100精選Dust:無需反向傳播的 Transformer 預訓練
Dust 是一種利用啟用空間零階最佳化的預訓練方法,能在不使用反向傳播的情況下訓練 Transformer。 - 效能:在 1M 至 20M tokens 的實驗中,Dust 在相同計算量下可與或優於傳統反向傳播,且在 10M tokens 時隨 population 增大,效能趨近於 backprop。
本事件熱度趨勢
還沒有足夠的連續觀測資料,暫不繪製趨勢。