跳到正文
熱點事件持續更新

Dust 無需反向傳播的 Transformer 預訓練

1 篇報導1 個報導來源8 小時前更新

先了解這件事

AI 綜述

2026-10-06 05:15,hackernews100 報導 Dust 為一種利用啟用空間零階最佳化的預訓練方法,能在不使用反向傳播的情況下訓練 Transformer。

  • 實驗顯示,在 1M 至 20M tokens 的範圍內,Dust 在相同計算量下可與或優於傳統反向傳播。
  • 特別是在 10M tokens 時,隨 population 增大,其效能趨近於 backprop。此報導為首次公開此技術,未提及之前相關報導。

AI 根據報導生成 · 2 小時前更新

報導時間線

沿著報導,瞭解事件的不同面向。

10月6日
  1. hackernews100精選
    Dust:無需反向傳播的 Transformer 預訓練

    Dust 是一種利用啟用空間零階最佳化的預訓練方法,能在不使用反向傳播的情況下訓練 Transformer。 - 效能:在 1M 至 20M tokens 的實驗中,Dust 在相同計算量下可與或優於傳統反向傳播,且在 10M tokens 時隨 population 增大,效能趨近於 backprop。

本事件熱度趨勢

還沒有足夠的連續觀測資料,暫不繪製趨勢。