跳到正文
Berkeley AI Research·· 2025-11-01AI 評分58

RL without TD learning

RL without TD learning

AI 導讀

作者介紹了一種基於分治範式的強化學習演算法 Transitive RL,旨在解決傳統時序差分學習在長步數任務中的誤差累積與擴充套件難題。

該方法通過在目標條件強化學習中應用可傳遞的貝爾曼更新規則,將軌跡分割為兩段,並利用資料集中的狀態和期望迴歸來計算軟最大值,從而在複雜長步數任務中取得了良好效能且無需手動調整超引數。

來源:Berkeley AI Research · bair.berkeley.edu