跳到正文
原文
Berkeley AI Research·· 2025-11-01精选AI 评分60

伯克利提出分治式离线强化学习算法 Transitive RL

RL without TD learning

AI 导读

伯克利AI研究团队发布论文介绍分治式值学习算法Transitive RL(TRL)。该算法适用于离线目标条件强化学习,通过期望回归计算软最优子目标,将对数级减少Bellman递归误差。在OGBench的1B规模长视任务上,TRL无需调整n参数即达到最优TD-n表现。

推荐理由

提出基于分治的离线目标条件强化学习算法TRL,理论上对数级减少误差累积,无需调整n步参数即可匹敌最优TD-n。

来源:Berkeley AI Research · bair.berkeley.edu