Berkeley AI Research·· 2025-11-01精选AI 评分60
伯克利提出分治式离线强化学习算法 Transitive RL
RL without TD learning
AI 导读
伯克利AI研究团队发布论文介绍分治式值学习算法Transitive RL(TRL)。该算法适用于离线目标条件强化学习,通过期望回归计算软最优子目标,将对数级减少Bellman递归误差。在OGBench的1B规模长视任务上,TRL无需调整n参数即达到最优TD-n表现。
推荐理由
提出基于分治的离线目标条件强化学习算法TRL,理论上对数级减少误差累积,无需调整n步参数即可匹敌最优TD-n。
来源:Berkeley AI Research · bair.berkeley.edu