跳到正文

论文研究

值得读的 AI 论文与研究成果:架构创新、训练方法、能力测量与理论进展的精选解读。

最新精选

第 21–24 条 · 共 24 条
4月1日周三
  1. Google Research70

    Google Research 发布 AI 评测基准设计路线图:多少评注者才够用

    Google Research 开源了「Forest vs Tree」仿真器,研究了在预算有限时增加评测项数(N)与增加单项评注者数(K)的权衡。研究发现传统 1 到 5 名评注者的做法往往不足以捕捉人类意见的细微差别,若目标是测量人类意见的全貌(如复杂性/细微度),每项可能需要超过 10 名评注者;而若只关注主流多数投票,增加项数则更有效。

    推荐理由:研究量化了 AI 评测中评注者数量的权衡,并开源了预算模拟器以辅助设计更可靠且成本效益更高的评测基准。

3月18日周三
3月12日周四
11月1日周六
  1. Berkeley AI Research60

    伯克利提出分治式离线强化学习算法 Transitive RL

    伯克利AI研究团队发布论文介绍分治式值学习算法Transitive RL(TRL)。该算法适用于离线目标条件强化学习,通过期望回归计算软最优子目标,将对数级减少Bellman递归误差。在OGBench的1B规模长视任务上,TRL无需调整n参数即达到最优TD-n表现。

    推荐理由:提出基于分治的离线目标条件强化学习算法TRL,理论上对数级减少误差累积,无需调整n步参数即可匹敌最优TD-n。