Google Research·· 2026-04-01精选AI 评分70
Google Research 发布 AI 评测基准设计路线图:多少评注者才够用
Building better AI benchmarks: How many raters are enough?
AI 导读
Google Research 开源了「Forest vs Tree」仿真器,研究了在预算有限时增加评测项数(N)与增加单项评注者数(K)的权衡。研究发现传统 1 到 5 名评注者的做法往往不足以捕捉人类意见的细微差别,若目标是测量人类意见的全貌(如复杂性/细微度),每项可能需要超过 10 名评注者;而若只关注主流多数投票,增加项数则更有效。
推荐理由
研究量化了 AI 评测中评注者数量的权衡,并开源了预算模拟器以辅助设计更可靠且成本效益更高的评测基准。
来源:Google Research · research.google