竞技场式评测:人类偏好投票的新玩法
匿名对打加人类投票的评测方式,正在成为模型能力的社会化标尺。
竞技场的机制
两个匿名模型回答同一问题,用户投票选更好的回答。海量真实投票形成 ELO 排名。无法刷分(题目来自用户)、无法过拟合(题目持续更新)。
排名的局限
偏好投票反映的是人类的主观偏好:长回答占优、自信语气占优。能力排名与风格排名的混淆是方法论争议。
对开发者的价值
竞技场排名是了解模型能力的快速参考,但选型决策仍需自己的评测。两者的关系是初筛与终审。
DISCUSSION
文章讨论
0 条评论
