模型评测的五个误区
从榜单迷信到裁判偏差,评测体系建设的常见坑与正确姿势。
误区一二
迷信通用榜单(与业务无关);样本量太小(几十条无法得出统计结论)。
误区三四五
用 LLM 当裁判却不校准裁判偏差;评测集被过拟合(提示词针对评测题优化);只测准确率不看延迟与成本。
正确姿势
业务真实样本、人工校准的评分标准、持续回归、多维度指标。评测是工程,不是玄学。
DISCUSSION
文章讨论
0 条评论
从榜单迷信到裁判偏差,评测体系建设的常见坑与正确姿势。
迷信通用榜单(与业务无关);样本量太小(几十条无法得出统计结论)。
用 LLM 当裁判却不校准裁判偏差;评测集被过拟合(提示词针对评测题优化);只测准确率不看延迟与成本。
业务真实样本、人工校准的评分标准、持续回归、多维度指标。评测是工程,不是玄学。
0 条评论