技术与工程已解决
评测集构建的方法论
从业务日志抽样到边界用例设计——一份高质量评测集的完整构建流程。
问题正文
样本来源
真实业务日志(最有价值但需脱敏标注)、人工设计的典型场景、边界与对抗用例(安全与健壮性)、历史事故的复盘案例。
覆盖设计
功能覆盖(每个核心场景都有)、难度覆盖(简单到困难)、边界覆盖(空输入、超长输入、混合语言)、对抗覆盖(注入、误导)。
标注规范
每条样本:输入、期望输出(或评分要点)、评分标准、难度标签。标注规范先行,标注分歧要仲裁并回写规范。
核心集 50 到 200 条足够支撑日常回归
质量远比数量重要
评测集与提示词开发隔离(禁止针对评测题优化)
定期补充新样本轮换
保留一部分隐藏集做最终验证
