技术与工程已解决
模型回归测试自动化
评测集进 CI、指标门槛、差异报告——让退化在上线前被拦截。
问题正文
回归的对象
模型供应商的静默更新、提示词修改、检索配置调整、后处理逻辑变更——任何一项都可能引发行为退化,且往往无人察觉。
自动化流水线
变更触发、运行评测集(几十到几百条核心用例)、生成差异报告(新旧对比)、指标低于门槛则阻断、报告推送到团队。
P0 冒烟集:几十条,每次必跑,分钟级
P1 全量集:数百条,每日跑
P2 扩展集:人工抽检
评测集进 CI、指标门槛、差异报告——让退化在上线前被拦截。
问题正文
模型供应商的静默更新、提示词修改、检索配置调整、后处理逻辑变更——任何一项都可能引发行为退化,且往往无人察觉。
变更触发、运行评测集(几十到几百条核心用例)、生成差异报告(新旧对比)、指标低于门槛则阻断、报告推送到团队。
P0 冒烟集:几十条,每次必跑,分钟级
P1 全量集:数百条,每日跑
P2 扩展集:人工抽检
ANSWERS
回答内容
可编程任务用规则评分(精确匹配、Schema 校验);开放任务用 LLM 裁判加校准;两者结合时明确各自覆盖的范围。
退化的具体用例与输出对比、指标变化幅度、与历史基线的趋势。报告要让没参与改动的人也能看懂问题在哪。
评测阻断需要团队共识:退化被拦截是价值而非麻烦。把每次拦截的案例整理成内部通报,强化这个认知。