技术与工程已解决
如何评估大模型的好坏?
榜单之外,建立贴合自己业务的评测体系才是正道。
问题正文
通用榜单的局限
MMLU 等学术榜单反映基础能力,但与你的业务场景可能毫无关系。榜单刷分甚至已经成为一种营销手段。
建立自己的评测集
从真实业务中收集 50 到 200 个代表性问题和标准答案或评分标准。每次换模型、改提示词都跑一遍,看核心指标的涨跌。
评估维度
准确性、格式遵从、拒答合理性、延迟、成本。自动化评估可以用 LLM 当裁判,但关键样本要人工抽查。
榜单之外,建立贴合自己业务的评测体系才是正道。
问题正文
MMLU 等学术榜单反映基础能力,但与你的业务场景可能毫无关系。榜单刷分甚至已经成为一种营销手段。
从真实业务中收集 50 到 200 个代表性问题和标准答案或评分标准。每次换模型、改提示词都跑一遍,看核心指标的涨跌。
准确性、格式遵从、拒答合理性、延迟、成本。自动化评估可以用 LLM 当裁判,但关键样本要人工抽查。
ANSWERS
回答内容
评估大模型要建立自己的评测集:从真实业务抽问题、定义评分标准、每次改动后回归。榜单只能参考,不能代替业务评测。
用强模型给候选输出打分是高效的评估方式,但要注意裁判自身的偏差(偏好长回答、偏好自家风格)。
把评测接进持续集成:提示词改动、模型升级前先跑评测,防止静默退化。