技术与工程已解决
微调数据怎么准备与清洗?
从数据采集到质量过滤到格式对齐,一份可落地的微调数据工程指南。
问题正文
质量先于数量
几百条高质量样本就能带来明显的风格对齐效果;几千条脏数据反而会让模型学坏。质量、一致性、多样性三个维度的优先级依次递减但缺一不可。
数据采集渠道
人工撰写最贵最好;真实业务记录脱敏后量大但噪声多;强模型合成便宜需要过滤;开源数据集改造要注意许可证。混合来源时必须统一风格标准。
一致性:同类任务的输出格式、语气、详略必须统一,模型对矛盾样本极其敏感
去重:精确去重加语义去重,重复样本会让模型过拟合到特定表达
难度分布:简单与困难样本按业务真实比例搭配,不要全是简单案例
污染检查:与评测集做重叠检测,防止评测泄漏
清洗流水线
规则过滤(长度、格式、乱码)到启发式过滤(重复率、语言检测)到模型过滤(强模型给样本打分并剔除低质量内容)到人工抽检(按比例抽查并重点看边界样本)。每一步保留审计记录。
格式对齐
训练格式必须与推理时的使用方式完全一致:系统提示词、对话结构、特殊标记都要对齐。训练与推理的格式差异是最隐蔽的效果杀手。
