开放交流已解决
大模型的训练数据从哪来?
从网页到代码到书籍,训练数据构成与数据质量的决定性作用。
问题正文
主要来源
公开网页(经清洗)、开源代码库、书籍与论文、百科与问答社区、以及后期的人工标注数据。数据配比是各家模型的核心秘方。
数据质量决定论
垃圾进垃圾出在模型训练中体现得淋漓尽致。头部模型厂商在数据清洗、去重、质量过滤上投入巨大。
后期训练
预训练之后还有指令微调(教模型听懂指令)和人类反馈强化学习(教模型对齐人类偏好)阶段,数据量小但极其关键。
从网页到代码到书籍,训练数据构成与数据质量的决定性作用。
问题正文
公开网页(经清洗)、开源代码库、书籍与论文、百科与问答社区、以及后期的人工标注数据。数据配比是各家模型的核心秘方。
垃圾进垃圾出在模型训练中体现得淋漓尽致。头部模型厂商在数据清洗、去重、质量过滤上投入巨大。
预训练之后还有指令微调(教模型听懂指令)和人类反馈强化学习(教模型对齐人类偏好)阶段,数据量小但极其关键。
ANSWERS
回答内容
大模型的训练数据来自清洗后的公开网页、代码、书籍与人工标注,数据质量与配比是模型能力的决定性因素之一。
训练数据的版权争议仍在演进中,各国监管框架差异很大。这也是开源数据集日渐受重视的原因。
模型的知识有截止日期,且不了解未公开的内部数据——这正是 RAG 存在的理由。