技术与工程已解决
Embedding 模型微调与选型深挖
bge、gte、e5 三大系列的差异,以及什么时候值得微调自己的 Embedding 模型。
问题正文
三大系列的画像
BGE 系列(智源)中文能力强、生态完善,是中文 RAG 的事实默认选择。GTE 系列(阿里)在多语言与检索任务上表现均衡。E5 系列(微软)多语言学术基准强。中文场景起步默认 BGE 或 GTE。
选型实测方法
准备 50 到 100 条真实查询并标注相关文档,测三件事:Recall@5(相关文档是否出现在前 5)、硬负例区分度(相似但不相关的文档是否被排除)、多语言混合表现。一天完成,数据说话。
什么时候值得微调
领域术语与通用语料差异巨大(医疗、法律、金融);查询与文档的表达方式差异大(口语查询对书面文档);通用模型召回率明显不足时。微调用正负样本对即可,几百对起步。
