模型量化的实际体验:Q4 到底够不够用
实测不同量化级别在对话、代码、长文任务上的表现差异。
对话任务几乎无损
Q4_K_M 在日常对话、摘要、翻译任务上与原模型的差异,普通用户难以盲测分辨。
代码与数学更敏感
精确推理任务上,低量化会放大错误率。代码生成建议 Q5 以上或 16bit 小模型。
选择策略
先 Q4 跑通流程,对质量不满意的任务再升级量化级别。盲测是最诚实的评估方式。
DISCUSSION
文章讨论
0 条评论
实测不同量化级别在对话、代码、长文任务上的表现差异。
Q4_K_M 在日常对话、摘要、翻译任务上与原模型的差异,普通用户难以盲测分辨。
精确推理任务上,低量化会放大错误率。代码生成建议 Q5 以上或 16bit 小模型。
先 Q4 跑通流程,对质量不满意的任务再升级量化级别。盲测是最诚实的评估方式。
0 条评论