技术与工程已解决
什么是模型量化?量化后损失多大?
4bit 量化如何把 70B 模型塞进消费级显卡,以及质量损失的真实情况。
问题正文
量化的原理
模型权重原本用 16bit 浮点存储,量化把权重压到 8bit、4bit 甚至更低。相当于把高清照片压成高质量 JPG——体积大减,细节有损。
损失有多大
4bit 量化(如 Q4_K_M)在绝大多数任务上与原模型的差异难以察觉;2bit 量化会有明显的能力下降。代码、数学等精确任务比闲聊更敏感。
实践建议
消费级硬件优先选 Q4_K_M 或 Q5 系列;对质量敏感的任务用 Q8 或保留原精度的小模型。同一架构下更大的模型加 4bit 通常优于更小的模型加 16bit。
