技术与工程已解决
大模型的上下文长度越长越好吗?
128K 甚至 1M 的窗口背后,有效使用率才是关键指标。
问题正文
数字游戏
各家都在卷上下文长度,但能塞进 1M Token 不等于能用好 1M Token。中间部分的召回精度会显著下降。
真实成本
长上下文的推理成本随长度超线性增长,延迟也大幅上升。把 100 页文档整本塞进去,不如检索出最相关的 10 段。
正确姿势
长上下文和 RAG 不是二选一:用 RAG 缩小范围,用长上下文处理被选中的复杂材料,是当前的最佳实践。
128K 甚至 1M 的窗口背后,有效使用率才是关键指标。
问题正文
各家都在卷上下文长度,但能塞进 1M Token 不等于能用好 1M Token。中间部分的召回精度会显著下降。
长上下文的推理成本随长度超线性增长,延迟也大幅上升。把 100 页文档整本塞进去,不如检索出最相关的 10 段。
长上下文和 RAG 不是二选一:用 RAG 缩小范围,用长上下文处理被选中的复杂材料,是当前的最佳实践。
ANSWERS
回答内容
上下文长度是容量上限而非效率保证,塞得下不等于用得好,有效召回率随长度衰减。
做大海捞针测试只是及格线,更要测多跳推理:把关键信息分散在文档各处,看模型能否综合。
保持系统提示精炼、按相关性排序参考资料、把最重要的信息放在开头或结尾。