一份关于上下文工程的综合指南,解释了为什么过多的上下文反而会降低 LLM 的性能,并概述了优化模型输出的四种核心策略:写入(Write)、选择(Select)、压缩(Compress)和隔离(Isolate)。
📝 详细摘要
本文探讨了新兴的上下文工程学科,挑战了“更大的上下文窗口会自动带来更好的 LLM 性能”这一迷思。文章引用了 Chroma 2025 年关于上下文衰减(context rot)的研究,解释了位置偏差(“迷失在中间”问题)和注意力稀释等架构限制如何导致准确率随输入长度增加而下降。作者将上下文工程定义为对完整信息环境(包括系统指令、检索到的知识和历史记录)的编排,并详细介绍了四种基本策略:将上下文保存到外部(写入)、使用 RAG 进行相关性检索(选择)、总结或修剪历史记录(压缩),以及将任务分配给专门的智能体(隔离)。
💡 主要观点
- 更多的上下文可能导致上下文衰减和显著的性能下降。 研究表明,一旦上下文超过特定阈值,准确率可能会从 95% 暴跌至 60%,因为每一个额外的 token 都会消耗有限的注意力预算,导致模型分心。
💬 文章金句
- 给 LLM 提供更多信息反而可能让它变笨。
- 信息在输入中的位置与信息本身同样重要。
- 上下文工程是一门精妙的艺术与科学,旨在为下一步操作在上下文窗口中填充恰到好处的信息。
- 当模型能力足够强时,大多数失败就不再是智能层面的失败,而是上下文层面的失败。
📊 文章信息
AI 评分:88
来源:ByteByteGo Newsletter
作者:ByteByteGo
分类:人工智能
语言:英文
阅读时间:10 分钟
字数:2412
标签: 上下文工程, LLM, RAG, 上下文衰减, 注意力机制