← 回總覽

LLM 上下文工程指南

📅 2026-04-06 23:30 ByteByteGo 人工智能 1 分鐘 1220 字 評分: 88
上下文工程 LLM RAG 上下文衰减 注意力机制
📌 一句话摘要 一份关于上下文工程的综合指南,解释了为什么过多的上下文反而会降低 LLM 的性能,并概述了优化模型输出的四种核心策略:写入(Write)、选择(Select)、压缩(Compress)和隔离(Isolate)。 📝 详细摘要 本文探讨了新兴的上下文工程学科,挑战了“更大的上下文窗口会自动带来更好的 LLM 性能”这一迷思。文章引用了 Chroma 2025 年关于上下文衰减(context rot)的研究,解释了位置偏差(“迷失在中间”问题)和注意力稀释等架构限制如何导致准确率随输入长度增加而下降。作者将上下文工程定义为对完整信息环境(包括系统指令、检索到的知识和历史记录)

📌 一句话摘要

一份关于上下文工程的综合指南,解释了为什么过多的上下文反而会降低 LLM 的性能,并概述了优化模型输出的四种核心策略:写入(Write)、选择(Select)、压缩(Compress)和隔离(Isolate)。

📝 详细摘要

本文探讨了新兴的上下文工程学科,挑战了“更大的上下文窗口会自动带来更好的 LLM 性能”这一迷思。文章引用了 Chroma 2025 年关于上下文衰减(context rot)的研究,解释了位置偏差(“迷失在中间”问题)和注意力稀释等架构限制如何导致准确率随输入长度增加而下降。作者将上下文工程定义为对完整信息环境(包括系统指令、检索到的知识和历史记录)的编排,并详细介绍了四种基本策略:将上下文保存到外部(写入)、使用 RAG 进行相关性检索(选择)、总结或修剪历史记录(压缩),以及将任务分配给专门的智能体(隔离)。

💡 主要观点

- 更多的上下文可能导致上下文衰减和显著的性能下降。 研究表明,一旦上下文超过特定阈值,准确率可能会从 95% 暴跌至 60%,因为每一个额外的 token 都会消耗有限的注意力预算,导致模型分心。

“迷失在中间”现象是 Transformer 架构的一种结构性特征。 由于 RoPE 等位置编码方法,LLM 会更多地关注输入的开头和结尾,往往会忽略埋藏在长提示词中间的关键细节。
上下文工程与提示工程不同,且范围更广。 提示工程侧重于指令的措辞,而上下文工程则管理上下文窗口内信息、历史记录和工具的整个动态组合。
四种核心策略旨在解决 LLM 的无状态性和噪声等特定限制。 这些策略包括使用外部草稿板(写入)、用于定向检索的 RAG(选择)、自动摘要(压缩)以及多智能体委派(隔离),以保持上下文的聚焦。

💬 文章金句

- 给 LLM 提供更多信息反而可能让它变笨。

  • 信息在输入中的位置与信息本身同样重要。
  • 上下文工程是一门精妙的艺术与科学,旨在为下一步操作在上下文窗口中填充恰到好处的信息。
  • 当模型能力足够强时,大多数失败就不再是智能层面的失败,而是上下文层面的失败。

📊 文章信息

AI 评分:88

来源:ByteByteGo Newsletter

作者:ByteByteGo

分类:人工智能

语言:英文

阅读时间:10 分钟

字数:2412

标签: 上下文工程, LLM, RAG, 上下文衰减, 注意力机制

阅读完整文章

查看原文 → 發佈: 2026-04-06 23:30:52 收錄: 2026-04-07 02:00:42

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。