📌 一句话摘要 本文系统拆解 AI Coding Agent 的 Token 成本结构,提出从使用习惯、模型路由、上下文压缩、代码图谱到多 Agent 协作的五层优化框架,并提供可落地的工具与工程方法。 📝 详细摘要 文章以腾讯技术工程团队的实际经验为基础,深入分析了 AI Coding Agent 的 Token 成本构成。核心观点是:成本大头并非用户提问本身,而是系统为维持上下文而重复搬运的固定前缀、会话历史、工具定义等。作者提出了一个五层优化模型:1)使用习惯层(单 Session 单任务、压缩历史、完整路径引用等);2)模型路由层(按任务匹配模型档位、调整推理预算);3)上下文压缩
📌 一句话摘要
本文系统拆解 AI Coding Agent 的 Token 成本结构,提出从使用习惯、模型路由、上下文压缩、代码图谱到多 Agent 协作的五层优化框架,并提供可落地的工具与工程方法。
📝 详细摘要
文章以腾讯技术工程团队的实际经验为基础,深入分析了 AI Coding Agent 的 Token 成本构成。核心观点是:成本大头并非用户提问本身,而是系统为维持上下文而重复搬运的固定前缀、会话历史、工具定义等。作者提出了一个五层优化模型:1)使用习惯层(单 Session 单任务、压缩历史、完整路径引用等);2)模型路由层(按任务匹配模型档位、调整推理预算);3)上下文压缩层(RTK 压缩终端输出、Caveman 压缩 AI 回复、headroom 压缩所有输入、context-mode 压缩工具输出);4)代码图谱层(Graphify/CodeGraph 减少盲搜);5)多 Agent 协作层(Orchestrator-Worker 模式、上下文隔离、并行执行)。文章还指出了六个常见优化误区,并提供了大量实测数据和工具安装指南。
💡 主要观点
-
AI Coding Agent 的成本大头是系统重复搬运的上下文,而非用户提问本身。
典型请求中,用户问题仅占 0.1K tokens,而系统提示、工具定义、历史会话等固定/半固定上下文可达 200K+ tokens。优化应聚焦减少重复上下文,而非缩短提问语句。
优化应遵循五层递进路径:使用习惯→模型路由→上下文压缩→代码图谱→多 Agent 协作。
这五层从零工程投入的日常习惯到架构级改造,每层解决一类成本浪费:无意义历史、贵模型干便宜活、重复前缀、盲搜代码、所有任务挤在同一上下文。
上下文压缩工具(RTK、Caveman、headroom、context-mode)可叠加使用,实现 70-99% 的 Token 节省。
RTK 压缩终端命令输出(典型节省 89%),Caveman 压缩 AI 回复(65-75%),headroom 压缩所有输入内容(47-92%),context-mode 压缩 MCP 工具输出(98%)。它们互补不互斥。
代码图谱(Graphify/CodeGraph)通过知识图谱减少 AI 的盲搜循环,可降低 71.5 倍 Token 消耗。
大型项目中,AI 常陷入 grep→读文件→再 grep 的循环。代码图谱让 AI 在动手读文件前就知道该读哪里,显著减少工具调用和上下文回填。
多 Agent 协作(Orchestrator-Worker 模式)通过上下文隔离和并行执行,可节省 70-85% 的总 Token。
将复杂任务拆分为规划(强模型)和执行(便宜模型),每个 Worker 只看当前步骤的最小上下文,通过共享文件传递结果而非会话历史,同时支持并行加速。
💬 文章金句
- AI Coding Agent 的成本,本质上不是「你问了什么」,而是「系统为了回答你,重复搬运了多少上下文」。
- 你只问了一句话,但系统替你背了一整车背景。
- Token 优化重点,不是把提示词写短,而是把前缀写稳。
- 不要只想着把单次回答压短,更要想办法让系统少把同一批背景反复搬进来。
📊 文章信息
AI 初评:91
来源:腾讯技术工程
作者:腾讯技术工程
分类:人工智能
语言:中文
阅读时间:61 分钟
字数:15021
标签:
AI 编程, Token 成本优化, AI Agent, 上下文工程, 工程实践
阅读完整文章