← 回總覽

从 Harness 架构到 Token 经济学的探索

📅 2026-06-23 08:45 腾讯云开发者 人工智能 2 分鐘 1795 字 評分: 90
AI编程 LLM Harness Engineering Token经济学 ReAct
📌 一句话摘要 本文结合学术论文与真实项目配置,系统阐述 AI 辅助编程中的 Harness 工程——包括控制论基础、Rules/Hooks 架构、Token 成本优化及团队实战方法论。 📝 详细摘要 文章以 LangChain 实验数据引出 Harness 的概念:模型外的代码层决定 AI 的表现上限。作者从控制论(反馈与前馈)、ReAct 循环、Reflexion 记忆、蒙特卡洛树搜索、信息熵压缩等理论出发,详细拆解了项目的.codebuddy 配置——四层架构(Commands/Skills/Rules/Hooks)、Hooks 反馈控制实现、Rules 分级、Skills 领域封装

📌 一句话摘要

本文结合学术论文与真实项目配置,系统阐述 AI 辅助编程中的 Harness 工程——包括控制论基础、Rules/Hooks 架构、Token 成本优化及团队实战方法论。

📝 详细摘要

文章以 LangChain 实验数据引出 Harness 的概念:模型外的代码层决定 AI 的表现上限。作者从控制论(反馈与前馈)、ReAct 循环、Reflexion 记忆、蒙特卡洛树搜索、信息熵压缩等理论出发,详细拆解了项目的.codebuddy 配置——四层架构(Commands/Skills/Rules/Hooks)、Hooks 反馈控制实现、Rules 分级、Skills 领域封装、原子化提交工作流。第三部分给出模型选型与配额策略(Claude/DeepSeek/GLM/Hy3)。第四部分深入 Token 经济学,介绍 KV Cache 原理,展示通过 Rules 精简、disable-model-invocation 等手法使基础开销降低 36%。第五部分提供实战 Prompt 模板、对话管理策略与 7 条黄金法则。全文基于真实工程实践,信息密度高,可迁移性强。

💡 主要观点

- Harness 是模型外的代码层,决定 AI 能力的上限而非模型本身。 LangChain 实验显示仅换 Harness 可将 TerminalBench 通过率从 52.8%提至 66.5%,证明许多 AI 编程瓶颈出在架构而非模型权重。

Harness 本质是控制论的双环控制:前馈(Rules)预先注入约束,反馈(Hooks)在行动前后自动拦截与纠偏。 Rules 对应开环控制,在 AI 推理前注入;Hooks 对应闭环控制,在工具调用时检测、阻止或提示。两者结合构成 AI 的‘刹车系统’。
Token 成本优化核心是‘只让每次对话必须遵守的规则 alwaysApply’,辅以 KV Cache 复用和场景化 Skill 负载。 通过消除重复注入、将低频规则改为按需加载、对流程型 Skill 设 disable-model-invocation,项目基础开销从 23.5K 降至 15K tokens,降幅 36%。
Reflexion(失败反思记忆)的工程化版本是用人工提炼的‘编码红线’替代 AI 自动反思,写入 Rules 并由 Hooks 强制执行。 项目从真实 Bug 中提炼 8 条编码红线(如方案切换清理、通用控件保护),写入 ai-coding-defense.md,同时 commit-quality.sh 在提交时自动扫描拦截违规。
原子化提交工作流(每步=最小可独立验证单元)避免大 PR 噩梦,配合三种 review 模式应对不同风险。 每步修改后立即 lint+type-check+commit,支持自行 review(A)、用户 review(B)、传统模式(C),确保每步干净可追溯。

💬 文章金句

- 很多时候卡住你的,不是模型,是模型外面那层「壳」。

  • 没有 Harness 的 ReAct 就像没有刹车的车——它能跑,但不知道什么时候该停。
  • 模型包含智能,而 Harness 是让智能变得有用的系统。
  • Rules 不是「建议」,是「工具会拦」。

📊 文章信息

AI 初评:90

来源:腾讯云开发者

作者:腾讯云开发者

分类:人工智能

语言:中文

阅读时间:43 分钟

字数:10703

标签: AI编程, LLM, Harness Engineering, Token经济学, ReAct

阅读完整文章

查看原文 → 發佈: 2026-06-23 08:45:00 收錄: 2026-06-23 20:00:39

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。