86
Peking University proposes LIFE-HARNESS, a method that improves deterministic LLM Agent performance by adapting runtime interfaces without updating model weights, achieving an average relative improvement of 88.5% across 116/126 settings. P PaperAgent
Yesterday 1726 words (about 7 min) View Source →
Sign in to highlight text and take notes as you read. Sign in now
PaperAgent 2026-06-20 16:37 北京
大家好,我是PaperAgent,不是Agent! Adapting the Interface, Not the Model. 不改模型,而是适配模型与环境之间的运行时接口。
!Image 2 提升 LLM Agent,通常意味着换更强的模型、做指令微调、强化学习或蒸馏。
这些方法当然有效,但在很多垂直领域任务中,Agent 失败并不一定来自模型能力不足。
!Image 3 北大学者观察到,很多错误其实发生在模型与环境的接口处:Harness工程唱罢,Environment工程登场!
!Image 4 * 模型知道大概要做什么,却没有正确调用工具;
* 动作意图合理,但 JSON、函数名、参数或 SQL 格式无法被环境执行;
* 环境已经返回错误,模型却没有触发有效恢复;
* 轨迹反复搜索、点击、尝试,直到耗尽 step budget。
这说明,Agent 不只是一个 LLM。
它更像是一个运行时系统:模型观察环境、理解工具、提交动作、接收反馈,并在多轮交互中持续决策。最终性能不仅取决于模型参数,也取决于模型和环境之间的runtime interface。
!Image 5 基于这一点,北大学者提出LIFE-HARNESS。
LIFE-HARNESS:从训练轨迹中演化运行时接口
!Image 6 LIFE-HARNESS 不更新模型权重,也不修改评测环境,而是从训练轨迹中挖掘可复用的失败模式,并将其转化为运行时干预。
它包含四层设计:
1. Environment Contract Layer
在交互开始前,显式化工具规则、动作协议、答案格式、环境约束和常见陷阱。
这一层的目标是让模型先理解:
> 这个环境到底要求我怎么做?
2. Procedural Skill Layer
很多垂域任务都有稳定的“做事套路”。
例如购物agent中先搜索、再筛选、比较并购买;数据库任务中先定位表和字段,再构造查询并检查结果。这些过程经验可以从训练轨迹中提取出来,在新任务开始时检索并提供给模型。
它相当于给模型一份可复用的任务攻略:
> 遇到类似任务时,参考过去成功轨迹中的操作路径。
3. Action Realization Layer
模型想对了,不代表动作一定能被环境执行。
例如,模型本该调用 tool,却把动作写成自然语言;或者 JSON 缺字段、参数类型错误、函数名写错,导致环境无法解析。
Action Realization Layer 就像一道动作检查器,在环境执行前检查并修正这些格式问题。
它关注的是:
> 模型想做的事,能不能真正变成环境可执行的动作。
4. Trajectory Regulation Layer
Agent 的失败也可能发生在整条轨迹中。
模型可能反复搜索、重复点击、持续执行无效动作,或者在收到错误反馈后仍然沿着错误方向尝试。
Trajectory Regulation Layer 会监控这些重复、停滞和无效恢复信号,并在必要时触发纠偏提示。
它的作用是:
> 当轨迹开始陷入循环时,把模型及时拉回有效路径。
实验结果:平均相对提升 88.5%
!Image 7 我们在 3 个 benchmark suite 上评测了 LIFE-HARNESS:
* τ-bench
* τ²-bench
* AgentBench
实验覆盖 7 个确定性 Agent 环境
模型方面,我们评测了 18 个不同 backbone,包括 instruction-tuned models、reasoning models 和 agent-specialized models。
结果显示:
> LIFE-HARNESS 在116 / 126个 model-environment 设置中带来提升,平均相对提升 88.5%。
更重要的是,harness 的演化只使用了Qwen3-4B-Instruct的训练轨迹,但最终可以迁移到另外 17 个模型上。
这说明 LIFE-HARNESS 学到的并不是某个模型的特殊行为,而是环境侧稳定存在的结构:工具协议、任务流程、错误模式和恢复策略。
Harness 和模型训练是什么关系?
LIFE-HARNESS 并不是要替代模型训练。模型训练仍然很重要。但在确定性垂域 Agent 中,很多失败来自接口错配,而不是模型本身缺少能力。
实验中我们也发现,即使是经过 tool-use 训练的 agent-specialized model,加入 LIFE-HARNESS 后仍然可以继续提升。这说明,工具使用训练并不会完全消除接口层、动作层和轨迹层的失败。
换句话说:
> 模型训练提升模型能力,runtime harness 改善模型与环境之间的交互条件。
二者是互补关系。
总结
LIFE-HARNESS 试图回答一个问题: 能否不更新模型权重,只通过适配 runtime harness 来提升确定性 LLM Agent?
实验结果表明,在规则明确、反馈可复现的垂域 Agent 任务中,这是可行的。
Agent 适配不一定只能发生在模型内部,也可以发生在观察、工具、动作、反馈和轨迹控制组成的运行时系统中。
当一个垂域 Agent 表现不好时,也许第一步不该总是重新训练模型,而是先问:
这个问题真的需要改模型吗?还是只需要把模型与环境之间的接口适配好?
文章链接如下:https://arxiv.org/pdf/2605.22166题目是:Adapting the Interface, Not the Model: Runtime Harness Adaptation for Deterministic LLM Agents单位:北京大学https://github.com/Tianshi-Xu/Life-Harness
动手设计AI Agents:(编排、记忆、插件、workflow、协作)
分享两篇Claude Skills最新论文,有3个核心结论
DeepSeek押注的Harness,被这篇最新综述彻底讲透了
2026,做Agentic AI,绕不开这两篇开年综述
已经读到这了,不妨点个👍、❤️、↗️三连,加个星标⭐,不迷路哦~