← 回總覽

垂域 Agent 狂飙 88.5%!北大 Life-Harness 告别训练

📅 2026-06-20 16:37 PaperAgent 人工智能 5 分鐘 6126 字 評分: 86
AI Agent LLM Agent 工程 运行时适配 北大研究
📌 一句话摘要 北大提出 LIFE-HARNESS,一种不更新模型权重、仅通过适配运行时接口来提升确定性 LLM Agent 性能的方法,在 116/126 个设置中平均带来 88.5% 的相对提升。 📝 详细摘要 本文介绍北京大学提出的 LIFE-HARNESS 方法,核心思想是「适配接口,而非模型」。作者观察到,在确定性垂域 Agent 任务中,大量失败并非源于模型能力不足,而是发生在模型与环境的运行时接口处,如工具调用格式错误、动作无法被环境执行、轨迹陷入循环等。LIFE-HARNESS 包含四层设计:Environment Contract Layer(显式化工具规则与约束)、Pr

86

Peking University proposes LIFE-HARNESS, a method that improves deterministic LLM Agent performance by adapting runtime interfaces without updating model weights, achieving an average relative improvement of 88.5% across 116/126 settings. P PaperAgent

Yesterday 1726 words (about 7 min) View Source →

Sign in to highlight text and take notes as you read. Sign in now

PaperAgent 2026-06-20 16:37 北京

!Image 1

大家好,我是PaperAgent,不是Agent! Adapting the Interface, Not the Model. 不改模型,而是适配模型与环境之间的运行时接口。

!Image 2 提升 LLM Agent,通常意味着换更强的模型、做指令微调、强化学习或蒸馏。

这些方法当然有效,但在很多垂直领域任务中,Agent 失败并不一定来自模型能力不足。

!Image 3 北大学者观察到,很多错误其实发生在模型与环境的接口处Harness工程唱罢,Environment工程登场!

!Image 4 * 模型知道大概要做什么,却没有正确调用工具;

* 动作意图合理,但 JSON、函数名、参数或 SQL 格式无法被环境执行;

* 环境已经返回错误,模型却没有触发有效恢复;

* 轨迹反复搜索、点击、尝试,直到耗尽 step budget。

这说明,Agent 不只是一个 LLM。

它更像是一个运行时系统:模型观察环境、理解工具、提交动作、接收反馈,并在多轮交互中持续决策。最终性能不仅取决于模型参数,也取决于模型和环境之间的runtime interface

!Image 5 基于这一点,北大学者提出LIFE-HARNESS

LIFE-HARNESS:从训练轨迹中演化运行时接口

!Image 6 LIFE-HARNESS 不更新模型权重,也不修改评测环境,而是从训练轨迹中挖掘可复用的失败模式,并将其转化为运行时干预。

它包含四层设计:

1. Environment Contract Layer

在交互开始前,显式化工具规则、动作协议、答案格式、环境约束和常见陷阱。

这一层的目标是让模型先理解:

> 这个环境到底要求我怎么做?

2. Procedural Skill Layer

很多垂域任务都有稳定的“做事套路”。

例如购物agent中先搜索、再筛选、比较并购买;数据库任务中先定位表和字段,再构造查询并检查结果。这些过程经验可以从训练轨迹中提取出来,在新任务开始时检索并提供给模型。

它相当于给模型一份可复用的任务攻略:

> 遇到类似任务时,参考过去成功轨迹中的操作路径。

3. Action Realization Layer

模型想对了,不代表动作一定能被环境执行。

例如,模型本该调用 tool,却把动作写成自然语言;或者 JSON 缺字段、参数类型错误、函数名写错,导致环境无法解析。

Action Realization Layer 就像一道动作检查器,在环境执行前检查并修正这些格式问题。

它关注的是:

> 模型想做的事,能不能真正变成环境可执行的动作。

4. Trajectory Regulation Layer

Agent 的失败也可能发生在整条轨迹中。

模型可能反复搜索、重复点击、持续执行无效动作,或者在收到错误反馈后仍然沿着错误方向尝试。

Trajectory Regulation Layer 会监控这些重复、停滞和无效恢复信号,并在必要时触发纠偏提示。

它的作用是:

> 当轨迹开始陷入循环时,把模型及时拉回有效路径。

实验结果:平均相对提升 88.5%

!Image 7 我们在 3 个 benchmark suite 上评测了 LIFE-HARNESS:

* τ-bench

* τ²-bench

* AgentBench

实验覆盖 7 个确定性 Agent 环境

模型方面,我们评测了 18 个不同 backbone,包括 instruction-tuned models、reasoning models 和 agent-specialized models。

结果显示:

> LIFE-HARNESS 在116 / 126个 model-environment 设置中带来提升,平均相对提升 88.5%

更重要的是,harness 的演化只使用了Qwen3-4B-Instruct的训练轨迹,但最终可以迁移到另外 17 个模型上。

这说明 LIFE-HARNESS 学到的并不是某个模型的特殊行为,而是环境侧稳定存在的结构:工具协议、任务流程、错误模式和恢复策略。

!Image 8

Harness 和模型训练是什么关系?

LIFE-HARNESS 并不是要替代模型训练。模型训练仍然很重要。但在确定性垂域 Agent 中,很多失败来自接口错配,而不是模型本身缺少能力。

实验中我们也发现,即使是经过 tool-use 训练的 agent-specialized model,加入 LIFE-HARNESS 后仍然可以继续提升。这说明,工具使用训练并不会完全消除接口层、动作层和轨迹层的失败。

换句话说:

> 模型训练提升模型能力,runtime harness 改善模型与环境之间的交互条件。

二者是互补关系。

总结

LIFE-HARNESS 试图回答一个问题: 能否不更新模型权重,只通过适配 runtime harness 来提升确定性 LLM Agent?

实验结果表明,在规则明确、反馈可复现的垂域 Agent 任务中,这是可行的。

Agent 适配不一定只能发生在模型内部,也可以发生在观察、工具、动作、反馈和轨迹控制组成的运行时系统中。

当一个垂域 Agent 表现不好时,也许第一步不该总是重新训练模型,而是先问: 这个问题真的需要改模型吗?还是只需要把模型与环境之间的接口适配好? 文章链接如下:https://arxiv.org/pdf/2605.22166题目是:Adapting the Interface, Not the Model: Runtime Harness Adaptation for Deterministic LLM Agents单位:北京大学https://github.com/Tianshi-Xu/Life-Harness 动手设计AI Agents:(编排、记忆、插件、workflow、协作) 分享两篇Claude Skills最新论文,有3个核心结论 DeepSeek押注的Harness,被这篇最新综述彻底讲透了 2026,做Agentic AI,绕不开这两篇开年综述

已经读到这了,不妨点个👍、❤️、↗️三连,加个星标⭐,不迷路哦~

查看原文 → 發佈: 2026-06-20 16:37:00 收錄: 2026-06-21 02:00:46

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。