上海 AI Lab 提出 Self-Harness 方法,让模型在不更换底层模型的情况下,通过自动检测失败模式并迭代优化 Agent 外层 Harness,实现显著性能提升。
📝 详细摘要
文章介绍了上海人工智能实验室提出的 Self-Harness 方法,该方法让模型在固定底层模型、工具和评测的前提下,通过检查自身运行轨迹、从失败中提取可复用的失败模式、提出有边界的 Harness 修改,并经回归测试验证后采纳。实验在 Terminal-Bench-2.0 基准上表明,仅改动 Harness 即可使 Qwen3.5-35B-A3B 提升 104%、MiniMax M2.5 提升 28%、GLM-5 提升 24%。文章进一步分析了不同模型在初始 Harness 下的典型失败模式,并说明 Self-Harness 如何根据这些模式生成模型自适应的改动,同时采用保守的双分片回归测试确保改动真正带来收益而不显著回退。文末提供了论文和开源项目链接,供读者深入探索。
💡 主要观点
- Self-Harness 让模型检测自身运行轨迹中的失败模式,提出有边界的 Harness 修改并经回归测试验证后采纳。 该方法把 Harness 优化转化为可记录、可复现、可回退的闭环过程,避免凭感觉随意改动提示词。
💬 文章金句
- 模型先检查自己的运行轨迹,从失败里挖出模式,再提出有边界的 Harness 修改,最后交给回归测试决定要不要采纳。
- Self-Harness 不是堆更长的提示词,而是在一次次验证门控后,只留下真的带来收益、又没有明显回退的 Harness edits。
- 它没有证明“Agent 可以完全自己进化”,也没有绕过 benchmark 范围。
- 在初始 Harness 下,MiniMax M2.5 有时会持续探索数据集。即使已经找到关键元信息,也迟迟不创建评测所需的答案文件,最后因为缺少产物或超时失败。
- Self-Harness 为它引入依赖预检查、失败后产物恢复、避免完全相同命令重试,以及由工具错误触发的 artifact-focused 提醒。
📊 文章信息
AI 初评:78
来源:量子位
作者:Jay
分类:人工智能
语言:中文
阅读时间:10 分钟
字数:2480
标签: 人工智能, Agent, 自进化, Harness, 前沿研究