← 回總覽

让 Agent 学会「如何演化」:清华、华为提出层次化技能元演化框架 HiSME

📅 2026-07-23 15:17 机器之心 人工智能 2 分鐘 1521 字 評分: 78
大语言模型 Agent 测试时学习 元技能 技能演化 层次化框架
📌 一句话摘要 本文介绍清华与华为提出的层次化技能元演化框架 HiSME,说明其如何在不更新模型参数的情况下同时优化技能及其生成算法。 📝 详细摘要 文章围绕清华大学与华为基础模型部提出的 HiSME 框架展开,指出现有静态技能演化在适配不同场景和维护成本方面的不足。HiSME 将系统分为轨迹、技能和元技能三层,利用 extractor、refactorer、refiner 等组件从任务轨迹中抽取、重构和维护技能,并通过元技能对演化策略本身进行反馈优化。实验在 BFCL-v3 multi-turn base 和 MineDojo 上表明,HiSME 在性能和 token 开销上均优于无技能

📌 一句话摘要

本文介绍清华与华为提出的层次化技能元演化框架 HiSME,说明其如何在不更新模型参数的情况下同时优化技能及其生成算法。

📝 详细摘要

文章围绕清华大学与华为基础模型部提出的 HiSME 框架展开,指出现有静态技能演化在适配不同场景和维护成本方面的不足。HiSME 将系统分为轨迹、技能和元技能三层,利用 extractor、refactorer、refiner 等组件从任务轨迹中抽取、重构和维护技能,并通过元技能对演化策略本身进行反馈优化。实验在 BFCL-v3 multi-turn base 和 MineDojo 上表明,HiSME 在性能和 token 开销上均优于无技能、静态演化及 AWM、Memento 等基线,且元技能具有可迁移性。文末进一步讨论了 Learning to Evolve 和 Automatic Harness Engineering 两个研究方向。

💡 主要观点

- HiSME 将技能演化分为轨迹、技能和元技能三层结构。 轨迹层提供任务执行记录,技能层负责从轨迹中抽取和维护可复用技能,元技能层则记录并优化生成技能的算法策略,使演化过程自身能够从经验中学习。

元技能以文本规则形式写回 extractor、refactorer 和 refiner 的 prompt,指导后续技能演化。 例如,extractor 学会不要仅凭表层情绪词抽取工作流,而需关注可验证状态或 API 前置条件;refiner 学会在技能误触发时收窄触发条件,从而减少低质量技能的产生。
在 BFCL-v3 多轮工具调用和 MineDojo 开放世界任务上的实验表明,HiSME 在成功率和 token 效率上均优于基线。 相比无技能基线、静态技能演化 SkillX 以及 AWM、Memento 等 test-time learning 方法,HiSME 通过更善于生成、修订和筛选技能的演化流程获得提升,尤其在长程交互任务中减少无效探索和失败恢复。
元技能具有可迁移性:将一次运行中学到的元技能冻结后用于初始化静态技能演化,其表现接近完整 HiSME。 这表明元技能本身捕捉到了有效的演化策略,可在新任务中直接复用,进一步降低了从零开始调校演化算法的成本。

💬 文章金句

- HiSME 把整个系统分成三个层次:轨迹、技能和元技能。

  • HiSME 的核心观点是:技能演化可以被看作对 Agent 测试时边际性能收益的优化。
  • 元技能会被写回 skill extractor、refactorer 和 refiner 的 prompt 中,让后续技能演化算法根据测试时反馈调整策略。

📊 文章信息

AI 初评:78

来源:机器之心

作者:机器之心

分类:人工智能

语言:中文

阅读时间:12 分钟

字数:2779

标签: 大语言模型 Agent, 测试时学习, 元技能, 技能演化, 层次化框架

阅读完整文章

查看原文 → 發佈: 2026-07-23 15:17:00 收錄: 2026-07-24 00:00:45

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。