本文介绍清华与华为提出的层次化技能元演化框架 HiSME,说明其如何在不更新模型参数的情况下同时优化技能及其生成算法。
📝 详细摘要
文章围绕清华大学与华为基础模型部提出的 HiSME 框架展开,指出现有静态技能演化在适配不同场景和维护成本方面的不足。HiSME 将系统分为轨迹、技能和元技能三层,利用 extractor、refactorer、refiner 等组件从任务轨迹中抽取、重构和维护技能,并通过元技能对演化策略本身进行反馈优化。实验在 BFCL-v3 multi-turn base 和 MineDojo 上表明,HiSME 在性能和 token 开销上均优于无技能、静态演化及 AWM、Memento 等基线,且元技能具有可迁移性。文末进一步讨论了 Learning to Evolve 和 Automatic Harness Engineering 两个研究方向。
💡 主要观点
- HiSME 将技能演化分为轨迹、技能和元技能三层结构。 轨迹层提供任务执行记录,技能层负责从轨迹中抽取和维护可复用技能,元技能层则记录并优化生成技能的算法策略,使演化过程自身能够从经验中学习。
💬 文章金句
- HiSME 把整个系统分成三个层次:轨迹、技能和元技能。
- HiSME 的核心观点是:技能演化可以被看作对 Agent 测试时边际性能收益的优化。
- 元技能会被写回 skill extractor、refactorer 和 refiner 的 prompt 中,让后续技能演化算法根据测试时反馈调整策略。
📊 文章信息
AI 初评:78
来源:机器之心
作者:机器之心
分类:人工智能
语言:中文
阅读时间:12 分钟
字数:2779
标签: 大语言模型 Agent, 测试时学习, 元技能, 技能演化, 层次化框架