← 回總覽

阿里 SkillClaw:让 Agent 技能在真实使用中集体进化

📅 2026-04-22 21:39 PaperAgent 人工智能 2 分鐘 1518 字 評分: 87
SkillClaw Agent 技能进化 LLM Agent 集体学习 阿里
📌 一句话摘要 本文介绍了阿里提出的 SkillClaw 框架,其核心是通过 Agentic Evolver 分析多用户交互数据,实现 Agent 技能的集体进化与共享,并在 WildClawBench 基准上验证了其持续提升任务性能的有效性。 📝 详细摘要 文章详细解读了阿里巴巴研究团队提出的 SkillClaw 框架,旨在解决当前 LLM Agent 技能库在部署后保持静态、无法从真实使用经验中持续学习的问题。SkillClaw 构建了一个“中心化进化架构”,通过采集多用户交互的结构化轨迹,利用一个名为 Agentic Evolver 的 LLM Agent 进行开放推理,对技能进行精

📌 一句话摘要

本文介绍了阿里提出的 SkillClaw 框架,其核心是通过 Agentic Evolver 分析多用户交互数据,实现 Agent 技能的集体进化与共享,并在 WildClawBench 基准上验证了其持续提升任务性能的有效性。

📝 详细摘要

文章详细解读了阿里巴巴研究团队提出的 SkillClaw 框架,旨在解决当前 LLM Agent 技能库在部署后保持静态、无法从真实使用经验中持续学习的问题。SkillClaw 构建了一个“中心化进化架构”,通过采集多用户交互的结构化轨迹,利用一个名为 Agentic Evolver 的 LLM Agent 进行开放推理,对技能进行精炼、创建或跳过操作。所有候选更新都需经过严格的“夜间验证”阶段,确保只有真正优于旧版本的改进才会被部署到共享技能库中,从而实现技能的单调进化。文章重点展示了在包含 60 个复杂真实任务的 WildClawBench 基准上进行的 6 天实验,结果表明 SkillClaw 能带来持续稳定的性能提升,并在多个案例研究中具体说明了进化如何改进 Agent 的精确性、鲁棒性和约束感知能力。

💡 主要观点

- SkillClaw 解决了 Agent 技能部署后静态化、无法从真实失败中集体学习的问题。 传统 Agent 技能库中的技能一旦部署便固定不变,用户各自试错的经验无法沉淀为共享知识。SkillClaw 通过采集多用户交互轨迹,将个体经验转化为系统级改进信号。

核心是 Agentic Evolver,它基于多用户证据对技能进行开放推理式更新。 Evolver 联合分析成功与失败会话,识别通用改进模式,执行精炼、创建或跳过操作,确保更新既解决共性问题,又保留原有有效部分。
严格的“夜间验证”机制保证了技能进化的单调性,防止性能回退。 所有候选技能更新必须在真实环境中与旧技能进行对比验证,只有确认整体性能提升才会被接受部署,确保用户始终使用最优技能池。
在 WildClawBench 上的实验证明,该框架能带来持续、稳定的任务性能提升。 经过 6 天昼夜循环的进化,在社交、搜索、创意等多个领域的复杂任务上均观察到显著性能提升,特别是在解决程序性知识缺失问题上效果突出。

💬 文章金句

- 本质上,每个用户都在独立地‘重新发现’同样的解决方案,系统层面的知识无法累积。

  • 当不同用户在不同场景下调用同一个技能时,产生的成功/失败模式构成了对该技能行为边界的‘自然消融实验’。
  • Evolver 始终联合分析成功和失败会话。成功会话定义了技能的‘不变量’,失败会话定义了‘目标’。
  • 这保证了单调部署行为——已部署的技能池不会随时间退化,用户始终与‘前一晚验证通过的最佳技能池’交互。
  • 当失败源于缺失或不正确的程序性知识时,技能进化特别有效。

📊 文章信息

AI 初评:87

来源:PaperAgent

作者:PaperAgent

分类:人工智能

语言:中文

阅读时间:10 分钟

字数:2428

标签: SkillClaw, Agent 技能进化, LLM Agent, 集体学习, 阿里

阅读完整文章

查看原文 → 發佈: 2026-04-22 21:39:00 收錄: 2026-04-23 16:00:30

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。