← 回總覽

Agent 开始“自我进化”:会出题、会反思,还会自己长出新技能

📅 2026-07-27 17:27 腾讯技术工程 人工智能 2 分鐘 1299 字 評分: 91
AI Agent 自我进化 强化学习 大模型 技术趋势
📌 一句话摘要 本文深度解析了自进化 Agent 的技术演进路径,将其划分为经验存储型、RL 训练型与 0 数据自学型三大路线,并详细拆解了各路线下的前沿研究工作。 📝 详细摘要 文章系统性地梳理了 Agent 从“被动执行”向“主动进化”转变的技术脉络。作者将自进化技术分为三个维度:第一类是“经验/Skill 存储型”,通过外挂记忆库实现跨会话能力积累,代表工作如 EvoSkill 和 CoEvoSkills;第二类是“基于 RL 的训练型”,通过强化学习将经验内化至模型权重,重点讨论了 SkillRL、SKILL0 及具有高度启发性的 SkillOS;第三类是“0 数据自学型”,探索无

📌 一句话摘要

本文深度解析了自进化 Agent 的技术演进路径,将其划分为经验存储型、RL 训练型与 0 数据自学型三大路线,并详细拆解了各路线下的前沿研究工作。

📝 详细摘要

文章系统性地梳理了 Agent 从“被动执行”向“主动进化”转变的技术脉络。作者将自进化技术分为三个维度:第一类是“经验/Skill 存储型”,通过外挂记忆库实现跨会话能力积累,代表工作如 EvoSkill 和 CoEvoSkills;第二类是“基于 RL 的训练型”,通过强化学习将经验内化至模型权重,重点讨论了 SkillRL、SKILL0 及具有高度启发性的 SkillOS;第三类是“0 数据自学型”,探索无需人工标注、通过 Agent 互考实现闭环的激进路径。文章不仅提供了技术框架的横向对比,还通过对前沿论文的深度拆解,提出了关于“总结能力”、“横向 vs 纵向总结”以及“内化技能”等关键技术洞察。

💡 主要观点

- 自进化 Agent 旨在解决 LLM 的静态知识、上下文限制及重复犯错问题。 通过让 Agent 在交互中自动积累、提炼并复用经验,实现能力的动态增长,摆脱对人工频繁调优的依赖。

技术路线分为存储型、训练型与自学型三大类。 存储型通过外挂 Skill 库实现;训练型通过 RL 将经验写入权重;自学型则实现从出题到解题的全自动闭环。
SkillOS 证明了训练专门的“管理者”比直接训练“执行者”更高效。 通过训练专门的 Curator 来管理 Skill 的增删改,即使解题模型保持冻结,也能显著提升整体性能。
Skill 的“总结”环节是当前研究中被低估的关键环节。 目前多数工作将总结任务交给冻结的 LLM,如何优化总结的质量与效率是实现高效进化的核心空白。

💬 文章金句

- 让 Agent 自己越用越聪明,而不是每次都靠人工去喂数据、调提示词、改模型。

  • 与其花大钱让 GPT-5 / Claude 4.6 给你的产品蒸馏 Skill,不如让产品自己用的小模型来 self-evo。
  • 学会如何管理技能,而不是学会如何使用技能。

📊 文章信息

AI 初评:91

精选文章:是

来源:腾讯技术工程

作者:腾讯技术工程

分类:人工智能

语言:中文

阅读时间:44 分钟

字数:10776

标签: AI Agent, 自我进化, 强化学习, 大模型, 技术趋势

阅读完整文章

查看原文 → 發佈: 2026-07-27 17:27:00 收錄: 2026-07-28 00:00:58

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。