文章介绍 MindLab 开源的 Macaron-V1 大模型,通过冻结巨型基座、仅训练小型 LoRA 专家并使用强化学习持续写回经验,实现低成本的持续学习与模块协作。
📝 详细摘要
文章首先指出大模型训练完成后难以持续学习的问题,接着介绍 MindLab 团队从早期工作 FireAct 演进而来的 Macaron-V1 方案:冻结庞大基座(如 GLM‑5.2 或通义千问 3.6),仅训练少量 LoRA 专家,利用强化学习把新经验写回参数,使已部署模型能够低成本持续进化。文章详细说明了两个版本(旗舰版 Venti 7480B、轻量版 Tall 35B)及其技术细节,展示了通过多个小模块协作提升性能的实验结果(单模块 36.4% 准确率,198 模块投票后达 48.7%),并介绍了支撑大规模模块管理的 MinT 基础设施。最后讨论了持续学习仍面临的挑战,并指出该工作与行业领袖对下一代模型的看法高度一致。
💡 主要观点
- Macaron‑V1 通过冻结巨型基座、仅训练小型 LoRA 专家实现低成本持续学习。 该方法在万亿参数模型上仅需约十分之一算量,使模型部署后仍能通过强化学习不断吸收新经验。
💬 文章金句
- 冻住庞大的基座,只训练一个很小的附加模块,用强化学习把新经验持续写回参数,让大模型部署之后还能低成本地持续学习。
- 从 FireAct 到 Macaron‑V1,是同一条路走下来的:当年用监督微调一次性写进去,如今换成强化学习持续写回。
- 单个模块的准确率是 36.4%,198 个模块一起投票后升到 48.7%,明显高于对同一个模块反复采样所能达到的上限(约 43.3%),也高于基线的 37.3%。
- 这条路线的一部分证据还可以外部核对,不用只看官方给的数字:相关训练框架的补丁已经并入几个主流开源训练项目的上游,配套基础设施也以 verl‑mint 的名字开源。
- 持续学习这个方向本身还有几个公认的难点:模糊反馈下如何稳定地找到可靠的学习信号、不断写入新经验时如何不覆盖旧能力、大量模块的多样性如何真正变成群体层面的能力。
📊 文章信息
AI 初评:86
来源:Datawhale
作者:Datawhale
分类:人工智能
语言:中文
阅读时间:14 分钟
字数:3335
标签: 大模型, 强化学习, LoRA, 持续学习, 开源模型