← 回總覽

梁文锋看重的持续学习,一支国产团队悄悄做出来了!

📅 2026-07-23 22:07 Datawhale 人工智能 2 分鐘 1586 字 評分: 86
大模型 强化学习 LoRA 持续学习 开源模型
📌 一句话摘要 文章介绍 MindLab 开源的 Macaron-V1 大模型,通过冻结巨型基座、仅训练小型 LoRA 专家并使用强化学习持续写回经验,实现低成本的持续学习与模块协作。 📝 详细摘要 文章首先指出大模型训练完成后难以持续学习的问题,接着介绍 MindLab 团队从早期工作 FireAct 演进而来的 Macaron-V1 方案:冻结庞大基座(如 GLM‑5.2 或通义千问 3.6),仅训练少量 LoRA 专家,利用强化学习把新经验写回参数,使已部署模型能够低成本持续进化。文章详细说明了两个版本(旗舰版 Venti 7480B、轻量版 Tall 35B)及其技术细节,展示了通

📌 一句话摘要

文章介绍 MindLab 开源的 Macaron-V1 大模型,通过冻结巨型基座、仅训练小型 LoRA 专家并使用强化学习持续写回经验,实现低成本的持续学习与模块协作。

📝 详细摘要

文章首先指出大模型训练完成后难以持续学习的问题,接着介绍 MindLab 团队从早期工作 FireAct 演进而来的 Macaron-V1 方案:冻结庞大基座(如 GLM‑5.2 或通义千问 3.6),仅训练少量 LoRA 专家,利用强化学习把新经验写回参数,使已部署模型能够低成本持续进化。文章详细说明了两个版本(旗舰版 Venti 7480B、轻量版 Tall 35B)及其技术细节,展示了通过多个小模块协作提升性能的实验结果(单模块 36.4% 准确率,198 模块投票后达 48.7%),并介绍了支撑大规模模块管理的 MinT 基础设施。最后讨论了持续学习仍面临的挑战,并指出该工作与行业领袖对下一代模型的看法高度一致。

💡 主要观点

- Macaron‑V1 通过冻结巨型基座、仅训练小型 LoRA 专家实现低成本持续学习。 该方法在万亿参数模型上仅需约十分之一算量,使模型部署后仍能通过强化学习不断吸收新经验。

方法从监督微调的 FireAct 演进到强化学习的持续写回,实现经验增量积累。 FireAct 曾用监督微调一次性写入行为轨迹,而 Macaron‑V1 用强化学习持续更新参数,更贴近真实交互反馈。
模型支持多个 LoRA 专家协作,实现群体智能提升单模块性能。 在 Qwen3‑30B 基座上训练近 200 个小模块,多数投票后准确率从 36.4% 提升至 48.7%,验证了协同增益。
配套的 MinT 基础设施实现海量小模块的训练、评估、部署与回滚,支撑百万级模块规模。 MinT 提供统一管线,使大规模专家模块化训练成为可能,为后续扩展奠定了工程基础。

💬 文章金句

- 冻住庞大的基座,只训练一个很小的附加模块,用强化学习把新经验持续写回参数,让大模型部署之后还能低成本地持续学习。

  • 从 FireAct 到 Macaron‑V1,是同一条路走下来的:当年用监督微调一次性写进去,如今换成强化学习持续写回。
  • 单个模块的准确率是 36.4%,198 个模块一起投票后升到 48.7%,明显高于对同一个模块反复采样所能达到的上限(约 43.3%),也高于基线的 37.3%。
  • 这条路线的一部分证据还可以外部核对,不用只看官方给的数字:相关训练框架的补丁已经并入几个主流开源训练项目的上游,配套基础设施也以 verl‑mint 的名字开源。
  • 持续学习这个方向本身还有几个公认的难点:模糊反馈下如何稳定地找到可靠的学习信号、不断写入新经验时如何不覆盖旧能力、大量模块的多样性如何真正变成群体层面的能力。

📊 文章信息

AI 初评:86

来源:Datawhale

作者:Datawhale

分类:人工智能

语言:中文

阅读时间:14 分钟

字数:3335

标签: 大模型, 强化学习, LoRA, 持续学习, 开源模型

阅读完整文章

查看原文 → 發佈: 2026-07-23 22:07:00 收錄: 2026-07-24 08:00:45

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。