本文介绍持续学习(Continuous Learning)这一新兴 AI 赛道,深度解析 Mind Lab 的 Macaron V1 技术架构与商业路径,并将其置于硅谷同行的竞争格局中,探讨「参数空间迭代」与「提示词空间迭代」两条路线的本质差异与产业意义。
📝 详细摘要
持续学习正成为硅谷与国内 AI 创业的新热点。本文从「提示词空间的迭代」与「参数空间的迭代」两条路线的本质差异切入,介绍持续学习的核心逻辑:让模型在部署后通过行动获取经验、将经验沉淀进可训练参数,实现「用得越多越好用」。文章梳理了 Sutton、Thinking Machines Lab(TML)、Oak Lab 等硅谷明星玩家的布局,重点解析 Mind Lab 的 Macaron V1——基于 GLM-5.2 基座、采用 Mixture-of-LoRA 架构、原生支持 2M 上下文、首个完成大规模后训练的国内模型。技术层面,团队验证了 LoRA 在万亿参数 MoE 模型上强化学习无损(算力压至全参数微调的约 10%),并发现「群体智能」现象:198 个不同 adapter 多数投票可将 AIME24 准确率从 36.44% 提升至 48.67%。商业层面,Mind Lab 已实现两周 1000 万美元 ARR,核心交付的是模型在客户场景中的持续成长能力,而非单纯推理算力。文章最后指出,持续学习方向明确但技术尚未收敛,基模公司与垂直后训练公司之间的分工正在形成。
💡 主要观点
- 持续学习代表「参数空间的迭代」,将经验直接写入模型可训练参数,与依赖外部机制的「提示词空间迭代」形成结构性差异。 提示词、memory、RAG 等手段本质上是将经验保存在模型外部,每次使用需重新读取,上下文膨胀与记忆冲突不可避免;持续学习则将反复出现的行为变化沉淀为稳定参数,模型直接给出更合适的判断,无需重复加载上下文。
💬 文章金句
- 模型的能力不再停在训练结束的那一刻,用得越多,越好用。
- 我们希望训练模型这件事,最后能像调用模型一样简单。会用 Token,就能训 Token。
- 目前全世界都还没有找到好的方法。
📊 文章信息
AI 初评:88
来源:Founder Park
作者:Founder Park
分类:人工智能
语言:中文
阅读时间:19 分钟
字数:4707
标签: 持续学习, LoRA, AI Agent, 后训练, 强化学习