← 回總覽

Sutton、OpenAI 联创押注的持续学习,有中国团队带着模型进场了

📅 2026-07-25 10:48 Founder Park 人工智能 2 分鐘 2009 字 評分: 88
持续学习 LoRA AI Agent 后训练 强化学习
📌 一句话摘要 本文介绍持续学习(Continuous Learning)这一新兴 AI 赛道,深度解析 Mind Lab 的 Macaron V1 技术架构与商业路径,并将其置于硅谷同行的竞争格局中,探讨「参数空间迭代」与「提示词空间迭代」两条路线的本质差异与产业意义。 📝 详细摘要 持续学习正成为硅谷与国内 AI 创业的新热点。本文从「提示词空间的迭代」与「参数空间的迭代」两条路线的本质差异切入,介绍持续学习的核心逻辑:让模型在部署后通过行动获取经验、将经验沉淀进可训练参数,实现「用得越多越好用」。文章梳理了 Sutton、Thinking Machines Lab(TML)、Oak

📌 一句话摘要

本文介绍持续学习(Continuous Learning)这一新兴 AI 赛道,深度解析 Mind Lab 的 Macaron V1 技术架构与商业路径,并将其置于硅谷同行的竞争格局中,探讨「参数空间迭代」与「提示词空间迭代」两条路线的本质差异与产业意义。

📝 详细摘要

持续学习正成为硅谷与国内 AI 创业的新热点。本文从「提示词空间的迭代」与「参数空间的迭代」两条路线的本质差异切入,介绍持续学习的核心逻辑:让模型在部署后通过行动获取经验、将经验沉淀进可训练参数,实现「用得越多越好用」。文章梳理了 Sutton、Thinking Machines Lab(TML)、Oak Lab 等硅谷明星玩家的布局,重点解析 Mind Lab 的 Macaron V1——基于 GLM-5.2 基座、采用 Mixture-of-LoRA 架构、原生支持 2M 上下文、首个完成大规模后训练的国内模型。技术层面,团队验证了 LoRA 在万亿参数 MoE 模型上强化学习无损(算力压至全参数微调的约 10%),并发现「群体智能」现象:198 个不同 adapter 多数投票可将 AIME24 准确率从 36.44% 提升至 48.67%。商业层面,Mind Lab 已实现两周 1000 万美元 ARR,核心交付的是模型在客户场景中的持续成长能力,而非单纯推理算力。文章最后指出,持续学习方向明确但技术尚未收敛,基模公司与垂直后训练公司之间的分工正在形成。

💡 主要观点

- 持续学习代表「参数空间的迭代」,将经验直接写入模型可训练参数,与依赖外部机制的「提示词空间迭代」形成结构性差异。 提示词、memory、RAG 等手段本质上是将经验保存在模型外部,每次使用需重新读取,上下文膨胀与记忆冲突不可避免;持续学习则将反复出现的行为变化沉淀为稳定参数,模型直接给出更合适的判断,无需重复加载上下文。

LoRA 在后训练中的效果已获充分验证,是持续学习在工程上成立的关键前提。 John Schulman 的《LoRA Without Regret》证明 LoRA 样本效率和最终性能与全参数微调一致;Mind Lab 在万亿参数稀疏 MoE 模型上进一步验证,LoRA 强化学习算力压至全参数微调约 10%,rank-1 配置仍稳定可靠。
Macaron V1 采用 Mixture-of-LoRA 架构,实现插件式能力扩展,不触动基座模型已有知识。 V1 在冻结的 GLM-5.2 基座上搭载四个 1B LoRA 专家(Chat/Agent/Coding/UI4A),新能力以 LoRA 插件形式加入,不同来源的专家可在同一基座上组合路由,学习新任务只需训新 LoRA 插入,无需重训整个模型。
「群体智能」现象揭示了 LoRA adapter 的新 scaling 维度:挂载模型越多,整体智能线性提升。 从同一模型出发、用不同数据顺序训出的 198 个 adapter 多数投票后,AIME24 准确率从 36.44% 升至 48.67%,超越从同一 adapter 重复采样的 43.78%,表明不同学习轨迹带来的差异具有互补性。
持续学习的商业逻辑正在转变:从卖 Token 到卖学习能力,数据与模型版本由客户自管理。 通用模型难以天然理解所有垂直场景,客户又不一定愿意交出核心数据给基模公司重训;LoRA 的成本弹性使轻量训练商业化可行,最小的个人级 LoRA 几十美元即可训练,企业级 LoRA 几万到几十万美元不等。

💬 文章金句

- 模型的能力不再停在训练结束的那一刻,用得越多,越好用。

  • 我们希望训练模型这件事,最后能像调用模型一样简单。会用 Token,就能训 Token。
  • 目前全世界都还没有找到好的方法。

📊 文章信息

AI 初评:88

来源:Founder Park

作者:Founder Park

分类:人工智能

语言:中文

阅读时间:19 分钟

字数:4707

标签: 持续学习, LoRA, AI Agent, 后训练, 强化学习

阅读完整文章

查看原文 → 發佈: 2026-07-25 10:48:00 收錄: 2026-07-25 22:00:04

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。