本文介绍了南北阁实验室提出的 3B 参数 Looped Transformer 模型 Nanbeige4.2-3B,通过架构创新、Agent 数据构造和多阶段训练,实现代码智能体、办公智能体、复杂工具调用和通用推理的统一能力。
📝 详细摘要
文章详细阐述了 Nanbeige4.2-3B 模型的设计动机——在 3B 参数限制下实现代码、办公、工具调用和通用推理的全能 Agent。模型采用 Looped Transformer 结构,通过两次循环提升 token 效率;在预训练阶段扩大语料并上采样数学、代码和合成 QA 数据;构建了代码智能体、复杂工具调用和办公智能体三类 Agent 数据管线,强调环境、任务和 Scaffold 的联合扩展;后训练分阶段进行 SFT(保留错误上下文但不学习错误动作)和 RL(Think/Non-Think 两阶段 RLHF、带长度控制的 Reasoning RL 以及结合结果与过程奖励的 Agentic RL),显著提升推理准确率并降低输出长度;最后展示了在 OpenClaw 基准上的表现,优于同规模的 Qwen3.5-4B 和 Qwen3.5-9B,并讨论了部署支持和后续研究方向。
💡 主要观点
- Looped Transformer 架构在固定参数下提升有效计算深度。 模型在完成一遍所有 Transformer 层后将隐藏状态再送入同一层进行第二遍计算,两次循环在效果、速度和稳定性间取得最佳平衡,相比同规模标准 Transformer 获得约 75%的 token efficiency 提升。
💬 文章金句
- 在 3B 参数的约束下,用一个模型同时掌握代码智能体、办公智能体、复杂工具调用,以及通用推理。
- Nanbeige4.2-3B 采用 Looped Transformer:模型从底到顶经过一遍所有 Transformer 层后,输出的隐藏状态会再次送入同一组 Transformer 层,完成第二遍计算。
- 循环两遍最合适:两遍在效果、训练速度和稳定性之间取得了最好的平衡——相比同规模的标准 Transformer,它具有约 75%的 token efficiency(训练相同 token 数的 loss 水平)收益。
- 结合结果与过程奖励的 Agentic RL:不只看'最后做没做成',也看'中间每一步是否有效'。
📊 文章信息
AI 初评:90
来源:魔搭ModelScope社区
作者:魔搭ModelScope社区
分类:人工智能
语言:中文
阅读时间:19 分钟
字数:4514
标签: AI模型, 小模型, Agent, Looped Transformer, 强化学习