本文深度解读 Sapient Intelligence 发布的 HRM-Text 模型,该模型以 1B 参数和极低训练成本,通过分层递归架构与针对性训练目标,在推理基准上挑战了传统 Scaling Law,并获得了图灵奖得主 Yoshua Bengio 的跟进研究。
📝 详细摘要
文章详细介绍了 Sapient Intelligence 于 2026 年 5 月发布的 HRM-Text 模型。该模型仅有约 1B 参数,训练成本约 1500 美元,但在 MATH、GSM8K 等推理基准上取得了超越许多 2B-7B 开源模型的成绩。其核心创新在于两点:一是采用双时间尺度递归架构(高层模块 H 和低层模块 L),让有限参数在输出前进行多轮内部计算,提高有效计算深度;二是采用「仅回答目标」和 PrefixLM 注意力掩码,将训练信号集中在任务完成上,而非预测无关的文本。文章通过消融实验验证了各项设计的有效性,并讨论了该模型在知识覆盖上的局限(如 MMLU 成绩一般)。文章还介绍了该模型的前身 HRM-Symbolic,以及图灵奖得主 Yoshua Bengio 参与发表的 GRAM 工作,表明该研究方向正获得学界关注。最后,文章探讨了 Sapient 选择另辟蹊径的动机,以及 HRM 路线作为 Scaling Law 之外另一种可能性的价值与挑战。
💡 主要观点
- HRM-Text 通过分层递归架构,让有限参数在潜空间内进行多轮内部计算,提升有效计算深度。 模型引入以不同时间尺度运行的高层(H)和低层(L)模块,在预测一个 token 前完成 8 次递归更新,使深层计算仍能持续修改内部状态,而非像标准 Transformer 那样很快趋于稳定。
💬 文章金句
- HRM-Text 所展示的,可能不仅仅是一个新的模型架构。如果说过去十年 AI 的主要增长轴,是参数规模、数据规模和训练算力的持续扩张,那么 HRM 所探索的,是另一个更底层的问题:计算过程本身,能否成为新的增长轴?
- 在一个已经被 Scaling 深刻塑造的行业中,这种可能性本身就足够重要。因为下一代智能系统的增长,或许不仅来自更多参数、更多数据和更多算力,也来自一个更基础的问题:模型究竟应该如何思考。
📊 文章信息
AI 初评:88
来源:机器之心
作者:机器之心
分类:人工智能
语言:中文
阅读时间:26 分钟
字数:6353
标签: LLM, 模型架构, AI Agent, 模型训练与推理, 开源项目