← 回總覽

新架构模型 HRM-Text 创新纪录!1B 参数、1000 美元,图灵奖得主都亲自下场了

📅 2026-06-09 12:07 机器之心 人工智能 2 分鐘 1720 字 評分: 88
LLM 模型架构 AI Agent 模型训练与推理 开源项目
📌 一句话摘要 本文深度解读 Sapient Intelligence 发布的 HRM-Text 模型,该模型以 1B 参数和极低训练成本,通过分层递归架构与针对性训练目标,在推理基准上挑战了传统 Scaling Law,并获得了图灵奖得主 Yoshua Bengio 的跟进研究。 📝 详细摘要 文章详细介绍了 Sapient Intelligence 于 2026 年 5 月发布的 HRM-Text 模型。该模型仅有约 1B 参数,训练成本约 1500 美元,但在 MATH、GSM8K 等推理基准上取得了超越许多 2B-7B 开源模型的成绩。其核心创新在于两点:一是采用双时间尺度递归架构

📌 一句话摘要

本文深度解读 Sapient Intelligence 发布的 HRM-Text 模型,该模型以 1B 参数和极低训练成本,通过分层递归架构与针对性训练目标,在推理基准上挑战了传统 Scaling Law,并获得了图灵奖得主 Yoshua Bengio 的跟进研究。

📝 详细摘要

文章详细介绍了 Sapient Intelligence 于 2026 年 5 月发布的 HRM-Text 模型。该模型仅有约 1B 参数,训练成本约 1500 美元,但在 MATH、GSM8K 等推理基准上取得了超越许多 2B-7B 开源模型的成绩。其核心创新在于两点:一是采用双时间尺度递归架构(高层模块 H 和低层模块 L),让有限参数在输出前进行多轮内部计算,提高有效计算深度;二是采用「仅回答目标」和 PrefixLM 注意力掩码,将训练信号集中在任务完成上,而非预测无关的文本。文章通过消融实验验证了各项设计的有效性,并讨论了该模型在知识覆盖上的局限(如 MMLU 成绩一般)。文章还介绍了该模型的前身 HRM-Symbolic,以及图灵奖得主 Yoshua Bengio 参与发表的 GRAM 工作,表明该研究方向正获得学界关注。最后,文章探讨了 Sapient 选择另辟蹊径的动机,以及 HRM 路线作为 Scaling Law 之外另一种可能性的价值与挑战。

💡 主要观点

- HRM-Text 通过分层递归架构,让有限参数在潜空间内进行多轮内部计算,提升有效计算深度。 模型引入以不同时间尺度运行的高层(H)和低层(L)模块,在预测一个 token 前完成 8 次递归更新,使深层计算仍能持续修改内部状态,而非像标准 Transformer 那样很快趋于稳定。

「仅回答目标」与 PrefixLM 掩码将训练信号集中到任务完成上,显著提升数据利用效率。 模型仅对回答部分计算损失,指令部分通过 PrefixLM 实现双向可见,使模型能更好地整合上下文,消融实验显示该组合贡献了大部分性能提升。
HRM-Text 在推理密集型任务上表现突出,但在知识覆盖型任务上受限于参数与数据规模。 模型在 MATH、GSM8K、ARC-Challenge 上超越多数 2B-7B 模型,但在 MMLU 上表现一般,说明其更适合作为偏重推理的紧凑模型,而非通用知识库。
该工作已获得图灵奖得主 Yoshua Bengio 的跟进研究,表明递归潜空间推理正成为重要研究方向。 Bengio 参与的 GRAM 论文在 HRM 架构基础上引入概率化多轨迹推理,验证了该路线的学术价值与扩展潜力。

💬 文章金句

- HRM-Text 所展示的,可能不仅仅是一个新的模型架构。如果说过去十年 AI 的主要增长轴,是参数规模、数据规模和训练算力的持续扩张,那么 HRM 所探索的,是另一个更底层的问题:计算过程本身,能否成为新的增长轴?

  • 在一个已经被 Scaling 深刻塑造的行业中,这种可能性本身就足够重要。因为下一代智能系统的增长,或许不仅来自更多参数、更多数据和更多算力,也来自一个更基础的问题:模型究竟应该如何思考。

📊 文章信息

AI 初评:88

来源:机器之心

作者:机器之心

分类:人工智能

语言:中文

阅读时间:26 分钟

字数:6353

标签: LLM, 模型架构, AI Agent, 模型训练与推理, 开源项目

阅读完整文章

查看原文 → 發佈: 2026-06-09 12:07:00 收錄: 2026-06-10 02:00:14

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。