← 回總覽

阶跃 Amoo 诞生记:欢迎来到 AgentEra!

📅 2026-07-15 17:00 十字路口Crossing 人工智能 8 分鐘 9324 字 評分: 84
AI Agent 大语言模型 Transformer 智能体系统 Step AOS
📌 一句话摘要 本文通过六幕动画讲述 AI 六十年演进史,解析阶跃 Step AOS 如何从模型层出发自下而上构建 Agent 原生系统,解决记忆、决策、行动三大墙壁问题,推动 AI 进入真正的智能体时代。 📝 详细摘要 文章以阶跃 Amoo 动画发布为切入点,梳理了 AI 发展历程:从 1956 年达特茅斯会议命名 AI,1966 年 ELIZA 开启人机对话,2012 年 ImageNet 时刻唤醒深度学习,2017 年 Transformer 奠基现代 AI,到 2022 年 ChatGPT 带来生成式 AI 时代,最终 AI 开始主动行动。文章详细解析了 Step AOS 的三层架
让人回到想象、热爱与创造中去。

!Image 1

👩 作者: 壹小姐

🥷 编辑: Koji

🧑‍🎨 排版: NCon

!Image 2: 图片

7月13日,阶跃带来一场“Agent时代真正的智能体”终端品牌发布。

大屏幕上,一颗微小的橙色像素点在混沌的信息碎片中亮起。它环顾四周,轻声问了一句:“我是谁?我在哪?”

台下没人能回答它。但接下来的几分钟里,这颗像素——阶跃Amoo用一段动画,走完了AI六十年的进化之路。

AI的历史,从来不是一条平滑的上升曲线。最早1956年达特茅斯会议,约翰·麦卡锡为这项新兴学科正式命名“人工智能”。那是AI发展史上的黄金年代。

1966年,是一个关键技术节点。那一年,ELIZA聊天机器人开启人机对话先河,首个语音识别系统让机器初识人言,Shakey机器人项目则首次将AI带向物理行动,共同奠定了自然交互与智能体探索的早期基石。

但现实远比预期波折。1973年,数学家詹姆斯·拉特希尔向英国政府提交报告,尖锐地指出AI的宏伟目标几乎全部无法实现。经费被大幅削减,AI进入第一次寒冬。而后专家系统在80年代短暂繁荣后,又迅速泡沫破裂,AI再一次被放逐到学术荒野。

直到2012年,一个被称为“ImageNet时刻”的事件改变了这一切。多伦多大学Hinton团队用深度卷积神经网络AlexNet,在ImageNet图像识别竞赛中以绝对优势夺冠,错误率比第二名低了超过10个百分点。 沉睡的巨人终于醒来。此后十余年,深度学习以摧枯拉朽之势重塑了整个技术版图。

!Image 3: 图片

从规则系统到ResNet,从大语言模型到生成式AI,从RLHF到Agent——在这场动画结尾,用户用一句“我想念两年前去的挪威森林”唤醒了那片森林时,它寓示着一个AI的里程碑时刻发生了: AI不再只是“能聊”或“能想”了。它开始行动了。

Amoo诞生记:六幕戏,一部AI简史

阶跃《Amoo诞生记》动画的六幕场景,本质上是把AI六十年的技术演进,压缩进了几分钟的视觉叙事里。

每一幕都是一个时代,每一帧都有典故。 第一幕:诞生。

黑暗中漂浮的信息碎片,是文本、图像、声音、代码、标注数据——人类全部知识的数字化沉淀。橙色像素点醒来,问出那个哲学般的命题。它此刻还不理解世界,它只是存在于世界之中。 第二幕:撞墙。

屏幕上出现指令:“IF WALL → FALL”。Amoo按指令前进,撞墙、弹回、再撞、再弹回。这是符号AI与规则系统的缩影——机器能执行人类写好的规则,但从不真正理解自己在做什么。

!Image 4

这一幕背后,是AI历史上最深刻的一条路线之争——符号主义与连接主义。

从纽厄尔和西蒙到麦卡锡和明斯基,符号主义相信智能来自符号操作与逻辑推理,一切行为由“If-Then”式的规则驱动。Amoo撞墙、弹回、再撞,正是这套范式的一个隐喻:它能执行规则,但却无法理解规则之外的世界。

而连接主义者相信智能来自大量简单计算单元的连接与学习,但它一度被视作学术界的异端。这一派的代表如1958年发明感知机的弗兰克·罗森布拉特,1986年与同事在《Nature》发表反向传播算法论文的杰弗里·辛顿。但这条路被主流质疑了几十年。辛顿和他的同路人曾被嘲笑为一小撮顽固的“蠢货”,直到2012年。 第三幕:贴标签。

一只人类的手给猫贴上“CAT”标签。Amoo兴奋地冲上去,把“BREAD”贴到了猫身上——猫变成了“吐司猫”。它慌乱中从身体里掏出一本像素小书,封面写着“ResNet”,翻页时闪过“shortcut connected”和“x+F(x)”。合上书,它终于正确地识别了猫。

2015年,ResNet横空出世,由张祥雨(阶跃首席科学家)和他的合作者提出,核心思想是用“shortcut connection”让深层网络得以训练——输出等于原始输入加上学到的残差。这一思想解决了深度学习最致命的“梯度消失”问题,让神经网络第一次可以做到上百层甚至上千层。

2016年,ResNet获得CVPR最佳论文奖;十年后的2026年6月,它再次荣获CVPR Longuet-Higgins时间检验奖,这是对一项研究十年影响力的最高认证。从残差连接衍生出的思想,早已溢出计算机视觉,渗透进自然语言处理、语音、多模态等几乎所有深度学习分支。

这一幕中,Amoo翻书、学习、修正、最终正确识别——“每认错一次,世界就清楚一点”,是从ResNet到所有监督学习。

!Image 5: 图片 第四幕:吞Token。

文字、代码、emoji、标点像海洋生物一样涌来,冲刷着Amoo。它一开始吞下词语只能吐出乱码,但吞得越来越多后,它开始尝试说话:“ooo……o?”

这一幕映射的是大语言模型的预训练与“预测下一个词”的核心任务。而这一切的基础,是2017年一篇险些被埋没的论文。

2017年6月12日周一下午17点57分,8位谷歌研究人员在arXiv上提交了一篇题为《Attention Is All You Need》的论文。Transformer横空出世,完全摒弃了递归结构,依赖注意力机制,实现了并行计算。

“Transformer就是ChatGPT里的‘T’,几乎所有人工智能的创造,底座都是Transformer。”这篇论文被视为现代人工智能的奠基性文献,截至2025年被引次数已超18万次。

这一幕中,Amoo被文字浪潮冲刷的画面,正是Transformer“并行注意力”机制的视觉呈现:每一个Token都同时被关注、被处理、被理解。

这时,画面中飘过的文字包括:Alan Turing、John McCarthy、Marvin Minsky、Fei-Fei Li、Convolutional Neural Network、Backpropagation、Word Embedding……以及“AI Infra”和“Distributed Training”——这是对阶跃首席技术官朱亦博的致敬。

!Image 6: 图片

朱亦博的职业生涯几乎与AI Infra的发展同步。他曾在微软研究院从事分布式系统研究,是RoCE网络技术的早期奠基人之一;然后在字节跳动从零建设国内最大规模的AI Infra之一;又担任过Google Cloud GPU产品技术负责人。

他认为,AI Infra“不再只是配角,而是决定大模型成败的核心要素”。“想做最优秀的大模型,必须有最优秀的Infra”——给定算力,Infra水平决定最终模型质量。关于万卡级AI基建怎么建、怎么管,他是这块真正的专家。

这一幕中,当Amoo被词语浪潮卷着跑的时候,它背后不仅仅是“训练”,更是整个AI基础设施在支撑它不被溺亡。

从GPT-1到ChatGPT,大语言模型的演进,在Amoo的第四幕中一闪而过。2018年6月,OpenAI发布GPT-1(1.17亿参数),初代产品“还平平无奇”。2019年GPT-2(15亿参数)、2020年GPT-3(1750亿参数),模型大小呈指数级增长。Scaling Law被验证:模型越大,数据越多,性能越佳。2022年底ChatGPT问世,生成式AI时代真正到来。

事实上,人类和生成式AI的命运,也是从2017年6月12日周一下午17点57分开始交汇。那一周,Transformer诞生;那一周,大语言模型的未来正在被悄然写就。

!Image 7: 图片 第五幕:六根手指。

聊天框弹出人类指令:“画一只手。”Amoo挥手,一只漂亮的手被生成出来——但有六根手指。手指摇了摇,比了一个“NO”,红色贴纸落下:“WRONG”。多余的手指变成补丁,回到Amoo身上。它的头顶长出了一根呆毛。

!Image 8

这是AIGC时代的所面临的经典困境:生成能力越强,幻觉与失控的风险越大。人类反馈、RLHF、安全对齐——每一次“错误”,都被吸收为经验,模型被修正一次。

这一幕还暗含了另一个重要的技术节点:2014年,生成对抗网络(GAN)被提出,开启了机器生成内容的大门。而2022年ChatGPT的RLHF(基于人类反馈的强化学习),则让AI第一次学会了与人类价值观对齐。

从GAN到扩散模型,从指令微调到人类反馈,AI从“能生成”到“生成得好”、再到“生成得对”,这背后每一步都伴随着无数次的“WRONG”与修正。

这一幕中,Amoo出现呆毛和四肢的形态,其实正是AI智慧演进的体现。

!Image 9: 图片 第六幕:开始行动。

用户耳语般说:“我现在很想念两年前去的挪威的那片森林。”没有追问,没有确认,Amoo自己判断:你不在挪威,你在家里,你需要的是被唤起回忆。

它伸出手释放“魔法”——森林、水流声、风、画面,一起被带到了用户身边。天外来音:“Hi, Amoo。”

!Image 10 这是对话、推理之外,A智能体开始主动行动。 此刻,AI正经历第三次时代变迁。从ChatEra对话时代到ReasoningEra推理时代,今天我们站在AgentEra智能体时代的门口。

!Image 11

从符号主义到连接主义,从规则系统到神经网络,从感知到语言,从生成到对齐,阶跃Amoo的六幕旅程,走完了AI从婴儿到成人的全部蜕变。Amoo,是阶跃站在AgentEra门槛上,递向新世界的那张入场券。

为什么是阶跃Amoo?它的主动行动与其他智能体有什么不同?

在这背后,让这颗像素Amoo得以走出屏幕、走进真实世界的,是系统的力量。

在Amoo之下,STEPX做了更多,它不是“在系统上装一个AI助手”,而是“为智能体构建了一套完整的行动底座”。这也是多模态“卷王”阶跃星辰的一个突破,首次把触角从基模伸向了硬件终端。

同一天,阶跃星辰做了系列重磅发布:终端品牌 STEPX、智能体系统 Step AOS,以及大模型原生智能体手机 STEPX Neo。

!Image 12

Step AOS,为Agent而生

真的有必要为阶跃Amoo,专门搭建一整套系统吗?

今天的手机里并不缺AI。几乎所有旗舰机都宣称自己“AI赋能”。但“能修图、做摘要、接电话、读屏幕的手机已经太多了”。但卡点在于,普通手机AI助手只能完成单应用内的问答、修图、翻译,却无法跨软件连贯执行任务。

比如,当我们让它们干一件跨应用的事时,“帮我比价机票,然后预约一辆去机场的车。”得到的结果往往是:你需要自己打开航司App、比价,然后再切到打车软件手动输入地址。 原因在于:在传统操作系统里,AI是一个外挂的“访客”,而不是系统底层的“原住民”。

Step AOS团队把这个问题归纳为“三堵墙”。

!Image 13 第一堵:记忆墙。

传统OS各层级数据不流通,App之间数据彼此割裂,端与端更是孤岛。App级别的智能体注定只有“局部记忆”——它记不住你昨天在另一个App里说过什么,更不可能形成跨设备、跨场景的长期记忆。但真正的智能体需要“记得全、记得清、忆得准、忆得快”。没有系统级重构,这些都无从谈起。 第二堵:决策墙。

好的决策需要端侧快反应——设闹钟、找照片、开应用,百毫秒级响应;也需要云侧深思考——复杂推理、长文分析、多步骤规划。但在传统系统里,两者缺乏统一的协同调度。 第三堵:行动墙。

这是最致命的一堵。没有原生接口,智能体只能模拟点击——像一只看不见的手在屏幕上“戳”。没有合法身份,智能体拿不到授权,无法获得可信的行动通道和可管可回溯的超级权限。它想做,但系统不让它做。

目前,行业主流的“OS+AI”方案,面对这三堵墙的做法是:加插件、加语音入口、加一个悬浮球。但本质上还是在现有OS上嵌入Agent能力。比如,Google在Android系统层嵌入Gemini Intelligence,Apple把Foundation Models框架开放给开发者,华为发布鸿蒙智能体框架HMAF。 这次,阶跃的选择完全不同。它是从模型层出发、自下而上重新设计整套系统的第一家,为Agent而生。

Step AOS采用三层架构。底层是资源供给底座——把Android、Linux、RTOS等传统操作系统的能力拆解为计算、数据、应用与服务三类资源,供给对象从“人与应用”扩展为“智能体”。中间层构建记忆、决策、安全三大核心特性。顶层以意图驱动的自然语言交互,把全部系统能力统一交付给用户。

!Image 14

别人的Agentic OS是在旧系统上给Agent开一扇窗,而Step AOS是直接为Agent盖了一座房子。它从设计第一天起,系统的服务对象就变了:它不仅要服务人,还要服务智能体。这里,智能体不再是访客,而是原住民。 不过,“盖房子”的前提是:你得先有一个足够聪明的大脑住进来。对此,阶跃用一整套模型矩阵来充当这颗大脑。

在基础模型层面,阶跃布局了“Pro+Flash+Edge”三 维度完整梯队。旗舰Pro系列(Step 2,总参数1T)负责深度推理与复杂任务;标准Flash系列(Step 3.7 Flash,总参196B+1.8B ViT,激活仅11B)专为生产级Agent场景优化;端侧Edge系列则让智能体在本地实现低延迟、零Token成本的即时响应。同时,Step Audio R2.5在语⾳理解上,让智能体可以拥有”五 感六觉”。

!Image 15

据阶跃介绍,这三大模型的分工,贯穿了Amoo的每一次行动。三者之间通过协同——能端则端、需云则云、端云接力,确保每一步都有最合适的模型来处理。这不是一个大模型干所有事,而是一个模型矩阵让每一件事都有最合适的模型。 而且,这一切并没有停留在实验室里。

这不是模型厂商的“技术授权”故事,而是一套已经在数千万台设备上跑通的端侧模型体系。截至目前,阶跃已发布超40款自研模型,国内60%头部手机品牌已与阶跃达成深度合作,模型装机量超过4200万台,日均服务近2000万人次。

现在,STEPX,不过是把这套能力从“赋能别人”变成了“做给自己”。这也是阶跃作为⼤模型公司的原⽣优势,终端⼚商不具备、也建不起来的壁垒。

!Image 16

我怎么确定Amoo是可信的?

当AI从“数字大脑”进化为“物理世界行动者”,一个必须直面的问题是:当它不再只是“说”,而是开始“做”,我们凭什么信任它?

阶跃的回答是,把Amoo的行动准则,写进Step AOS的安全框架里。

发布会上,阶跃提出了智能体行动治理四要素:可信、可见、可控、可逆

!Image 17

可信——操作在可信执行环境中完成,数据不出安全边界;可见——每一步操作可审计、可回溯;可控——权限按需授予、用完即收,智能体记忆可删除;可逆——误操作可一键撤回,行动可控。

而这套安全实践和标准,现在已经沉淀为行业准则。最近,STEPX联合上海人工智能实验室发布了《新一代智能体系统安全技术白皮书》,首次系统提出以上四要素。

当行业还在讨论“监管会不会扼杀创新”时,它已经把合规做进了系统底层。技术前进的速度和安全边界的建设同步进行,而不是“先狂奔再刹车”。

!Image 18

在外部合作层面,阶跃Amoo的生态伙伴也在继续扩容。STEPX 与携程、支付宝、滴滴、美团等首批生态伙伴达成 AI 深度合作,覆盖旅游出行、民生政务、本地生活、办公提效、内容创作等全场景服务,为用户带来 AI 生态新体验。 在这个量级的生态里,“可信、可见、可控、可逆”绝不是锦上添花,而是让智能体真正进入物理世界的一个通行证。

最后,当Agent智能体开始真正来到我们身边时,我们有必要——重新认识它。

回到阶跃Amoo那颗像素最初问出的第一个问题:“我是谁?”

动画结尾时,Amoo给出了它的回答:不是“我是一个超级智能”,而是——“我理解你,我陪伴你,我把世界带给你。”

这背后,是阶跃Amoo智能体的叙事里,一个反复出现的词:共生

这种共生体现在三个层面:人与智能体共生——Amoo越用越懂你,从工具变成伙伴;智能体与生态共生——服务提供商通过原子能力接入Step AOS;技术进化与安全边界共生——四要素安全框架从第一天就嵌入系统。

那么,当Agent开始承担了所有“怎么做”的繁琐,人类开始真正有时间去问“为什么”和“为什么不”,去思考“我要去做什么、到哪里去”的。

这也是阶跃为Amoo设定的最终进化方向:把人从操作和琐碎中解放出来,让人回到与生俱来的想象、热爱与创造中去。

欢迎来到 AgentEra

在“AI的iPhone时刻”被行业喊了多年之后,STEPX直接把一款大模型原生手机摆上了桌,而且比苹果、OpenAI还要提早一步。这是行业第一次有公司把“模型—系统—硬件”的完整链路走通。

从2023年4月阶跃成立,到今年7月STEPX发布会,这三年里,阶跃以一个基模厂商后来者入局,今天,当AI真正开始走入物理世界,它选择了又一条更有挑战的路——从模型走向终端。

STEPX的名字,其中“STEP”继承阶跃星辰基因,寓意技术阶跃式增长;“X”则代表探索与边界突破。

今天,一颗像素阶跃Amoo,逐渐从混沌中醒来,走过规则、感知、语言、生成、修正,最终开始行动,成为人类的智能体伙伴。它的行动边界,也正在从个人设备向真实世界的IoT全场景延伸。

而它标记的,不仅是一个新产品的诞生,更是一个时代的拐点——欢迎来到AgentEra! 十字路口正在寻找独立撰稿人,撰写 AI 产品和模型评测。

如果你写过类似文章:《实测 PixVerse C1[1]》、《实测 LibTV[2]》,请联系 zeo0811@gmail.com ,邮件内容请包括:① 个人介绍、② 你写过的 AI 评测文章。

我们会提供有竞争力的稿酬。期待与你一起观察与记录 AI 时代 🎪

!Image 19: 图片

查看原文 → 發佈: 2026-07-15 17:00:00 收錄: 2026-07-16 00:00:09

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。