← 回總覽

[随笔]什么是 AI Native

📅 2026-07-11 17:12 zartbot 人工智能 4 分鐘 4426 字 評分: 86
AI Native 模型架构 访存瓶颈 思维模型 AI Infra
📌 一句话摘要 本文是作者关于 AI Native 的深度随笔,提出核心观点:AI Native 的本质应是「Human as a Copilot for AI Model」,即人做模型的副驾驶,而非模型做人的副驾驶。 📝 详细摘要 这是一篇以随笔形式展开的技术思考文章。作者首先分享了自己回避复杂人际关系、专注技术、不争名利的个人态度和经历,包括在思科做 AI Infra 的遗憾、当前在 DPU 领域的技术积累与成就。随后切入正题,探讨「什么是 AI Native」。作者批判了当前流行的「Copilot」概念,认为其不够 AI Native,并提出核心观点:AI Native 应定义为「H

闲言碎语

这是一篇随笔, 主要是最近有些emo, 一直以来我都是那种回避复杂的人际关系, 不喜欢带团队, 不喜欢复杂的团队之间的斗争. 更多的就想安安静静地做点事情, 至于Credit啥的, 我也不会像某些人那样去“给别人credit”, 而是更多的把合作方都当作owner, 静静地陪伴他们成功就好, 愿意施舍我一点倒也蛮感激的.

其实很多时候, 在一个项目中的贡献, 自己做了多少自己清楚就行, 倒也没必要去抢什么credit, 又不是要青史留名. 或者一副趾高气昂的样子去施舍别人credit. 没必要, 反正我生活也足够简单, 也不需要多少钱, 去争什么呢? 我一直以来信奉的观点是, 如果世界只剩你一个人了, 去争名还是争利? 都是过眼浮云...充满好奇的去更好的了解这个世界更加有趣, 例如最近几年, 逐渐的从底层的算力芯片到互联再到Infra然后到整个模型的算法逐渐构筑了一个相对完整的认知...

当然与世无争的态度, 也有不少的遗憾....很多领先这个世界很多年的想法无法实现, 几年后由别人做出来成为现实. 倒也没什么失落的, 但是也有一丢丢的失望. 或许当年离开思科就是饱含着这种失望, 从2018年开始在思科做 AI Infra, 从分布式RL到后面ScaleUP的布局, 再到最近几年整个工业界的Ethernet ScaleUP, 然后现在看到思科几乎在这场浪潮中几乎完全踏空...

历史会记录这一切, 我也不亏欠它什么, 它选错了路, 我也不会抱怨什么, 相反最近和几个同事聊天的时候, 我冲口而出的是, 服务思科这家公司最大的收获是学会了如何做人...

最近也在处理一些比较复杂的生产关系, 倒也庆幸的是我这种人也不爱出风头, 也不抢Credit, 安安静静地服务好各位反而把一些事情简单的处理掉了. 只是觉得有些不值得, 这一周的时间可以学好多东西做好多事情了, 被一些琐碎的事情浪费掉有些可惜...

不过忙里偷闲还是读了一些书, 顺便大概累计花了10个小时做了一下 Anthropic 的一道公开的面试题, 在各种资源受限的情况下(例如众所周知xx不让用claude), 靠着一些唯一能拿到的通用计算CPU 并行做一些大规模的搜索来补模型的欠缺. 所幸的是也能勉强混个top10(当然发文的时候已经不是了), 当年搞各科竞赛的感觉似乎又回来了...毕竟人自己想一遍比交给模型思考, 人的收获更大, 这也是今天想写一些什么是AI Native的原因, 根本的原因是人自己要作为copilot, 而不是模型... 我后面会详细展开....

!Image 1 反正没资源嘛, 也不妨碍我做出好的事情, 没有xx卡, 也不妨碍我去逆向NV的GPU架构. 至少能拿到的卡证明了我能做什么:) 而有些卡也通过周末或者工作日半夜别人不用的时候做完了, 虽然白天还要工作, 连续的通宵很辛苦...

另外这些东西倒是墙内开花墙外香, 友商们和国外某些大厂一个劲的在追问要skill....要不是手上还有一个更有趣的活, 早就点了...

有人跟我说, 你这人没啥xx味. 一下子不知道是在夸人还在骂人? 公允的评价是毁誉参半吧. 至少现在的团队维持了初心, 一群有情有义的人在一起开开心心的做了一件非常有意义的事情, 我们在DPU这个领域做到了世界第一, 也是唯一一个从体系结构上完全区分了CPU/GPU/DPU的团队.

对于大多数国产芯片而言, 有几个能从“安全, 性能, 稳定, 成本”几个方面全面超越的? NV的RoCE就不谈了, 在推理时代它会遇到更多的问题. 而AWS连标准的RC Verbs接口都没有, Google的Falcon至今也没啥大规模部署, 最搞笑的微软Azure, 语义都支持不全.... 而CIPU这边, 不像某家遇到CVE动不动就要停机升级, 也不像某些卡那样网络拥塞问题解决不干净一天到晚的在工单群里擦屎... 最近几个月eRDMA大规模上量的时候, 基本上没有遇到任何问题, 生态的迁移因为RC Verbs兼容, 没有任何兼容性的适配问题, 性能上也没有因为网络的拥塞出现的工单...工业界折腾了几年还没在多路径和拥塞控制算法上追赶上我们...

什么是AI Native

其实我一直的观点是, 在 xx native之前, 先讨论清楚 xx 的名词定义. 例如AI Native之前的一个火热的名词是Cloud Native, 但是很有趣的是几乎所有做云原生的人都没搞清楚什么是云...很多人眼中的云原生充其量算是一个Code as a Infrastructure, 并没了解到云的实质...

回到AI Native这个话题上, 前几天和同事聊天的时候谈到一个很简单的观点, 为什么微软手握Office没有在working场景做出一番事业来, 为什么拿着Github也没有搞出一个很好的coding工具来? 然后现在成立新公司搞FDE拼部署?

时至今日, 我发现我已经好久好久没打开Office了, qoderwork或者公司内部的一些其它平台反而更舒服, 而某些依附在已有的文档/IM 上的AI/agent平台注定失败的原因也在此...

归根结底还是一开始观念上的错误, Copilot这个词本身就不是那么的AI native. 或者反过来一个对AI Native的定义应该变成Human as a Copilot for AI Model

其实这一切的实质就是, 首先承认模型比自己聪明, 不要把自己过往的任何经验用来指导模型. 我发现有很多人写的skill都有一系列问题, 就是过分的把自己的经验带入. 例如这个VLIW Kernel的题目, 更多的经验反而成为瓶颈, 甚至成为模型的束缚.

其实很多年前做量化的时候, 我也是一直有这样的观点. 全世界基本上都在做多因子模型的时候, 反反复复找因子, 又反反复复调模型... 而我一开始的算法更多的是关注于整个系统的分析, 给自己的第一条原则就是不使用任何因子, 不做任何回归类的事情, 而整个模型过去十多年了, 如今还能跑...

同样再来说, 现在很多家都在蒸馏, 那么不是那么礼貌的问一句, 真正的智能是靠小镇做题家那样的刷题能刷出来的么? 或许还是要靠更多更扎实的研究...可以看看Anthropic的 transformer-circuits.pub 过去很多年了, 他们在坚持做什么?

或者用一个被弄烂了的词“第一性原理”是什么? 回顾最近这几年, 我想大概有几点感受.

_首先是模型架构_, 为了更大规模的探索, 回顾到芯片本身的限制, 我们可以看到一条很清晰的路线:算力本身是可以很容易Scale的, 但是访存是很难进行Scale的那么很自然的一条路就是需要在算法上坚持去做更好的Sparse的处理. 大家可以看到整个DeepSeek的模型架构其实贯穿下来都在围绕着这一点. 从最早的坚持MoE的路径, 特别是逐渐的Finegrain MoE的演进, 再到后面逐渐的对Attention MLA/NSA/DSA/CSA的演进, 整个过程都在围绕着稀疏化和降低访存进行. 而外界很多人简单的把它理解为降本....

另外说一些反例, 就是那些莫名其妙做Linear Attention的, 想一个最极致的问题, 当你把5~10M的context 压进一个状态矩阵, 你觉得它能够很好的表示? 或许一些消融实验的结果是好的, 你有没有想过你的测试例大概率只在100K以内的context window...

_其次是算法层面_, 很简单的一个第一性原理就是整个深度学习的数学基础还停滞在1800~1900年的时代, 大量的微积分/线性代数相关的内容, 而近代数学的成果基本上还没有进入到算法研究的主线, 这是人类分工和认知的巨大缺陷, 毕竟很多内容需要纯数的博士阶段才会慢慢的学到, 也存在很多困境, 例如代数拓扑相关的很多算法在当代的GPU架构上是很难并行的, 而数学上看似精确的解在芯片层面低精度运算时又有一堆问题. 大多数算法工程师的知识背景又有很大的缺陷, 或许这是组织结构设计上的问题了...

其实你可以去看看每个模型公司的论文, 大概就能读懂他们的品味了... 很多团队大致就是在别人的工作上加一个A减一个B, 搞一些微小的创新, 并没有那种大开大合的结构变更.

_最后, 魔法在细节_, 其实很多问题都藏在细节里. 本质上一个好的基模团队不光是有好的算法研究, 还有工程上的细节处理. 说实话很多聪明的人并不在意那些工程上的脏活, 这就导致很多人职业生涯走不远. 算法上的洁癖和工程洁癖都是非常重要的研究品味... 当然这些品味本质上分两种, 有些人天生资质好就有, 像我这样的普通人大概率是通过反复吃屎学会的...

此时此刻, 又想到Sutton那篇《苦涩的教训》, 实质上这篇文章就是在谈AI Native, 只不过是在国内算力约束下, 或者未来在全球算力约束的瓶颈下, 需要更聪明的在芯片架构上进行协同.

我们可以看到其实Nvidia的GPU微架构也开始撞墙了, 从Ampere开始遇到寄存器的瓶颈, 到Hopper逐渐把Operand A/B允许从SMEM加载, 再到Blackwell引入TMEM, 然后你可以发现单个Blackwell Die的SM数量急剧减少, Epilogue的运算又遇到了SFU的瓶颈, 然后Blackwell Ultra砍掉一些东西才恢复回来, 然后又在很多极致的workload下严重降频. 而另一方面Rubin Ultra 4xDie的封装也出了问题...

那么如何结合算法本身在芯片角度去设计新的体系结构? 或者简单的套用本文的标题, AI Native的Accelerator长什么样子? 我想我是有了很清晰的答案了, 等我们明年先把 NV 的网党干趴下再来好好的折腾一下这块....

另外, 最近在读Anthropic的J-space了, 不要催啦, 在弄了...

查看原文 → 發佈: 2026-07-11 17:12:00 收錄: 2026-07-11 20:00:46

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。