← 回總覽

四年后,AI 调用费可能便宜一万倍?

📅 2026-07-15 19:51 非凡产研 人工智能 9 分鐘 10954 字 評分: 89
AI 推理 Token 成本 Agent PPIO AI 基础设施
📌 一句话摘要 文章通过访谈 PPIO 首席执行官姚欣,阐述 AI 推理成本将大幅下降、Agent 时代算力需求呈指数增长以及创业者需关注 Token 成本与单位经济模型的核心观点。 📝 详细摘要 文章围绕 PPIO 创始人姚欣的访谈,阐释了 AI 从 "模型能不能做" 转向 "能否用得起" 的核心矛盾。他指出,受模型能力提升和供给侧优化推动,Token 单价可能在四年内下降一万倍;与此同时,从 Chat 到 Agent 的转变将使同样用户规模下的算力需求放大 2–3 个数量级,因为 Agent 需要持续长时间的推理调用。文章进一步列出创业者常见的成本陷阱——过度使用顶尖模型、忽视 Pro

PPIO演示过一个不算复杂的任务:什么预设条件都不给,让AI自己想办法操控电脑。任务跑完,账单只要几块钱,但背后悄悄消耗了将近50万个Token。

这笔账,很多做AI应用的创业者可能压根没算过——他们更操心模型好不好用,没工夫算每一次调用到底花了多少钱。而这恰恰是PPIO联合创始人兼CEO姚欣现在最在意的事。我们找他聊了聊,从Token成本到Agent基础设施,从算力"既缺又剩"的悖论,到他对AI创业泡沫的判断。

问题变了:从"模型能不能"到"用不用得起"

如果不用官方介绍,PPIO在做什么?姚欣的说法是:"PPIO正在打造面向Agent需求的'Token工厂',我们让AI创业者的每一次Token调用都更便宜、更快、更稳定。面向未来的Agent时代,我们正在打造Agentic Cloud,让AI开发者能低成本跑推理、运行和部署Agent。"

他看任何新兴领域,习惯盯两个指标:供给侧的技术使用成本,需求侧的渗透率。拿移动互联网打比方——早期iPhone很贵,后来小米出了千元机,流量资费也从3G时代1GB几十元,降到4G时代几毛钱,成本的数量级下降才是普及的关键。

AI正在走同一条路,但节奏猛得多。姚欣算了笔账:一个Agent任务通常要自主循环10到50轮——思考、调用工具、观察结果、再思考,而且每一轮都要处理完整上下文,越往后每轮的计算量越大。"这不是线性增长,而是指数级膨胀。"过去两年行业焦点是"模型能不能做到",但DeepSeek、Qwen、GLM这些模型的能力已经越来越强,真正的问题变成了"能不能用得起"。 "Token成本四年会下降一万倍。今天一次一分钱的推理,未来可能只要千分之一分钱。"

但供给侧的压力是真实的——AI GPU最贵的部件是HBM高带宽内存,占物料成本50%到70%,过去两年HBM价格接近翻倍,全球能造HBM的只有SK Hynix、Samsung、Micron三家,3D堆叠工艺扩产周期长达12到18个月,供不应求。从HBM涨价,到GPU成本上升,到云厂商采购成本上升,再到推理服务价格上调,是一条确定的传导链。

一边是单价在降,一边是用量在指数级爆发。"PPIO做的就是帮助把Token单价往下打。"智能模型路由、语义缓存、弹性推理调度,本质上都是在降低AI应用的启动成本和边际成本。

!Image 1

算力"既缺又剩",创业者最容易踩哪些坑

姚欣用一句话概括当下的算力现状:既缺又剩,本质是结构性错配,不是总量问题。缺的是配备最新GPU、高速互联、完善软件栈的有效算力;剩的是硬件选型滞后、缺乏运营能力、地理位置偏远的"裸算力"。很多智算中心当初建设时瞄准的是训练场景,但市场已经转向推理和Agent——推理要的是弹性、低延迟、按需调用,跟集中式大机房的设计初衷是错位的。

集中式云厂商的推理定价里,包含大量基础设施溢价,对利润本来就薄的AI应用来说,Token单价太高。而且AI应用的推理需求波动极大,一个Agent可能一秒钟从0调用飙升到1000并发,传统云的扩缩容速度跟不上;AI实时交互对延迟又极其敏感,集中式数据中心可能离用户几千公里,边缘推理节点能把延迟压到20到50毫秒。这是PPIO放弃大模型训练、专注做推理的原因——战略就是取舍。

具体到创业者最容易踩的坑,姚欣列了几个:第一,Demo阶段直接调最贵的SOTA模型,效果好但成本高达每百万Token 10到30美元,实际上80%的场景用中等模型就够,成本只有十分之一;第二,不做Prompt优化和语义缓存——Prompt写好能省一半Token,加上语义缓存,很多团队上线后才发现30%的调用其实是重复的;第三,按峰值配置推理资源,实际利用率只有20%到30%。 "不该拿着锤子找钉子。别把'算力'本身当目标,创业者真正要的是'能跑起来的服务',算力到服务之间,还差着软件栈、运营能力和使用体验这一层。"

创业者该关心的,是成本结构,不是底层架构

"AI应用公司不需要关心底层算力架构,这是我们存在的价值。"姚欣说,但他们必须关心推理成本结构——每次调用花多少钱,规模化之后毛利是多少。"选对基础设施合作伙伴,就是在帮自己做好这道商业题。"

从Chat到Agent的转变,让底层基础设施的要求完全变了样。姚欣拆成三层来讲:第一,资源管理从"峰值短"变成"持续长"——生成式AI一次推理几秒钟完成,GPU很快释放;代理式AI一个任务可能持续跑几分钟甚至几小时,期间不断调用模型,同样的用户量,算力需求能放大2到3个数量级。第二,Token成本优化——自动选合适的模型,自动做Prompt缓存,自动路由到低成本节点。第三,执行环境的安全与合规——AI生成的代码不可控,需要给它一个"安全围栏",Agent要的不只是推理API,还得有完整的执行环境:文件系统、网络访问、快照恢复。

他还提到一个有意思的矛盾:AI具有"反组织"特性。大语言模型有幻觉,本质是生成式AI的不确定性;而大型机构在高价值场景里追求的恰恰是确定性,这跟AI的特性天然冲突。行业目前的一种解法,是并行跑多个Agent,用推理消耗去换可靠性。"这些复杂性应该由平台来承担,而不是每个创业团队自己解决。"

具体到PPIO自己的能力栈,分三层:模型服务层,面向Agent时代的智能Token工厂,平台中立、模型丰富,日均调用量超过一万亿Token,注册开发者56万+;Agent Harness平台层,国内首款兼容E2B的Agent沙箱,融合多智能体编排、Tool Use、记忆管理,业务规模发布一年增长超百倍;Agent接入层,预置OpenClaw、Hermes Agent等开箱即用模板,支持MCP/Skills等AI原生接口,让Agent直接调用基础设施资源。 "创业者只需要关心两件事:产品逻辑和用户体验。"

客户买的不是算力,是"能跑起来的服务"

一家做一站式AI助手的创新公司,集聊天、搜索、协作和编程支持于一体,找到PPIO时面临两个具体问题:需要快速验证新功能的可行性,又不想浪费资源;市面上多数LLM API缺一致性、可靠性和成本效益。PPIO给的方案是优化过的分布式推理和推理加速、支持函数调用能力的DeepSeek R1 API,帮对方在角色扮演、故事扩展、代码生成等场景快速测试特性、加速开发迭代。

这类案例背后是姚欣对商业模式转变的判断:"客户买的就是三样东西——模型API、Agent沙箱、GPU服务和企业私有化部署。"模型API上,PPIO用一个统一接口接入DeepSeek、Qwen、GLM、Kimi、MiniMax等主流开源模型,覆盖大语言模型、图像生成、语音识别、视频生成,按Token实际调用量收费;Agent沙箱是专门给AI Agent场景做的运行时基础设施,在隔离的云端环境里执行代码、访问文件系统,"你不能让它在你的生产环境里裸跑";GPU服务和私有化部署则面向有合规要求、需要独占资源的大客户。

效果数字也很实在:2026年,PPIO交付的知名大模型输入Token定价,比主要国际云服务商的平均收费低40%以上;同一款模型的性能表现,相比用SGLang这类基准推理引擎部署,首字节延迟降低了95%,总吞吐效率提高了300%。

姚欣特意强调了一件容易被搞混的事:PPIO不是"GPU租赁平台",也不是"模型API聚合商"。"单纯倒卖算力是生意,难成事业。"他们提供的是覆盖AI应用全生命周期的推理服务,包括智能模型路由、Token成本优化、Agent运行环境、弹性推理调度这一整套能力。"开发者不需要'算力',需要的是'能跑起来的服务'。"

和产业链上下游的关系也很清楚:和大模型公司是上下游——"他们造引擎,我们做智能路由和推理优化";和应用公司是服务关系;和传统云厂商互补大于竞争,因为大厂的推理服务往往绑定自家生态和模型,PPIO作为独立第三方,做的是不被任何一家云或模型绑定的中立路由。谈到长期壁垒,他归纳了四条:优质算力资源储备、推理算法优化能力、API兼容性和平台通用性,以及面向Agent的端到端能力——安全执行环境、状态管理、工作流编排。

"不谈收入落地的AI,都是泡沫"

姚欣自己也当过投资人,在硅谷访学期间发起过AI创业营。再次回到创业一线,他坦言:"我可能回不到24岁的状态了,因此我们选择支持当年的'姚欣们',陪伴他们成功。"

对现在AI创业的"热",他的判断很直接:"不谈收入落地的AI,都是泡沫。"他看好的方向是AI编程、AI Agent(企业自动化)、AI视频/内容生成、AI教育——这些场景有明确的付费意愿和可量化的效率提升。AI编程尤其被他看重,因为代码意味着自动化和智能,"AI能生成代码,就意味着它能控制计算机"。PPIO自己也是从营销、会议、中后台工具这类对准确性要求不高、但有付费意愿的痛点场景切入的。 "给创业者的建议,他给了三个指标:第一,单次交互的Token成本,这是'原料成本',算不清楚,商业模式就是空中楼阁;第二,用户渗透率,借鉴'跨越鸿沟'理论,渗透率到20%左右,意味着技术正从早期尝鲜者走向主流大众;第三,单位经济模型LTV/CAC——不是简单的获客成本,而是一个付费用户终身贡献除以获取成本。"

明年大量Agent将接管现有工作流

未来三年,姚欣预计Token单价会再降一到两个数量级,同时用量增长四五个数量级;从Chat到Agent的转变,会让同样用户量的算力需求放大2到3个数量级——生成式AI是"峰值短",代理式AI是"持续长",不是短期峰值,而是持续的高并发需求。"预计明年是Agent之年,大量Agent将接管现有工作流。"同样的花费,AI能力每年提升十倍,这个趋势会直接催生一批"免费AI应用"。 "AI时代真正重要的算力基础设施,不是堆更多GPU,而是让每一次Token调用都更聪明、更便宜。这与技术发展的本质一致:不断提升对地球资源的利用效率。"

访谈精选 Q&A

Q1:如果不用官方介绍,你会怎么向一个不了解PPIO的人解释你们现在在做什么?

姚欣:聚焦当下来看,PPIO正在打造面向Agent需求的"Token工厂",让AI创业者的每一次Token调用都更便宜、更快、更稳定。

面向未来的Agent时代,我们正在打造Agentic Cloud,让AI开发者能低成本地运行、推理和部署Agent。我们选择做一家赋能型基础设施公司,专注做好支撑,伴随优秀创业者共同成长。

Q2:过去两年大家更多关注模型能力和应用创新,为什么你认为算力基础设施会越来越成为核心问题?

姚欣:我看任何新兴领域,都会重点关注两个核心指标:供给侧的技术使用成本,以及需求侧的渗透率。

以移动互联网为例,早期iPhone非常昂贵,后来小米推出千元机,流量资费也从3G时代1GB几十元降到4G时代的几毛钱。成本的数量级下降,是技术走向普及的关键。

AI正在走同样的路,但Token消耗的增速远比传统互联网流量更猛。一个Agent任务可能需要自主循环10—50轮:思考、调用工具、观察结果、再思考。每一轮都要处理完整上下文,越往后计算量越大。这不是线性增长,而是指数级膨胀。

过去两年行业关心的是"模型能不能做到",但随着DeepSeek、Qwen、GLM等模型能力越来越强,真正的问题已经变成:"能不能用得起?"Token成本正在成为AI应用商业模式能否成立的决定性变量。

Q3:你曾提到AI应用可能迎来"免费时代"。如果应用价格不断下降,底层推理成本会承受什么压力?

姚欣:我们预测,Token成本在四年内会下降一万倍。今天一次需要0.01美元的推理,未来可能只需要0.001美元甚至更低。

但供给侧的成本压力也是真实存在的。AI GPU的核心成本组件是HBM高带宽内存,占物料成本的50%—70%。过去两年HBM价格接近翻倍,全球又只有少数厂商能够生产,扩产周期通常需要12—18个月。从HBM涨价,到GPU成本上升,再到云厂商采购成本和推理服务价格上升,是一条明确的传导链。

PPIO做的,就是帮助把Token单价继续往下打。智能模型路由、语义缓存、弹性推理调度,本质上都在降低AI应用的启动成本和边际成本。

未来会出现一个非常重要的趋势:Token单价持续下降,但Token使用总量增长四五个数量级。单价下降、总量爆发,这正是基础设施公司的机会。

Q4:AI应用创业者最常掉进哪些成本陷阱?

姚欣:第一个陷阱,是用最大的模型解决所有问题。很多创业者做Demo时直接调用SOTA模型,效果很好,但成本可能达到每百万Token 10—30美元。实际上,80%的任务用中等规模模型就够了,成本可能只有十分之一。我们曾经演示让AI在没有预设条件的情况下操控电脑,一个简单任务就消耗了接近50万Token。技术上已经可行,但成本还远远不够低。

第二个陷阱,是不做Prompt优化、缓存和上下文管理。同样的任务,Prompt写得好可能节省50%的Token。再配合语义缓存,很多重复问题可以直接跳过。我们看到不少团队上线后才发现,30%以上的调用其实是重复的。Agent模式下问题更严重。每一轮调用都要处理完整上下文,如果不做上下文压缩和分层缓存,成本会像滚雪球一样失控。

第三个陷阱,是按照峰值配置推理资源。很多团队按照最高并发采购算力,但日常资源利用率只有20%—30%。

第四个陷阱,是过度沉迷技术优化,忽略技术与商业之间的平衡。不能拿着锤子到处找钉子。

第五个陷阱,是把"算力"本身当成目标。开发者真正需要的不是一张GPU,而是模型能调用、Agent能运行、弹性够用、价格合理的完整服务。

Q5:算力成本是否已经成为决定AI应用商业模式能否成立的关键变量?

姚欣:会,而且已经是了,但不同场景之间差别很大。

例如AI陪伴和社交类产品,用户对话频次高、单次Token消耗多、上下文长,但ARPU比较低,所以对Token单价极其敏感。我们平台去年年初的客户以聊天、陪伴类应用为主。

今年又涌现出大量生产工具类应用。这些产品单次任务需要进行多轮模型调用,单位经济模型同样非常脆弱。

一个很有意思的现象是,我们平台上的头部客户名单,每半年到一年就会发生一次明显洗牌。这说明AI应用生态迭代非常快。最终能够活下来的,往往是最早把Token成本算清楚的团队。

Q6:AI应用公司应该从什么时候开始考虑算力和推理成本问题?

姚欣:AI应用公司不需要自己研究底层算力架构,这是PPIO存在的价值。

但从第一天开始,他们就必须关心推理成本结构:每次调用花多少钱,用户规模扩大之后毛利是多少,产品的单位经济模型能不能成立。

选择合适的基础设施合作伙伴,本质上就是在帮助自己做好这道商业题。

Q7:为什么现有云计算基础设施不一定能完全满足AI应用和Agent的需求?

姚欣:现在的算力是"既缺又剩",本质上是结构性错配,而不是简单的总量不足。

真正缺少的,是配备最新GPU、高速互联和完善软件栈的有效算力;大量剩余的,则是硬件选型滞后、缺乏运营能力,或者无法适配实际应用需求的"裸算力"。

很多智算中心最初按照大模型训练场景建设,但市场正在从训练转向推理和Agent。训练更关注大规模、集中式的计算,而推理需要弹性、低延迟和按需调用。两者的需求完全不同。

AI应用的请求波动非常剧烈,一个Agent可能在一秒钟内从零调用飙升到上千并发。传统云的扩缩容速度很难完全匹配这种需求。

这也是为什么我们选择放弃大模型训练,聚焦应用推理。战略就是取舍,要结合外部环境和自己的能力做选择。

Q8:一站式AI云服务最直接为创业团队解决什么问题?

姚欣:最直接解决的是"不要重复造轮子"。

一个AI创业团队通常只有3—5个人。如果他们还要自己部署模型、优化推理、管理GPU和处理运维,可能一半的精力都会浪费在基础设施上。

PPIO的能力可以分为三层。

第一层是模型服务。我们面向Agent时代打造智能Token工厂,通过统一API接入DeepSeek、Qwen、GLM、Kimi、MiniMax等模型,覆盖语言、图像、语音和视频等多模态能力,重点解决Token成本和长程任务问题。

第二层是Agent Harness平台,包括兼容E2B的Agent沙箱、多智能体编排、Tool Use和记忆管理等能力,为Agent提供完整运行环境。

第三层是Agent接入层,预置OpenClaw、Hermes Agent等智能体模板,并通过MCP、Skills等AI原生接口,让Agent能够直接调用基础设施资源和服务。

创业者应该把主要精力放在两件事上:产品逻辑和用户体验。

Q9:从Chat走向Agent,底层基础设施发生了哪些根本变化?

姚欣:从Chat到Agent,AI从"回答问题的嘴"变成了"动手干活的人"。干活需要工具、环境、持续思考和记忆,这对底层基础设施的要求完全不同。

首先,资源管理从"峰值短"变成了"持续长"。生成式AI的一次推理可能几秒钟就结束,GPU很快释放;但一个Agent任务可能持续运行几分钟甚至几小时,期间不断调用模型。调度系统面对的不再只是快速响应,而是长任务管理和资源持续占用。同样的用户量,Agent带来的算力需求可能放大两到三个数量级。

其次,平台需要自动进行Token成本优化,包括选择合适的模型、进行Prompt缓存、压缩上下文,以及自动路由到成本更低的推理节点。

再次,Agent需要安全的执行环境。AI生成的代码具有不确定性,不能直接在生产环境中裸跑。它需要一个包含文件系统、网络访问、权限隔离和快照恢复能力的安全沙箱。

这些复杂性不应该由每一家创业公司重新建设,而应该由基础设施平台统一承担。

Q10:模型API化和推理服务化之间是什么关系?

姚欣:两者是互补关系,不是替代关系。

模型API化让开发者不需要自己部署模型,但调用API本身就在消耗Token。当应用规模较小时,直接调用模型API通常已经足够。

但当用户规模上来之后,API调用的Token成本、延迟、稳定性和资源弹性就可能成为瓶颈。这时候就需要推理服务化,在模型路由、推理引擎、缓存、调度和硬件适配等更底层的位置进行优化。

Q11:AI时代的云服务,会不会从卖资源转向帮助应用跑通单位经济模型?

姚欣:会,这是最重要的变化之一。

目前能够看到明确商业闭环的AI应用,大多面向企业。但这里的To B和过去不太一样,它往往是从企业内部的个体用户开始的。我们把这类人称为"专业消费者",也就是Prosumer。

他们具备专业需求、技术能力和支付意愿,使用AI效率工具解决的是"节省时间"的问题,所以商业账更容易算清楚。

因此,AI推理平台的价值主张,不能只是"我们有便宜的推理服务",而应该变成"我们帮助你降低单次任务成本,跑通单位经济模型"。

传统云解决的是"算得快"的问题,Agent时代需要解决的是"干得了活"的问题。基础设施卖的不再只是Token,而是成本结构优化能力和完整的Agent工作环境。

Q12:客户真正从PPIO购买的是什么?

姚欣:说白了,主要是三样东西。

第一,模型API。PPIO通过统一API接入主流开源模型以及语言、图像、语音和视频等多模态能力,开发者不需要自己部署模型,按照实际Token调用量付费。目前平台日均Token调用量超过万亿,注册开发者超过56万。

第二,Agent沙箱。这是专门面向AI Agent设计的运行时基础设施,为Agent提供安全隔离的云端环境,使其能够执行代码、访问文件系统和调用网络。Agent生成的代码不可控,不能直接在生产环境中运行。PPIO的Agent沙箱业务发布一年后,规模增长超过百倍。

第三,GPU服务和企业私有化部署。对于有合规要求或者需要独占资源的大型客户,我们提供GPU容器实例和企业级私有化部署方案。

归根到底,开发者不需要"算力",而是需要"能跑起来的服务":模型能调、Agent能跑、弹性够用、价格合理。

Q13:PPIO在推理成本、延迟和吞吐量方面,能够带来怎样的实际效果?

姚欣:PPIO的推理优化覆盖多个层面,包括算子优化、推理引擎优化、存储系统优化,以及针对前沿硬件进行模型适配。通过这些优化,我们希望把计算资源利用率推到接近理论极限,从而持续降低推理成本。

以2026年的数据为例,通过PPIO模型API服务交付的部分知名大模型,输入Token价格比主要国际云服务提供商的平均价格低40%以上。

我们对一款知名大模型进行评估时,经过PPIO优化后的服务,相比使用SGLang这一基准推理引擎直接部署同一模型,首字节延迟降低了95%,总吞吐量效率提升了300%。

Q14:PPIO和大模型公司、应用公司以及传统云厂商分别是什么关系?

姚欣:和大模型公司是上下游关系。他们负责造引擎,我们负责模型承载、智能路由和推理优化。

去年开源模型生态还不够丰富,今年中国开源模型已经逐渐形成共识。从智谱、DeepSeek到通义千问,开源模型能力持续增强,也激发了独立云平台的活力。

和应用公司是服务关系。我们希望支持当年的"姚欣们",陪伴他们成功。

和传统云厂商则是互补大于竞争。大厂同样提供AI云服务,但通常会绑定自己的云生态或模型。PPIO作为独立第三方平台,可以提供中立的模型选择、跨模型路由和推理优化,不被任何一家云厂商或模型公司绑定。

Q15:未来AI基础设施行业的核心壁垒是什么?

姚欣:第一是优质AI算力资源储备。平台需要拥有足够的高性能GPU资源,并且支持动态推理调度和非高峰资源共享,以满足高并发和实时性能要求。

第二是推理优化能力。平台需要通过算子级优化、推理引擎设计、内存管理和硬件适配,持续提升模型速度并降低成本。

第三是API兼容性和平台通用性。需要提供标准化API、稳定的SDK和通用平台工具,让开发者能够跨模型、跨场景快速部署。

第四是Agent基础设施的端到端能力,包括安全执行环境、状态管理、记忆系统和工作流编排。

单纯倒卖算力是一门生意,但很难成为一项长期事业。真正的壁垒,是能否提供面向AI应用全生命周期的完整推理服务能力。

Q16:从创业者到投资人,再回到创业一线,你对今天的AI创业者有什么不同的判断?

姚欣:我必须承认,我可能回不到24岁的状态了。因此,我们选择支持当年的"姚欣们",陪伴他们成功。

今天做AI推理平台,时机是合适的。行业的一个基本共识是,模型能力的迭代速度正在相对放缓,AI开始进入应用时代。去年硅谷重点讨论训练,今年重点已经转向推理。

预计明年会成为Agent之年,大量Agent将开始接管现有工作流。模型和应用之间仍然存在巨大的基础设施缺口,这就是PPIO的机会。

我会以开放、赞赏和尊重的态度看待平台上的AI创业者,哪怕他们比我年轻10岁、20岁。他们中间充满了新的机会和希望。

Q17:你怎么看当前AI创业的"热"和"泡沫"?

姚欣:我的判断很简单:不谈收入落地的AI,都是泡沫。

AI编程、AI Agent和企业自动化、AI视频与内容生成、AI教育,都是目前能够看到较明确付费意愿和效率提升的方向。

AI编程尤其重要,因为代码本身意味着自动化和智能。过去,编程被认为是一项高智商工作;当AI能够生成代码,就意味着它不仅能回答问题,还能进一步控制计算机和完成任务。

现阶段更容易商业化的,是那些对准确率要求没有那么极端、但痛点明确且有支付意愿的场景,例如营销、会议和企业中后台工具。

这些由Prosumer率先使用的场景,正在最先走向商业化。

Q18:未来三年,AI基础设施最大的变化是什么?

姚欣:Token单价可能下降一到两个数量级,但Token使用量会增长四到五个数量级。

与此同时,从Chat到Agent的转变,会让相同用户规模所需要的算力放大两到三个数量级。

生成式AI是"峰值短",一次推理几秒钟完成,资源很快释放;代理式AI是"持续长",一个任务可能运行几分钟甚至几小时,期间持续调用模型。这不是一次短期峰值,而是持续、高并发的推理需求。

未来,推理将取代训练,成为AI最主要的资源消耗场景;AI推理平台也会从"卖Token"转向"卖Agent工作环境"。

大量Agent将开始接管现有工作流,而同样的花费所能获得的AI能力,每年可能提升十倍。这个趋势会直接催生出一批免费或接近免费的AI应用。

AI时代真正重要的基础设施,不是堆更多GPU,而是让每一次Token调用都更聪明、更便宜。这与技术发展的本质是一致的:不断提升对资源的利用效率。

!Image 2

查看原文 → 發佈: 2026-07-15 19:51:00 收錄: 2026-07-16 04:00:09

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。