"客户希望你能帮他登月,但只愿意付同城快递的钱。"
非凡大赏的一场企业AI圆桌上,Kyligence创始人韩卿借用了极客公园张鹏这句话,台下一片笑声。在座四位To B老兵,服务的企业客户从几百到几千家,谁都中过这一枪。
韩卿自己就有个现成的例子。前两天他陪销售去见客户,对方CIO拍板要搞数据方向的AI。韩卿问了两个问题。第一,你的2TB数据能放云端吗?不能,太敏感,必须放内网。第二,你有几张显卡?CIO挺高兴:四张。接着补了一句——我想让公司每个人都用上AI。
2TB核心数据锁内网、4张显卡、全员用AI,这三个条件摆在一起,是个无解的方程。 "但这就是当下企业AI落地最真实的处境:技术早就不是瓶颈,瓶颈在别处。"
这场圆桌的四位嘉宾,除了韩卿,还有数猎天下创始人程凯征、数势科技产品负责人岑润哲、实在智能创始人孙林君。他们有个共同身份:都不是AI原生创业者,而是从大数据时代一路打过来的企服老兵。孙林君的实在智能,已经有超过一百万个数字员工在客户那里上岗;韩卿做了十几年数据底座,国内大型银行和保险公司很多都是他的客户。
正因为踩过上一个时代所有的坑,他们聊企业AI,有种少见的诚实。
技术平权了,甲方还没准备好
大数据时代的To B生意是舒服的。客户知道自己要什么,像买车一样,预算和性能摆在明面上,挑就完了。
AI时代全变了。客户不知道自己要什么,你也不知道能给他什么。"看上去好像啥都能做,客户也啥都想要。"
韩卿说,现在很多客户的心态是"我先做个实验,你到别处去赚钱"。问题是每个客户都这么想,最后坑的是投资人。
更普遍的场景是:领导拍脑袋要搞AI,一口气列出一百个场景,IT做到一半发现申请不到服务器资源。业务部门反过来抱怨IT做的AI没用——准确率不够,根本用不起来。 "过去那套中心化的项目建设方式,在AI时代失效了。韩卿的判断是,这事目前没有标准答案,只能不断试。但如果前期基础工作没做好,试出来的结果不理想,客户就不愿继续投入,对甲乙双方都是浪费。"
POC做得很漂亮,上线没人敢拍板
程凯征补了另一个视角:现在企业里,老板最着急,底下的业务部门反而没那么急。
老板一着急,IT部门为了交差,会列出几页PPT的智能体场景。然后出现一个非常典型的症状:POC(概念验证)做得漂漂亮亮,到了上线那一步,没人敢拍板。
因为所有人都会问同一个问题:"这个智能体,靠谱吗?"
!Image 2: photoplus "数猎天下的解法很朴素:别拿完美当标准,拿人当标准。这个岗位原来的人是怎么干活的?能打多少分?人也不是百分之百靠谱,会有情绪、有状态起伏、有各种干扰。用同一套评估体系去测智能体,如果它不输于人,就具备了上线的资格。"
就像特斯拉的自动驾驶,刚开始没人敢坐,后来数据证明机器开车比人靠谱,事情就顺了。
孙林君在阿里做算法时验证过同样的逻辑:机器不可能没有幻觉,但人也会出错。上线标准不是"零错误",是"达到与人相当的水平"。 具体做法是把流程拆开,看哪些环节允许幻觉(多样性强一点反而是好事),哪些环节必须精准,然后分维度校验。
程凯征还有一句挺扎心的话:通用产品正在变得越来越不值钱,因为技术门槛降低了。真正值钱的,是你对场景的理解,以及场景沉淀下来的语义和本体。
幻觉的真相:你在逼AI"蒙一个"
聊到幻觉,三位技术出身的嘉宾给出了同一个方向的答案,只是说法不同。
程凯征的说法最形象。大模型为什么会产生幻觉?因为数据和语义没准备好,你却在逼它交卷。"就像考试,老师说不会也蒙一个——AI也是这个逻辑。"
解法是把闭卷考试变成开卷考试:企业把确定性的数据和知识准备好,AI只负责推理。他说从他们落地的情况看,经过这种工程化处理,幻觉基本可以消失。
这里有个经常被忽略的前置条件:语义和本体,也就是"AI如何理解你的企业"。 大模型吃了整个互联网的语料,但它不懂你公司内部的简称、缩写和流程。零售行业的Sell-in、Sell-out,各种MD、TD,你不教它,它就是个没做过入职培训的新员工。
孙林君也带着一个自己踩过的坑。他之前用OpenClaw抓数据生成报告,结果发现报告里的数据有问题。一路追查下去,原因让人哭笑不得:截图分辨率不够,AI识别不准,就自己编了点数据塞了进去。 "大模型不但自己会幻觉,驱动工具的时候也会幻觉,而且它不会主动告诉你'我看不清'。"
孙林君的解法是把任务链拆细:任务链越长、压缩越狠,幻觉率越高。不如拆成细致的工作流,把大模型框在特定范围里。比如财务票据审核,别把原始数据直接扔给它,而是让它写规则、写伪代码,再由确定性程序去校验,准确率会大幅提升。
他还分享了一个自家公司的例子:财务部门用新产品,自己花几句话就开发出一个智能体,而之前工程师做了一个月都没让他满意。工程师照葫芦画瓢实现了逻辑,但没有"财务思维",不理解专业术语,只能不断返工。说白了,大模型掌握的行业知识,已经超过了一般工程师。
韩卿的说法最简练,直接可以当slogan:不要让大模型干核心计算的活。AI负责表达,平台负责准确。
计算交给稳定的数据平台,大模型只做它最擅长的事——比如把干巴巴的数据,重新组织成老板爱看的秘书式报告。客户看到漂亮报告,第一反应是"数据对吗",第二反应是"能不能让我验证"。所以Kyligence从数据血缘追踪开始建了一整套可验证的体系,还在探索用AI去快速校验AI。 "说到底,治幻觉的从来不是更大的模型,而是更细的工程。"
从工具到同事:Agent进化的下一站
聊完"可信",岑润哲把话题拉向了远处:可信之后呢?
他的观察是,2024年初,大家还觉得智能问数Chatbot能在网页上用就行了。但OpenClaw这类工具出现之后,形态变了。在网页端,AI只是个工具;但当智能体入驻企业IM,被拉进群聊、参与协作,它就从"工具"变成了"同事"。
他认为数据智能产品的进化有三个要素:企业级的上下文共享、语义数据的标准与治理、以及智能体之间的协作。
第三点他举了个跨境电商的例子。客户用了数据分析智能体,反馈说"光分析不够"——发现了出海商品的财务异常,接下来呢?缺陷在哪?SEO怎么改?这就需要数据分析智能体把结构化的结论交给产品优化智能体、客服智能体去执行动作。Agent推Agent,才真正带来业务增效。
至于"更可信"和"更聪明"怎么选,岑润哲的回答是一句可以直接印在PPT上的话:可信是下限,聪明是上限。
金融场景里,客户经理给高净值用户出资产配置建议,数字错一个,信任就永远没了——可信绝对第一。但零售场景里,竞品上了活动你没上,时机就错过了,这时候趋势对、数据略有偏差,是可以接受的。
他还分享了一个挺反直觉的案例。一家知名茶饮连锁客户发现,Agent输出的分析思路比人想得更周全。人写的Prompt可能只有60分,Agent顺着它扩展出来的思路能到90分。Agent不只是执行指令,它在教决策者新的分析方法——这种杠杆,比给一个准确的数字更值钱。
先上岗,再登月
圆桌快结束时,孙林君讲了一个阿里的旧事,我觉得是全场最好的收尾。
他当时负责用大数据系统做维权纠纷处理,把2300人的团队缩减到100人。机器早期决策水平不高,就让它在背后默默学人的判断,一轮轮AB测试,数据越积越多,最后很多领域,机器达到了甚至超过了人的水平。 "'去年的智能体可能还取代不了人,今年很多工作已经可以胜任了。'他说这话的时候,语气很平静。所以回到开头那个只有4张显卡的CIO。他的问题也许不是显卡不够,而是顺序搞反了——企业AI从来不是先登月、再落地。是先让每一个具体的岗位跑起来,才谈得上登月。"
更多对话细节
Speakers|嘉宾Kyligence 联合创始人&CEO 韩卿
数猎天下&DataHunter 创始人 程凯征
数势科技 AI产品负责人 岑润哲
实在智能 创始人&CEO 孙林君 Host | 主持人
非凡资本 合伙人 赵亮Abner
技术平权了,甲方还没准备好
赵亮:我们今天的流程大概是先请各位做一个简单的自我介绍,介绍一下公司的产品、服务以及客户类型,每人大约一到两分钟。先从韩总开始。 韩卿:非常高兴能在这里给大家分享。我是来自 Kyligence 的创始人和 CEO 韩卿,大家叫我 Luke 就好。我们一直致力于做数据底座,在过去十多年的时间里,主要服务于金融、制造、零售等行业的客户,国内大型银行和保险公司很多都是我们的客户。过去十年,我们做得最多的是帮他们管理底层的数据能力。各位生活中息息相关的很多数据其实都存放在我们客户的平台上,当然,我们并不拥有数据。在过去两三年里,我们投入了很大精力将大模型引入到整个数据平台中。目前我们的定位很简单:为 AI 提供一个企业级可信的数据和上下文平台。
AI 虽然非常厉害,尤其是这两年智能化的提升确实惊人,但 AI 会"乱说话",它无法理解企业内部业务的真实情况。如何为 AI 提供这样一层能力,是我们目前投入的重点。这确实非常复杂,我们与客户打磨了很久,从底层数据整理、指标梳理到上层上下文能力的构建,这其实是一个企业组织级别的重构,而不只是简单的技术问题。我们也在不断探索,希望能与更多伙伴合作。谢谢。 赵亮:韩总提到为企业提供可信的 AI 智能体平台,这个话题我们一会儿再交流。接下来请程总。 程凯征:大家好,我叫程凯征,来自数猎天下(DataHunter),我是创始人。听名字就知道我们是做数据的,从成立到现在,我们一直帮助客户进行数据治理、清洗和整理。
从 2022 年底、2023 年开始,我们也投入精力在 AI 领域的积累,包括 AI 智能体、AI 所需的知识体系(也就是语义层或本体论)。看到今天几位嘉宾,其实大家在基础设施和技术积累上有很多相似之处,希望能有一些思维的碰撞。 赵亮:谢谢程总。程总的公司是 2014 年成立,2016 年正式运营,也有十多年了。韩总的公司也是 2016 年开始的。 岑润哲:各位好,我叫岑润哲,目前是数势科技的联创兼产品负责人。我们公司也一直在帮企业做可信的数据语义层,和几位嘉宾做的事情很相似。
我们在数据底层之上,为企业提供智能分析和现在比较火的"数字员工"概念,帮助他们实现数字化转型。我们的客户主要包含银行、券商、保险以及制造和零售行业。今年我们发现,很多企业除了使用 Chatbot 外,更希望雇佣数字员工(Agent)入驻到企业内部的 IM 工具中。
我们今年除了数据分析 Agent,也在做数字员工智能体。让智能体不再仅仅停留在网页端,而是走入 IM 工具,与企业发生更多的上下文(Context)交换,真正帮企业降本增效。非常期待能与各位嘉宾就数字 Agent 方面进行交流。 孙林君:大家好,我是实在智能的孙林君。我们公司成立于 2018 年,现在快八年了。刚开始我们做的是数字员工,从 RPA(机器人流程自动化)切入。RPA 是数字员工的一种,可以看作是"蓝领",负责数据搬运、软件操作等重复性、规则化的任务。
到了 2023 年,有了大模型加持,数字员工从"蓝领"升级到了"白领",进入了智能体阶段。虽然商业模式没变,本质上还是售卖机器人,但机器人能完成的任务更有价值、复杂度更高了。我们增强了机器人的"手脚"(操作稳定性与性能),并研发了垂直大模型"塔斯"作为"大脑"。我们的智能体在 2023 年算是国内发布较早的。
目前实在智能拥有超过五千家客户,积累了大量场景。我们统计过,在客户那边上岗的数字员工早已超过一百万个。我们最初的目标是为社会贡献一百万个数字员工,现在已经超额完成。我们新的使命是"以数字劳动力释放人类创造力",愿景是"人机共生,重塑十亿人的工作与生活"。Agent 作为人的工作助理,能力边界在不断拓展,我们也在为此努力。谢谢。 赵亮:孙总已经创造了一百万个数字员工。那实在智能自己雇佣了多少数字员工? 孙林君:举个例子,原来客户到我们公司参观,转一圈大约 15 分钟,现在要超过一个小时。因为走到哪个部门,员工都会介绍他们正在使用的智能体。现在我们跟客户交流时,会先研究他们的组织架构和岗位,看哪些能用数字员工替代。随便一个企业,我们都能提供几百种数字员工模板帮他们快速复用。 赵亮:大家可能留意到,今天的四位嘉宾所在的公司都不是典型的初创公司,而是相对成熟的企业,在企服赛道颇有名气,服务的客户从几百到几千不等。难能可贵的是,四位都经历了从大数据时代到 AI 智能时代的演进,产品也在不断迭代。
接下来请各位分享心路历程和客户服务经验。第一个问题请教韩总:作为大数据领域的标志性人物,您觉得企业从系统接入到结果验证的过程中,会遇到哪些风险、挑战或瓶颈? 韩卿:我觉得确实有很多"草"可以吐。过去做大数据时,我们踩到了风口。那时的特点是 To B 客户需求明确,知道自己想要什么,就像买车一样,去市场上挑价格和性能。
但到了 AI 时代,情况变了。客户不知道要什么,你也不知道能给他什么。看上去好像啥都能做,客户也啥都想要。极客公园的张鹏曾说过:客户希望你能帮他登月,但只愿意付同城快递的钱。这个过程挑战巨大。
客户端最大的挑战不在于技术,技术现在已经"平权"了。一旦明确需求,我们有能力很快做出来。但挑战在于客户的认知与投入意愿不等价。很多客户说"我先做个实验,你到别处去赚钱",结果每个客户都这么讲,最后坑的其实是投资人。
前两天我和销售去见一个客户,对方 CIO 说要搞数据相关的 AI。我问了两个问题:第一,你的数据大约 2TB,是必须放内网还是可以用云端 AI?他说数据很敏感,必须放内网。第二,你有几张显卡?他很开心地说有四张(可能是 H200 或 H400)。他想让每个人都用好 AI,但只有四张显卡,这是不可调和的矛盾。
领导说要搞 AI,甚至列了一百个场景,但最后发现申请不到服务器资源。业务部门的领导也会抱怨 IT 做的 AI 没用,因为业务人员根本用不起来,或者准确率不够。我认为最大的挑战在于,过去中心化的项目建设方式在 AI 时代必须发生变化。目前没有标准答案,只能不断尝试。如果前期基础工作没做好,导致结果不理想,客户就不愿继续投入,这对甲方乙方都是一种浪费。 赵亮:韩总从需求端和落地情况分析了挑战。同样的问题请教程总:数猎天下有十多年经验,背景偏传统 ERP 和 BI。在 AI 智能时代,从试点到规模化落地,您觉得卡点在哪里?是否需要建立新的验证标准? 程凯征:这是一个非常好的问题。我们一直做经典的 To B 业务,对企业侧需求非常了解。在 AI 时代,我们最明显的感触是:老板最着急,底下的业务部门反而没那么急。
老板着急往往不解决实际问题。正如韩总所说,IT 部门为了迎合老板,会列出几页 PPT 的智能体场景。但在实际落地中会出现典型症状:POC(概念验证)做得非常漂亮,但上线时谁都不敢拍板,因为大家会问:"这个智能体靠谱吗?"
我们的解法是:首先建立客观的评估体系。我们要看这个岗位原本的人是怎么做的,能打多少分。其实人也不是百分之百靠谱的,会有情绪、家庭等各种干扰。我们用同样的评估体系去衡量智能体,如果测试结果不输于人,那就具备了上线的逻辑。就像特斯拉的自动驾驶,刚开始大家也怀疑,但数据证明 AI 开车比人靠谱。 赵亮:这个评估体系会不会过于定制化?每个客户、每个岗位都不一样。 程凯征:这是必然的。做 To B 的都知道,很多场景很难快速复制。大家都想做通用的东西,但通用产品正变得越来越不值钱,因为技术门槛降低了。真正值钱的是你对场景的理解,以及由场景积攒下来的语义和本体,这才是 AI 智能体落地的核心。 赵亮:同样的问题请教孙总:孙总有很强的算法背景,曾在阿里负责多年算法。实在智能从 RPA 转型 AI 智能,服务了几千家客户。在从 POC 到规划落地的过程中,您遇到了哪些"水土不服"的问题? 孙林君:做 POC 时通常只关注主流程,虽然考虑了部分异常,但上线时会发现很多细枝末节没考虑到,这些细节非常耗费人力。
前几天我们财务部门用新产品,自己花几句话就开发出了一个智能体,而之前工程师花了一个月都没让他完全满意。我们研究发现,工程师虽然照葫芦画瓢实现了逻辑,但他没有"财务思维",不理解专业术语,导致不断返工。开发认为业务方在改需求,业务方认为开发理解不到位。现在大模型掌握的行业知识甚至超过了一般工程师。
此外,性能也是瓶颈。POC 时并发量小,真正上线后,算力、数据并发都会成为卡点。
关于准确率,我在阿里时就验证过,人也会出错,机器也不可能完全没有幻觉。上线标准应该是机器达到与人相当的水平。我们要拆解流程,看哪些地方允许幻觉(甚至多样性更好),哪些地方必须精准,通过多维度校验强制达到高水平。 赵亮:接下来想请教岑总:数势科技有很强的互联网和零售基因。作为产品负责人,您构想中 AI 数据产品的终极形态是什么样的? 岑润哲:我觉得这会经历几个发展阶段。2024 年初,大家还觉得智能问数 Chatbot 在手机或网页上能用就行。但随着 OpenClaw 等工具的到来,形态发生了很大改变。
在网页端,用户会觉得 AI 只是个工具。但当智能体入驻 IM 工具,渗透到组织毛细血管时,它就从"工具"变成了"伙伴"或"同事"。你可以把智能体拉进群聊协作,这种协作关系是智能体进化的关键。
我认为数据智能产品进化的要素有三点:第一,企业级协作能力,实现 Context(上下文)共享。第二,语义数据的标准与治理,这是输出可信结论的基础。第三,智能体之间的协作(A 推 A)。
举个跨境电商的例子:我们部署的数据分析智能体能分析出海商品的财务数据,但客户反馈说"光分析不够",他们想知道缺陷在哪、如何优化 SEO。这就需要数据分析智能体与产品优化智能体或客服智能体协作。数据分析发现异常,结构化地传递给其他 Agent 执行 Action(如优化广告、生成视频)。Agent 间的协作才能真正带来业务增效,这也是我们今年的核心重点。 赵亮:岑总提到了两点:从工具到伙伴,以及多智能体协作。刚才几位都提到了可信度问题,尤其是在企业级应用中,大模型幻觉、数据漂移、上下文丢失等问题非常受关注。请教韩总和孙总:作为技术和算法出身,你们如何看待 AI 决策的可信度?目前有好的解决方案吗? 韩卿:这是落地中最大的问题。客户看到漂亮的 AI 报告,第一反应是:"上面的数据点对吗?"第二反应是:"能不能让我验证它?"靠 AI 自我验证是不现实的。
因为我们做底层平台,所以会从血缘追踪和定义开始,构建一套可验证的体系。大模型的幻觉不可避免,所以我们的原则是:不要让大模型直接处理核心计算。
我们把计算交给稳定的数据平台,大模型只负责它最擅长的部分——比如把干巴巴的数据重新组织成老板喜欢的秘书式报告。AI 负责表达,平台负责准确。
另外,如果每个数据点都要人工校验也不现实。我们正在探索用 AI 的方式去快速校验 AI,通过场景打磨和人工抽查不断提升阈值,确保最终输出是准确可信的。 赵亮:孙总怎么看? 孙林君:我之前也用过 OpenClaw,给它一个任务去抓取数据并生成报告。结果发现数据有问题,追查发现它因为截图分辨率不够,识别不准,就自己编了点数据塞进去。这说明大模型在驱动工具时也存在幻觉,且缺乏"主动幻觉抑制"机制。
这就是为什么我们要训练专门用于流程分解和执行校验的大模型。任务链越长,或者任务被过度压缩,幻觉率就越高。可行做法是将其拆解为细致的工作流,把大模型框在特定范围内。比如财务票据审核,不是直接扔原始数据,而是让大模型写规则或伪代码再校验,准确率会大幅提升。
随着版本迭代,大模型的幻觉在大幅降低。去年的智能体可能还无法取代人,但今年很多工作已经可以胜任,未来甚至会超过人的水平。我对此持乐观态度。
我在阿里时,曾将 2300 人的维权团队缩减到 100 人。当时我们用大数据监测纠纷,机器看的数据远超人工,虽然早期决策水平不高,但我们让机器在背后学习人的决策,做 AB 测试。随着数据积累和 Scaling Up,机器在很多领域已经达到或超过了人的水平。在现在的模型体量下,这件事会更加成立。 赵亮:接下来的问题请教程总:数猎天下服务过雀巢、蔡司、强生医疗等传统企业。在这些企业接入 AI 系统之前,您觉得他们需要补齐哪些课?最好能结合案例分享。 程凯征:企业上 AI 有两个必须的前置条件。
第一是数据齐备。这回到了信息化和数字化的老话题,企业的信息化系统(如 ERP、MES)是否完善,数据准备工作是否到位。
第二是常被忽略的——语义和本体,即 AI 如何理解你的企业。大模型虽然有互联网语料训练出的通用知识,但它不了解企业内部的简称、缩写和特定流程。比如零售行业的 Sell-in、Sell-out,或者各种 MD、TD 等行业缩写。如果你把 AI 当成新员工扔进公司,没有这些背景知识,它就无法理解业务。
当数据和语义不清晰时,非要逼 AI 完成任务,幻觉就产生了。就像考试时老师说"不会也蒙一个",AI 也是这个逻辑。如果把考试变成"开卷考试",把确定性的数据和知识准备好,只让 AI 做推理,幻觉概率就会急剧下降。从我们落地的情况看,经过工程化处理,幻觉基本上可以消失。 赵亮:最后一个问题请教岑总:现在大家既关心大模型"更可信",也关心大模型"更聪明"。在企业级场景中,二者能否兼得?如果只能选其一,哪个优先级更高? 岑润哲:这取决于业务场景。我认为"可信是下限,聪明是上限"。
比如金融机构的客户经理为高净值用户出具资产配置建议书,可信度绝对第一。如果数字错了,客户将永远失去信任。但在零售消费或门店管理场景中,迭代时机更重要。竞品上了活动你没上,就错过了时机。这时让 AI 发挥发散性思维更重要,数据稍微有点偏差但趋势正确也是可以接受的。
在银行风控、财务分析等场景,可信是绝对的下限。但要让 Agent 发挥实际作用,上限在于"更聪明"。很多企业发现,Agent 不仅仅是执行指令,更能教会他们新的分析思路。
我们服务过一家知名茶饮连锁企业,他们发现 Agent 输出的分析思路比人想得更好。原来的 Prompt 可能只有 60 分,但 Agent 扩展出的思路能达到 90 分。这种杠杆效应让决策者变得更聪明,这比单纯给出一个数字更有价值。 赵亮:因为时间关系,今天的 Panel 只能到这里了。