80
Based on Jensen Huang's latest interview, this article explains that the key to Agent deployment lies in the external Harness system (Prompt, tools, memory, evaluation, etc.) and suggests that programmers should shift from writing code to building Agents, with enterprises establishing their own Agent engineering assets. 
Yesterday 4245 words (about 17 min) View Source →
Sign in to highlight text and take notes as you read. Sign in now
原创 姜篇 2026-07-11 15:34 北京
编辑 | 姜篇 “少写一些重复代码,多造一些能把事情做完的 Agent。”
黄仁勋说这句话,不仅是一句告诫,更是他对未来的AI市场的判断。
最新的一次26分钟访谈,黄仁勋没有提起GPU、算力或新模型参数,而是聚焦于更现实的问题:
当Agent开始真正替人调用工具、执行流程,企业究竟应该把工程资源放在哪里?
黄仁勋的答案不是“再等一个更强模型”。他认为,模型只是其中一层,决定Agent能不能进入生产环境的,是模型外面的整套系统Harness。
它包括Prompt、工具说明、记忆、上下文管理、任务拆分、重试、评测和权限控制。
模型负责推理,Harness负责把推理组织成可以验收的工作。
这也是为什么,LangChain只调整模型周围的工程环境,没有重新训练Nemotron 3 Ultra,就把Deep Agents评测成绩推到了0.86;与最高分闭源模型0.87只差0.01,但单次评测成本从43.48美元降到了4.48美元。
黄仁勋随后把话题从评测推向公司组织。
他认为,未来不少公司不会再把业务流程写成一条条固定规则,而会把自己的数据、工具、权限和验收标准装进 Harness,再让多个Agent在里面工作。
> 黄仁勋:NVIDIA的软件工程师开始把时间花在构建Agent上。并不是说Python会消失,而是在重新划分工程师的交付物。过去交付函数和服务,接下来还要交付角色、工具、边界、评测和退出机制。
以下为访谈内容,我们进行了翻译与整理。 “写代码像打字”,程序员开始换一张工作清单
_“prefer to be building agents”_
黄仁勋:工程师会更愿意去构建 Agent。 Harrison Chase:更多 AI进入公司以后,程序员的岗位会不会被直接代替? 黄仁勋:需求不会因为编程效率提高就减少。软件变便宜以后,过去因为成本太高而没被开发的工具、流程和服务会被重新开发。工程师会减少一部分机械编码,但更多的是 Agent设计和验证工作。
他把写代码类比成打字。打字能力很重要,却不是作家的全部工作;同样,写出一段 Python仍然重要,但也不再等于完成一个Agent系统。工程师还要决定它能看见什么、能调用什么、失败后怎么恢复,以及输出由谁验收。
黄仁勋谈 NVIDIA工程师从写软件转向构建Agent
这不是把程序员从代码里抽走,而是把代码放进更长的责任链。生成代码只解决“写出来”,Agent工程还要解决“跑得动、做得对、出错能停、过程可追溯”。 模型只是原料,Harness才把它变成能交付的系统
_“The way to build better agents”_
黄仁勋:更好的 Agent,要靠持续改进模型周围的系统。 Harrison Chase:过去半年 Agent突然变得更有用,进步主要来自模型,还是来自模型周围的系统? 黄仁勋:模型能力当然重要,但生产级 Agent的上限越来越取决于Harness。一个模型单独回答问题时表现不错,不代表它能在长任务里保持计划、正确使用工具并处理异常。
Harness可以理解为模型的工作台。系统Prompt定义角色,工具描述告诉它有哪些手段,记忆保存中间状态,Middleware处理上下文和异常,评测器判断结果是否达到标准。每一层都不显眼,却会叠加成最终表现。
黄仁勋解释模型与 Harness的关系
这也改变了团队排查问题的方式。Agent失败时,第一反应不再只是换模型,而是回看执行轨迹:它在哪一步误解了任务,是工具说明不清、上下文丢失、计划过长,还是验收条件根本没有写进系统。 不重训模型,只改 Harness,成绩追到Opus身后
访谈给出的技术样本是 Nemotron 3 Ultra。
LangChain先让它运行公开的Deep Agents评测,再逐条分析失败轨迹,没有改模型权重,而是调整系统Prompt、工具描述和中间件。
结果是,调过的 Nemotron 3 Ultra拿到0.86,最高分闭源模型为0.87。差距只有0.01。更值得注意的是,提升来自模型外部的工程,而不是一次新的训练。
LangChain官方评测:Nemotron 3 Ultra配合专用Harness取得0.86,单次成本4.48美元
这张图说明,同一个模型放进不同Harness,能力会被释放到不同程度;比较Agent系统时,只看模型榜单已经不够。
对开发团队来说,执行轨迹开始像测试日志一样重要。它能告诉你分数丢在哪里,也能把一次偶然失败变成新的回归用例。
长期积累的 Prompt、工具接口、轨迹和评测集,会逐渐变成公司的Agent工程资产。 便宜约 10倍,改变的不只是账单
_“run larger eval suites”_
黄仁勋:更低的推理成本,让团队可以运行更大的评测集。 Harrison Chase:开放模型最直接的优势是不是成本? 黄仁勋:成本下降会改变开发方法,而不只是让相同的事更便宜。Agent完成一次任务往往要多轮推理、调用多个工具,还可能并行尝试不同路径;当每一次试验都昂贵,团队就会主动减少评测和探索。
0.86对应4.48美元,接近它的模型对应43.48美元。
在这组评测里,成本大约相差一个数量级。对一次演示而言,几十美元未必夸张;但当同一套流程每天回归、每次版本迭代都要比较多个变量时,差距会迅速放大。
便宜带来的第一项能力是“多试”。团队可以同时比较模型、Prompt、工具和重试策略;第二项能力是“常测”,把评测放进日常开发与生产监控;第三项能力才是“多部署”,把过去只能服务少数高价值任务的Agent扩展到更多细分流程。 先用前沿模型探路,再把高频任务专门化 Harrison Chase:既然开放模型更便宜、更可控,企业是否应该完全离开前沿闭源模型? 黄仁勋的核心判断:这不是二选一。问题刚出现、边界还不清楚时,前沿模型适合探索上限;任务反复出现、验收标准逐渐稳定后,再把它收敛成专门化 Agent。
一种更实际的落地路径:先挑最难的一批真实任务,让能力更强的模型跑出可用轨迹;再收集失败案例、人工修改和工具调用记录;最后把规则、上下文和评测固化,迁移到成本更低的开放模型或专用 Agent。
这里的“专门化”不只发生在模型权重里。
很多时候,真正拉开差距的是公司自己的工具说明、业务词汇、权限边界、历史轨迹和验收数据。它们共同决定Agent是否理解这家公司。 公司未来会建在 Harness之上
_“companies will be built on harnesses”_
黄仁勋:未来的公司会把越来越多能力建在 Harness上。 Harrison Chase:企业真正应该拥有的 Agent资产是什么? 黄仁勋:不是某个单独模型,而是模型、Harness、运行时与公司数据的组合。模型可以替换,真正把业务知识沉淀下来的,是系统如何分解任务、调用内部工具、处理例外并验证结果。
黄仁勋谈“公司将建立在Harness之上“
过去,企业把流程写进 ERP、CRM和一串固定审批规则。
Agent时代,部分流程会从变成“给定目标、工具、权限和验收标准,再让系统规划路径”。Harness就是承接这些业务规则的新容器。
这也解释了为什么开放栈被反复强调。
企业希望掌握自己的记忆、轨迹、评测集和调优数据,并决定它们运行在什么基础设施上。模型重要,但模型周围的系统更直接地映射公司的独有知识。 Agent入职先领门禁,密钥不能直接交给它
一个会调用终端、数据库和内部API的Agent,已经不只是聊天机器人,而是拥有行动能力的软件进程。
NemoClaw蓝图把Deep Agents Code、Nemotron 3 Ultra与OpenShell运行时组合起来。
模型负责推理,Harness负责组织任务,OpenShell把代码执行放进沙箱,并对网络、凭证、文件和日志分别施加策略。
NemoClaw官方架构:Agent在OpenShell沙箱内执行,网络、凭证和日志分别受控
> 黄仁勋:Agent不应直接拿到长期密钥。更合理的方式是由运行时根据当前任务和策略临时注入权限,让Agent只在必要时间、必要范围内访问必要资源。
黄仁勋谈安全、沙箱与访问控制
落到工程实现,至少要回答四个问题:它以谁的身份行动,哪些命令可以执行,失败后如何停止或回滚,谁能复盘完整轨迹。没有这些边界,Agent能力越强,风险敞口也越大。 别急着把 Agent当同事,它首先是一套受控软件 Harrison Chase:当 Agent用自然语言协作、表现得越来越像人,我们应该在多大程度上把它拟人化? 黄仁勋:自然语言让交互更顺畅,但不应模糊责任边界。Agent可以拥有角色和名字,却不能因为语气自信就被默认正确,也不能因为“像同事”就跳过权限与验收。
判断 Agent是否完成任务,要看外部证据:测试是否通过、Diff是否符合预期、数据是否写入正确位置、审批记录是否完整。
它说“已经完成”,只是一个待验证的输出。
拟人化可以帮助团队理解协作关系,但工程管理必须保持去人格化:每一次工具调用都有身份,每一次高风险动作都有策略,每一个最终结果都有验证器。 更多 AI意味着更多工作,前提是需求被重新打开
_“You’re taking all the mundane work”_
黄仁勋:AI先代替的,是大量机械、重复的工作。
黄仁勋对就业问题的回答延续了他一贯的供给逻辑:当生产一项数字服务的成本下降,社会不会只满足于原来的数量,而会产生更多此前做不起、排不上优先级的需求。
对程序员而言,真正变化的不是“还有没有代码”,而是工作清单的重排。
样板代码、格式转换和重复调试会更多交给Agent;任务定义、系统设计、评测构建、权限治理和异常处理会变得更重要。
这份判断并不保证每个岗位都原样保留。
软件供给扩大以后,新的工作会从“亲手完成每一步”转向“设计一套能持续完成任务的系统”。个人是否受益,取决于能不能跨过这次职责迁移。 最后缺的不是模型,而是一整套 Agent栈
工程全景中。模型负责推理,Harness负责计划、记忆和工具,运行时负责隔离与执行,Evals和Guardrails负责判断结果能否交付。少任何一层,Agent都可能只停在演示阶段。
这套结构也给出了团队的实施顺序:先用真实任务建立评测,再让模型和 Harness跑起来;随后补足沙箱、身份、日志和人工接管;最后才讨论规模化部署与成本优化。
黄仁勋总结开放模型
模型会继续变强,但企业真正需要长期经营的,是模型周围那套与自身数据、工具和责任边界绑定的工程环境。
黄仁勋所说的 Harness,可能就是下一代软件公司最核心的一层基础设施。
参考链接: