← 回總覽

淘宝主播 Agent 的 Harness 工程实战

📅 2026-08-07 11:58 大淘宝技术 人工智能 2 分鐘 1621 字 評分: 90
AI Agent Harness 工程 LLM 上下文工程 Agent 安全
📌 一句话摘要 本文介绍淘宝直播主播 Agent 的 Harness 工程实战,通过六元组定义、分层架构与八项落地实践,将概率性模型能力转化为高风险直播场景中可用、可控、可演化的工业级产品。 📝 详细摘要 本文是淘宝直播技术团队关于主播 Agent Harness 工程化建设的一手实战分享。文章首先将 Harness 形式化为执行循环、工具注册、上下文管理、状态存储、生命周期钩子、评估接口六元组,并确立框架层兜底安全与状态、业务层专注 Skill 开发的分层架构。存储层面采用逻辑统一、物理分治:会话存 MySQL、记忆存 Hologres(向量+全文+标量混合检索)、技能存 GitLab。

📌 一句话摘要

本文介绍淘宝直播主播 Agent 的 Harness 工程实战,通过六元组定义、分层架构与八项落地实践,将概率性模型能力转化为高风险直播场景中可用、可控、可演化的工业级产品。

📝 详细摘要

本文是淘宝直播技术团队关于主播 Agent Harness 工程化建设的一手实战分享。文章首先将 Harness 形式化为执行循环、工具注册、上下文管理、状态存储、生命周期钩子、评估接口六元组,并确立框架层兜底安全与状态、业务层专注 Skill 开发的分层架构。存储层面采用逻辑统一、物理分治:会话存 MySQL、记忆存 Hologres(向量+全文+标量混合检索)、技能存 GitLab。实战部分覆盖上下文工程(分层压缩、Reducer 状态模式、大上下文卸载)、工具调用强约束与幂等设计、生命周期 Hook 注入、沙箱执行隔离、五层纵深防御、异常降级、以 DAG 全局规划替代 ReAct 单步决策的 PlanEngine,以及离线+在线+主播满意度的三层评测体系。文章用主播直播的高风险、长程、多话题场景作为压力测试,给出了将概率性模型能力转化为可控工业级产品的完整工程方法论。

💡 主要观点

- Harness 是把模型变成可用产品的一层工程化骨架,可通过六元组定义。 执行循环、工具注册、上下文管理、状态存储、生命周期钩子、评估接口六个维度构成完整定义,任何 Agent 项目都可对照检查缺失项。

主播 Agent 采用框架层兜底、业务层只写 Skill 的分层架构。 框架层承载安全、状态、上下文与可观测等不变工程能力,业务方用 Skill 声明能力与风险,新需求迭代不必动框架。
上下文工程用分层压缩、Reducer 状态模式和外部卸载解决漂移与膨胀。 分层压缩保留结构、Reducer 让 LLM 只看干净状态快照而非大海捞针,超大内容走外部存储按需消费。
安全采用从 Prompt 边界到执行审计的五层纵深防御。 Prompt 硬编码、Schema 强约束、审批分层、执行验证、审计记录层层兜底,适合高风险低容错的直播场景。
用 DAG 全局规划替代 ReAct 单步决策,提升长程复合指令的恢复性与效率。 结合三层 Checkpoint、并行调度、增量 Replan 与 SubAgent 隔离,对比实验显示执行成功率与效率优于原生 ReAct。

💬 文章金句

- 模型能力是概率的、会漂移的、偶尔会失控的,真正让 Agent 可用、可控、可演化的,是模型外面那一层工程化的“骨架”(Harness)

  • 人负责控制方向、设定边界与检查点,AI 负责在边界内自主推进。
  • 模型再强,没有河道也会泛滥成灾;河道修好了,哪怕水流有波动,整体也是可控的。
  • LLM 只负责决策(产生 Action),Reducer 函数负责状态变更(纯函数、确定性)。

📊 文章信息

AI 初评:90

来源:大淘宝技术

作者:大淘宝技术

分类:人工智能

语言:中文

阅读时间:35 分钟

字数:8642

标签: AI Agent, Harness 工程, LLM, 上下文工程, Agent 安全

阅读完整文章

查看原文 → 發佈: 2026-08-07 11:58:00 收錄: 2026-08-07 20:00:47

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。