本文介绍淘宝直播主播 Agent 的 Harness 工程实战,通过六元组定义、分层架构与八项落地实践,将概率性模型能力转化为高风险直播场景中可用、可控、可演化的工业级产品。
📝 详细摘要
本文是淘宝直播技术团队关于主播 Agent Harness 工程化建设的一手实战分享。文章首先将 Harness 形式化为执行循环、工具注册、上下文管理、状态存储、生命周期钩子、评估接口六元组,并确立框架层兜底安全与状态、业务层专注 Skill 开发的分层架构。存储层面采用逻辑统一、物理分治:会话存 MySQL、记忆存 Hologres(向量+全文+标量混合检索)、技能存 GitLab。实战部分覆盖上下文工程(分层压缩、Reducer 状态模式、大上下文卸载)、工具调用强约束与幂等设计、生命周期 Hook 注入、沙箱执行隔离、五层纵深防御、异常降级、以 DAG 全局规划替代 ReAct 单步决策的 PlanEngine,以及离线+在线+主播满意度的三层评测体系。文章用主播直播的高风险、长程、多话题场景作为压力测试,给出了将概率性模型能力转化为可控工业级产品的完整工程方法论。
💡 主要观点
- Harness 是把模型变成可用产品的一层工程化骨架,可通过六元组定义。 执行循环、工具注册、上下文管理、状态存储、生命周期钩子、评估接口六个维度构成完整定义,任何 Agent 项目都可对照检查缺失项。
💬 文章金句
- 模型能力是概率的、会漂移的、偶尔会失控的,真正让 Agent 可用、可控、可演化的,是模型外面那一层工程化的“骨架”(Harness)
- 人负责控制方向、设定边界与检查点,AI 负责在边界内自主推进。
- 模型再强,没有河道也会泛滥成灾;河道修好了,哪怕水流有波动,整体也是可控的。
- LLM 只负责决策(产生 Action),Reducer 函数负责状态变更(纯函数、确定性)。
📊 文章信息
AI 初评:90
来源:大淘宝技术
作者:大淘宝技术
分类:人工智能
语言:中文
阅读时间:35 分钟
字数:8642
标签: AI Agent, Harness 工程, LLM, 上下文工程, Agent 安全