← 回總覽

从"机械应答"到"服务伙伴":得物高可控智能客服的 Agent 工程实践|AICon 演讲整理

📅 2026-07-15 18:30 得物技术 人工智能 2 分鐘 1823 字 評分: 87
智能客服 Agent 架构 强化学习 数据飞轮 多智能体协作
📌 一句话摘要 本文详细介绍了得物智能客服从单 Agent 到多 Agent、Harness 架构的演进,以及数据飞轮、RL 训练和人工经验对齐等关键技术实践。 📝 详细摘要 文章围绕得物智能客服 Agent 的落地展开,首先分析传统客服的痛点及 Agent 化的必要性与挑战;接着详细阐述了从 Single-Agent 到 Multi-Agent 再到跨场景 Harness 架构的演进路径,包括总控、出话、评估器、润色四类 Agent 的角色划分及 SelectorGroupChat 动态调度机制;随后介绍了 PE 自动化流水线与 DPO 模型训练构成的数据飞轮,以及如何通过 LLM-as

📌 一句话摘要

本文详细介绍了得物智能客服从单 Agent 到多 Agent、Harness 架构的演进,以及数据飞轮、RL 训练和人工经验对齐等关键技术实践。

📝 详细摘要

文章围绕得物智能客服 Agent 的落地展开,首先分析传统客服的痛点及 Agent 化的必要性与挑战;接着详细阐述了从 Single-Agent 到 Multi-Agent 再到跨场景 Harness 架构的演进路径,包括总控、出话、评估器、润色四类 Agent 的角色划分及 SelectorGroupChat 动态调度机制;随后介绍了 PE 自动化流水线与 DPO 模型训练构成的数据飞轮,以及如何通过 LLM-as-a-Judge 生成偏好数据进行模型优化;接着讲解了 RL 决策训练框架,涉及 Cold-start SFT、Rule-Based-Reward、Model-Based-Reward、GRPO 算法、对抗 Reward Hacking 与 CoT 思考过程,以提升决策质量并控制灾难性遗忘;随后描述了基于百分制服务测评体系的模型蒸馏(CoT-RL 策略蒸馏、DPO 话术蒸馏、表情模块)实现人类经验对齐,以及半双工消息流控制方案和基于 Qwen3-4B 的分类模型实现精准消息合并/切分;最后总结了技术路线并展望了未来方向。全文结构清晰、技术细节丰富,兼具理论深度与工程实践价值。

💡 主要观点

- 从 Single-Agent 演进到 Multi-Agent,解决 Prompt 过长和串行 Pipeline 限制。 引入总控 Agent、出话 Agent、评估器 Agent 和润色 Agent,通过 SelectorGroupChat 动态调度,显著提升问题解决率。

提出跨场景 Harness 架构,实现跨会话记忆、上下文压缩和总控 Agent 统一管理。 该架构支持数据飞轮驱动模型持续优化,并正在探索 Skill 自动化生成,以提升跨场景复用能力。
构建 PE 自动化流水线与 DPO 模型训练的数据飞轮,利用 LLM-as-a-Judge 生成偏好数据。 通过对比数据抽取、LLM 提供修改建议、人工 Review、离线跑测和在线实验闭环,持续优化 Prompt 并提升模型对齐程度。
采用 RL 决策训练框架,结合 Rule-Based-Reward、Model-Based-Reward 和 GRPO 算法进行训练。 通过 Cold-start SFT 预热、对抗 Reward Hacking、加入 CoT 思考过程以及动态学习率控制,有效减少灾难性遗忘并提升决策质量。
通过百分制服务测评体系和模型蒸馏(CoT-RL 策略蒸馏、DPO 话术蒸馏、表情模块)实现人类经验对齐;采用半双工消息流控制和分类模型实现精准消息合并/切分。 模型评分接近 Top5% 人工水平,半双工设计防止 Agent 回复被打断,分类基于 Qwen3-4B 实现多消息处理策略。

💬 文章金句

- 听不懂人话、自作聪明:

  • SOP 人工维护成本高:场景问法无法穷举。
  • Prompt 过长,模型指令遵循能力有限。
  • 通过 SelectorGroupChat 模式实现动态调度,解决率提升明显
  • 通过 DPO 模型训练飞轮,利用 'LLM-as-a-Judge' 搜集回流数据并重新训练:

📊 文章信息

AI 初评:87

来源:得物技术

作者:得物技术

分类:人工智能

语言:中文

阅读时间:10 分钟

字数:2478

标签: 智能客服, Agent 架构, 强化学习, 数据飞轮, 多智能体协作

阅读完整文章

查看原文 → 發佈: 2026-07-15 18:30:00 收錄: 2026-07-16 00:00:09

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。