本文详细介绍了得物智能客服从单 Agent 到多 Agent、Harness 架构的演进,以及数据飞轮、RL 训练和人工经验对齐等关键技术实践。
📝 详细摘要
文章围绕得物智能客服 Agent 的落地展开,首先分析传统客服的痛点及 Agent 化的必要性与挑战;接着详细阐述了从 Single-Agent 到 Multi-Agent 再到跨场景 Harness 架构的演进路径,包括总控、出话、评估器、润色四类 Agent 的角色划分及 SelectorGroupChat 动态调度机制;随后介绍了 PE 自动化流水线与 DPO 模型训练构成的数据飞轮,以及如何通过 LLM-as-a-Judge 生成偏好数据进行模型优化;接着讲解了 RL 决策训练框架,涉及 Cold-start SFT、Rule-Based-Reward、Model-Based-Reward、GRPO 算法、对抗 Reward Hacking 与 CoT 思考过程,以提升决策质量并控制灾难性遗忘;随后描述了基于百分制服务测评体系的模型蒸馏(CoT-RL 策略蒸馏、DPO 话术蒸馏、表情模块)实现人类经验对齐,以及半双工消息流控制方案和基于 Qwen3-4B 的分类模型实现精准消息合并/切分;最后总结了技术路线并展望了未来方向。全文结构清晰、技术细节丰富,兼具理论深度与工程实践价值。
💡 主要观点
- 从 Single-Agent 演进到 Multi-Agent,解决 Prompt 过长和串行 Pipeline 限制。 引入总控 Agent、出话 Agent、评估器 Agent 和润色 Agent,通过 SelectorGroupChat 动态调度,显著提升问题解决率。
💬 文章金句
- 听不懂人话、自作聪明:
- SOP 人工维护成本高:场景问法无法穷举。
- Prompt 过长,模型指令遵循能力有限。
- 通过 SelectorGroupChat 模式实现动态调度,解决率提升明显。
- 通过 DPO 模型训练飞轮,利用 'LLM-as-a-Judge' 搜集回流数据并重新训练:
📊 文章信息
AI 初评:87
来源:得物技术
作者:得物技术
分类:人工智能
语言:中文
阅读时间:10 分钟
字数:2478
标签: 智能客服, Agent 架构, 强化学习, 数据飞轮, 多智能体协作