← 回總覽

蚂蚁阿福:从 0 到生产的医疗 Agent 工程化落地

📅 2026-07-14 14:21 InfoQ 中文 人工智能 2 分鐘 1410 字 評分: 88
医疗 Agent LLM Agentic RAG 评测体系 上下文工程
📌 一句话摘要 本文分享蚂蚁集团医疗 Agent '阿福' 的工程化落地经验,涵盖评测体系、上下文管理、Agentic RAG、记忆机制及推理优化等关键实践。 📝 详细摘要 文章基于蚂蚁集团医疗健康资深专家在 QCon 2026 的分享,系统阐述了医疗 Agent 的研发范式与挑战。作者指出医疗场景对确定性、可解释性与合规性的极高要求,并分享了从 Badcase 驱动的评测体系建设、长上下文处理与压缩策略、Agentic RAG 解决多跳检索问题,到病例级长期记忆与隐私合规管理的完整技术方案。此外,文章还深入探讨了 KV cache 优化、Speculative Decoding 等推理加

📌 一句话摘要

本文分享蚂蚁集团医疗 Agent '阿福' 的工程化落地经验,涵盖评测体系、上下文管理、Agentic RAG、记忆机制及推理优化等关键实践。

📝 详细摘要

文章基于蚂蚁集团医疗健康资深专家在 QCon 2026 的分享,系统阐述了医疗 Agent 的研发范式与挑战。作者指出医疗场景对确定性、可解释性与合规性的极高要求,并分享了从 Badcase 驱动的评测体系建设、长上下文处理与压缩策略、Agentic RAG 解决多跳检索问题,到病例级长期记忆与隐私合规管理的完整技术方案。此外,文章还深入探讨了 KV cache 优化、Speculative Decoding 等推理加速技术,以及 Agent RL 训练框架的解耦实践。

💡 主要观点

- 医疗 Agent 追求确定性,容错空间极小。 代码 Agent 出错可重试,但医疗诊断错误可能导致悲剧,需严格遵循循证逻辑,而非简单追求输出一致。

评测集建设应从 Badcase 起步,动态迭代。 Badcase 是最重要的资产,需分拣归类,定期加入 Benchmark 以防止过拟合,并利用自动化评估将耗时从 12 天缩短至小时级。
上下文管理需解决长文本丢失与污染问题。 采用结构化与非结构化混合策略、渐进式阅读及上下文压缩,优化 32K-64K 上下文效果,避免指南文档污染主上下文。
Agentic RAG 通过多跳检索解决复杂医疗问题。 利用知识图谱合成多跳问题,结合循证医学检索与信息融合,解决如“肝功能不好加发烧”等复杂查询的时效性与准确性问题。
记忆系统需处理长期数据、冲突融合与隐私合规。 建立病例级长期记忆与遗忘机制,通过角色区分与冲突确认保障数据安全,确保不同用户画像下的个性化决策。

💬 文章金句

- 医疗 Agent 与其他 Agent 的根本差异在于:如果是代码 Agent,代码出错 retry 就行,但医疗对专业性的要求极高,一个致命回答背后可能就是一个家庭的悲剧。

  • 有了渠道,要把这些 badcase 动态分拣,是产品需求还是功能不完善,慢慢分解再走迭代。如果是模型能力或系统框架不足,就要放到 Benchmark 里作为定期发布项。
  • Agent 最大的问题就是概念非常多,但最终决定 Agent 的不是概念,而是每个细节你做得扎不扎实。

📊 文章信息

AI 初评:88

来源:InfoQ 中文

作者:InfoQ 中文

分类:人工智能

语言:中文

阅读时间:33 分钟

字数:8014

标签: 医疗 Agent, LLM, Agentic RAG, 评测体系, 上下文工程

阅读完整文章

查看原文 → 發佈: 2026-07-14 14:21:00 收錄: 2026-07-14 20:00:38

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。