浙江大学与上海人工智能实验室联合提出 IBISAgent,将生物医学图像分割建模为多步马尔可夫决策过程,通过交错的文本推理与点击动作替代隐式分割 token,结合冷启动 SFT 与 Agentic 强化学习,在多个基准上大幅超越现有方法。
📝 详细摘要
本文介绍了被 CVPR 2026 接收的 IBISAgent 框架,旨在解决现有医学多模态大模型在图像分割任务中的核心瓶颈:单次推理无法自我纠错、隐式分割 token 破坏语言推理能力、缺乏自主决策机制以及训练数据不足。IBISAgent 将分割重新定义为多步视觉决策过程,每一步由推理、行动、观测三个元素构成闭环,不引入任何新组件或隐式 token。研究团队构建了包含 456K 条高质量推理轨迹的冷启动数据集,通过两阶段训练(冷启动 SFT + Agentic 强化学习)实现自主多轮迭代精化。实验结果显示,IBISAgent 在域内测试集、域外泛化集和私有数据集上均大幅领先所有对比方法,平均 IoU 提升 35.13%,DSC 提升 37.58%,F1 提升 29.79%。消融实验证明冷启动 SFT、自我反思轨迹和 RL 三个方案缺一不可,细粒度的逐步反馈信号是驱动模型在质量与效率之间取得最优平衡的关键。
💡 主要观点
- IBISAgent 将分割任务建模为多步马尔可夫决策过程,以交错的文本推理与点击动作替代隐式 token。 该方法保留 MLLM 完整的语言推理能力,避免隐式 token 导致的灾难性遗忘,同时实现自主多轮迭代精化,使模型能像人类专家一样边看边想、边想边做。
💬 文章金句
- IBISAgent 将分割重新定义为多步视觉决策过程的 Agentic MLLM 框架。
- 模型每一步都能'看到'自己上一步分割的结果,形成视觉感知与语言推理的闭环。
- 细粒度的逐步反馈信号是驱动模型在质量与效率之间取得最优平衡的关键,单纯依赖最终结果奖励无法达到同等效果。
- 相比医学专用 MLLM 基线,平均 IoU 提升 35.13%,DSC 提升 37.58%,F1 提升 29.79%。
📊 文章信息
AI 初评:88
来源:量子位
作者:一水
分类:人工智能
语言:中文
阅读时间:11 分钟
字数:2709
标签: IBISAgent, 医学图像分割, 多模态大模型, 强化学习, Agentic MLLM