← 回總覽

国产多模态 Agent 拿下医学分割 SOTA!不用改模型、不加 token

📅 2026-04-22 15:17 一水 人工智能 2 分鐘 1446 字 評分: 88
IBISAgent 医学图像分割 多模态大模型 强化学习 Agentic MLLM
📌 一句话摘要 浙江大学与上海人工智能实验室联合提出 IBISAgent,将生物医学图像分割建模为多步马尔可夫决策过程,通过交错的文本推理与点击动作替代隐式分割 token,结合冷启动 SFT 与 Agentic 强化学习,在多个基准上大幅超越现有方法。 📝 详细摘要 本文介绍了被 CVPR 2026 接收的 IBISAgent 框架,旨在解决现有医学多模态大模型在图像分割任务中的核心瓶颈:单次推理无法自我纠错、隐式分割 token 破坏语言推理能力、缺乏自主决策机制以及训练数据不足。IBISAgent 将分割重新定义为多步视觉决策过程,每一步由推理、行动、观测三个元素构成闭环,不引入任何

📌 一句话摘要

浙江大学与上海人工智能实验室联合提出 IBISAgent,将生物医学图像分割建模为多步马尔可夫决策过程,通过交错的文本推理与点击动作替代隐式分割 token,结合冷启动 SFT 与 Agentic 强化学习,在多个基准上大幅超越现有方法。

📝 详细摘要

本文介绍了被 CVPR 2026 接收的 IBISAgent 框架,旨在解决现有医学多模态大模型在图像分割任务中的核心瓶颈:单次推理无法自我纠错、隐式分割 token 破坏语言推理能力、缺乏自主决策机制以及训练数据不足。IBISAgent 将分割重新定义为多步视觉决策过程,每一步由推理、行动、观测三个元素构成闭环,不引入任何新组件或隐式 token。研究团队构建了包含 456K 条高质量推理轨迹的冷启动数据集,通过两阶段训练(冷启动 SFT + Agentic 强化学习)实现自主多轮迭代精化。实验结果显示,IBISAgent 在域内测试集、域外泛化集和私有数据集上均大幅领先所有对比方法,平均 IoU 提升 35.13%,DSC 提升 37.58%,F1 提升 29.79%。消融实验证明冷启动 SFT、自我反思轨迹和 RL 三个方案缺一不可,细粒度的逐步反馈信号是驱动模型在质量与效率之间取得最优平衡的关键。

💡 主要观点

- IBISAgent 将分割任务建模为多步马尔可夫决策过程,以交错的文本推理与点击动作替代隐式 token。 该方法保留 MLLM 完整的语言推理能力,避免隐式 token 导致的灾难性遗忘,同时实现自主多轮迭代精化,使模型能像人类专家一样边看边想、边想边做。

两阶段训练框架结合冷启动 SFT 与 Agentic 强化学习,驱动模型超越简单模仿。 冷启动 SFT 在自动生成的推理轨迹上建立像素级推理先验;Agentic 强化学习以细粒度奖励信号驱动模型自主探索更优决策策略,实现性能的显著跃升。
细粒度的逐步反馈奖励设计是模型在质量与效率间取得最优平衡的关键。 区域点击奖励与渐进式分割改进奖励引导模型将每次点击落在语义有效区域并带来实质性改善,最终将平均交互步数从 11.29 步压缩至 4.26 步,同时维持最高分割质量。

💬 文章金句

- IBISAgent 将分割重新定义为多步视觉决策过程的 Agentic MLLM 框架。

  • 模型每一步都能'看到'自己上一步分割的结果,形成视觉感知与语言推理的闭环。
  • 细粒度的逐步反馈信号是驱动模型在质量与效率之间取得最优平衡的关键,单纯依赖最终结果奖励无法达到同等效果。
  • 相比医学专用 MLLM 基线,平均 IoU 提升 35.13%,DSC 提升 37.58%,F1 提升 29.79%。

📊 文章信息

AI 初评:88

来源:量子位

作者:一水

分类:人工智能

语言:中文

阅读时间:11 分钟

字数:2709

标签: IBISAgent, 医学图像分割, 多模态大模型, 强化学习, Agentic MLLM

阅读完整文章

查看原文 → 發佈: 2026-04-22 15:17:04 收錄: 2026-04-22 18:00:51

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。