← 回總覽

小红书 dots 团队提出 Vision-OPD,让多模态大模型“看清细节”!

📅 2026-07-28 19:00 小红书技术REDtech 人工智能 7 分鐘 7600 字 評分: 89
Multimodal LLM Vision-OPD Self-Distillation Fine-grained Visual Understanding Computer Vision
📌 一句话摘要 小红书 dots 团队提出 Vision-OPD 框架,通过在线自蒸馏技术,让多模态大模型无需外部工具即可实现对图像细节的精准识别。 📝 详细摘要 针对多模态大模型在处理细粒度视觉问题时存在的「区域到全局鸿沟」问题,小红书 dots 团队提出了 Vision-OPD(Vision On-Policy Distillation)框架。该框架的核心思想是利用模型在裁剪放大后的「特权视角」下的表现作为监督信号,通过在线采样与 token 级蒸馏,将局部细节的感知能力内化到全图输入的单次前向推理中。实验证明,仅使用约 6.2K 条全自动合成数据,Vision-OPD 就能让 9B

89

The Xiaohongshu dots team introduced the Vision-OPD framework, which uses online self-distillation to enable multimodal LLMs to accurately identify image details without external tools. ![Image 1: 小红书技术REDtech小红书技术REDtech](https://www.bestblogs.dev/articles?sourceid=fb78bd "View More From This Source")

Today 4026 words (about 17 min) View Source →

Sign in to highlight text and take notes as you read. Sign in now

原创 REDtech 2026-07-28 19:00 上海

!Image 2

一次前向把细节看清的在线自蒸馏框架

!Image 3

多模态大模型(Multimodal LLM)如今在通用看图说话上已经相当能打,但只要问题的答案藏在图里一小块决定性的细节上,它们就常常给出一个错误的回答。

举个例子: “图中人物戴的护耳是什么颜色?”

!Image 4

这道题人盯着完整大图也未必能一眼答对——那块护耳藏在画面的一小块区域,不凑近看根本分辨不清颜色。当下顶尖的多模态大模型同样频频翻车:给它完整大图,它信誓旦旦答“黑色”,而正确答案其实是“绿色”。

为突破这一瓶颈,小红书 dots团队提出了Vision-OPD(Vision On-Policy Distillation)。仅用约6.2K条全自动合成数据,便让 9B 模型在多个细粒度视觉理解基准上取得SOTA超越 Gemini-3.5-Flash、Gemini-3.1-Pro 和 GPT-5.4 等顶尖闭源模型。

!Image 5

论文标题:

Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation

!Image 6

在 _V*_ Bench、ZoomBench、HR-Bench 4K、HR-Bench 8K、MME-RealWorld-EN、MME-RealWorld-CN 六个细粒度视觉理解基准上的平均准确率(%)。Vision-OPD-9B 以 79.7 总体第一,Vision-OPD-4B 也达 77.1。

!Image 7

模型为什么会在这种细节题上翻车?有一个有意思的现象:同一个模型,看裁剪放大后的局部图,回答细粒度问题的准确率,明显高于看完整大图。这道坎叫作「区域到全局鸿沟」

还是以前面那道题为例(基于 Qwen3.5-9B):

* 给完整大图:模型被全局场景带偏,答“黑色”——

* 只给裁剪放大后的关键区域:决定性证据被凸显出来,模型答“绿色”——

!Image 8

这并不是个例。系统评测显示,区域输入的准确率持续高于全局输入约 18~22 个百分点,即便是体量大得多的开源模型和闭源模型(GLM-4.6V、GPT-5.4、Gemini-3.1-Pro),也都表现出同样显著的差距。

!Image 9

这说明一个关键事实:单纯堆参数规模,并不能弥合这道鸿沟。模型的细粒度瓶颈,往往不在“认不认得出”,而在“盯不盯得住”。

那要怎么弥合这道鸿沟?最近流行的"Thinking-with-Images"(边想边看)方法给模型配上裁剪、放大的视觉工具,让它在推理时主动去抠局部,确实有效——但代价是反复编码图像、反复调用模型,推理开销大幅增加

于是问题来了: 能不能把“放大关键区域、让证据从背景里凸显出来”这个好处,通过训练直接内化进模型,让它一次前向就能从整图里用上细粒度证据,而不必在推理时动用任何工具?

!Image 10

既然模型看局部一向比看全局强,那么它看裁剪图时的表现,就是一份现成的、可以拿来提升全图表现的特权监督信号——用前者去教后者,把“放大”的收益内化成单次前向的能力。

由此,团队提出Vision-OPD,一个面向细粒度视觉理解的区域到全局在线自蒸馏框架。 2.1 训练框架

它的精髓在于,从同一个模型里派生出两个“视角不同”的策略:

* 裁剪教师(Teacher):只看那块对准了关键证据的裁剪放大图,这是它的特权视角;

* 全图学生(Student):看完整大图。

!Image 11

学生先在全图上自己生成回答轨迹(在线采样);对学生写下的每一段前缀,Vision-OPD 分别算出裁剪教师和全图学生的 logits 分布,再把两者的散度压到最小。这样一来,模型就在学生自己的生成轨迹上,把教师的裁剪特权行为迁移给了全图策略——不用外部教师、不用真值标签、不用奖励验证器、推理时也不用任何工具。

这套“在线采样 + token 级蒸馏”的组合,好处有两层:

* 在线采样:训练前缀就是学生自己写出来的序列,训练和推理的状态分布对得上,避开了传统离线蒸馏里“前缀对不上、误差越滚越大”的毛病;

* 稠密 token 级监督:每个 token 都拿到有意义的梯度,不像 GRPO 这类强化学习只有稀疏的序列级奖励,哪怕一批采样样本恰好全对或全错,训练也不会停摆。 2.2 数据合成

数据从哪来?团队用一条全自动流水线,从无标注图像里造出三元组 (全图、裁剪图、问题),总共合成约6.2K条:

  • 对原图做物体识别和分割,挑出面积占比很小(最可能藏着细粒度证据)的区域;
  • 让模型给每个区域生成一个“光看这块就能答”的问题;
  • 把区域的边界框叠回原图,再加一句空间约束(比如“只关注红框里的物体”),得到学生输入
  • 把这块区域裁剪、放大,得到教师输入
因为裁剪图是从无标注图像里全自动抽出来的,这套方法能适配任意图像语料。

!Image 12 3.1 与 SOTA 模型对比

团队把 Vision-OPD 用在Qwen3.5-4B/9B上,在V* Bench、ZoomBench、HR-Bench 4K/8K、MME-RealWorld(EN/CN)等细粒度视觉理解基准上评测。

!Image 13 Vision-OPD-9B 拿下 79.68 的平均分,在所有对比模型中总体第一:

• 超过闭源的Gemini-3.5-Flash、Gemini-3.1-Pro

• 超过体量大得多的开源模型,比如Qwen3.5-397B

• 也超过各类"Thinking-with-Images"智能体模型,而 Vision-OPD 只需对图片做一次前向Vision-OPD-4B 的平均分也有 77.07,超过GPT-5.4、Kimi-K2.6,说明 Vision-OPD 确实能把细粒度视觉理解的本事,有效地“装”进现有模型里。 3.2 专精却不偏科

更难得的是它专精却不偏科。在非细粒度的视觉任务(MMVP、CV-Bench、MMStar、POPE)上,它保持了原模型的看图与推理能力,没有出现专项微调常见的“学了新的、忘了旧的”。

!Image 14 3.3 鸿沟在训练中逐渐收敛

那么 Vision-OPD 究竟有没有真的缩小这道 「区域到全局鸿沟」?训练曲线给出了直接的证据:随着训练进行,模型的区域到全局鸿沟逐渐缩小。这正印证了 Vision-OPD 让模型学会了直接从全图里识别出“裁剪才看得到”的证据,把放大聚焦的本事内化进了一次前向。

!Image 15

!Image 16

Vision-OPD 背后的洞见很简单:大模型的细粒度瓶颈,往往不在“认不认得出”,而在“盯不盯得住”;而模型自己在裁剪条件下的特权感知,恰好可以拿来监督它的全图行为。

它从同一个模型派生出裁剪教师和全图学生,在学生的在线采样轨迹上做 token 级自蒸馏,不用更强的外部教师、不用真值标签、不用奖励验证器,推理时也不用任何工具。仅凭约 6.2K 条全自动合成数据,就让一个 9B 模型在多个细粒度视觉理解基准上,超过了闭源模型、更大的开源模型以及 "Thinking-with-Images" 智能体模型,同时不丢通用能力。

它提供了一条可复现、低成本的细粒度视觉理解训练路径,让多模态大模型从“看个大概”走向“看清细节”

!Image 17

* 袁千皓,小红书 dots 后训练团队算法实习生,现为中国科学院软件研究所中文信息处理实验室的在读博士生,在 ICML、ACL、ICCV 等自然语言处理、机器学习、计算机视觉领域顶级会议上发表数篇一作论文,主要研究方向为大语言模型后训练。

* 连轩,小红书 dots 后训练团队算法工程师,在 ICLR、ICML、ACL、AAAI 等自然语言处理、机器学习领域顶级会议上发表数篇论文,主要研究方向为大语言模型后训练。

!Image 18 团队介绍:

我们是 dots 基座大模型的 Post-train 团队。我们相信,模型不只是记住世界,而是真正学会在真实世界中思考、行动与自我成长。团队聚焦可验证奖励 RL、长程 agentic 智能、综合推理与自我演进等最前沿的方向,构建下一代能在复杂真实任务中可靠工作、并持续自我迭代的基座模型。 工作职责:

在以下一个或多个方向进行深度攻关。 1. Frontier Research

* Self Evolving:提升模型进行机器学习与大模型优化的能力,探索以 AI 加速 AI 研发的新范式:让模型参与到自身的训练、部署及 Agent 调度机制的迭代中,把改进的对象从“模型本身”抬升到“产生模型的研发流程”,构建可递归的能力增益回路,持续寻找下一代能力增长曲线。

* Lifelong Learning:探索模型“学会学习”的 Meta 能力:让模型在与陌生、开放环境的在线交互中持续更新自身内部状态,无需重新训练即可积累经验,不断提升长期的 decision making 与任务完成能力。

* Scalable Oversight:在难以 verify 的 fuzzy / 开放式任务上,突破人类监督的扩展性瓶颈:研究可扩展的监督、自我评估与自我修正机制,让监督信号的质量能随模型能力一同增长,降低对外部人工反馈的依赖。 2. RL Algorithms

* 研究面向长程、多轮、稀疏奖励场景的 RL 算法,系统性解决信用分配、训练稳定性、探索效率等核心问题;

* 设计更有效、更鲁棒的奖励与评估信号,缓解 reward hacking、验证误差与奖励噪声对训练的干扰;

* 研发 Adaptive Thinking,使模型按任务复杂度动态调整思考深度,在保证效果的同时实现高效推理;

* 探索新的优化目标与训练范式,显著提升长程、稀疏奖励任务的收敛速度与样本效率;

* 与 infra / 工程团队协同,推进 rollout 加速、环境稳定性、训推一致性等工程化瓶颈的解决。 3. Agentic Intelligence

* 在 Proactive Agent、CLI/GUI 计算机控制,高价值专业知识任务、深度信息获取、 软件工程等任务上,提升模型的 Agentic 能力,让模型在高复杂度真实任务上达到行业前沿水平;

* 构建复杂、多样、多模态、可验证的 RL 环境,在复杂 harness 上开展 blackbox RL 训练,提升模型在长程、多工具、真实环境中的规划、执行与反思能力;

* 研究超长程任务下的多智能体协作、长程记忆与跨任务经验的积累复用;

* 建设可规模化的 Agent 训练环境与评测体系。 4. Reasoning

* 探索 RL Scaling Law,提升模型 general 的真实推理与反思能力(而非仅在特定任务或 Benchmark 上的表现);

* 在人类智能密度最高的领域(如顶尖数学、竞赛编程、前沿科学等)持续突破,向达到乃至超过人类顶尖水平的方向迈进;

* 推动推理与工具使用、真实环境的结合,并提升模型思考效率及 adaptive thinking 的能力。 任职资格 基础要求

* 基础能力:扎实的机器学习与深度学习基础,对大模型训练全流程(pretrain / mid-train / post-train)有深入理解;

* 解决问题:逻辑严密的分析能力,能从复杂现象中抽象出底层问题并给出系统性方案;

* 专业能力:深刻理解并能解决 RL 训练中的核心问题,包括 Reward Hacking、Training Stability、Exploration Efficiency,以及长程信用分配、环境噪声 / 非-policy 负向 reward、训推一致性等真实工程化挑战;

* 动手能力:优秀的算法实现能力与工程性能感知,具备优秀的数据敏锐度,能从数据中提炼出让模型效果突破的 insight。 加分项

* 研究成果:在 NeurIPS、ICLR、ICML、CVPR、ACL 等顶级会议发表过高水平成果,或主导过知名开源项目者优先;

* 工程与系统:熟悉大规模 RL 训练基础设施(rollout / 采样加速、sandbox 与 trajectory replay、训推框架),或有 agent harness / 可验证环境搭建经验者优先;

* 敏锐的直觉和探索精神:具备极强的好奇心,能在高度不确定的无人区中通过严谨实验寻找确定性;不满足于优化已有 Benchmark,而对“模型是否真的在理解、在进化”保持极度敏感。 欢迎感兴趣的朋友发送简历至:zhangyawen@xiaohongshu.com 投递链接:小红书招聘

!Image 19

查看原文 → 發佈: 2026-07-28 19:00:00 收錄: 2026-07-28 22:00:58

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。