89
The Xiaohongshu dots team introduced the Vision-OPD framework, which uses online self-distillation to enable multimodal LLMs to accurately identify image details without external tools. 
Today 4026 words (about 17 min) View Source →
Sign in to highlight text and take notes as you read. Sign in now
原创 REDtech 2026-07-28 19:00 上海
一次前向把细节看清的在线自蒸馏框架
多模态大模型(Multimodal LLM)如今在通用看图说话上已经相当能打,但只要问题的答案藏在图里一小块决定性的细节上,它们就常常给出一个错误的回答。
举个例子: “图中人物戴的护耳是什么颜色?”
这道题人盯着完整大图也未必能一眼答对——那块护耳藏在画面的一小块区域,不凑近看根本分辨不清颜色。当下顶尖的多模态大模型同样频频翻车:给它完整大图,它信誓旦旦答“黑色”,而正确答案其实是“绿色”。
为突破这一瓶颈,小红书 dots团队提出了Vision-OPD(Vision On-Policy Distillation)。仅用约6.2K条全自动合成数据,便让 9B 模型在多个细粒度视觉理解基准上取得SOTA,超越 Gemini-3.5-Flash、Gemini-3.1-Pro 和 GPT-5.4 等顶尖闭源模型。
论文标题:
Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation
在 _V*_ Bench、ZoomBench、HR-Bench 4K、HR-Bench 8K、MME-RealWorld-EN、MME-RealWorld-CN 六个细粒度视觉理解基准上的平均准确率(%)。Vision-OPD-9B 以 79.7 总体第一,Vision-OPD-4B 也达 77.1。
模型为什么会在这种细节题上翻车?有一个有意思的现象:同一个模型,看裁剪放大后的局部图,回答细粒度问题的准确率,明显高于看完整大图。这道坎叫作「区域到全局鸿沟」。
还是以前面那道题为例(基于 Qwen3.5-9B):
* 给完整大图:模型被全局场景带偏,答“黑色”——错;
* 只给裁剪放大后的关键区域:决定性证据被凸显出来,模型答“绿色”——对。
这并不是个例。系统评测显示,区域输入的准确率持续高于全局输入约 18~22 个百分点,即便是体量大得多的开源模型和闭源模型(GLM-4.6V、GPT-5.4、Gemini-3.1-Pro),也都表现出同样显著的差距。
这说明一个关键事实:单纯堆参数规模,并不能弥合这道鸿沟。模型的细粒度瓶颈,往往不在“认不认得出”,而在“盯不盯得住”。
那要怎么弥合这道鸿沟?最近流行的"Thinking-with-Images"(边想边看)方法给模型配上裁剪、放大的视觉工具,让它在推理时主动去抠局部,确实有效——但代价是反复编码图像、反复调用模型,推理开销大幅增加。
于是问题来了: 能不能把“放大关键区域、让证据从背景里凸显出来”这个好处,通过训练直接内化进模型,让它一次前向就能从整图里用上细粒度证据,而不必在推理时动用任何工具?
既然模型看局部一向比看全局强,那么它看裁剪图时的表现,就是一份现成的、可以拿来提升全图表现的特权监督信号——用前者去教后者,把“放大”的收益内化成单次前向的能力。
由此,团队提出Vision-OPD,一个面向细粒度视觉理解的区域到全局在线自蒸馏框架。 2.1 训练框架
它的精髓在于,从同一个模型里派生出两个“视角不同”的策略:
* 裁剪教师(Teacher):只看那块对准了关键证据的裁剪放大图,这是它的特权视角;
* 全图学生(Student):看完整大图。
学生先在全图上自己生成回答轨迹(在线采样);对学生写下的每一段前缀,Vision-OPD 分别算出裁剪教师和全图学生的 logits 分布,再把两者的散度压到最小。这样一来,模型就在学生自己的生成轨迹上,把教师的裁剪特权行为迁移给了全图策略——不用外部教师、不用真值标签、不用奖励验证器、推理时也不用任何工具。
这套“在线采样 + token 级蒸馏”的组合,好处有两层:
* 在线采样:训练前缀就是学生自己写出来的序列,训练和推理的状态分布对得上,避开了传统离线蒸馏里“前缀对不上、误差越滚越大”的毛病;
* 稠密 token 级监督:每个 token 都拿到有意义的梯度,不像 GRPO 这类强化学习只有稀疏的序列级奖励,哪怕一批采样样本恰好全对或全错,训练也不会停摆。 2.2 数据合成
数据从哪来?团队用一条全自动流水线,从无标注图像里造出三元组 (全图、裁剪图、问题),总共合成约6.2K条:
- 对原图做物体识别和分割,挑出面积占比很小(最可能藏着细粒度证据)的区域;
- 让模型给每个区域生成一个“光看这块就能答”的问题;
- 把区域的边界框叠回原图,再加一句空间约束(比如“只关注红框里的物体”),得到学生输入;
- 把这块区域裁剪、放大2×,得到教师输入。
!Image 12 3.1 与 SOTA 模型对比
团队把 Vision-OPD 用在Qwen3.5-4B/9B上,在V* Bench、ZoomBench、HR-Bench 4K/8K、MME-RealWorld(EN/CN)等细粒度视觉理解基准上评测。
!Image 13 Vision-OPD-9B 拿下 79.68 的平均分,在所有对比模型中总体第一:
• 超过闭源的Gemini-3.5-Flash、Gemini-3.1-Pro;
• 超过体量大得多的开源模型,比如Qwen3.5-397B;
• 也超过各类"Thinking-with-Images"智能体模型,而 Vision-OPD 只需对图片做一次前向。 Vision-OPD-4B 的平均分也有 77.07,超过GPT-5.4、Kimi-K2.6,说明 Vision-OPD 确实能把细粒度视觉理解的本事,有效地“装”进现有模型里。 3.2 专精却不偏科
更难得的是它专精却不偏科。在非细粒度的视觉任务(MMVP、CV-Bench、MMStar、POPE)上,它保持了原模型的看图与推理能力,没有出现专项微调常见的“学了新的、忘了旧的”。
!Image 14 3.3 鸿沟在训练中逐渐收敛
那么 Vision-OPD 究竟有没有真的缩小这道 「区域到全局鸿沟」?训练曲线给出了直接的证据:随着训练进行,模型的区域到全局鸿沟逐渐缩小。这正印证了 Vision-OPD 让模型学会了直接从全图里识别出“裁剪才看得到”的证据,把放大聚焦的本事内化进了一次前向。
Vision-OPD 背后的洞见很简单:大模型的细粒度瓶颈,往往不在“认不认得出”,而在“盯不盯得住”;而模型自己在裁剪条件下的特权感知,恰好可以拿来监督它的全图行为。
它从同一个模型派生出裁剪教师和全图学生,在学生的在线采样轨迹上做 token 级自蒸馏,不用更强的外部教师、不用真值标签、不用奖励验证器,推理时也不用任何工具。仅凭约 6.2K 条全自动合成数据,就让一个 9B 模型在多个细粒度视觉理解基准上,超过了闭源模型、更大的开源模型以及 "Thinking-with-Images" 智能体模型,同时不丢通用能力。
它提供了一条可复现、低成本的细粒度视觉理解训练路径,让多模态大模型从“看个大概”走向“看清细节”。
* 袁千皓,小红书 dots 后训练团队算法实习生,现为中国科学院软件研究所中文信息处理实验室的在读博士生,在 ICML、ACL、ICCV 等自然语言处理、机器学习、计算机视觉领域顶级会议上发表数篇一作论文,主要研究方向为大语言模型后训练。
* 连轩,小红书 dots 后训练团队算法工程师,在 ICLR、ICML、ACL、AAAI 等自然语言处理、机器学习领域顶级会议上发表数篇论文,主要研究方向为大语言模型后训练。
!Image 18 团队介绍:
我们是 dots 基座大模型的 Post-train 团队。我们相信,模型不只是记住世界,而是真正学会在真实世界中思考、行动与自我成长。团队聚焦可验证奖励 RL、长程 agentic 智能、综合推理与自我演进等最前沿的方向,构建下一代能在复杂真实任务中可靠工作、并持续自我迭代的基座模型。 工作职责:
在以下一个或多个方向进行深度攻关。 1. Frontier Research
* Self Evolving:提升模型进行机器学习与大模型优化的能力,探索以 AI 加速 AI 研发的新范式:让模型参与到自身的训练、部署及 Agent 调度机制的迭代中,把改进的对象从“模型本身”抬升到“产生模型的研发流程”,构建可递归的能力增益回路,持续寻找下一代能力增长曲线。
* Lifelong Learning:探索模型“学会学习”的 Meta 能力:让模型在与陌生、开放环境的在线交互中持续更新自身内部状态,无需重新训练即可积累经验,不断提升长期的 decision making 与任务完成能力。
* Scalable Oversight:在难以 verify 的 fuzzy / 开放式任务上,突破人类监督的扩展性瓶颈:研究可扩展的监督、自我评估与自我修正机制,让监督信号的质量能随模型能力一同增长,降低对外部人工反馈的依赖。 2. RL Algorithms
* 研究面向长程、多轮、稀疏奖励场景的 RL 算法,系统性解决信用分配、训练稳定性、探索效率等核心问题;
* 设计更有效、更鲁棒的奖励与评估信号,缓解 reward hacking、验证误差与奖励噪声对训练的干扰;
* 研发 Adaptive Thinking,使模型按任务复杂度动态调整思考深度,在保证效果的同时实现高效推理;
* 探索新的优化目标与训练范式,显著提升长程、稀疏奖励任务的收敛速度与样本效率;
* 与 infra / 工程团队协同,推进 rollout 加速、环境稳定性、训推一致性等工程化瓶颈的解决。 3. Agentic Intelligence
* 在 Proactive Agent、CLI/GUI 计算机控制,高价值专业知识任务、深度信息获取、 软件工程等任务上,提升模型的 Agentic 能力,让模型在高复杂度真实任务上达到行业前沿水平;
* 构建复杂、多样、多模态、可验证的 RL 环境,在复杂 harness 上开展 blackbox RL 训练,提升模型在长程、多工具、真实环境中的规划、执行与反思能力;
* 研究超长程任务下的多智能体协作、长程记忆与跨任务经验的积累复用;
* 建设可规模化的 Agent 训练环境与评测体系。 4. Reasoning
* 探索 RL Scaling Law,提升模型 general 的真实推理与反思能力(而非仅在特定任务或 Benchmark 上的表现);
* 在人类智能密度最高的领域(如顶尖数学、竞赛编程、前沿科学等)持续突破,向达到乃至超过人类顶尖水平的方向迈进;
* 推动推理与工具使用、真实环境的结合,并提升模型思考效率及 adaptive thinking 的能力。 任职资格 基础要求
* 基础能力:扎实的机器学习与深度学习基础,对大模型训练全流程(pretrain / mid-train / post-train)有深入理解;
* 解决问题:逻辑严密的分析能力,能从复杂现象中抽象出底层问题并给出系统性方案;
* 专业能力:深刻理解并能解决 RL 训练中的核心问题,包括 Reward Hacking、Training Stability、Exploration Efficiency,以及长程信用分配、环境噪声 / 非-policy 负向 reward、训推一致性等真实工程化挑战;
* 动手能力:优秀的算法实现能力与工程性能感知,具备优秀的数据敏锐度,能从数据中提炼出让模型效果突破的 insight。 加分项
* 研究成果:在 NeurIPS、ICLR、ICML、CVPR、ACL 等顶级会议发表过高水平成果,或主导过知名开源项目者优先;
* 工程与系统:熟悉大规模 RL 训练基础设施(rollout / 采样加速、sandbox 与 trajectory replay、训推框架),或有 agent harness / 可验证环境搭建经验者优先;
* 敏锐的直觉和探索精神:具备极强的好奇心,能在高度不确定的无人区中通过严谨实验寻找确定性;不满足于优化已有 Benchmark,而对“模型是否真的在理解、在进化”保持极度敏感。 欢迎感兴趣的朋友发送简历至:zhangyawen@xiaohongshu.com 投递链接:小红书招聘