86
This paper achieves bidirectional acceleration of multimodal inference (Prefill and Decode) using Vision Token dynamic compression and SERE expert re-routing, reducing TTFT by 13% and TPOT by 16.5%. 
Yesterday 5269 words (about 22 min) View Source →
Sign in to highlight text and take notes as you read. Sign in now
原创 REDtech 2026-08-05 17:59 上海
“问一问”需要从多篇图文笔记中提炼关键信息,并持续生成准确、连贯的答案。面对多图输入带来的视觉 Token 膨胀和 MoE Decode 阶段的专家计算开销,我们从 Prefill 与 Decode 两端协同优化:利用动态 Vision Token 压缩减少冗余视觉输入,通过 SERE 专家重路由、关键专家保护与高性能 Kernel,减少 Decode 阶段的专家计算和权重搬运。在效果基本持平的前提下,30 图样本 TTFT 下降 13%,实际业务多图负载 TPOT 下降 16.5%。本文将介绍这套方案从算法设计、工程落地到 Bad Case 治理的完整实践。
!Image 4 1.1 多模态大模型推理流程 “问一问”是小红书面向搜索与提问场景的智能回答能力:系统结合用户问题与站内已有笔记,自动提炼多篇内容及图片中的关键点,生成简洁、可读的答案。此类请求通常包含多篇笔记、多张图片和较长上下文,对首 token 延迟与连续生成速度均提出较高要求。多模态大模型的在线推理通常分为 Prefill 与 Decode 两个阶段:Prefill 一次性处理文本和视觉输入,完成上下文编码;Decode 则基于已有上下文逐 token 生成结果。随着视觉 token 与 MoE 专家规模增长,两阶段的性能瓶颈逐渐分化,需要分别优化。 1.2 PD 分离架构与核心指标
* TTFT:主要受输入长度和 Prefill 计算影响
* TPOT:主要受 Decode 阶段访存与专家计算影响
如图所示,Prefill 在长序列下更偏计算密集:批内激活专家数从 8 增至 128,延迟仅变化 2.9%;Decode 更受权重搬运影响,激活专家数从 8 增至 64 时,MoE 延迟放大 3.7 倍。因此,我们分别采用 Vision Token 动态压缩与 SERE 专家重路由。两项优化均不改变模型权重,并且适配 PD 分离部署。
!Image 6 2.1 Vision Token 冗余
* 图片经过 Vision Encoder 和 Merger 后会被编码为大量 Vision Token。一张高分辨率图片可能需要成千上万个 Token 表示;在高分辨率、多图场景下,视觉序列会显著拉长,成为 TTFT 的核心计算瓶颈。
৹ ViT 深层特征已经在少量 Token 上聚合了主要信息,而 Decoder 对大量视觉 Token 的关注度较低,可据此压缩冗余 Token、提高有效信息密度。
* 实验进一步发现,不同图片和任务对压缩的敏感程度不同:OCR、表格和文档类图片包含更多细节,不能采用固定比例裁剪,而需要根据图片信息密度动态分配 Token 预算。
!Image 10 2.2 MoE 专家激活冗余
* MoE 的稀疏性按 token 计算,但线上服务按 batch 执行。请求越多,不同 token 命中的专家并集越大:在 Qwen3-30B-A3B 中,batch size 从 1 增至 128 时,单层平均激活专家数从 8 增至 93.4。
* Decode 单步计算量小、权重搬运占主导,属于典型的 Memory-Bound 阶段。批内激活专家越多,Fused MoE 需要读取的权重越多,TPOT 随之显著上升。
* 核心矛盾不是单个 token 的 Top-K,而是 batch 内专家并集膨胀。直接缩小 Top-K 虽然更快,却会破坏模型能力,因此需要利用专家相似性做动态、可回退的重路由。
!Image 13 3.1 VisionZip 算法原理
* VisionZip 的核心观察是:视觉编码器深层特征中,少量 dominant tokens 已经聚合了主要图像信息。算法基于 attention score 识别这些关键信息 token,保留高价值视觉内容,并裁剪冗余 vision tokens。压缩发生在进入 LLM 之前,因此可以从 Prefill 起点缩短序列长度,直接降低 TTFT。
* 多图场景下,不同图片的信息密度不同,固定比例裁剪容易误伤细节密集图片。我们通过实验,将多张图片的 tokens 放在同一重要性空间中竞争,发现OCR、文档、表格等信息密度更高的图片自然获得更多 token 预算。既压缩整体视觉序列,也保留了关键图片中的细节信息。
!Image 14 3.2 工程落地
我们进一步将 VisionZip 从论文方法转化为可部署的推理优化能力,并在 vLLM 中完成了 Qwen2.5-VL、Qwen3-VL 和 Qwen3.5 的动态视觉 Token 剪枝适配。
在视觉特征进入 LLM 前,从 ViT 指定层提取 Attention 统计信息,以每个视觉 Token 接收到的平均注意力衡量其信息聚合能力。与逐图片固定比例裁剪不同,同一请求内所有图片的视觉 Token 会进入统一候选池,在全局预算下共同参与token budget分配:内容复杂、信息密度更高的图片自动获得更多 Token 配额,内容简单或信息重复的图片则被更激进地压缩,从而在有限上下文中保留更多有效视觉信息。
在线执行阶段,方案复用 FlashAttention 已有的 Softmax LSE,通过定制 Triton Kernel 分块恢复局部 Attention Probability,并直接完成列方向重要性归约。整个过程无需生成完整 Attention Matrix,局部 Attention Block 仅驻留于片上存储,最终只输出每个 Token 的重要度分数,有效减少中间张量和显存读写开销。
同时,我们对vllm中的多模态序列管理与位置编码逻辑进行了适配,同步更新多模态输入长度、图片边界、原始空间索引以及 mRoPE 位置编码,使压缩后的视觉序列能够无缝接入原有 Prefill、KV Cache 和 Decode 链路。 3.3 效果与收益
在 Qwen3-VL-32B 的 30 图样本上,裁剪 40% vision tokens 时,TTFT 从 687 ms 降至 601 ms,下降 13%,多项业务效果指标基本无损。
在多图评测集 RAG-IGBench 上,保留 70% 和 60% vision tokens 时,Integrated Score 分别为 38.20% 和 37.48%,与 baseline 的 37.61% 基本持平。保留 50% 时 Integrated Score 降至 29.06%,说明高压缩率会影响细节理解和跨图对齐。
因此,我们增加了多图场景下token budget竞争实验,混合 1k OCRBench 和 1k CCBench。发现OCR 类细节敏感图片信息密度更高,在统一 top-k 竞争中会获得更多 token,OCRBench 图片保留率平均比 CCBench 高 13.6%。
case示例:
!Image 20 4.1 算法原理
* SERE(Similarity-based Expert Re-routing)不改模型权重、不重新训练,而是在 Decode 阶段按层、按 batch 动态重排专家路由。它先用少量通用数据离线计算层内专家的功能相似度,再在运行时识别可复用的专家计算。
* 每一层先汇总当前 batch 内所有 token 的 Top-K′ 主专家,形成共享候选集合;其余 Top-K 次级专家从整个 batch 的主专家中寻找最相似者,而不是只回到本 token 的主专家,从而真正缩小批内激活专家并集。
* 当次级专家与主专家的相似度超过阈值时,将其 token 重路由到最相似的主专家;相似度不足的关键专家仍按原路径计算。Router 权重保持不变,Prefill 也维持原始 Top-K。
!Image 21 4.2 工程落地
* 离线校准:使用少量通用文本采集各层专家激活,以 Frobenius 相似度生成逐层矩阵。矩阵只需计算一次,不依赖下游任务标签,也不需要重新训练模型。
* 在线执行:在推理框架中加入高性能 CUDA 重路由算子,一次完成 batch 主专家汇总、最相似专家查找和保护位判断,并直接衔接 Fused MoE,避免 Python/CUDA 往返和额外排序开销。
* 关键专家保护:以逐层 0/1 矩阵标记不可替代专家。算子只阻止“被保护的源专家”发生重路由,不改变其他专家的候选集合,也不会把其他专家吸附到被保护专家;CUDA Graph、PD 分离和原始部署参数均保持不变。 4.3 效果与收益
* 业务速度收益:在实际业务模型的多图负载上,以 1000 个请求、相同 QPS 统计,TPOT 从 8.5 ms 降至 7.1 ms,下降 16.5%。
* 效果验证:以下分别展示内部业务评测、公开模型效果保留,以及不同 QPS 下的加速结果。
* 内部业务评测表:在实际业务模型和内部评测数据集上,我们测试了输出幻觉、内容理解、大模型安全、输出格式和结构化内容生成等任务。加入 SERE K=2 与关键专家保护后,各类聚合指标整体与 Baseline 持平,说明端到端 TPOT 收益没有以业务效果回退为代价。
* 公开评测表:使用公开 Qwen3-30B-A3B 和 OpenCompass 公开数据集验证性能保留。原始 Top-8 模型平均准确率为 82.24;SERE K=2(ρ=0.5)达到 80.37,保留 97.7% 的原始效果,同时 TPOT 从 44.40 ms 降至 32.82 ms。直接固定 Top-2 的平均准确率仅 14.30,说明收益来自相似性引导的动态重路由,而不是简单少算专家。
* 在公开模型和数据集上,我们对比了不同 QPS 与 Top-K 下的批处理推理延迟。以 QPS=16 为例,CUDA 版 SERE 在 K=2 时将延迟从 Baseline 的 44.4 ms 降至 32.8 ms,约 1.4× 加速;K=1 时降至 28.0 ms,约 1.6× 加速。随着 QPS 接近服务饱和区,加速比有所收敛,说明该方法的主要收益来自 Decode 阶段减少专家权重搬运,而不是提升服务的饱和容量上限。
* Kernel 优化:初版重路由链路需要分步完成批内主专家汇总、相似专家查找和路由更新。我们将这些步骤融合到单个 CUDA Kernel 中,以 warp 协作完成候选专家扫描与规约;相似度矩阵和逐层 0/1 保护矩阵采用同形状连续布局,减少索引与访存开销;运行时假设保护矩阵始终存在,仅在源专家准备重路由时执行一次保护位判断,并移除额外排序、Host 同步、nullptr 检查和双路径分支。微基准中,优化后的重路由算子相对初版提升约 4.1×;该数字是算子级加速,端到端业务 TPOT 收益为 16.5%。
!Image 25 5.1 统一评测体系
* 文本内容:Rouge-1、Edit Distance
* 叙事顺序:Kendall Score
* 图文一致性:Alignment Score、CLIP Score
* 综合效果:Integrated Score 5.2 Vision Token 压缩边界
* 在 InfoVQA、复杂 OCR 和结构化表格等细节敏感任务中,高比例 Vision Token 压缩会暴露少量效果回归。分析发现问题主要来自细粒度文字、数字和局部区域被过度裁剪:模型仍能理解图像主体,但在字段级内容、表格单元格和跨图细节对齐上更容易丢失信息。
* 问题不在通用感知能力:DocVQA、MMBench 等任务在中低压缩率下整体稳定,退化主要集中在细节密度高、需要精确读取的输入。因此,默认采用裁剪 30%–40% 的稳健档位,对 InfoVQA、复杂 OCR、表格生成等场景降低压缩率。 5.3 专家重路由 Bad Case 修复
* 在结构化表格生成中,原始 SERE K=2 的少量回归主要发生在 Decode 后段:Top-8 尾部专家被逐层重路由后,微小偏差累积为字段或数字扩写。简单提高 K 或全局阈值会牺牲加速收益,因此我们基于完整业务样本构建逐层关键专家 0/1 保护矩阵;Kernel 仅保留受保护专家的原始路由,其余专家继续按 SERE 重路由。每层保护 16 个关键专家后,指标由 80.5% 恢复至 83.9%,接近 Baseline 的 84.9%,额外 TPOT 约为 0.1 ms。
!Image 26 6.1 阶段性收益
* Vision Token 压缩优化 TTFT:在 Qwen3-VL-32B 的 30 图样本上,裁剪 40% vision tokens 时,TTFT 从 687 ms 降至 601 ms,下降 13%,多项业务效果指标基本无损。
* 动态专家重路由优化 TPOT:SERE 在 Decode 阶段将相似的次级专家重路由到 batch 内已激活的主专家,减少专家权重搬运。公开 Qwen3-30B-A3B 上,保守 K=2 将 TPOT 从 44.4 ms 降至 32.8 ms(降低 26.1%,约 1.35×);业务多图负载在 1000 请求、相同 QPS 口径下由 8.5 ms 降至 7.1 ms(降低 16.5%)。
* 效果侧覆盖输出幻觉、内容理解、大模型安全、输出格式和结构化内容生成等任务,聚合指标整体与 Baseline 持平;关键专家保护仅增加约 0.1 ms TPOT。 6.2 后续方向
* 根据输入动态选择 Vision Token 压缩率
* 根据生成状态动态调整专家重路由强度
* 联合优化 Prefill、KV Cache 传输和 Decode
* 推广至更多多模态模型和业务场景
!Image 27 雨田
小红书大模型基建部引擎优化工程师,曾在CVPR,SIGGRAPH,ACL等算法领域顶会发表多篇论文。
主要研究方向:大模型推理引擎和加速算法,低精度量化,投机解码等。 吴俊彤
小红书大模型基建部Ace实习生,北京大学信息工程学院硕士在读,曾在ICLR,AAAI,EMNLP等算法领域顶会发表多篇论文,代表作包含SERE,BEAM,HYPIC等,
主要研究方向:MoE推理加速,动态MoE架构设计,位置无关缓存等。 楼康
小红书大模型基建部日常实习生,西北工业大学软件学院硕士在读,
主要研究方向:低精度量化,Vision Token压缩,在线策略蒸馏。
!Image 28 我们是小红书大模型基建部,负责公司级 AI 大模型全链路基础设施建设(Github主页https://github.com/redai-infra)。团队完整闭环「算力 - 框架 - 平台」,致力于解决产业级大模型生产效率问题,构建了 Relax RL训练框架、RedSlim 压缩工具、rLLM 推理框架、DirectLLM MaaS 系统和 QuickSilver 大模型平台等核心产品。我们致力于打造小红书面向 AI 时代的生产力底座,在训练、推理、压缩、MaaS、算力和 Agent 等方向持续建设领先、可靠、易用的 AI Infra 能力,让模型能力像水电一样稳定、普惠、低成本地服务社区、大商业、国际化、审核、企业智能等核心业务场景,并推动小红书在大模型 Infra 领域形成清晰的行业辨识度与长期技术影响力。 重点建设及探索方向:
- 长文多图千卡 RL 训练:面向长上下文、多模态与 Agentic 任务,探索万亿参数模型在千卡集群上的高稳定、高效率训练。
- Agentic 长文高效推理:面向 DeepResearch、多轮 Agent 等复杂推理场景,优化 KV Cache、PD 分离、请求调度与端到端成本。
- Efficient LLM 加速算法:探索量化、稀疏化、低秩压缩、蒸馏等技术,让大模型以更低显存、延迟和成本服务核心业务。
- 大模型 Token Hub:建设统一承载开源、商用、自研模型的公司级 MaaS 系统,实现多模型接入、智能路由与高可用服务。
- AI Native 大模型平台:构建覆盖算力管理、大模型生产、Agent 开发、工具调用、应用编排与业务接入的 AI Native 一体化平台。
- 万卡集群异构算力调度:面向 GPU / NPU / 多地域多卡型环境,建设统一算力底座,探索万卡训推混部、弹性伸缩、潮汐调度技术。
* 大模型训练框架研发工程师/专家: #小程序://小红书招聘/mtaP6UhbhMY7b0x
* 大模型高性能推理研发工程师/专家: #小程序://小红书招聘/iskxjdj6DBr6bKy
* 大模型推理服务(MaaS)研发工程师/专家: #小程序://小红书招聘/pETRL565EwIgIwH
* 大模型与 Agent 平台全栈工程师/专家: #小程序://小红书招聘/nOqJoZ3MrygkR5d
* 大模型 GPU 调度研发工程师/专家: #小程序://小红书招聘/DxzYx2RFhxWC3ne 校招&实习岗位:
* 【REDstar】大模型 RL Training Infra 工程师: #小程序://小红书招聘/qbyiYl22wQ5FFWC
* 【REDstar】大模型 Efficient Inference Infra 工程师: #小程序://小红书招聘/owXcjGEIjbnEKek
* 【Ace顶尖实习生】全模态Agent长程任务RL算法+工程Co-Design研究: #小程序://小红书招聘/gRnDppB9aC9kzTl
* 【Ace顶尖实习生】全模态大模型理解与生成轻量化及加速算法研究: #小程序://小红书招聘/LSzFvDjuOOpjoUn 欢迎关注大模型基建部小红书账号,我们将在上边分享更多 AI 基建技术探索与招聘信息~