← 回總覽

顶会入选 | COVERT —— 面向视觉语言模型的隐私保护推理框架入选 ECCV 2026

📅 2026-07-27 19:00 字节跳动技术团队 人工智能 1 分鐘 1206 字 評分: 88
AI Security Vision-Language Models Privacy Preservation ECCV VLMaaS
📌 一句话摘要 字节跳动安全研究团队提出 COVERT 框架,通过视觉管线精确重参数化与定制化调优,实现了兼顾安全性、模型效果与推理效率的 VLMaaS 隐私保护方案。 📝 详细摘要 本文介绍了字节跳动安全研究团队与南京大学合作提出的 COVERT 框架,该研究已被 ECCV 2026 收录。针对视觉语言模型即服务(VLMaaS)中用户上传图像可能导致的隐私泄露风险,COVERT 提出了协变混淆方案。该框架通过对视觉管线(卷积、ViT、语义投影)进行精确重参数化,使服务端能在混淆空间内完成等效推理;同时针对隐藏状态反演攻击,引入了效用感知的定制化调优。实验证明,COVERT 在保持极低精度

📌 一句话摘要

字节跳动安全研究团队提出 COVERT 框架,通过视觉管线精确重参数化与定制化调优,实现了兼顾安全性、模型效果与推理效率的 VLMaaS 隐私保护方案。

📝 详细摘要

本文介绍了字节跳动安全研究团队与南京大学合作提出的 COVERT 框架,该研究已被 ECCV 2026 收录。针对视觉语言模型即服务(VLMaaS)中用户上传图像可能导致的隐私泄露风险,COVERT 提出了协变混淆方案。该框架通过对视觉管线(卷积、ViT、语义投影)进行精确重参数化,使服务端能在混淆空间内完成等效推理;同时针对隐藏状态反演攻击,引入了效用感知的定制化调优。实验证明,COVERT 在保持极低精度损失(

💡 主要观点

- COVERT 是首个面向 VLMaaS 场景的实用隐私保护框架。 它不仅覆盖视觉输入,还涵盖了文本输入与推理响应,解决了现有方案在安全性、效果与效率之间的权衡难题。

通过视觉管线的精确重参数化实现等价推理。 针对卷积、ViT 及语义投影模块设计可抵消的参数变换,确保服务端在混淆空间内计算结果与原模型对齐。
引入效用感知的定制调优以防御反演攻击。 通过在 ViT 注意力层注入受控噪声并进行轻量微调,在维持模型任务效果的同时,大幅降低了攻击者恢复空间结构的能力。
在高性能推理与高安全性之间取得了良好平衡。 实验显示其在 Qwen2.5-VL 等模型上精度下降控制在 3% 以内,且在 vLLM 上的吞吐开销仅增加约 6%。

💬 文章金句

- 随着视觉语言模型(VLMs)在医疗、金融、办公自动化等高敏场景中的落地,用户上传的图片、截图、票据和身份信息正在成为云端推理服务中的关键隐私风险。

  • COVERT 将多模态隐私保护从高开销的安全计算方案推进到更具实际部署可能性的系统形态。

📊 文章信息

AI 初评:88

来源:字节跳动技术团队

作者:字节跳动技术团队

分类:人工智能

语言:中文

阅读时间:12 分钟

字数:2929

标签: AI Security, Vision-Language Models, Privacy Preservation, ECCV, VLMaaS

阅读完整文章

查看原文 → 發佈: 2026-07-27 19:00:00 收錄: 2026-07-28 00:00:58

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。