字节跳动安全研究团队提出 COVERT 框架,通过视觉管线精确重参数化与定制化调优,实现了兼顾安全性、模型效果与推理效率的 VLMaaS 隐私保护方案。
📝 详细摘要
本文介绍了字节跳动安全研究团队与南京大学合作提出的 COVERT 框架,该研究已被 ECCV 2026 收录。针对视觉语言模型即服务(VLMaaS)中用户上传图像可能导致的隐私泄露风险,COVERT 提出了协变混淆方案。该框架通过对视觉管线(卷积、ViT、语义投影)进行精确重参数化,使服务端能在混淆空间内完成等效推理;同时针对隐藏状态反演攻击,引入了效用感知的定制化调优。实验证明,COVERT 在保持极低精度损失(
💡 主要观点- COVERT 是首个面向 VLMaaS 场景的实用隐私保护框架。 它不仅覆盖视觉输入,还涵盖了文本输入与推理响应,解决了现有方案在安全性、效果与效率之间的权衡难题。
💬 文章金句
- 随着视觉语言模型(VLMs)在医疗、金融、办公自动化等高敏场景中的落地,用户上传的图片、截图、票据和身份信息正在成为云端推理服务中的关键隐私风险。
- COVERT 将多模态隐私保护从高开销的安全计算方案推进到更具实际部署可能性的系统形态。
📊 文章信息
AI 初评:88
来源:字节跳动技术团队
作者:字节跳动技术团队
分类:人工智能
语言:中文
阅读时间:12 分钟
字数:2929
标签: AI Security, Vision-Language Models, Privacy Preservation, ECCV, VLMaaS