文章介绍蚂蚁开源的 AI 安全框架 SingGuard-NSFA 与 SingGuard,说明其从内容审核向行为与感知安全的转变及技术细节。
📝 详细摘要
文章指出,随着大模型能够调用工具、执行代码,AI 安全的焦点已从单纯的内容审核转向对智能体行为和多模态感知的全链路防护。蚂蚁安全团队基于多年支付安全与风控积累,先后发现 OpenClaw 漏洞、开源 ClawAegis,如今推出两款开源框架:SingGuard-NSFA 通过在请求拦截和响应兜底两端设卡、采用 NSFA 风险分类体系及生成式/判别式双模推理,实现可审计的行为安全与低延迟实时拦截;SingGuard 则将安全规则做为运行时输入,支持动态红线、快慢思考协同以及 RI-Mask 多规则并行加速。两款框架在多个基准上均达到 SOTA,体现了从漏洞挖掘到底层安全基础设施的系统性布局。
💡 主要观点
- AI 安全重心从内容审核转向行为与感知的全链路防护 文章指出,随着大模型能够调用工具、执行代码,仅审查输出已不足,需要在执行前拦截风险并监控多模态输入。
💬 文章金句
- 滥用工具、恶意代码生成、提示注入等诸如此类的行为风险,早已不是一两个补丁就能彻底解决的。
- 面对新的风险形态,一个越来越明显的趋势是,行业开始把注意力从'漏洞修补'转向'安全框架'本身。
- 它的核心思想是把安全检查前置到智能体执行之前,然后在请求拦截和响应兜底两端同时设卡,共同发力把防线从文本合规推进到行为安全。
- 所谓兵来将挡水来土掩,那么未知风险和不断变化的规则又如何解决呢?
- SingGuard-NSFA 在 3 大评测基准(用户请求安全、模型响应安全、跨数据集泛化)上均取得 SOTA,最小的 0.8B 模型就能比肩 8B 竞品,9B 大小更是在泛化上达到 91.29% F1,精度与召回更加均衡。
📊 文章信息
AI 初评:88
来源:量子位
作者:鹭羽
分类:人工智能
语言:中文
阅读时间:11 分钟
字数:2550
标签: AI安全, 智能体安全, 多模态安全, 开源框架, SOTA