← 回總覽

Claude Code 砸的坑,蚂蚁安全在尝试填上

📅 2026-07-13 14:53 鹭羽 人工智能 2 分鐘 1496 字 評分: 88
AI安全 智能体安全 多模态安全 开源框架 SOTA
📌 一句话摘要 文章介绍蚂蚁开源的 AI 安全框架 SingGuard-NSFA 与 SingGuard,说明其从内容审核向行为与感知安全的转变及技术细节。 📝 详细摘要 文章指出,随着大模型能够调用工具、执行代码,AI 安全的焦点已从单纯的内容审核转向对智能体行为和多模态感知的全链路防护。蚂蚁安全团队基于多年支付安全与风控积累,先后发现 OpenClaw 漏洞、开源 ClawAegis,如今推出两款开源框架:SingGuard-NSFA 通过在请求拦截和响应兜底两端设卡、采用 NSFA 风险分类体系及生成式/判别式双模推理,实现可审计的行为安全与低延迟实时拦截;SingGuard 则将安

📌 一句话摘要

文章介绍蚂蚁开源的 AI 安全框架 SingGuard-NSFA 与 SingGuard,说明其从内容审核向行为与感知安全的转变及技术细节。

📝 详细摘要

文章指出,随着大模型能够调用工具、执行代码,AI 安全的焦点已从单纯的内容审核转向对智能体行为和多模态感知的全链路防护。蚂蚁安全团队基于多年支付安全与风控积累,先后发现 OpenClaw 漏洞、开源 ClawAegis,如今推出两款开源框架:SingGuard-NSFA 通过在请求拦截和响应兜底两端设卡、采用 NSFA 风险分类体系及生成式/判别式双模推理,实现可审计的行为安全与低延迟实时拦截;SingGuard 则将安全规则做为运行时输入,支持动态红线、快慢思考协同以及 RI-Mask 多规则并行加速。两款框架在多个基准上均达到 SOTA,体现了从漏洞挖掘到底层安全基础设施的系统性布局。

💡 主要观点

- AI 安全重心从内容审核转向行为与感知的全链路防护 文章指出,随着大模型能够调用工具、执行代码,仅审查输出已不足,需要在执行前拦截风险并监控多模态输入。

SingGuard-NSFA 采用双模推理护栏,实现生成式与判别式两种风险拦截模式 生成式提供可审计的链式推理;判别式延迟低至 45‑57ms,适合实时在线拦截;外挂分类头便于快速扩展新风险。
SingGuard 将安全规则做为运行时输入,支持动态红线及快慢思考协同 不同业务可现场下发规则,模型按规则逐条判定;快思考秒判,慢思考深度推理,配合 RI-Mask 实现多规则并行提速 5 倍以上。
蚂蚁安全的技术积累与开源实践形成从漏洞挖掘到底层框架的闭环 从支付安全到 AI 安全,先发现 OpenClaw 漏洞,再开源 ClawAegis,如今发布 SingGuard 系列,展示持续的安全能力沉淀。

💬 文章金句

- 滥用工具、恶意代码生成、提示注入等诸如此类的行为风险,早已不是一两个补丁就能彻底解决的。

  • 面对新的风险形态,一个越来越明显的趋势是,行业开始把注意力从'漏洞修补'转向'安全框架'本身。
  • 它的核心思想是把安全检查前置到智能体执行之前,然后在请求拦截和响应兜底两端同时设卡,共同发力把防线从文本合规推进到行为安全。
  • 所谓兵来将挡水来土掩,那么未知风险和不断变化的规则又如何解决呢?
  • SingGuard-NSFA 在 3 大评测基准(用户请求安全、模型响应安全、跨数据集泛化)上均取得 SOTA,最小的 0.8B 模型就能比肩 8B 竞品,9B 大小更是在泛化上达到 91.29% F1,精度与召回更加均衡。

📊 文章信息

AI 初评:88

来源:量子位

作者:鹭羽

分类:人工智能

语言:中文

阅读时间:11 分钟

字数:2550

标签: AI安全, 智能体安全, 多模态安全, 开源框架, SOTA

阅读完整文章

查看原文 → 發佈: 2026-07-13 14:53:56 收錄: 2026-07-13 20:00:38

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。