← 回總覽

OpenAI 推出自动化红队模型 GPT-Red,专攻 GPT-5.6 提示注入漏洞

📅 2026-07-17 18:00 FreeBuf 人工智能 3 分鐘 3391 字 評分: 78
AI安全 红队 提示注入 GPT-5.6 OpenAI
📌 一句话摘要 OpenAI 推出自动化红队模型 GPT‑Red,专门用于自动发现并修复 GPT‑5.6 中的提示注入漏洞。 📝 详细摘要 文章介绍了 OpenAI 最新推出的自动化红队模型 GPT‑Red,该模型通过自对弈强化学习生成对抗性提示,以检测 GPT‑5.6 中的提示注入漏洞。文章详细描述了 GPT‑Red 的训练机制、在早期模型和已发布模型上的攻击成果,以及在间接提示注入竞技场中的高成功率。文中还提到 OpenAI 已将 GPT‑Red 与已发布模型隔离,并报告称在受控环境中 GPT‑5.6 对直接提示注入的失效率降至 0.05%。文章引用了 OpenAI 的官方表述和外部链

Title: OpenAI 推出自动化红队模型 GPT-Red,专攻 GPT-5.6 提示注入漏洞 | BestBlogs.dev

URL Source: https://www.bestblogs.dev/article/bd7853a352?amp%3Butm_medium=feed&%3Butm_campaign=resources&%3Bentry=rss_article_item

Published Time: 2026-07-17 18:00:00

Markdown Content: 78

OpenAI launches the automated red‑team model GPT‑Red, specifically designed to automatically discover and fix prompt‑injection vulnerabilities in GPT‑5.6. ![Image 1: FreeBufFreeBuf](https://www.bestblogs.dev/articles?sourceid=SRC_05367037 "View More From This Source")

Yesterday 1188 words (about 5 min) View Source →

Sign in to highlight text and take notes as you read. Sign in now

FreeBuf 2026-07-17 18:00 上海

!Image 2

GPT-Red:针对GPT-5.6 Sol的自动化红队工具,专攻提示注入漏洞。

!Image 3: FreeBuf

!Image 4

OpenAI推出了GPT-Red,这是一个内部自动化红队模型,旨在发现并修复GPT-5.6中的提示注入漏洞。

这种方法旨在应对日益严峻的安全挑战。虽然人工红队演练很有价值,但它们无法以跟上日益先进的AI系统所需的规模生成对抗性测试用例。

提示注入指的是恶意指令隐藏在第三方内容(如网页、电子邮件、工具输出、代码仓库和本地文件)中,AI在处理这些内容时可能受到攻击。

最近,CrowdStrike公布了五种针对AI Agent的新型提示注入技术,攻击者能在其中植入隐藏指令,这些指令在特定条件或关键词激活前一直处于休眠状态。

攻击者可能利用这种方法绕过AI的预定任务,胁迫其泄露敏感信息、上传文件、转发凭证或执行未经授权的操作。

GPT-Red通过发送对抗性提示、观察目标模型的响应,并迭代开发更强的攻击手段,从而实现了测试流程的自动化。

!Image 5: GPT-Red攻击性能(来源:OpenAI)

OpenAI使用自对弈强化学习训练了GPT-Red,在这种训练中攻击模型与多个防御模型在模拟威胁场景中相互对抗。

Part 01

GPT-Red的对抗训练机制

GPT-Red在成功触发有效失效时获得奖励,而防御模型则在完成原始用户任务的同时抵御攻击时获得奖励。

!Image 6: 针对更强攻击的鲁棒性(来源:OpenAI)

训练环境模拟了真实的攻击面。根据具体场景,GPT-Red可能操纵网页横幅、电子邮件正文、本地文件或工具响应中的内容。这种设置使模型能够评估Agent工作流程中的直接和间接提示注入风险。

Part 02

GPT-Red对早期模型的攻击成果

OpenAI报告称,GPT-Red成功攻破了早期的内部模型和已发布的模型,包括GPT-5.5这样先进的版本。

!Image 7: GPT-Red攻击实时售货机Agent(来源:OpenAI)

GPT-Red攻击中获得的发现随后被用于训练GPT-5.6。该公司指出,GPT-5.6 Sol在其最具挑战性的直接提示注入基准测试中,失效次数比仅仅四个月前发布的最强已发布模型减少了六倍。

此外,OpenAI在基于Dziemian等人研究的间接提示注入竞技场内部副本上对GPT-Red进行了评估。据报道,GPT-Red在针对GPT-5.1的测试场景中成功率达到84%,而独立运作的人工红队成员仅达到13%。

在另一项测试中,GPT-Red攻击了一个支持AI的自动售货机Agent,成功执行了恶意操作,例如将高价值库存商品的价格改为0.50美元,以该价格添加更高价位的商品,以及取消其他客户的订单。

!Image 8: 数据泄露任务中的红队测试(来源:OpenAI)

OpenAI表示,这些问题已被披露,目前正在测试额外的安全防护措施。

Part 03

安全措施与改进效果

为降低风险,OpenAI将GPT-Red与已发布的模型保持隔离,以防止其训练过程中开发的攻击能力被暴露。

该公司报告称,在其受控环境中,GPT-Red的直接提示注入尝试中,GPT-5.6 Sol的失效比例仅为0.05%,同时保持其通用能力并避免过度拒绝行为。 推荐阅读 ![Image 9](https://mp.weixin.qq.com/s?__biz=MjM5NjA0NjgyMA==&mid=2651342454&idx=1&sn=30ae51eba566ed3187493e4e817d3124&scene=21#wechat_redirect)

电报讨论

![Image 10](https://www.bestblogs.dev/article/bd7853a352?amp%3Butm_medium=feed&%3Butm_campaign=resources&%3Bentry=rss_article_item)

!Image 11: 扫码加入AI安全交流群

!Image 12: 下载FreeBuf知识大陆APP 阅读原文

查看原文 → 發佈: 2026-07-17 18:00:00 收錄: 2026-07-18 02:00:50

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。