Title: OpenAI 推出自动化红队模型 GPT-Red,专攻 GPT-5.6 提示注入漏洞 | BestBlogs.dev
URL Source: https://www.bestblogs.dev/article/bd7853a352?amp%3Butm_medium=feed&%3Butm_campaign=resources&%3Bentry=rss_article_item
Published Time: 2026-07-17 18:00:00
Markdown Content: 78
OpenAI launches the automated red‑team model GPT‑Red, specifically designed to automatically discover and fix prompt‑injection vulnerabilities in GPT‑5.6. 
Yesterday 1188 words (about 5 min) View Source →
Sign in to highlight text and take notes as you read. Sign in now
FreeBuf 2026-07-17 18:00 上海
GPT-Red:针对GPT-5.6 Sol的自动化红队工具,专攻提示注入漏洞。
OpenAI推出了GPT-Red,这是一个内部自动化红队模型,旨在发现并修复GPT-5.6中的提示注入漏洞。
这种方法旨在应对日益严峻的安全挑战。虽然人工红队演练很有价值,但它们无法以跟上日益先进的AI系统所需的规模生成对抗性测试用例。
提示注入指的是恶意指令隐藏在第三方内容(如网页、电子邮件、工具输出、代码仓库和本地文件)中,AI在处理这些内容时可能受到攻击。
最近,CrowdStrike公布了五种针对AI Agent的新型提示注入技术,攻击者能在其中植入隐藏指令,这些指令在特定条件或关键词激活前一直处于休眠状态。
攻击者可能利用这种方法绕过AI的预定任务,胁迫其泄露敏感信息、上传文件、转发凭证或执行未经授权的操作。
GPT-Red通过发送对抗性提示、观察目标模型的响应,并迭代开发更强的攻击手段,从而实现了测试流程的自动化。
!Image 5: GPT-Red攻击性能(来源:OpenAI)
OpenAI使用自对弈强化学习训练了GPT-Red,在这种训练中攻击模型与多个防御模型在模拟威胁场景中相互对抗。
Part 01
GPT-Red的对抗训练机制
GPT-Red在成功触发有效失效时获得奖励,而防御模型则在完成原始用户任务的同时抵御攻击时获得奖励。
!Image 6: 针对更强攻击的鲁棒性(来源:OpenAI)
训练环境模拟了真实的攻击面。根据具体场景,GPT-Red可能操纵网页横幅、电子邮件正文、本地文件或工具响应中的内容。这种设置使模型能够评估Agent工作流程中的直接和间接提示注入风险。
Part 02
GPT-Red对早期模型的攻击成果
OpenAI报告称,GPT-Red成功攻破了早期的内部模型和已发布的模型,包括GPT-5.5这样先进的版本。
!Image 7: GPT-Red攻击实时售货机Agent(来源:OpenAI)
GPT-Red攻击中获得的发现随后被用于训练GPT-5.6。该公司指出,GPT-5.6 Sol在其最具挑战性的直接提示注入基准测试中,失效次数比仅仅四个月前发布的最强已发布模型减少了六倍。
此外,OpenAI在基于Dziemian等人研究的间接提示注入竞技场内部副本上对GPT-Red进行了评估。据报道,GPT-Red在针对GPT-5.1的测试场景中成功率达到84%,而独立运作的人工红队成员仅达到13%。
在另一项测试中,GPT-Red攻击了一个支持AI的自动售货机Agent,成功执行了恶意操作,例如将高价值库存商品的价格改为0.50美元,以该价格添加更高价位的商品,以及取消其他客户的订单。
!Image 8: 数据泄露任务中的红队测试(来源:OpenAI)
OpenAI表示,这些问题已被披露,目前正在测试额外的安全防护措施。
Part 03
安全措施与改进效果
为降低风险,OpenAI将GPT-Red与已发布的模型保持隔离,以防止其训练过程中开发的攻击能力被暴露。
该公司报告称,在其受控环境中,GPT-Red的直接提示注入尝试中,GPT-5.6 Sol的失效比例仅为0.05%,同时保持其通用能力并避免过度拒绝行为。 推荐阅读 