OpenAI推出自动化红队模型GPT-Red,专攻GPT-5.6提示注入漏洞

admin 2026-07-26 05:02:16 网络安全文章 来源:ZONE.CI 全球网 0 阅读模式

文章总结: OpenAI推出自动化红队模型GPT-Red,专攻GPT-5.6提示注入漏洞。该模型通过自对弈强化学习训练,成功攻破早期模型,包括GPT-5.5。GPT-Red的发现用于训练GPT-5.6,使其在直接提示注入基准测试中失效次数减少六倍。安全措施包括隔离模型,防止攻击能力暴露。建议使用自动化红队测试提升AI系统安全性。 综合评分: 85 文章分类: AI安全,红队,漏洞分析,安全工具,渗透测试


cover_image

OpenAI推出自动化红队模型GPT-Red,专攻GPT-5.6提示注入漏洞

FreeBuf

2026年7月17日 18:00 上海

在小说阅读器读本章

去阅读

OpenAI推出了GPT-Red,这是一个内部自动化红队模型,旨在发现并修复GPT-5.6中的提示注入漏洞。

这种方法旨在应对日益严峻的安全挑战。虽然人工红队演练很有价值,但它们无法以跟上日益先进的AI系统所需的规模生成对抗性测试用例。

提示注入指的是恶意指令隐藏在第三方内容(如网页、电子邮件、工具输出、代码仓库和本地文件)中,AI在处理这些内容时可能受到攻击。

最近,CrowdStrike公布了五种针对AI Agent的新型提示注入技术,攻击者能在其中植入隐藏指令,这些指令在特定条件或关键词激活前一直处于休眠状态。

攻击者可能利用这种方法绕过AI的预定任务,胁迫其泄露敏感信息、上传文件、转发凭证或执行未经授权的操作。

GPT-Red通过发送对抗性提示、观察目标模型的响应,并迭代开发更强的攻击手段,从而实现了测试流程的自动化。

OpenAI使用自对弈强化学习训练了GPT-Red,在这种训练中攻击模型与多个防御模型在模拟威胁场景中相互对抗。

Part01

GPT-Red的对抗训练机制

GPT-Red在成功触发有效失效时获得奖励,而防御模型则在完成原始用户任务的同时抵御攻击时获得奖励。

训练环境模拟了真实的攻击面。根据具体场景,GPT-Red可能操纵网页横幅、电子邮件正文、本地文件或工具响应中的内容。这种设置使模型能够评估Agent工作流程中的直接和间接提示注入风险。

Part02

GPT-Red对早期模型的攻击成果

OpenAI报告称,GPT-Red成功攻破了早期的内部模型和已发布的模型,包括GPT-5.5这样先进的版本。

GPT-Red攻击中获得的发现随后被用于训练GPT-5.6。该公司指出,GPT-5.6 Sol在其最具挑战性的直接提示注入基准测试中,失效次数比仅仅四个月前发布的最强已发布模型减少了六倍。

此外,OpenAI在基于Dziemian等人研究的间接提示注入竞技场内部副本上对GPT-Red进行了评估。据报道,GPT-Red在针对GPT-5.1的测试场景中成功率达到84%,而独立运作的人工红队成员仅达到13%。

在另一项测试中,GPT-Red攻击了一个支持AI的自动售货机Agent,成功执行了恶意操作,例如将高价值库存商品的价格改为0.50美元,以该价格添加更高价位的商品,以及取消其他客户的订单。

OpenAI表示,这些问题已被披露,目前正在测试额外的安全防护措施。

Part03

安全措施与改进效果

为降低风险,OpenAI将GPT-Red与已发布的模型保持隔离,以防止其训练过程中开发的攻击能力被暴露。

该公司报告称,在其受控环境中,GPT-Red的直接提示注入尝试中,GPT-5.6 Sol的失效比例仅为0.05%,同时保持其通用能力并避免过度拒绝行为。

参考来源:

GPT-Red – A Red Teamer to Find Prompt Injection Vulnerabilities in GPT 5.6 Sol

GPT-Red – A Red Teamer to Find Prompt Injection Vulnerabilities in GPT 5.6 Sol

推荐阅读

#

#

#

#

#

#

#

#

#

#

#

#

#

#

#

电报讨论


免责声明:

本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。

任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。

本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我

本文转载自:FreeBuf 《OpenAI推出自动化红队模型GPT-Red,专攻GPT-5.6提示注入漏洞》

评论:0   参与:  0