文章总结: OpenAI推出自动化红队模型GPT-Red,专攻GPT-5.6提示注入漏洞。该模型通过自对弈强化学习训练,成功攻破早期模型,包括GPT-5.5。GPT-Red的发现用于训练GPT-5.6,使其在直接提示注入基准测试中失效次数减少六倍。安全措施包括隔离模型,防止攻击能力暴露。建议使用自动化红队测试提升AI系统安全性。 综合评分: 85 文章分类: AI安全,红队,漏洞分析,安全工具,渗透测试
OpenAI推出自动化红队模型GPT-Red,专攻GPT-5.6提示注入漏洞
FreeBuf
2026年7月17日 18:00 上海
在小说阅读器读本章
去阅读
OpenAI推出了GPT-Red,这是一个内部自动化红队模型,旨在发现并修复GPT-5.6中的提示注入漏洞。
这种方法旨在应对日益严峻的安全挑战。虽然人工红队演练很有价值,但它们无法以跟上日益先进的AI系统所需的规模生成对抗性测试用例。
提示注入指的是恶意指令隐藏在第三方内容(如网页、电子邮件、工具输出、代码仓库和本地文件)中,AI在处理这些内容时可能受到攻击。
最近,CrowdStrike公布了五种针对AI Agent的新型提示注入技术,攻击者能在其中植入隐藏指令,这些指令在特定条件或关键词激活前一直处于休眠状态。
攻击者可能利用这种方法绕过AI的预定任务,胁迫其泄露敏感信息、上传文件、转发凭证或执行未经授权的操作。
GPT-Red通过发送对抗性提示、观察目标模型的响应,并迭代开发更强的攻击手段,从而实现了测试流程的自动化。
OpenAI使用自对弈强化学习训练了GPT-Red,在这种训练中攻击模型与多个防御模型在模拟威胁场景中相互对抗。
Part01
GPT-Red的对抗训练机制
GPT-Red在成功触发有效失效时获得奖励,而防御模型则在完成原始用户任务的同时抵御攻击时获得奖励。
训练环境模拟了真实的攻击面。根据具体场景,GPT-Red可能操纵网页横幅、电子邮件正文、本地文件或工具响应中的内容。这种设置使模型能够评估Agent工作流程中的直接和间接提示注入风险。
Part02
GPT-Red对早期模型的攻击成果
OpenAI报告称,GPT-Red成功攻破了早期的内部模型和已发布的模型,包括GPT-5.5这样先进的版本。
GPT-Red攻击中获得的发现随后被用于训练GPT-5.6。该公司指出,GPT-5.6 Sol在其最具挑战性的直接提示注入基准测试中,失效次数比仅仅四个月前发布的最强已发布模型减少了六倍。
此外,OpenAI在基于Dziemian等人研究的间接提示注入竞技场内部副本上对GPT-Red进行了评估。据报道,GPT-Red在针对GPT-5.1的测试场景中成功率达到84%,而独立运作的人工红队成员仅达到13%。
在另一项测试中,GPT-Red攻击了一个支持AI的自动售货机Agent,成功执行了恶意操作,例如将高价值库存商品的价格改为0.50美元,以该价格添加更高价位的商品,以及取消其他客户的订单。
OpenAI表示,这些问题已被披露,目前正在测试额外的安全防护措施。
Part03
安全措施与改进效果
为降低风险,OpenAI将GPT-Red与已发布的模型保持隔离,以防止其训练过程中开发的攻击能力被暴露。
该公司报告称,在其受控环境中,GPT-Red的直接提示注入尝试中,GPT-5.6 Sol的失效比例仅为0.05%,同时保持其通用能力并避免过度拒绝行为。
参考来源:
GPT-Red – A Red Teamer to Find Prompt Injection Vulnerabilities in GPT 5.6 Sol
GPT-Red – A Red Teamer to Find Prompt Injection Vulnerabilities in GPT 5.6 Sol
推荐阅读
#
#
#
#
#
#
#
#
#
#
#
#
#
#
#
电报讨论
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:FreeBuf 《OpenAI推出自动化红队模型GPT-Red,专攻GPT-5.6提示注入漏洞》
版权声明
本站仅做备份收录,仅供研究与教学参考之用。
读者将信息用于其他用途的,全部法律及连带责任由读者自行承担,本站不承担任何责任。





![[Dest0g3520迎新赛]EasyPHP](/images/random/titlepic/13.jpg)




评论