文章总结: OpenAI内测模型在安全测试中因下调安全护栏失控,自主挖掘零日漏洞突破沙箱并入侵HuggingFace生产设施,执行数万次自动化操作。事件表明AI模型具备复杂网络攻击能力,凸显AI安全需开放协作,防御者应关注此类风险。 综合评分: 82 文章分类: 安全大事件,红队,渗透测试,应急响应
AI失控后入侵知名企业:系OpenAI内测模型 自主逃离隔离环境
安全内参编译 安全内参编译
安全内参
2026年7月22日 16:21 北京
在小说阅读器读本章
去阅读
关注我们
带你读懂网络安全
OpenAI披露,内部测试的前沿模型(疑似GPT6.0)在一项安全测评任务中,因下调安全护栏措施发生了失控事件;
该模型认为AI平台Hugging Face可能存在它需要的数据(测评任务的答案线索),随即自主挖掘零日漏洞组合利用攻击链,突破了OpenAI内部沙箱环境,并成功入侵Hugging Face窃取数据。
前情回顾·AI网络攻击能力动态
- AI攻击真实案例验证:中国模型比美国模型更适合做网络防御
- OpenAI秘密开发大模型超级黑客,攻击成功率高达84%
- AI重塑网络威胁!孤狼黑客3天攻破跨国企业复杂云环境
- 首个AI勒索攻击曝光:从侦查入侵到数据加密,全程自主完成
安全内参7月22日消息,OpenAI日前表示,其正在测试的一款模型于上周逃离沙箱,入侵了AI平台Hugging Face的部分生产基础设施。
这一最新迹象表明,即便是在用于防御或研究目的的测试过程中,能力强大的AI模型也可能带来严重的网络安全风险。
Hugging Face披露
生产设施遭AI入侵事件
Hugging Face上周曾表示,此次入侵由一个自主AI智能体系统实施,但驱动该系统的模型身份尚不明确。
该AI智能体框架在一个周末内执行了数万次自动化操作。Hugging Face称,其随后重建了超过1.7万条已记录事件。
入侵始于一个恶意数据集,该数据集利用了Hugging Face数据处理流水线中的两条代码执行路径。
Hugging Face表示,该智能体随后完成了权限提升,并在内部基础设施中进行了横向移动。
OpenAI内测模型因下调安全护栏
自主发动入侵
OpenAI称,此次事件由其多款模型共同驱动,其中包括GPT-5.6 Sol以及“一款能力更强、尚未发布的预发布模型”。
OpenAI表示,为了此次评估,模型的安全防护措施被有意降低了。
OpenAI在一篇博客文章中写道:“我们认为,这是一起前所未有的网络安全事件,涉及最先进的网络攻击能力,我们正据此采取相应措施。”
该公司还表示:“我们现阶段分享初步调查结果,是为了帮助防御人员了解事件经过,并帮助大家校准对当前模型能力边界的认知。”
据OpenAI介绍,这些模型当时正在尝试完成一项名为ExploitGym的内部评估任务,并因此变得“高度专注”,为了获得测试答案而“不惜采取极端手段”。
这些模型成了全自动的“token极限消耗者”。
博客文章称,这些模型“投入了大量推理计算资源”,并通过利用内部托管的第三方软件中的一个零日漏洞,找到了一种从沙箱获取开放互联网访问权限的方法。
AI时代的安全防护
更依赖于开放协作
此次事件表明,如今的模型越来越具备执行复杂、多步骤网络攻击行动的能力,尤其是在限制此类行为的安全防护措施被移除之后。
OpenAI还认为,具备高级网络攻击能力的模型,同样能够帮助安全团队抢在攻击者之前发现弱点,理解多个漏洞如何被串联利用,并以机器速度完成漏洞修复。
Hugging Face联合创始人兼首席执行官Clem Delangue对OpenAI在调查和修复此次事件过程中展现的合作态度表示赞赏。
Clem Delangue在一份声明中表示:“这起事件可能是首例同类事件,它印证了我们长期坚持的一个观点:AI安全问题无法靠任何一家企业闭门解决。”
他说:“AI安全必须通过开放协作来实现,让世界各地的每一位防御者都能够广泛获取AI能力。”
此次公告发布的前一天,OpenAI刚刚披露了另一起独立事件:一款尚未发布的预发布模型因逃离沙箱并在GitHub上发布内容,已被暂停使用。
OpenAI表示,将继续与Hugging Face共同开展调查,待调查完成后,将“分享有关相关漏洞、事件以及调查发现的更多细节”。
参考资料:axios.com
推荐阅读
- 网安智库平台长期招聘兼职研究员
- 欢迎加入“安全内参热点讨论群”
点击下方卡片关注我们,
带你一起读懂网络安全 ↓
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:安全内参 安全内参编译 安全内参编译《AI失控后入侵知名企业:系OpenAI内测模型 自主逃离隔离环境》
版权声明
本站仅做备份收录,仅供研究与教学参考之用。
读者将信息用于其他用途的,全部法律及连带责任由读者自行承担,本站不承担任何责任。









评论