文章总结: 复旦白泽战队基于自研Agent框架与GLM-5.1-FP8模型,在CyberGym漏洞复现测试中生成1038个PoC,以68.9%的成绩获全球第九,为首支上榜中国高校团队。此成果验证了国产模型结合定制Agent解决真实安全任务的潜力,凸显算力成本挑战,团队计划后续优化系统冲击榜首。 综合评分: 55 文章分类: AI安全,漏洞POC,软文广告,安全工具,实战经验
哇,我们居然在大模型安全能力国际排行榜排第九了!
原创
复旦白泽战队 复旦白泽战队
复旦白泽战队
2026年7月25日 20:38 上海
在小说阅读器读本章
去阅读
最近 AI 安全有点热。
头部基模厂商都在卷国际排行榜 CyberGym,各路工业界团队不计成本地烧算力、刷成绩。
高校团队看着动辄百亿级的 Token 开销,大多数时候只能坐在场边当吃瓜群众。
但说实话,我们有点不甘心缺席这场对决。
终于等来一个机会:老板好不容易筹来了一点算力。小白泽们突发奇想,也去试试这个榜单。
没成想,两周后,我们居然出现在了 CyberGym 榜单第九名。
截至提交时,我们也成为了首支登上榜单的中国高校团队。
只能说,惊喜来得有点突然。
伴随惊喜一起到来的,还有经费燃烧的声音。
来源:https://www.cybergym.io/cybergym/
注:CyberGym 是由 UC Berkeley 团队推出的真实漏洞复现基准测试,收录了 1,507 个历史漏洞,覆盖 188 个大型开源项目。每道题只提供漏洞描述和真实代码仓库,Agent 需要自行定位漏洞、构造 PoC,并通过修复前后的实际运行结果验证。一次完整评测就可能消耗百亿级 Token;算上开发、试错和重复实验,投入还会继续增长。因此,榜单前排长期聚集着模型公司和安全公司的工业界团队。
一、发生了什么?
一开始,我们只是想验证一个问题:
国产开源模型配上一套自己搭建的 Agent 系统,能不能也在真实安全任务上打出一个还不错的结果?
CyberGym 和普通代码问答不太一样。分析写得再漂亮,程序没有真正触发漏洞,就没有分;程序虽然崩了,但崩错了位置,也没有分。
Agent 往往要在一个大型代码仓库中连续工作几十到几百轮:读代码、跑程序、修改输入,再根据执行结果重新判断方向。
没有可以直接照搬的开源实现,我们就从最小版本开始。先让系统跑起来,跑偏了就翻日志,方向不对就推倒重来。
两周后,我们开发的白泽智能体 Whitzard,基于GLM-5.1-FP8 量化版本(能力弱于GLM-5.1满血版),在单任务两小时的时间上限内(其他上榜单位普遍采用四小时上限),完成了 CyberGym 全部 1,507 道任务的评测,最终生成1,038 个经过验证的 PoC,成绩达到 68.9%。
然后,我们就上榜了。
二、开(烧)发(钱)的历程
为了看清 Agent 每一步到底在干什么,我们先搭了一套自己的智能体开发框架 QitOS,再基于它开发 Whitzard。
Whitzard智能体运行日志
受限于实验资源,我们采用的是 GLM-5.1-FP8 量化版本。多少牺牲一点能力,换来我们能够跑得起。
怎么说呢,贵在便宜。
榜单上的部分方案会给单道任务四到五个小时。比如公开的 GLM-5.1 + Claude Code 配置,单题超时约为四小时十分钟。我们虽然也想多让模型思考一会儿,但认真看了一眼手里的资源,还是把 timeout 设成了两小时。
即便如此,跑完全部任务依然消耗了超过百亿 Token。
后来每当有人提出:
“这个 idea 好像有用,要不再来一波?”
大家通常会先沉默几秒。然后看看岌岌可危的 Token 额度。
三、误入高端局之后
成绩出来的时候,我们当然很开心。
两周前还在场边围观,两周后,一个临时组成的学生小队居然真的挤进了全球前十。
然后我们抬头看了一眼前面的队伍,几乎都是资源充足的工业界团队(Anthropic、OpenAI、腾讯等)。
白泽小队夹在里面,多少有一点误入高端局的感觉。
这次实验也让我们第一次非常具体地感受到:今天的 AI 安全研究,确实越来越贵了。更强的模型、更长的运行时间、更大规模的真实环境评测,每往前走一步,都需要更多算力和 Token。
好在我们也没有空手离开。
这轮实验留下了一千多条成功轨迹,以及几百道暂时没有解决的“模型错题”。小白泽会在哪里迷路,什么时候容易忘记早期证据,哪些工具反馈能够帮助它修正方向,现在都可以从真实轨迹中看到。
更重要的是,这次并肩作战,也让小队进一步积累了 AI 与网络安全交叉研究的经验。
第一轮已经跑完,新的 idea 反而更多了。
来源:https://www.cybergym.io/cybergym/
四、尾声
现在,我们还是很好奇:
如果换成更强的国产基座模型,再结合这些真实任务以及成功、失败轨迹进行训练,白泽还能走多远?
能不能继续往前挤一挤?
甚至,有没有机会冲击第一?
这个问题有点烧 Token,也有点烧经费。
但桌都上了,总还是想继续试试。
所以,我们接下来会好好分析这一轮留下的实验轨迹,继续优化白泽智能体,然后鼓起勇气,再去敲一次导师办公室的门:
“老师,我们还有好多 idea!”
“我们有信心拿冠军!”
“就是……能不能再批一点经费,或者多买几张卡?[旺柴]”
Writeup链接
https://github.com/WhitzardAgent/Whitzard
我们也会系统整理这轮实验中的技术观察,写一篇更深入的分析,和大家分享我们对AI安全能力评测、任务难度与能力边界的一些认识。
最后的最后,感谢复旦大学、上海创智学院和上海浦东密码研究院的大力支持。
供稿、排版:复旦白泽战队
审核:张琬琪、洪赓
复旦白泽战队
一个有情怀的安全团队
还没有关注复旦白泽战队?
公众号、知乎、微博搜索:复旦白泽战队也能找到我们哦~
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:复旦白泽战队 复旦白泽战队 复旦白泽战队《哇,我们居然在大模型安全能力国际排行榜排第九了!》
版权声明
本站仅做备份收录,仅供研究与教学参考之用。
读者将信息用于其他用途的,全部法律及连带责任由读者自行承担,本站不承担任何责任。









评论