哇,我们居然在大模型安全能力国际排行榜排第九了!

admin 2026-07-26 04:47:45 网络安全文章 来源:ZONE.CI 全球网 0 阅读模式

文章总结: 复旦白泽战队基于自研Agent框架与GLM-5.1-FP8模型,在CyberGym漏洞复现测试中生成1038个PoC,以68.9%的成绩获全球第九,为首支上榜中国高校团队。此成果验证了国产模型结合定制Agent解决真实安全任务的潜力,凸显算力成本挑战,团队计划后续优化系统冲击榜首。 综合评分: 55 文章分类: AI安全,漏洞POC,软文广告,安全工具,实战经验


cover_image

哇,我们居然在大模型安全能力国际排行榜排第九了!

原创

复旦白泽战队 复旦白泽战队

复旦白泽战队

2026年7月25日 20:38 上海

在小说阅读器读本章

去阅读

最近 AI 安全有点热。

头部基模厂商都在卷国际排行榜 CyberGym,各路工业界团队不计成本地烧算力、刷成绩。

高校团队看着动辄百亿级的 Token 开销,大多数时候只能坐在场边当吃瓜群众。

但说实话,我们有点不甘心缺席这场对决

终于等来一个机会:老板好不容易筹来了一点算力。小白泽们突发奇想,也去试试这个榜单。

没成想,两周后,我们居然出现在了 CyberGym 榜单第九名。

截至提交时,我们也成为了首支登上榜单的中国高校团队。

只能说,惊喜来得有点突然。

伴随惊喜一起到来的,还有经费燃烧的声音

来源:https://www.cybergym.io/cybergym/

注:CyberGym 是由 UC Berkeley 团队推出的真实漏洞复现基准测试,收录了 1,507 个历史漏洞,覆盖 188 个大型开源项目。每道题只提供漏洞描述和真实代码仓库,Agent 需要自行定位漏洞、构造 PoC,并通过修复前后的实际运行结果验证。一次完整评测就可能消耗百亿级 Token;算上开发、试错和重复实验,投入还会继续增长。因此,榜单前排长期聚集着模型公司和安全公司的工业界团队。

一、发生了什么?

一开始,我们只是想验证一个问题:

国产开源模型配上一套自己搭建的 Agent 系统,能不能也在真实安全任务上打出一个还不错的结果?

CyberGym 和普通代码问答不太一样。分析写得再漂亮,程序没有真正触发漏洞,就没有分;程序虽然崩了,但崩错了位置,也没有分。

Agent 往往要在一个大型代码仓库中连续工作几十到几百轮:读代码、跑程序、修改输入,再根据执行结果重新判断方向。

没有可以直接照搬的开源实现,我们就从最小版本开始。先让系统跑起来,跑偏了就翻日志,方向不对就推倒重来。

两周后,我们开发的白泽智能体 Whitzard,基于GLM-5.1-FP8 量化版本(能力弱于GLM-5.1满血版),在单任务两小时的时间上限内(其他上榜单位普遍采用四小时上限),完成了 CyberGym 全部 1,507 道任务的评测,最终生成1,038 个经过验证的 PoC,成绩达到 68.9%

然后,我们就上榜了。

二、开(烧)发(钱)的历程

为了看清 Agent 每一步到底在干什么,我们先搭了一套自己的智能体开发框架 QitOS,再基于它开发 Whitzard。

Whitzard智能体运行日志

受限于实验资源,我们采用的是 GLM-5.1-FP8 量化版本。多少牺牲一点能力,换来我们能够跑得起。

怎么说呢,贵在便宜。

榜单上的部分方案会给单道任务四到五个小时。比如公开的 GLM-5.1 + Claude Code 配置,单题超时约为四小时十分钟。我们虽然也想多让模型思考一会儿,但认真看了一眼手里的资源,还是把 timeout 设成了两小时。

即便如此,跑完全部任务依然消耗了超过百亿 Token。

后来每当有人提出:

“这个 idea 好像有用,要不再来一波?”

大家通常会先沉默几秒。然后看看岌岌可危的 Token 额度。

三、误入高端局之后

成绩出来的时候,我们当然很开心。

两周前还在场边围观,两周后,一个临时组成的学生小队居然真的挤进了全球前十。

然后我们抬头看了一眼前面的队伍,几乎都是资源充足的工业界团队(Anthropic、OpenAI、腾讯等)。

白泽小队夹在里面,多少有一点误入高端局的感觉。

这次实验也让我们第一次非常具体地感受到:今天的 AI 安全研究,确实越来越贵了。更强的模型、更长的运行时间、更大规模的真实环境评测,每往前走一步,都需要更多算力和 Token。

好在我们也没有空手离开。

这轮实验留下了一千多条成功轨迹,以及几百道暂时没有解决的“模型错题”。小白泽会在哪里迷路,什么时候容易忘记早期证据,哪些工具反馈能够帮助它修正方向,现在都可以从真实轨迹中看到。

更重要的是,这次并肩作战,也让小队进一步积累了 AI 与网络安全交叉研究的经验。

第一轮已经跑完,新的 idea 反而更多了。

来源:https://www.cybergym.io/cybergym/

四、尾声

现在,我们还是很好奇:

如果换成更强的国产基座模型,再结合这些真实任务以及成功、失败轨迹进行训练,白泽还能走多远?

能不能继续往前挤一挤?

甚至,有没有机会冲击第一?

这个问题有点烧 Token,也有点烧经费。

但桌都上了,总还是想继续试试。

所以,我们接下来会好好分析这一轮留下的实验轨迹,继续优化白泽智能体,然后鼓起勇气,再去敲一次导师办公室的门:

“老师,我们还有好多 idea!”

“我们有信心拿冠军!”

“就是……能不能再批一点经费,或者多买几张卡?[旺柴]”

Writeup链接

https://github.com/WhitzardAgent/Whitzard

我们也会系统整理这轮实验中的技术观察,写一篇更深入的分析,和大家分享我们对AI安全能力评测、任务难度与能力边界的一些认识。

最后的最后,感谢复旦大学、上海创智学院和上海浦东密码研究院的大力支持。

供稿、排版:复旦白泽战队

审核:张琬琪、洪赓

复旦白泽战队

一个有情怀的安全团队

还没有关注复旦白泽战队?

公众号、知乎、微博搜索:复旦白泽战队也能找到我们哦~


免责声明:

本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。

任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。

本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我

本文转载自:复旦白泽战队 复旦白泽战队 复旦白泽战队《哇,我们居然在大模型安全能力国际排行榜排第九了!》

所谓财务自由 网络安全文章

所谓财务自由

文章总结: 作者探讨财务自由,介绍退休规划的百分之四规则并指出其幸存者偏差等局限。作者将自由解构为目的与资源,认为平静与满足无需巨额财富,通过创作喜欢且有价值的
评论:0   参与:  0