文章总结: 智谱GLM-5.3模型通过后训练提升,一个月内在269个开源项目中挖出2436个真实漏洞,涵盖严重和高危漏洞,影响广泛。其能力来自任务环境和Agent自造环境的改进。官方计划开源但先进行安全评估,强调防御价值。 综合评分: 86 文章分类: 漏洞分析,威胁情报,AI安全,安全工具,红队
最新智谱 GLM-5.3:这个 AI 一个月挖出了 2436 个真实漏洞
原创
零壹界点 零壹界点
零壹界点
2026年8月16日 08:10 江苏
在小说阅读器读本章
去阅读
想象一下:你收到一条看起来完全正常的消息,没有链接、没有附件,你什么都没点,手机已经不在你手里了。
这不是电影。今天(8 月 14 日),智谱发布 GLM-5.3,随发布交出一份漏洞战报:一个月时间,这个模型在 269 个开源项目里挖出了 2436 个真实漏洞,最早的一个 1981 年就写进了代码。上面那个场景,是这些漏洞被修复前「差点发生什么」的五个案例之一——攻击者全程远程完成,稳定且隐蔽。
你手机里躺着的某个开源组件,可能正踩着这 2436 个洞里的一个。
一个能挖漏洞挖到这种程度的模型,是防御者,还是威胁本身?官方自己也纠结,纠结到把权重推迟两周。往下看。
被拦下来的五件事,最轻的是接管你的编辑器
2436 这个数字太抽象。官方挑了五个已修复的案例,把「一个漏洞」还原成「差点发生什么」。
最轻的一个,是 AI 编程编辑器 Cursor:清华 NASP 实验室用 GLM-5.3 分析它的二进制代码和权限边界,发现攻击者可能实现任意文件写入,进而窃取敏感信息、接管整个开发环境——你电脑上的代码、密钥、会话,等于递了出去。
最重的一个,是一家全球顶级具身智能机器人厂商的系统:被挖出致命级漏洞,一旦利用,攻击者可能同时远程劫持上千台机器人,控制它们执行动作。
中间还有三个。一款数亿日活的即时通信软件,一条消息就能让用户失去设备控制权。诞生于 1983 年的 DNS(域名系统)协议里的一类协议级缺陷:攻击者只需发送少量特殊请求,就能把服务器计算压力最高放大近 8 万倍,按网络测绘估算,可能影响全球九成以上的主流 DNS 系统、超过 1000 万处公网服务。微软的三枚重大漏洞串起来,一封邮件就能打进企业内网——微软修复后,在致谢里写下了发现方。
这五件事覆盖的范围,从开发者的编辑器,一路延伸到互联网的基础协议,再到会在物理世界里走动的设备。全部已联系厂商修复,走国家漏洞库的协同披露流程。
2436 个漏洞,45 年跨度:跑分装不下它
这份战报的完整数字:269 个项目、2436 个漏洞,其中严重 107 个、高危 990 个、中危 1286 个、低危 53 个。它们的年龄跨度 45 年,最早的写于 1981 年,平均每个漏洞在被发现前,已经在代码里躺了 26.6 年。
命中的包括 Linux 内核、Apple 的浏览器引擎 WebKit、FreeBSD、GStreamer——都是被无数双眼睛看过几十年的代码。
官方按全球漏洞交易市场的公开报价,给这批漏洞估了个价:3000 万元。
这张表里能看出他们的底气:Linux、Windows、macOS、VMware 这些 900 万美元档的目标全被拿下,微信、WPS 也在 700 万档。红叉也有——nginx、OpenSSL、curl、OpenSSH 这几个常年被反复审计的基础组件没挖动,PlayStation、iOS、Android 也没拿下。
想自己核对的话,官方建了一个公开账本(cvd.z.ai):53 个已公开披露、2383 个还在禁令期。已公开的条目都带 CVE(公开漏洞编号),可以按项目和编号查自己用的开源组件有没有中招。
能力怎么来的:一个月,两个改动
基座模型一点没换,跟上一版 GLM-5.2 用的是同一个底子,所有提升全部来自后训练。官方博客开篇只有一句话:
Scaling post-training is all we did for GLM-5.3.(我们做的全部事情,就是把后训练规模拉大。)
把什么拉大?两件事。
第一件,任务环境。过去训练编码模型,用的是编程练习题——输入输出明确、几分钟做完、对错一目了然。GLM-5.3 的环境换成了工程师要干好几天的真活:以一个机器学习基础设施任务为例,模型拿到的环境跟工程师完全一样,要自己诊断训练链路的瓶颈、动手优化、跑实验验证,交付一个可测量的提速,还不能把正确性搞坏。
第二件,环境不够,让 Agent 自己造。造环境有三条硬条件——能跑起来、能自动验证、贴近真实工作,而且量要大。他们把这件事做成了管线:研究 Agent 从真实工作里收集任务模式,变成可运行的环境;裁判 Agent 自己先做一遍,确认这题真能解;验证器在看不到参考答案的情况下合成,还必须通过三道关——正确答案判得过、什么都不做判不过、没做完判不过——才够格直接拿去训练。
编码侧的成果(官方自评):Terminal Bench 3.0 从 4.6 分涨到 28.3 分,六倍多;六个基准里两项全场第一,闭源也算在内。
但真正的意外在安全侧。他们往训练配方里加了漏洞发现的数据和环境,预期只是「更会找漏洞」。随着训练规模上去,模型开始跨多个利用阶段做推理,为一整条完整的攻击链拟出连贯的计划——这个「规划完整利用链」的能力,官方自己都写着超出预期。
为什么敢开源:两周,三道防线
一个能挖洞挖到 CyberGym(白盒漏洞发现基准)全场第一、能规划完整攻击链、已经在真实项目里挖出两千多个洞的模型,把权重公开意味着什么?意味着任何人都能拿它扫任何代码库,还不用受 API 约束。
所以官方把「发布」和「开源」拆开了:权重两周后再放,中间做安全评估和加固。HuggingFace 上的模型页现在还是 Coming Soon。
加固是三层:最外层一个轻量分类器挡在 API 门口,拦截大规模滥用;中间一层推理监控器,跟着模型的思考过程实时审查任务意图;最里层是深度安全对齐,让模型自己识别并拒绝攻击性请求。前两层都留在官方服务器上,权重一开源就失效,所以最后有效的只有最里层。这两周要做的事,官方原话是「尽可能限制其潜在攻击能力,保留其防御价值」。
智谱中文稿把开源的理由说得很直白:如果强大的攻击能力正在扩散,防守能力就不能只留在少数几家闭源公司手里。他们点名 Anthropic 向约 150 家大型机构提供安全模型,而更广泛的企业和开源项目拿不到同等水平的能力。
当最强的矛被锁在少数人手里,最好的盾必须属于所有人。
这句话是不是漂亮话,看他们同步上线的三件事:对重点开源项目做持续安全审计;在 HuggingFace 上开放 OpenVuln,让维护者免费找洞修洞;给开源维护者免费模型额度。
防守者还是威胁?答案在拿它的人手里
把整件事连起来看:一个模型,一个月后训练,长出了能挖出 2436 个真实漏洞的能力。用它的人是防守方,它就是盾——DNS 协议级缺陷、微软内网通道、机器人控制权,都在造成损失之前被挖了出来。上个月,他们还用它帮安全团队从一个叫 Neo 的攻击 AI Agent 手里还原出整条攻击链——4 台服务器、7 个域名、6 万个邮箱、18567 封钓鱼邮件。用它的人是攻击方,它就是矛,这也是权重必须等两周的原因。
所以判断很简单:所有用开源组件的人都该记住这个模型,因为它的战报,就是你的组件自查清单。但也先别急着当威胁看——它挖出的这些洞,在被它挖出来之前,已经在那躺了平均 26.6 年。
真正的威胁一直都在。它只是把灯打开了。
[官方漏洞披露账本]:https://cvd.z.ai/ [GLM-5.3 官方发布博客]:https://z.ai/blog/glm-5.3
参考链接: [1] https://github.com/THUDM/slime [2] https://huggingface.co/spaces/zai-org/OpenVuln [3] https://docs.z.ai/devpack/overview
「点赞」「转发」「小心心」都点上,欢迎在评论区留下你的想法!
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:零壹界点 零壹界点 零壹界点《最新智谱 GLM-5.3:这个 AI 一个月挖出了 2436 个真实漏洞》
版权声明
本站仅做备份收录,仅供研究与教学参考之用。
读者将信息用于其他用途的,全部法律及连带责任由读者自行承担,本站不承担任何责任。










评论