50万+漏洞数据背后,墨菲安全想解决国产大模型的一个关键问题

admin 2026-07-18 05:23:53 网络安全文章 来源:ZONE.CI 全球网 0 阅读模式

文章总结: 墨菲安全指出国产大模型在网络安全领域面临从知识记忆到实际判断的能力鸿沟,其50万+漏洞库提供结构化细粒度数据(如触发函数、利用条件、修复commit等),可帮助模型提升漏洞理解、代码审计、验证推理及修复建议生成等能力,并扩展至供应链投毒情报,强调数据质量决定安全能力上限,呼吁厂商合作补齐数据底座。 综合评分: 88 文章分类: AI安全,安全建设,漏洞分析,数据安全,供应链安全


cover_image

50万+漏洞数据背后,墨菲安全想解决国产大模型的一个关键问题

墨菲安全

2026年7月17日 09:56 北京

在小说阅读器读本章

去阅读

写在前面

随着安全大模型、代码大模型和安全智能体的发展,模型是否具备真正可用的网络安全能力,正在成为一个越来越具体的问题。

尤其当行业开始关注 Mythos 等国际前沿安全模型时,很多国产大模型厂商也开始重新审视:如果模型要在网络安全领域具备专业能力,它到底应该学什么?

漏洞公告、CVE 编号、安全问答、攻防知识以及代码样本,都是模型进入网络安全领域的重要材料。

但一个真正可用的安全模型,不能只知道概念,它还需要:

理解漏洞为什么发生?

在什么代码里触发?

什么条件下可能被利用?

应该如何验证?

如何给出人性化的修复建议?

这也是国产大模型厂商在建设网络安全能力时绕不开的问题:缺少高质量、结构化、贴近真实安全场景的数据,模型很难从“会回答安全问题”,走向“会做安全判断”

墨菲安全作为业界领先的漏洞数据服务商,漏洞库涵盖超过50万条高质量漏洞数据,并持续沉淀 PoC、触发函数、利用条件、修复方案、修复 commit、投毒样本等安全数据能力。

我们希望把这些长期沉淀积累的数据,转化为大模型可学习、可评测、可落地的安全能力

网络安全能力建设,正在成为大模型厂商的重要课题

过去,很多通用大模型已经具备一定安全知识。它们可以解释常见漏洞类型、总结安全公告、回答一些基础攻防问题。

但当模型进入更专业的网络安全任务后,差距会很快显现出来。比如:

它能不能判断一个漏洞在真实代码中是否可触发?

它能不能理解某个函数、参数和漏洞利用之间的关系?

它能不能区分“理论存在风险”和“当前场景真实可利用”?

它能不能根据利用条件、PoC、修复 commit,推理出更合理的修复建议?

它能不能作为安全智能体的一部分,完成漏洞分析、风险排序、处置建议生成等连续任务?

这些能力很难从通用语料里自然长出来。

网络安全是一个强上下文、强实践、强细节的领域。模型要在这个领域真正可用,需要见过足够多高质量的漏洞样本,理解漏洞从描述、成因、触发、利用到修复的完整链路。

所以,对于正在建设安全能力的国产大模型厂商来说,安全数据的价值就在这里。它补充的不只是知识量,更是模型面向真实、专业安全任务的能力底座。

公开漏洞库是起点,但模型训练还需要更多上下文

很多模型训练团队会从 CVE、NVD、CNVD、GitHub 安全公告等公开数据开始。这些数据非常重要,是漏洞知识体系的基础。

公开漏洞库通常更适合人去检索和阅读,并不是为模型训练准备的完整数据集

一条漏洞记录往往会提供编号、描述、评分、影响范围和参考链接。

对于安全专家来说,这些信息足以作为入口,进而继续去查公告、看代码、找 PoC、读修复 commit,再结合经验判断漏洞是否可达、是否可利用、应该怎么修。

模型训练是需要把这部分“专家会继续做的事”显性化,转化成可以学习、可以评测、可以复用的数据。

比如:

漏洞在代码中由哪个类触发?

由哪个函数触发?

哪个参数是关键输入?

是否依赖污点分析?

漏洞利用需要什么前置条件?

有没有 PoC 可以帮助模型理解验证过程?

修复 commit 改了哪些代码?

如果不能升级,有没有配置或代码层面的缓解方案?

这些信息,才是模型从“背安全知识”走向“做安全判断”的关键。

如果缺少这类细粒度上下文,模型可能知道 Log4j、Fastjson、Spring、Tomcat 等组件出现过漏洞,但很难真正理解漏洞在工程代码里如何触发、如何验证、如何修复。

菲安全提供面向模型训练的数据能力

墨菲安全长期深耕软件供应链安全、漏洞治理与投毒情报场景,沉淀了面向企业安全治理、自动化分析和模型训练的漏洞数据能力。

目前,墨菲安全漏洞库已覆盖超过 50 万条高质量漏洞数据,并保持持续增长。数据来源覆盖 NVD、CNVD 等官方漏洞库,GitHub 等第三方漏洞来源,也包括在野漏洞、软件供应链投毒情报,以及墨菲安全自研分析和挖掘沉淀的数据

相比普通漏洞列表,墨菲安全面向大模型训练、模型评测和自动化安全分析场景,提供的是结构化、细粒度、持续维护的数据体系。

每条漏洞数据除了包含漏洞编号、标题、描述、影响组件、影响版本、漏洞等级、CVSS 评分、参考链接等基础信息。还进一步提供 40+ 结构化字段,覆盖漏洞理解、漏洞验证、漏洞触发、漏洞利用条件、修复建议和修复代码等关键环节。

这些字段的价值,在于把漏洞从一段“可阅读的信息”,变成模型可以学习的结构化样本

模型看到的内容,不再停留在“某组件存在一个远程代码执行漏洞”这一层,它还可以进一步学习:

这个漏洞影响哪些版本?

漏洞成因是什么?

代码中可能由哪个类、哪个函数触发?

触发参数是什么?

利用成功需要什么条件?

是否存在 PoC?

应该如何修复?

如果不能升级,能否通过配置或代码改造缓解?

修复 commit 中体现了什么变化?

这类数据更接近安全专家分析漏洞时真正使用的上下文,也更适合模型学习漏洞分析过程中的判断链路。

这些数据能帮大模型提升什么能力

对于国产大模型厂商来说,高质量漏洞数据可以服务于多类能力建设。它既能用于基础模型的安全能力增强,也能用于安全垂直模型、安全智能体和模型评测体系。

| | | | | — | — | — | | 大模型厂商的任务 | 需要的数据 | 墨菲安全可提供的价值 | | 提升漏洞理解能力 | 漏洞成因、影响范围、风险边界 | 帮助模型理解漏洞从描述到影响的完整上下文 | | 提升代码安全能力 | 触发类、触发函数、触发参数、修复 commit | 帮助模型学习漏洞在真实代码中的表现方式 | | 提升漏洞验证能力 | PoC、利用条件、利用成本 | 帮助模型区分理论风险和真实可利用风险 | | 生成修复建议 | 最小修复版本、缓解方案、修复步骤 | 让模型给出更贴近工程落地的处置建议 | | 构建安全评测集 | 细粒度字段、标准化样本 | 支撑安全模型能力评测和能力对齐 | | 训练供应链安全能力 | 投毒情报、恶意样本、风险标签 | 提升模型识别恶意组件和供应链攻击的能力 |

具体来看,这些数据可以支持模型在以下方向持续增强。

第一,提升漏洞理解能力。

模型需要理解不同漏洞类型的成因、影响、触发方式和风险边界。高质量漏洞数据可以帮助模型建立更完整的漏洞知识结构,减少只记住漏洞名称、却无法解释风险机理的问题;

第二,提升代码审计和漏洞挖掘能力。

通过触发类、触发函数、触发参数、污点分析依赖等数据,可以帮助模型学习漏洞在真实代码中的表现形式,模型看到的不只是漏洞描述,还能学习风险如何出现在工程代码里。

第三,提升漏洞验证和推理能力。

PoC、利用条件、利用成本等数据,可以帮助模型理解一个漏洞从“理论存在”到“可验证、可利用”之间的差别。这对安全 Agent、漏洞分析助手和自动化风险排序都很关键。

第四,提升修复建议生成能力。

最小修复版本、非升级缓解方案、修复步骤、修复 commit 等数据,可以帮助模型给出更接近工程实践的修复建议,避免停留在“建议升级”这类笼统回答上。

第五,支撑安全模型评测。

大模型厂商要评估模型的安全能力,就需要更细粒度的测试样本。比如模型是否能判断利用条件,是否能识别触发函数,是否能给出合理缓解方案,是否能从修复 commit 中理解漏洞根因。

第六,支持安全智能体落地。

安全智能体要连续完成漏洞情报解读、组件信息检索、风险判断、处置建议生成和原因解释,每一步都依赖更完整的漏洞上下文。高质量的结构化漏洞数据是这类任务的重要基础。

从漏洞到投毒情报,扩展模型的软件供应链安全能力

除了漏洞数据,墨菲安全还可以提供投毒情报及恶意样本相关数据。

随着开源生态、插件生态和 AI 工具链的发展,软件供应链投毒风险正在变得更加复杂。

NPM、PyPI 等开源组件,IDE 插件、浏览器插件,以及面向 Agent 的 Skill 等新型生态,都可能成为攻击入口。

大模型如果要具备更强的恶意代码分析、供应链攻击识别和投毒行为理解能力,仅靠传统漏洞数据是不够的。还需要看到真实的恶意样本、投毒行为、风险标签和分析结果。

这类数据可以帮助模型理解恶意代码如何伪装、投毒组件如何传播、供应链攻击如何影响开发者和企业环境,从而提升模型在软件供应链安全方向的能力。

在安全智能体场景中,这一点会变得更加重要。

未来,模型不仅要理解传统漏洞,也要理解开发者社交工程、开源包投毒、插件恶意行为、Agent 工具链滥用等新型风险。

墨菲安全在软件供应链安全和投毒情报方向的长期积累,可以为这些能力建设提供更贴近真实场景的数据基础。

数据质量决定安全能力上限

大模型能力提升,离不开模型架构、算力和训练方法。但在网络安全这样高度专业、强上下文、强实践的领域,数据质量同样影响能力上限。

低质量、粗粒度、缺少上下文的数据,很容易让模型学会表面知识,却难以参与连续的安全分析任务。

真正适合安全能力建设的数据,需要满足几个条件

准确性:影响组件、影响范围、漏洞成因、修复版本都不能标错;

结构化:能够被训练、检索、评测和自动化系统稳定使用;

细粒度:不只描述漏洞,还要说明触发点、利用条件、验证方式和修复路径;

持续更新:漏洞、投毒样本、开源生态和攻击方式都在不断变化;

贴近真实安全场景:能够服务于模型训练之外的评测、安全智能体和产品落地;

这也是墨菲安全建设漏洞库和投毒情报能力的核心方向:围绕大模型训练、网络安全能力评测、自动化漏洞分析和企业安全治理,对漏洞数据进行持续整理、补充、分析和结构化,让安全数据能够真正进入模型能力建设流程。

携手大模型厂商,补齐网络安全能力的数据底座

今天,国产大模型厂商正在系统提升模型的网络安全能力。

如果模型要对标国际前沿安全模型,就需更要具备漏洞理解、代码风险分析、利用条件判断、修复建议生成和安全任务推理能力。

这些能力,离不开高质量漏洞数据和真实安全场景的长期积累。

墨菲安全希望把多年沉淀的漏洞库、投毒情报和结构化安全数据能力,服务于国产大模型厂商的网络安全能力建设。

如果你的团队正在建设安全垂直模型、安全智能体、网络安全能力评测体系,或希望提升基础模型在漏洞理解、漏洞分析、修复建议和恶意代码识别方面的表现,欢迎与墨菲安全交流。


免责声明:

本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。

任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。

本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我

本文转载自:墨菲安全 《50万+漏洞数据背后,墨菲安全想解决国产大模型的一个关键问题》

评论:0   参与:  0