中国应该如何发布第一个能自主完成端到端网络攻击的AI模型?

admin 2026-08-03 04:58:58 网络安全文章 来源:ZONE.CI 全球网 0 阅读模式

文章总结: 本文探讨中国首发自主端到端网络攻击AI模型的策略。借鉴海外经验,厂商应利用九十天防御窗口,联合安全厂商与关基运营者建设大模型驱动的CTEM平台。通过专用漏洞框架打通发现与修复闭环,在攻击能力扩散前完成关键信息基础设施的验证与修复,建议业界即刻启动联合建设。 综合评分: 94 文章分类: AI安全,漏洞分析,安全建设,网络安全,供应链安全


cover_image

中国应该如何发布第一个能自主完成端到端网络攻击的 AI 模型?

四楼南侧东 四楼南侧东

表图

2026年8月2日 22:21 北京

在小说阅读器读本章

去阅读

最近,OpenAI 和 Anthropic 都披露了多起模型在真实互联网环境中自主完成网络攻击的案例。假设某家中国模型厂商在一次内部评测中确认,自己的新模型能够自主完成一场端到端网络攻击。它接到目标后自行侦察,寻找入口,发现并利用漏洞,获得更高权限,随后在复杂的 IT 环境中横向移动,进一步访问更重要的系统和数据。整个过程中,人类只给出目标,没有为它逐步编写攻击脚本,也没有告诉它下一步应该做什么。

这家模型厂商第二天应该做什么?

最容易想到的动作是准备发布会:公布评测结果,展示模型能力,邀请客户试用,争夺“国内第一”的位置。但我认为,这家模型厂商应该暂缓向公众提供完整能力,在监管部门指导下,用三个月时间对关键信息基础设施和关键软件供应链开展一次大规模、受控的安全验证与修复。这里所说的关键信息基础设施,是由各行业、各领域的保护工作部门依法认定并纳入清单管理的特定网络设施和信息系统。在更广泛的攻击群体获得同样能力的网络安全能力前,抢先对关基系统进行一次全面的漏洞修复至关重要,这可以称为“九十天防御窗口”。

但即使模型厂商愿意这样做,仅靠自身也无法完成。前沿模型可以用机器速度发现漏洞、验证攻击,却不了解每家客户的资产和生产环境,也无法替客户安排变更、完成修复。要把模型能力变成一轮全国性的安全修复行动,模型厂商、安全厂商、软件供应商和关键信息基础设施运营者必须提前建立新的协作方式。

他山之石:Mythos 是如何被发布出来的

Anthropic 发布 Mythos 的过程,值得中国模型厂商研究。2026 年 4 月 7 日,Anthropic 公布 Claude Mythos Preview。这是一款通用前沿模型,但它在网络安全任务上的能力出现了明显跃迁。除了发现单个漏洞,它还能验证漏洞是否真实可利用,并把多个看似不严重的问题串成完整攻击链。Anthropic 没有将其作为普通模型直接推向公众,而是同步启动 Glasswing 项目,把 Mythos Preview 的访问权限限定在大约 50 家关键软件厂商、基础设施运营者和安全机构。参与者可以通过 Claude API、Amazon Bedrock、Google Cloud Vertex AI 和 Microsoft Foundry 调用 Mythos Preview,赶在同等能力大规模扩散之前,先扫描自己的关键代码和系统。

一个多月后,Anthropic 披露,Glasswing 参与者合计发现了超过 1 万个高危或严重漏洞。Cloudflare 在自己的关键系统中发现约 2,000 个问题,其中约 400 个被评为高危或严重;Mozilla 则在 Firefox 150 的测试中发现并修复了 271 个漏洞。这些数字的验证口径并不完全相同,但已经足以看出,前沿模型正在大幅提高漏洞发现的速度和规模。

6 月 9 日,Anthropic 又发布了 Fable 5 和 Mythos 5。两者使用同一个底层模型,区别主要在安全护栏。面向普通用户的 Fable 5 设置了更严格的网络安全限制;Mythos 5 则在部分网络安全任务上放宽限制,只提供给 Glasswing 中经过验证的防守方。同一套底层能力由此形成了两种发布方式:一般用户使用护栏更严格的模型,可信安全团队获得更完整的网络安全能力,同时接受更严格的访问控制。

三天后,美国政府以国家安全和出口管制为由,要求 Anthropic 停止向外国人提供 Fable 5 和 Mythos 5。Anthropic 当时无法实时核验全球用户和员工的国籍,只能暂停所有用户的访问。此后,Anthropic 与政府及合作伙伴重新审查此前存在争议的安全护栏绕过方式,并更新安全分类器。6 月底相关限制解除,Fable 5 恢复面向全球用户开放,Mythos 5 则先恢复给部分美国机构,再逐步扩大可信访问范围。

从这段过程看,具备高级网络攻击能力的模型很难照着普通产品的方式发布。能力如何分级、谁可以访问、在哪些环境中运行、怎样监测滥用,以及何时与政府和产业伙伴联动,都构成发布方案的一部分。模型正式上线时,访问机制、安全护栏、运行监测和外部协作也必须同时就位。

光有模型 API 还不够,漏洞发现需要框架和流程

Glasswing 解决了谁可以使用 Mythos,却没有替参与者解决怎样把模型用好的问题。项目提供的是受控模型访问,代码、运行环境、安全工具和工作流程仍要由每个参与者自己准备。拿到 API 以后,参与者还得自己回答如何拆分任务、怎样调用工具以及如何验证结果。

Cloudflare 最早尝试的办法很直接:把一个通用 coding Agent 指向代码仓库,让它自己寻找漏洞。模型确实会给出一些发现,但这种方法无法有效覆盖大型代码库,也会产生大量似是而非的结果。一个 Agent 沿着单条思路工作,很快就会受到上下文长度、任务漂移和吞吐量限制。它适合围绕一条已有线索深入调查,不适合对数十万行代码开展系统性的漏洞研究。

Cloudflare 最后围绕模型建设了一套专用 vulnerability harness。系统先理解代码库架构、入口和信任边界,再按模块和漏洞类型拆成大量边界清楚的小任务,由多个 Agent 并行探索。初步发现还要交给独立 Agent 验证,随后完成去重、跨代码库可达性分析和结构化报告。只有能够证明攻击者输入确实抵达漏洞的发现,才进入人工处理队列。

这套 harness 还有一个重要特点:底层模型可以替换。Cloudflare 后来专门写了一篇文章,介绍如何建设不依赖单一模型的漏洞发现 harness。

[译苑雅集Vol. 12]高强度使用 Mythos 两个月后,Cloudflare 打造了一套不依赖单一模型的企业级漏洞发现工程系统

今天表现最好的模型可能是 Mythos;下一代模型出现以后,既有的侦察、验证、去重和报告流程仍然可以继续使用。

模型决定能力上限,harness 决定能力能否转化为稳定产出。

漏洞发现能力大幅提升后,修复能力成为新瓶颈

即使有了好的 harness,九十天防御窗口仍然可能卡在更现实的地方:漏洞找出来了,谁来修?Anthropic 扫描了 1,000 多个开源项目,Mythos Preview 最初识别出 6,202 个被判断为高危或严重的问题。外部安全团队对其中 1,752 个进行了仔细评估,90.6% 被确认是真实问题,最终确认达到高危或严重级别的比例为 62.4%。模型已经找得相当准,麻烦也随之转到维护者一边:短时间内多出了一个巨大的待处理队列。

Anthropic 公布阶段结果时,已经向维护者披露了约 530 个高危或严重漏洞,完成修复的只有 75 个。部分差距来自九十天协调披露期尚未结束,也有些漏洞可能已经修复但没有公开记录。即便如此,Anthropic 仍然承认,开源维护者的处理能力已经成为现实约束。有些维护者甚至要求它放慢披露速度,因为团队没有足够时间完成验证和补丁设计。一个高危或严重漏洞平均需要大约两周才能完成修复。

从系统维护者的角度看,早期 Glasswing 带有明显的“管杀不管埋”问题。模型和安全研究团队把越来越多问题送到维护者面前,要关闭风险,仍然要经过复现和定级,确认受影响资产及责任团队,设计补丁、完成回归测试,最后等到合适的变更窗口部署。任何一个环节跟不上,漏洞报告就只能留在待办清单里。

关键信息基础设施的情况更加复杂。许多系统运行时间长,依赖大量第三方组件;有些设备无法随时停机,有些软件已经找不到原始开发团队,还有些漏洞位于供应商无法立即修改的底层产品。即使模型已经给出补丁建议,运营者也要确认修改不会影响业务连续性,必要时还得先用网络隔离、访问控制或虚拟补丁降低风险。

评价这类计划,漏洞发现数量只能算过程指标。经过验证的问题有多少,实际可利用的暴露是否得到优先处理,补丁有没有完成部署和复测,暂时无法修复的漏洞是否已经采取可靠的缓解措施,这些结果更重要。漏洞发现能力跨过门槛以后,修复体系能接住多少,决定了防守优势能否兑现。

网络安全厂商开始接手后半程

模型厂商也看到了修复瓶颈。OpenAI 后来推出 Daybreak,把 GPT-5.5-Cyber、Trusted Access、Codex Security、Patch the Planet 和合作伙伴计划组织在一起。Codex Security 负责验证发现、生成补丁并检查修复结果,Patch the Planet 推动补丁进入开源项目,合作伙伴则把前沿模型嵌入客户已有的产品和服务。

不过,模型厂商很难独自掌握每个客户的资产、攻击路径、实时遥测、业务重要性和变更窗口。同一个漏洞在对外开放的核心系统中可能需要立即处理,在受到多层隔离的系统中则可以等到正常维护窗口。这样的风险判断和大量具体的修补工作,最终仍要由掌握客户环境的网络安全厂商完成。

海外网络安全厂商已经开始尝试这条路。2026 年 4 月,CrowdStrike 发起 Project QuiltWorks:OpenAI 和 Anthropic 提供前沿模型,Falcon 提供客户侧遥测、威胁情报和攻击路径分析,多家服务伙伴负责现场评估与修复。此后,Armadin 的自主攻击能力被接入 Falcon,Accenture 在平台上构建了用于漏洞评估、风险排序和补偿性控制的 Agent;联盟又接入 AWS、保险和风险服务机构。QuiltWorks 把模型、客户环境和交付网络组织到了一起,不过目前披露的案例仍以漏洞发现规模为主,实际修复率和复测通过率还有待验证。

全球最大的独立网络安全厂商 Palo Alto Networks 采取了更贴近客户现场的做法。它推出 Unit 42 Frontier AI Defense,用前沿模型、攻防经验和 Cortex 平台检查客户的基础设施、应用、代码、身份与云环境,验证能够串成真实攻击路径的暴露,再通过风险分析、架构蓝图和安全改造推动整改。4 月底,Palo Alto Networks 又接入 Armadin,推出 External AI Hyperattack Assessment:系统先发现互联网暴露资产、云资源和泄露密钥,再用超过 5 万个攻击模板调度自主攻击 Agent,完成侦察、利用和后渗透模拟,把攻击链变成可以验证的风险证据。

负责交付的 Frontier AI Alliance 随后又吸纳 Cognizant、HCLTech、Kyndryl 等八家咨询与安全服务公司,由 Unit 42 发现暴露、验证攻击路径并提出改造蓝图,合作伙伴进入客户现场完成整改。Project Lightwell 则把链条延伸到漏洞修复:正式补丁无法立即部署时,Palo Alto Networks 先用虚拟补丁阻断利用路径,IBM 和 Red Hat 提供软件修复,IBM Security Services 帮助客户排序、部署和验证。这一计划的长期目标,是把漏洞验证到网络保护上线的时间压缩到同一天。

QuiltWorks 的长处是组织产业资源;Palo Alto Networks 的方案更贴近客户现场,把自主攻击、风险排序、现场整改、临时保护和软件修复接了起来。客户需要回答的是哪些漏洞可以被利用、应该先修什么、由谁修,以及修复后风险是否已经关闭。一个会找漏洞的模型,只是这套能力的起点。

中国版 Glasswing,应当直接按 CTEM 建设

中国模型厂商做出具备端到端网络攻击能力的模型后,早期 Glasswing 的做法只能作为起点。中国版 Glasswing 从第一天起就应该以关闭真实风险为目标,直接建设一套由大模型驱动的 CTEM(Continuous Threat Exposure Management),也就是持续威胁暴露管理平台与运营体系。CTEM 的核心,是把攻击面发现、可利用性验证、风险排序、修复和复测放进持续循环。它通常由多类产品共同支撑:资产管理和外部攻击面管理负责发现资产与入口,漏洞管理、应用安全、云安全和身份安全提供问题线索,BAS(入侵与攻击模拟)、自动化渗透测试和攻击路径分析验证实际风险。威胁情报和业务信息决定优先级,工单、SOAR、虚拟补丁和修复编排工具推动处置与复测。

放到本文讨论的场景中,模型的发现需要直接进入客户现有的安全运营和修复流程。大模型驱动的 CTEM 要把代码和软件组件、身份权限、互联网暴露、网络路径与运行时遥测连接起来。模型持续寻找新的攻击路径,harness 拆解并验证任务,安全平台结合客户环境判断业务影响,修复团队或自动化系统负责落实解决方案,修完再由模型复测。

这套体系至少需要五类参与者。模型厂商提供基础模型、可信访问和后训练能力,并对高风险调用实施身份验证、范围限制、日志审计和异常监测。安全厂商建设专用 harness,把模型接入资产管理、攻击面管理、代码安全、身份安全和检测响应平台,同时提供客户现场服务。关键信息基础设施运营者提供合法授权、系统知识和业务连续性要求。基础软件和设备厂商负责处理共性漏洞、供应链漏洞并提供正式补丁。保护工作部门则依据既有清单,协调测试范围、授权管理、漏洞处置和跨单位协作。

这套平台的输出不能停在漏洞报告上。每次测试都要先确定范围和授权边界,弄清资产、软件组件及其相互关系。模型和 harness 找到暴露后,安全平台结合可利用性和业务影响排出优先级,再推动修复方案生成、测试和部署。工作完成的标志是复测确认风险已经降低,并留下可以审计的证据。

这套体系还必须适应中国关键信息基础设施的现实。许多运营者要求数据、代码和日志留在本地,模型需要支持专有云、私有化部署或受控远程调用。工业控制、医疗、能源和通信系统对连续运行要求很高,正式补丁无法快速部署时,需要先用网络隔离、虚拟补丁和检测规则降低风险。软件资产和维护责任往往分散在不同单位,平台还得把问题准确送到设备厂商、软件供应商或系统集成商手中。

模型提供能力,专用 harness 负责执行,安全平台补上客户环境和控制手段,服务团队与软件厂商完成修复。缺了其中任何一环,前沿模型都很难从一次能力展示变成关键信息基础设施运营者可以持续使用的安全工具。

更强模型到来之前,模型厂商和安全厂商就要开始联合建设平台

建设这套体系,不必等到国内真的出现 Mythos 级模型。GLM-5.2、Kimi K3、DeepSeek V4 等国内模型已经具备很强的代码和 Agent 能力。安全厂商已经可以用这些模型建设第一代 vulnerability harness,从资产理解和任务拆分开始,逐步跑通工具调用、漏洞验证、攻击路径分析、修复建议和复测。

平台之外,模型训练也要提前准备。安全厂商拥有真实客户场景、攻防经验、漏洞样本和安全工具,模型厂商掌握基础模型以及后训练和强化学习基础设施。双方可以共同建设合法、隔离的网络靶场,把漏洞发现、利用验证、长程路径规划、补丁生成和修复复测变成结果可判定的训练任务。只要沙箱能够判断任务成败,模型就可以围绕明确奖励持续进行RL强化学习训练。

这项合作不能停留在一次微调上。新的漏洞类型、软件架构和攻击路径不断出现,安全平台也会积累成功与失败的执行轨迹。模型厂商和安全厂商需要建立长期的后训练机制,把新的漏洞样本、攻击路径和执行结果持续送回训练与评测体系,同时保留严格的授权边界和全程审计。

平台本身还应保持模型可替换。下一代模型跨过端到端攻击能力门槛后,平台可以替换能力内核,不必重建既有 harness、资产上下文、修复流程和客户连接。如果等到新模型发布以后再寻找合作伙伴、建设靶场、理解客户资产并设计修复流程,九十天窗口很可能在准备过程中耗尽。现在动手,等窗口开启时,手里才会有已经跑起来的平台、团队和客户关系。

写在最后

中国第一个能自主完成端到端网络攻击的模型,很可能在我们做好准备之前出现。Anthropic 预计,Mythos Preview 发布后的六到十二个月内,其他模型厂商也会陆续获得相近能力。无论这个估计是否准确,能力扩散的方向已经很清楚,讨论的重心应该从“会不会发生”转向“什么时候发生”。

第一家掌握这种能力的中国模型厂商,首先得到的是一段稀缺的防御时间。它有机会让关键信息基础设施和关键软件供应链赶在同类能力大规模扩散前完成一轮验证和修复,也有责任避免把未经约束的高级攻击能力直接交给所有用户。

国内网络安全厂商可以在模型厂商、保护工作部门和关键信息基础设施运营者之间承接这套能力:把前沿模型装进专用 harness,接入客户资产和安全平台,组织软件厂商与服务团队完成修复,再用持续复测证明风险已经降低。这样一套由大模型驱动的 CTEM 平台,很可能成为下一阶段最重要的安全产品之一。


免责声明:

本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。

任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。

本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我

本文转载自:表图 四楼南侧东 四楼南侧东《中国应该如何发布第一个能自主完成端到端网络攻击的 AI 模型?》

评论:0   参与:  0