TechWorld黑客马拉松SHOW——安全畅想:基于COA编排+多智能体架构的智能人机对抗靶场

admin 2026-02-17 20:13:06 网络安全文章 来源:ZONE.CI 全球网 0 阅读模式

文章总结: 绿盟科技提出基于COA编排与多智能体架构的智能人机对抗靶场方案,以解决传统靶场攻击路径预设、缺乏动态博弈及红队专家依赖问题。核心架构包括RAG知识库(消除幻觉)、COA编排(人控战略+AI决策)、三层智能体决策引擎(战略-战术-执行OODA闭环)及武器MCP(决策与执行解耦)。该方案实现7×24小时自适应陪练、白盒决策可解释性,降本增效并量化安全能力,推动网络靶场向数字孪生实战演进。 综合评分: 85 文章分类: AI安全,安全建设,红队,渗透测试,安全运营


cover_image

TechWorld黑客马拉松SHOW——安全畅想:基于COA编排+多智能体架构的智能人机对抗靶场

原创

创新研究院 创新研究院

绿盟科技研究通讯

2026年2月10日 18:09 北京

一.  背景

传统的网络靶场长期受困于攻击路径预设、缺乏动态博弈、高度依赖高成本的红队专家等问题,尤其缺乏专业的攻击人员作为陪练,训练人员难以面对真实的攻击场景和攻击对手进行专业的训练。面对 APT(高级持续性威胁)攻击的高复杂性与隐蔽性,单纯的 “自动化” 工具已难以模拟真实的对抗烈度。攻击者不再按照剧本出牌,而是根据现场防御策略实时调整战术。一切训练的目标围绕实战,如何模拟一个智能化的陪练对手,让受训人员以尽可能接近真实世界的攻击进行实战训练,培养新质战斗力,是亟需解决的问题。

当前,网络安全行业正在经历一场从“自动化”向“智能化”的跨越。我们思考的核心在于:能否基于大模型(LLM)构建一个具备“认知能力”的数字攻防对手进行人机对抗?基于此,我们引入了 AI大模型(LLM) 作为核心大脑,结合 人在回路(Human-in-the-Loop)+OODA的指挥思想,构建智能人机对抗靶场 。基于针对APT组织的画像,利用多智能体(Multi-Agent)技术,对APT组织的技战术倾向、武器工具运用、战术战法运用等进行模拟仿真,让智能体像真实的APT组织一样,具备网络作战的 OODA(观察-调整-决策-行动)闭环能力,实现从“按部就班”到“随机应变”的质变,达到对网络环境和受训人员操作自适应的能力,以期能够实现实时自适应的人机对抗训练。

二.  技术方案

针对当前面临的业务痛点,我们设计了“知识库+COA编排+多智能体决策引擎+武器MCP”的四维深度架构,通过对复杂攻击链进行全面解耦,基于APT组织的攻击策略、网络态势、武器工具等信息,进行实时决策和迭代决策,实现对作战环境和训练人员的自适应陪练。通过“知识库+COA编排+多智能体决策引擎+武器MCP”的核心能力,将整个攻防协作任务拆解成“决策->执行->反馈-决策”的可迭代和闭环的智能系统。

知识库:基于检索增强生成(RAG)技术,以 ATT&CK 战术框架、CVE 漏洞库为核心知识锚点,实现资产情报、漏洞情报的实时聚合与关联映射,核心技术价值是消除决策中的 “信息幻觉”,为后续动作提供可验证的战术依据。

COA 编排:本质是 “行动方案的结构化编排”,形成“攻击阶段-战术-技术-武器工具”的行动方案,由人工定义战略目标与安全边界,AI 完成战术技术的匹配与筛选,同时嵌入宏观约束规则,为实现“人控战略、AI决策战技” 的协同指挥提供数据基础。

多智能体决策引擎:采用 “战略 – 战术 – 执行” 三层拆分的分级指挥架构,结合 OODA 循环(观察 – 调整 – 决策 – 行动)的闭环决策逻辑,通过多智能体的分工协同,完成从目标拆解到动作优先级排序的全链路推理,核心是将复杂决策拆解为可量化、可迭代的原子任务。

武器 MCP:将决策结果转换为可以执行的动作的功能,将上层决策输出转化为可执行的工具参数,并通过 “决策层 – 执行层” 的解耦设计,实现执行动作的灵活替换与风险隔离。

2.1

知识库:基于RAG的动态情报中枢

大模型(LLM)在攻防领域落地的第一道门槛,是 “专业性不足” 与 “输出有幻觉”,即缺乏攻防领域的专属逻辑,也容易凭空生成不可靠的决策。而知识库的核心设计,正是从 “知识锚定、精准检索、数据约束” 三个维度,给大模型补上专业网络安全攻防能力,在决策攻击手段时降低产生幻觉的风险。

对于专业知识库的构建,我们从以下一下三个方面对RAG的向量知识库进行持续构建和迭代:

● 专业知识源

专业知识是知识库的内容根基,我们以ATT&CK、CVE漏洞库、蓝军实战案例等三类核心资产作为底层内容锚点。以 ATT&CK 框架为战术方法论底座,覆盖 “初始访问 – 权限提升 – 横向移动” 的全链路攻击逻辑;以CVE漏洞库同步漏洞的利用条件、影响版本、验证 POC 等技术细节;以蓝军实战案例沉淀 “工具选型 – 作战倾向 – 效果反馈” 的实战经验。这些内容直接补上了大模型 “不懂攻防领域专属逻辑” 的短板,让后续决策从源头就有专业支撑。

● 数据向量化 + 向量数据库

传统关键词检索的痛点是 “漏关联、搜不准”(比如搜 “远程代码执行”,可能漏掉适配的 CVE-2024-xxx 漏洞)。我们通过向量化模型,将 ATT&CK 战术、CVE 漏洞、实战案例转化为 “语义向量”,并存储到向量数据库中,相当于给每段专业知识贴了 “语义标签”,大模型能基于 “语义相似度”,直接匹配到与当前攻防场景强相关的知识,解决 “专业知识检索低效” 的问题。

● RAG 引擎闭环

当攻防仿真中的智能体需要决策(比如 “选什么工具完成初始访问”)时,RAG 引擎会启动 “检索 – 增强” 的闭环逻辑:先从向量数据库实时检索关联知识(对应 ATT&CK 的 “初始访问” 战术、适配当前资产的 CVE 漏洞、同类案例的工具成功率);再将这些 “已验证的数据知识” 投喂给大模型,让大模型基于情报生成决策,而非凭空编造内容。通过将大模型的 “生成式输出” 绑定到 “专业知识实据” 上,彻底消除大模型的 “幻觉” 问题。

2.2

COA编排:演练安全边界的保障

在攻防演练中,“既达成演练目标,又不突破演练边线” 是核心痛点 ,COA(Course of Action,行动方案)编排正是通过 “人控战略 + AI转约束 + 流程锁边界” 的三层逻辑,实现演练安全与目标的双重保障。

在演练开始前,首先我们做好“战略意图”,用户通过可视化界面(COA 编排页面),直接定义演练的核心战略要素 ,包括攻击策略、攻击方向(如内网渗透)、战略目标(如获取靶机权限),把抽象的 “演练需求” 转化为系统可识别的结构化指令,避免后续智能体操作偏离人的预期。然后利用系统大模型(LLM)的意图分析能力,解析用户的战略指令后,自动转化为对智能体的 “宏观约束”, 比如从 “内网渗透” 的需求中,提炼出 “禁止高噪扫描(避免触发真实防御)” 的约束;从 “获取靶机权限” 的目标中,转化出 “优先读取数据库” 的执行规则,把 “人的安全诉求” 嵌入智能体的执行逻辑,从根源上避免智能体出现 “违规操作”。最后,我们将宏观约束映射到具体攻击流程中(如 “探测→低噪扫描→漏洞利用 / 变限→凭证获取→目标达成”),同时通过可视化界面展示全流程,整个演练过程始终处于 “人类设定的演练边界” 内 ,让演练流程 “透明、可控”,既完成教学 / 测试目标,又不会因为幻觉或恶意指令引发演练风险。

最终,通过 “人定战略→AI 转约束→流程锁边界” 的闭环,既保证智能体按目标推进演练,又把操作严格限定在安全范围内,彻底解决了“演练流程失控” 的行业痛点。

2.3

智能体决策引擎:三层分级指挥

APT组织的攻击行为通常由多人或多个决策进行分工协作执行,为了模拟APT组织的多角色,我们将决策引擎解耦为三层 Multi-Agent 架构,由智能体扮演不同的角色。同时通过智能体决策引擎的 “三层分级指挥”,将复杂攻防决策拆解为 “战略 – 战术 – 执行” 的分层闭环,并嵌入 OODA(观察 – 调整 – 决策 – 行动)循环逻辑,解决传统攻防中 “层级混同、响应低效、动作脱节” 的痛点。

战略级的指挥官 / 战略中枢作为顶层大脑,借助战略 OODA 环完成全局态势观察、顶层目标决策与指令下发,为整个攻防行动明确核心方向;战术级的战术队长则承接战略指令,以战术 OODA 环适配当前场景的实际约束,对比不同路径的风险与收益后选定最优战术方案,成为连接顶层意图与落地动作的中间调度层;执行级的一线特种兵则基于战术任务,通过执行 OODA 环调用 Nmap、暴力破解等工具完成具体操作,并将结果实时反馈。整个体系形成 “战略定方向、战术选路径、执行做落地” 的全链路闭环,同时执行反馈反向校准战术、战术反馈校准战略,既避免了顶层方向模糊的问题,也解决了战术选择盲目、执行与意图脱节的协同痛点,让攻防决策高效且精准可控。

2.4

武器MCP:认知决策层与物理执行层的解耦

在攻防决策的落地环节,认知与执行的 “能力断层” 始终是核心卡点:具备成熟战术认知的大模型,能精准规划攻防路径,却缺乏直接操作扫描器、漏洞利用框架等底层工具的能力 —— 二者的直接耦合,要么让战术意图在工具操作中 “变形失真”,要么会因工具迭代被迫频繁调整决策层逻辑。为了填补这一断层,通过武器 MCP,完成对武器库的标准化封装,实现认知决策层与物理执行层的解耦。

在MCP和武器工具协同方面,通过MCP实现 “封装 + 解耦” 的核心设计,顶层是认知决策层(LLM 大脑),只负责输出战术认知与决策,不用关注任何底层工具的操作细节,即大模型的战术判断,无需适配扫描器、口令爆破等工具的不同调用逻辑;中间层的武器 MCP是连接二者的枢纽:它先对武器库中的各类攻防工具做了标准化封装,消解了不同工具的操作差异;再将 LLM 输出的抽象决策,转化为统一的 “原子化指令”,精准下发至对应的工具组件;底层是物理执行层(Kali 攻击机 + 靶场环境),接收 MCP 的原子化指令后,驱动工具与靶场中的 Web 服务器、数据库等资产完成实际交互。

总之,基于MCP,通过标准化封装让大模型的战术认知能精准落地,完成决策层与执行层的解耦,决策层的大模型无需绑定工具逻辑,执行层的工具迭代也不用改动决策层,让两者能独立高效推进。

三.  效果呈现

传统脚本+规则驱动的人机对抗演练,通常“黑箱”操作,用户知其然不知其所以然。我们坚信,在演练与教学场景中,AI 的思考过程比工具执行结果结果更重要。

系统采用全链路白盒决策机制 。系统界面清晰展示 AI 的思维链条(Chain of Thought):

● 态势感知: “当前依据了哪些网络拓扑情报?网络态势?对手执行了什么操作?”

● 决策逻辑: “为何在此时选择放弃暴力破解而转向社工钓鱼?”

● 数据支撑: “利用了哪个历史漏洞的成功率数据?”

通过为大模型提供可靠的决策依据,让决策结果更具有可解释性,让演练复盘变得有据可依 ,防守方不仅能看到攻击结果,更能洞察攻击者的战术意图,从而实现从“被动防御”到“主动防御”的认知升级。

四.  场景案例

为了验证架构的实战价值,我们构建了高仿真的对抗场景,验证人机协同作战的动态决策能力 。

场景设定: 模拟某关键信息基础设施的窃密场景。

● Step 1:想定任务与意图对齐(战略层 – 人)

用户(指挥官):通过可视化的 COA 编排界面定义战略意图。设定总体作战目标,宏观约束。

Step 2:阶段研判与战略决策(战略层 – 机/人协同)

智能体研判(机): “战略智能体”作为中枢大脑,实时接入靶场态势感知数据,运行 OODA(观察-调整-决策-行动)环路。它分析当前对目标网络的认知度极低,结合 RAG 知识库中的 ATT&CK 战术手册,研判当前应进入“网络探测阶段”。系统据此生成决策建议,并给出基于历史案例的置信度理由。

战略确认(人): 指挥官审视 AI 的阶段研判报告及依据。确认 AI 的判断符合当前态势后,一键批准进入“探测阶段”。

Step 3:技战术组合规划(战术层 – 机/人协同)

智能体规划(机): 依据战略层下达的“网络探测”任务,“战术智能体”开始统筹技战术。它权衡后决定开始进入网站指纹扫描的技战术执行。

战术审核(人): 红队专家或指挥官对 AI 生成的战术路径进行快速审核,确保其战术动作组合符合既定的宏观约束,必要时可进行微调干预。

Step 4:武器调度与精准执行(执行层 – 机/人协同)

智能体调度(机): “执行智能体”负责将战术路径转化为具体的工具操作指令。它通过“武器 MCP”协议,调用原子化的安全能力。例如,为了执行被动识别,它自动选择相应的嗅探工具,并配置精准的过滤参数(如只监听特定协议头),而非进行全流量抓包。

执行授权(人): 作为物理世界的最后一道安全阀,人在回路中对高风险操作指令进行最终确认。授权通过后,指令被发送至底层物理靶场环境真正执行,完成“认知”到“物理”的跨越。

五.  客户价值

基于上述架构,智能人机靶场为客户带来了实质性的价值收益:

  1. 降本增效,常态化实战: 解决了“红队专家请人难、成本高”的痛点。AI 智能体可 7×24 小时待命,将高水平的红蓝对抗演练变得低成本、可复制、常态化 。

  2. 能力量化,精准评估: 通过白盒数据记录,精准评估防守体系在攻击链每一个环节(侦查、武器化、交付、利用)的响应时效与有效性,量化安全建设成果。

  3. 以攻促防,验证韧性: 用“会思考的矛”去打磨“盾”。在动态变化的攻击手段面前,验证安全设备配置的真实有效性,避免防御策略流于形式。

六. 结语

网络安全的本质是对抗,对抗的核心是人与人的博弈。引入 AI 大模型与多智能体架构,并非为了完全取代人,而是为了将顶尖攻击专家的经验沉淀为可复用的模型 。通过“人在回路”的战略引导与 AI 的战术执行,我们将网络靶场从简单的“模拟演习”推向了“数字孪生实战”的新高度,为提升客户安全对抗能力提供了最真实的练兵场。

内容编辑:杨林辉

责任编辑:舒    展

本公众号原创文章仅代表作者观点,不代表绿盟科技立场。所有原创内容版权均属绿盟科技研究通讯。未经授权,严禁任何媒体以及微信公众号复制、转载、摘编或以其他方式使用,转载须注明来自绿盟科技研究通讯并附上本文链接。

关于我们

绿盟科技研究通讯由绿盟科技创新研究院负责运营,绿盟科技创新研究院是绿盟科技的前沿技术研究部门,包括星云实验室、天枢实验室和孵化中心。团队成员由来自清华、北大、哈工大、中科院、北邮等多所重点院校的博士和硕士组成。

绿盟科技创新研究院作为“中关村科技园区海淀园博士后工作站分站”的重要培养单位之一,与清华大学进行博士后联合培养,科研成果已涵盖各类国家课题项目、国家专利、国家标准、高水平学术论文、出版专业书籍等。

我们持续探索信息安全领域的前沿学术方向,从实践出发,结合公司资源和先进技术,实现概念级的原型系统,进而交付产品线孵化产品并创造巨大的经济价值。

长按上方二维码,即可关注我


免责声明:

本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。

任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。

本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我

本文转载自:绿盟科技研究通讯 创新研究院 创新研究院《TechWorld黑客马拉松SHOW——安全畅想:基于COA编排+多智能体架构的智能人机对抗靶场》

评论:0   参与:  0