文章总结: 本文介绍AI逆向分析平台利用大模型自动分析恶意HWP样本的实践。通过对比DeepSeek、GPT和Gemini三个模型的分析结果,展示AI能自动识别文件类型、提取载荷、追踪shellcode并还原攻击链,最终生成可复核的专业报告。文章强调多模型接入的价值及平台需规定证据标准与报告边界,为安全分析提供新思路。 综合评分: 88 文章分类: 恶意软件,漏洞分析,逆向分析,ai安全,安全工具
从查VT跑沙箱到拥有一名AI逆向分析师
原创
L L
狼蛛安全实验室
2026年9月11日 07:47 广东
在小说阅读器读本章
去阅读
在公众号小说中沉浸阅读
从“查 VT、跑沙箱”到拥有一名 AI 逆向分析师
过去,很多安全服务人员拿到一份可疑样本,通常先丢 VT,再跑沙箱。
查 VT,是想知道有没有人见过它、各家安全厂商如何判定;跑沙箱,是想观察它在一个受控环境里启动了什么进程、修改了哪些文件、连接了哪些地址。
如果两者仍然无法给出明确答案,样本就只能继续转交给逆向分析人员。
然而,高级逆向人员数量有限。面对包含文档、脚本、Shellcode 和多阶段载荷的复杂样本,他们同样需要逐层拆解文件、处理混淆、阅读反编译代码、验证关键逻辑。一份复杂样本即使交到专家手中,也可能需要数小时甚至数天才能完成分析。
今天,大模型已经具备很强的代码理解和推理能力,但只有一个对话框仍然不够。
我们为 AI 配备了隔离分析环境、反编译工具、文件解析与脚本工具,以及专业的分析方案和任务编排流程。用户无需掌握逆向技术,也不必预先判断样本类型,只需提交样本、选择分析方案,AI 就能像一名资深逆向分析师一样持续工作:自动识别文件类型,选择合适的分析工具,逐层提取载荷,追踪关键代码,提出并验证假设,还原程序配置与通信机制,最终形成一份包含分析证据和中间产物、可由人工复核的专业报告。
AI 不再只是回答逆向问题,而是开始独立完成逆向任务。
这一次,我们选择了一份真实攻击样本进行验证。
一份很多沙箱都不擅长处理的 HWP 文档
本次测试使用的是一份从公开渠道获得的真实 HWP 样本。HWP 是韩国 Hancom Office 使用的文档格式,可以简单理解为韩国常见的“Word 文档”。
HWP 文件依赖特定的软件环境,许多通用沙箱缺少这套环境,因而无法进行有效的动态分析。
我们用这份样本检验 AI 自动化逆向分析平台面对真实复杂文件时能分析到什么程度。技术结论要求 AI 从样本自身提取证据,公开威胁情报主要用于后续关联与归因。
样本的基本信息如下:
| 项目 | 内容 |
| — | — |
| 文件类型 | HWP 5.0 / CFB-OLE 复合文档 |
| 文件大小 | 640,817 字节 |
| MD5 | A5E4D92C27FB4F8308F77A3833451801 |
| SHA-256 | a73c3f27b0c6ccb8eddde4c0b9d00893f853bb7a5abf50a20a7a687fee8e8ade |
| 诱饵主题 | 韩国 KTV 时事访谈节目嘉宾邀请 |
该样本也出现在奇安信威胁情报中心公开的 Kimsuky 鱼叉式钓鱼活动分析中,可作为外部交叉验证材料。
同一份样本,交给三个不同的大模型
大模型已经具备很强的代码理解能力,但不同模型的逆向分析能力并不相同。为了观察这种差异,我们在同一平台中使用同一份 HWP 样本、同一个“基础恶意行为分析”方案,分别创建了三个任务。
图:同一份样本、同一分析方案,由三个不同模型完成,平台均判定任务已完成、风险等级为高。
我们根据三份任务的完整事件日志,对耗时、Token 和有效分析工具调用进行了统计:
| 模型 | AI 实际分析耗时 | 非缓存 Token | 分析工具调用 | | — | — | — | — | | DeepSeek V4 Pro(high) | 13 分 26 秒 | 139,085 | 30 次 | | GPT-5.6 Sol(high) | 20 分 48 秒 | 190,586 | 44 次 | | Gemini 3.8 Flash(high) | 10 分 15 秒 | 672,048 | 55 次 |
耗时从 AI 运行时收到任务、正式开始分析的首个事件算起,到最终报告生成完毕为止,不包含用户创建任务后可能发生的排队、虚拟机分配和运行时启动等待。
效率之外,更重要的是模型是否真正回答了分析方案提出的问题。本次方案要求识别样本行为、持久化方式、网络活动、风险指标和攻击归因;我们将几个分析目的结果纳入对比。
| 分析目标 | DeepSeek V4 Pro | GPT-5.6 Sol | Gemini 3.8 Flash | | — | — | — | — | | 样本行为 | 部分完成 | 完成 | 完成 | | 持久化 | 结论有偏差 | 完成,边界明确 | 未明确回答 | | 网络活动(C2) | 未完成 | 完成 | 完成 | | 风险指标 | 部分完成 | 完成 | 完成 | | 威胁归因 | 未完成 | 完成,中等置信度 | 完成,但置信度偏高 |
这里的“完成”表示报告给出了能够支撑结论的样本证据;“部分完成”表示只覆盖了攻击链的一部分;“结论有偏差”或“未明确回答”,则表示该次任务仍需要人工复核或补充分析。这只是对本次实际报告的评价,不代表模型在其他样本上的固定能力。
三个模型取得了相同的基础结论:
- 样本是高风险恶意 HWP 文档;
- 文档内部包含 OLE 对象、批处理和混淆 PowerShell;
- 攻击链涉及
help.exe进程注入; - 样本会使用正常诱饵内容掩盖后台恶意行为。
真正的差异出现在继续向下追踪的深度,以及模型对证据边界的把握上。
DeepSeek:Token 最少,但遗漏了关键后续阶段
DeepSeek V4 Pro 在 13 分 26 秒内完成任务,非缓存 Token 和工具调用次数都是三者中最少的。它成功识别了恶意 HWP、批处理、PowerShell 和进程注入,足以判定样本为高风险。
但它没有继续识别出原始 HWP 文件尾部实际存在的 817 字节 Shellcode,也没有还原出 C2 和二阶段下载逻辑;同时,它对脚本中的文件路径产生了错误理解,进而推断出并不存在于已分析阶段的 Hwp.exe 替换持久化行为。
这份结果说明,较少的 Token 和较快的收敛可以提高效率,但如果模型过早认为证据已经充分,也可能停在攻击链中间,甚至基于错误理解形成结论。
GPT:耗时更长,但对事实、推断和未知边界最克制
GPT-5.6 Sol 用时约 20 分 48 秒,是三次任务中耗时最长的,但报告对关键边界处理得更严谨。
它不仅还原了文档、BAT、PowerShell、Shellcode、help.exe 注入和网络下载链条,还识别出初始执行依赖用户点击伪装图片,而不是简单地把“打开文档”写成必然自动触发。
在持久化问题上,它明确指出:当前已分析阶段没有发现计划任务、服务、注册表 Run 键或启动目录等持久化实现;由于服务器端最终载荷没有取得,不能排除后续载荷建立持久化。在攻击归因上,它将 Kimsuky 的置信度保持为“中等”,与公开情报的结论一致。
这份报告的特点不是给出最强烈的结论,而是明确告诉读者:哪些已经由代码确认,哪些仍然未知,哪些判断依赖公开威胁情报。
Gemini:速度最快、追踪最深,但归因置信度更激进
Gemini 3.8 Flash 用约 10 分 15 秒完成任务,是三者中最快的。它进行了最多的分析工具调用,使用 Ghidra 继续追踪 817 字节 Shellcode,并还原出 C2 解密、WinINet API 动态解析、二阶段下载、XOR 解密及内存执行机制。
它还生成了 BAT、PowerShell、Shellcode、诱饵文档和辅助分析脚本等多份产物。就攻击链覆盖范围和交付内容而言,这份报告最适合直观展示 AI 在十分钟内能够完成多少工作,因此本文后续以这次任务作为主要案例。
不过,它把 Kimsuky 归因置信度提高到了 95%,并使用了“完整还原”等较强措辞。考虑到服务器端最终载荷并未取得,公开情报对该活动也只给出中等置信度归因,正式报告仍应由平台规则或人工复核对这些措辞进行校准。
对比结果说明了什么
这不是一次具有统计意义的模型排行榜,只是同一样本、同一方案下的三次真实任务。换一个样本或分析目标,结果可能发生变化。
但它至少说明了三点:
- 大模型的选择会真实影响逆向结果。 差异不仅体现在速度和 Token,也会体现在是否继续追踪、能否正确理解代码,以及是否克制地区分事实与推断。
- 平台不能只负责“调用模型”。 它还需要规定证据标准、完成条件和报告边界,并保存完整任务过程,使结果可以比较和复核。
- 报告质量不能只看结论有多丰富。 少分析一层可能漏掉 C2,分析得很深也可能产生过度归因;真正可靠的是代码证据、分析产物、限制说明和人工可复核性。
因此,多模型接入的价值并不只是让用户在界面上选择不同名称。它使团队可以根据任务复杂度、时效要求和结果严谨性选择模型,也为同一样本的交叉分析和质量评估提供了条件。
AI 用十分钟分析出了什么
下面具体展开速度最快的 Gemini 任务。我们把原始文件提交给平台,选择恶意样本分析方案,随后由 AI 在隔离环境中完成分析。
从任务首个事件到最终报告生成,实际执行时间约为10 分 15 秒。
任务完成后,平台生成了包含关键发现、攻击链、判定依据、技术细节和分析产物的专业报告:
图:Gemini 任务生成的真实报告页面,关键发现中直接展示了从 HWP、BAT、PowerShell、Shellcode 到二阶段载荷的分析链条。
这十分钟得到的不是一句“这是恶意文件”,也不是一个依赖特征库匹配的病毒家族标签,而是一条落实到文件、脚本和代码证据的多阶段攻击链。这条链条的价值,在于它回答了沙箱报告经常无法回答的几个问题:恶意代码藏在哪里?每一层如何进入下一层?为什么要注入系统进程?通信地址如何生成?下载的数据又将怎样被解密和执行?
第一层:拆开 HWP,找到隐藏的对象
AI 首先识别出,该文件并不是普通的单层文档,而是一个 HWP 5.0 格式的 CFB/OLE 复合文档。
通过解析内部结构,AI 找到了两个关键嵌入对象:
-
BIN0002.OLE:包含第一阶段批处理脚本;
-
BIN0003.OLE:包含用于欺骗受害者的正常诱饵文档。
此外,AI 发现原始 HWP 文件尾部还追加了 817 字节数据。后续分析证明,这段数据就是攻击链中的 Shellcode。
这已经超出了“文档是否报毒”的层面。AI 开始回答攻击者是如何组织这份恶意文档的。
第二层:解开 BAT 和 PowerShell
AI 从 OLE 对象中提取出第一阶段批处理脚本。该脚本会判断系统架构,选择对应的 PowerShell 路径,并对一段十六进制混淆内容进行转换,恢复出下一阶段 PowerShell 代码。
继续分析解码后的 PowerShell,AI 还原出了完整的进程注入与反取证流程:
- 隐藏 PowerShell 窗口;
- 查找当前运行的 HWP 进程,并取得正在打开的恶意文档路径;
- 终止 HWP 进程,解除原文件占用;
- 从原始文档尾部截取 817 字节 Shellcode;
- 以挂起状态启动系统程序
SysWOW64\help.exe; - 将 Shellcode 写入
help.exe,再通过远程线程执行; - 用正常诱饵文档覆盖原恶意文件并重新打开;
- 删除临时脚本,降低受害者察觉攻击的可能性。
对受害者来说,表面上可能只是文档短暂关闭后又重新打开;在后台,恶意代码已经进入一个合法系统进程。
第三层:进入 Ghidra,追踪 Shellcode
面对从文档中提取出的原始 Shellcode,简单的字符串扫描已经不够。AI 将其交给 Ghidra,结合反汇编和反编译结果继续追踪代码。
分析确认,该 Shellcode 会先通过 GetPC 技术获得自身位置,再使用单字节 XOR 解密出通信地址。随后,它通过遍历 PEB、计算 ROR13 哈希的方式动态定位所需的 Windows API,并加载 WinINet 网络组件。
代码逻辑表明,Shellcode 会:
- 连接远程地址
work3.b4a.app; - 申请约 10 MB 的可执行内存;
- 下载服务器返回的二阶段数据;
- 以返回数据的首字节作为 XOR 密钥完成解密;
- 将执行权直接转移到解密后的载荷。
由于隔离分析环境没有配置外网,平台提示词也不允许主动连接 C2,因此没有尝试下载二阶段文件。
第四层:不只分析行为,还尝试完成归因
逆向分析回答的是“样本做了什么、如何做到”;威胁归因还要继续回答“它可能与谁有关”。
AI 将以下信息进行了关联:
- 面向韩国涉朝政策与学术专家的 KTV 节目邀请诱饵;
- HWP 内嵌 OLE 对象和多阶段脚本投递方式;
- 注入
SysWOW64\help.exe的实现; - 在原文档尾部追加 Shellcode;
- 用正常诱饵覆盖恶意文档的反取证手法;
- 样本中的通信基础设施与公开威胁情报。
综合这些证据,任务报告给出了与 Kimsuky 相关的高置信度判断。公开威胁情报也将相关活动以中等置信度归因于 Kimsuky,两者在攻击目标和关键技战术上基本吻合。
归因不是看到一个相似字符串就贴上组织标签。即使多个维度高度吻合,它仍然是一项需要说明证据来源和置信度的分析判断,而不是绝对事实。
AI 交付的不只是结论
一次可复核的逆向分析,不能只有最终文字报告。其他分析人员应当能够沿着报告中的证据,检查每一个关键判断来自哪里。
本次任务在分析过程中生成并记录了五类关键产物:
| 分析产物 | 作用 |
| — | — |
| stage1_installer.bat | 从 OLE 对象中提取的第一阶段批处理脚本 |
| stage2_powershell_0.ps1 | 解混淆后的 PowerShell 注入与反取证代码 |
| stage3_shellcode.bin | 从 HWP 文件尾部提取的 817 字节 Shellcode |
| lure_decoy_document.hwp | 从文档中剥离的正常诱饵文件 |
| fetch_and_decrypt_stage2.py | 根据逆向结果生成的二阶段获取与解密辅助脚本 |
报告同时给出了样本结构、关键代码逻辑、解密算法、网络 IOC、风险判断、处置建议和分析限制。
这意味着分析人员拿到的不是一个黑盒答案,而是一组可以继续验证、检测和处置的成果。
平台用约十分钟完成的,不是一次病毒扫描,也不是给样本贴上“恶意”标签,而是一次有过程、有代码证据、有中间产物、可以人工复核的逆向分析。
为什么只有一个大模型对话框还不够
看到这里,一个自然的问题是:既然大模型已经能够理解代码,为什么普通人不能直接把恶意样本发给大模型分析?
因为逆向分析从来不只是“读懂一段代码”。
一个未知样本可能是文档、压缩包、脚本、可执行程序、固件、内存片段或多层载荷。分析人员首先要识别真实格式,然后选择相应的解析方法;发现内嵌对象后要继续提取,遇到混淆要编写脚本还原,得到二进制后还要加载到反编译器中追踪函数和数据流。
在这个过程中,还必须不断提出问题:
- 这段数据是配置、密文还是可执行代码?
- 当前脚本只是加载器,还是最终载荷?
- 某个敏感 API 只是存在,还是确实构成了一条恶意调用链?
- 样本没有运行成功,是因为它没有恶意能力,还是环境没有满足触发条件?
- 哪些是直接证据,哪些是合理推断,哪些仍然未知?
只有对话框的大模型缺少接触样本的安全环境,也没有操作专业工具的“眼睛和双手”;它可能能够解释一段已经提供给它的代码,却无法自行完成从未知文件到最终报告的完整任务。
大模型解决了理解与推理问题,但要让它成为一名真正能够工作的逆向分析师,还需要一套平台。
平台如何让普通人拥有一名 AI 逆向分析师
我们的目标并不是让每个用户先学会 Ghidra、OLE 结构、PowerShell 解混淆和 Shellcode 分析,再来使用 AI。
我们把逆向分析中常用的文件解析工具、脚本环境、反编译工具和隔离分析环境固化在平台中。用户不需要自己搭建逆向实验室,也不需要记住每一种工具的命令和操作方式。
更重要的是,用户可以直接使用自然语言描述自己的分析目标,例如:
判断这份文档是否存在恶意行为,提取它释放的载荷和通信地址,分析持久化与规避机制,并判断它可能与哪个攻击组织有关。
平台据此构建相应的分析方案,把自然语言目标转化为任务目标、可用工具、安全边界、证据要求和报告格式。分析方案确定后,还可以反复用于同类样本,使后续任务拥有相对一致的分析过程和交付标准。
从用户提交样本到取得报告,平台主要解决了五个问题。
1. 固化安全的分析环境
恶意样本不能在办公电脑或承载平台服务的主机上随意打开。平台为每个任务分配隔离分析环境,将样本操作限制在受控虚拟机内,并在任务结束后回收环境。
本次案例中,分析方案明确规定:不得在宿主机加载或执行样本,不得从宿主机连接样本涉及的 IP 和域名;所有样本操作必须在指定隔离虚拟机中完成。
安全边界不再依赖分析人员每次临时注意,而是成为任务流程的一部分。
2. 为 AI 配备专业工具
平台把文件解析器、脚本环境、Ghidra 等逆向工具连接给 AI。AI 先识别样本类型,再决定使用什么工具:文档使用格式解析方法,脚本进行解码和语义分析,Shellcode 或可执行二进制再进入反汇编和反编译流程。
工具不是为了展示“调用过”,而是为了获得能够支撑结论的证据。
3. 用自然语言构建分析方案
用户不必编写复杂脚本来编排分析过程,只需要说明想解决的问题。
“判断是否恶意”“提取配置和 IOC”“分析通信协议”“检查持久化机制”“进行攻击组织归因”,都可以成为分析方案的一部分。平台把这些目标转化为 AI 能够持续执行的任务约束和完成标准。
这使不同岗位可以构建适合自己的方案:安全运营人员关注告警研判和 IOC,应急人员关注攻击链与处置建议,威胁情报人员关注 TTP 和归因,产品安全人员则可能更关注漏洞、协议与关键算法。
4. 让 AI 持续完成任务
真实逆向分析不可能靠一次问答完成。AI 需要在多个工具和多份中间文件之间持续工作,根据新发现调整下一步方向。
平台负责维护任务上下文、调度工具、管理隔离环境、保存中间产物,并要求 AI 为最终报告预留整理时间。AI 则围绕分析目标循环执行:提出假设、调用工具、获取证据、修正判断,再继续深入下一层。
本次任务中,AI 在十分钟内完成了 55 次有效分析工具调用。对用户而言,操作仍然只是提交样本和选择方案。
5. 交付可以复核的结果
最终报告不仅要有结论,还要说明依据、限制和置信度,并保存具有交付价值的中间产物。这样可以减少大模型“给出一个听起来合理的答案,却无法证明”的问题。
整个过程可以概括为:
固化隔离环境和专业工具 ↓用自然语言构建分析方案 ↓AI 自动选择工具并持续分析 ↓交付证据、产物与可复核报告
普通人并不是突然学会了逆向分析,而是平台把专业工具、隔离环境和分析方法组织起来,让普通用户能够用自然语言调用这些专业能力。
过去,只有逆向专家知道应该使用什么工具、先看哪里、如何逐层深入;现在,用户只需描述自己想解决的问题,平台负责把它转化成一项可以由 AI 执行的逆向分析任务。
AI 替代了什么,又没有替代什么
“拥有一名 AI 逆向分析师”,并不等于所有样本都能在十分钟内完整还原,也不意味着高级逆向人员从此不再需要。
AI 自动化平台首先改变的是大量样本的第一轮深度分析。
过去,普通安全人员查完 VT、跑完沙箱,仍然无法解释样本时,只能把问题排队交给少数专家。现在,AI 可以先完成文件拆解、脚本解混淆、关键代码追踪、配置和 IOC 提取、初步归因与报告整理,把一个未知样本转化成带有证据的分析结果。
高级逆向人员可以把时间集中在更困难的部分:
- 强对抗壳、虚拟化保护和自修改代码;
- 未取得的服务端载荷或特殊外部依赖;
- 高风险结论与攻击归因的最终复核;
- 新型攻击技术和分析方案的建设。
换句话说,AI 不是简单复制一个专家的答案,而是在平台提供的环境、工具和流程中,承担原本需要专家逐步操作的大量工作。
对缺少逆向人员的团队,它提供了从“不会分析”到“能够获得代码级结论”的入口;对已经拥有逆向团队的组织,它则可以承担批量初筛和标准化分析,让专家从重复劳动中释放出来。
从看见行为,到理解代码
VT 不会消失,沙箱也不会被取代。它们仍然是样本研判中重要而高效的工具。
真正发生变化的是:在“查 VT、跑沙箱”和“等待高级专家”之间,出现了一种新的选择。
安全人员不再只能知道一个样本有没有报毒、这一次运行做了什么,还可以继续追问:恶意逻辑藏在哪里?代码如何进入下一阶段?配置如何加密?在什么条件下触发?通信机制如何实现?结论有哪些直接证据?
在这份 HWP 样本中,AI 用约十分钟完成了从文档结构、批处理和 PowerShell,到 Shellcode、进程注入、通信机制及威胁归因的连续分析。更重要的是,它留下了能够被人检查的代码证据和分析产物。
大模型提供了理解和推理能力,平台则为这种能力补上了眼睛、双手、实验室和标准作业流程。
用户提交的是一个未知样本,得到的是一名 AI 逆向分析师完成的任务结果。
这或许就是自动化样本分析正在发生的下一次变化:
AI 不再只是告诉我们“它可能有问题”,而是开始解释“问题究竟藏在哪里,它是如何工作的,以及我们凭什么得出这个结论”。
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:狼蛛安全实验室 L L《从查VT跑沙箱到拥有一名AI逆向分析师》
版权声明
本站仅做备份收录,仅供研究与教学参考之用。
读者将信息用于其他用途的,全部法律及连带责任由读者自行承担,本站不承担任何责任。










评论