文章总结: 本文由黑鸟撰写,基于Trailofbits专栏,系统梳理了AI全链路安全风险。核心观点是AI安全不能仅关注模型幻觉或提示注入,而需覆盖训练数据、MLOps流水线、模型存储、推理硬件及智能体等环节。关键发现包括SleepyPickle攻击利用pickle序列化缺陷植入后门、数据投毒与Datasig溯源方案、图像缩放解析漏洞及Anamorpher工具。可操作建议包括优先使用safetensors格式、引入AIBOM管理、定期使用Buttercup等工具进行自动化压力测试,并强调全链路前置防护的重要性。 综合评分: 90 文章分类: AI安全,漏洞分析,红队,安全工具,渗透测试
不止模型漏洞,AI全链路藏着你看不见的安全风险
原创
黑鸟 黑鸟
黑鸟
2026年8月1日 23:19 广东
在小说阅读器读本章
去阅读
很多人聊AI安全只会盯着大模型幻觉、提示注入(promptinjection)这类表层问题,全球知名安全研究机构Trailofbits专门开设machine-learning专栏,把机器学习(ML)从训练数据、MLOps流水线、模型存储、推理硬件到智能体(agent)完整链路的安全隐患全部拆解清楚,普通用户、AI开发者、企业运维都能看懂这套完整风险逻辑。
先简单认识Trailofbits,这家团队常年承接DARPA(美国国防高级研究计划局)相关AI安全项目。
很多人听过互联网早期ARPANET、自动驾驶、人机交互等颠覆性技术都诞生自DARPA,它不局限于军用技术研发,长期布局可信人工智能、对抗机器学习方向的前沿探索,持续资助高风险高价值的网络安全创新项目,推动AI安全从学术理论走向可落地的工具与标准。
DARPA在2023年正式启动AIxCC(AI Cyber Challenge)赛事,目标打造能够自主寻找、修复代码漏洞的自动化智能系统,缩小攻防双方的能力差距,Trailofbits就是这项赛事的核心参赛团队之一,产出Buttercup、Datasig、SleepyPickle、Anamorpher等多款开源安全工具。区别于只做单一代码审计的厂商,他们的machine-learning安全团队会搭配密码学、应用安全、底层系统工程师协同排查,多数AI系统的致命漏洞都出现在ML、开发、底层硬件、加密技术的交叉地带,单一领域技术人员很难发现这类隐蔽缺陷。
模型文件存储:最容易被忽略的底层爆破点SleepyPickle攻击
绝大多数Python开发者保存训练好的模型都会直接使用pickle序列化格式,这也是Trailofbits专栏重点剖析的高危向量,pickle本质是一套独立虚拟机(pickleVM),文件内部存储可直接执行的操作码(opcode),攻击者不用篡改模型权重,只需要在模型文件里植入恶意字节码,任何人加载这份模型文件时恶意代码会自动运行。
这套攻击手段被团队命名为SleepyPickle,属于混合式模型利用技术,攻击逻辑分三层递进,第一阶段篡改pickle文件植入执行载荷,第二阶段绑定模型后门(backdoor),第三阶段渗透所有加载模型的终端用户,不像传统攻击只破坏服务器,SleepyPickle能顺着模型分发链路扩散风险。
为了解决pickle原生缺陷,团队完成safetensors安全审计,对比pickle做了权限隔离,禁止执行任意代码,同时配套发布MLFiles开源仓库整理全行业主流模型存储格式安全对比,还推出基于Semgrep的静态检测规则,嵌入CI流程就能提前拦截不安全模型加载代码。
训练数据层面:投毒攻击(datapoisoning)与数据集溯源方案Datasig
训练数据是AI的根基,也是攻击者最常用的突破口,传统安全工具没有针对数据集的检测能力,攻击者混入少量恶意样本就能完成数据投毒,在模型内部埋下后门,日常正常识别不会出错,遇到攻击者指定触发条件就输出错误结果,金融风控、人脸识别场景一旦中招会直接造成财产损失。
针对数据溯源空白,Trailofbits推出Datasig工具,核心技术是数据集指纹生成,不用读取完整原始训练数据,就能生成唯一轻量化标识,快速比对两份数据集是否同源、是否被篡改,这套能力直接补齐AIBOM(AI物料清单)的检测短板,文章里用MNIST手写数字数据集完成完整验证,覆盖视觉类模型通用检测逻辑。
除投毒之外,专栏还提到数据泄露衍生风险,部分企业为了云端大规模推理放弃本地端侧处理,选择PCC私有云环境运算数据,即便搭配同态加密(HomomorphicEncryption),现阶段该技术规模化落地存在性能瓶颈,云端解密环节会出现信息泄露漏洞,自研定制ML硬件还会存在底层实现缺陷,同类漏洞在商用AI芯片上早已完成修复,自研硬件很难同步跟进补丁。
输入与图像漏洞:特制样本绕过模型识别Anamorpher工具
视觉类大模型比如Gemini、VertexAIStudio、谷歌助手等都存在图像缩放解析漏洞,Trailofbits专栏详细拆解攻击原理,攻击者制作经过变形处理的特制图像,正常肉眼观察内容合规,但经过模型内置缩放算法处理后会触发隐藏指令,完成越权访问、隐私提取等操作。
团队开源Anamorpher工具,既能生成这类攻击样本,也能给企业做压力测试,批量扫描图像输入接口的防护短板,这类漏洞属于输入处理缺陷,能直接给整条ML流水线植入后门,相关研究成果也在DEF CON安全会议AI专场公开分享,覆盖视觉、多模态大模型通用防御思路。
MLOps全链路审计:从训练到上线的完整威胁建模
Trailofbits不单独拆解某一类漏洞,而是提出端到端AI评估体系,覆盖四大核心环节,第一训练阶段核查数据集来源、标注流程、投毒检测机制,第二MLOps流水线检查代码提交、模型版本管理、自动化部署权限,第三模型制品(modelartifact)检测存储格式、水印、知识产权保护,第四推理环节校验硬件、云端环境、agent循环交互逻辑。
团队会开展红队测试(red-team)模拟真实黑客攻击,针对新型AI架构做威胁建模,专门测试多技术交叉边界的安全盲区,普通企业常规安全测试只会扫描应用层代码,完全忽略ML专属风险,比如模型权重窃取、推理侧信道信息泄露、智能体越权调用内部接口。
自研项目Buttercup正是Trailofbits参与DARPA AIxCC赛事打造的获奖方案,拿下赛事第二名。项目采用多智能体(multi-agent)架构,融合静态分析与AI引导模糊测试(fuzzing),自动挖掘代码漏洞,借助LLM生成修复方案并验证补丁有效性,整套流程无需人工介入,单台笔记本或企业Kubernetes集群都能部署,可覆盖20余种CWE通用漏洞类型,漏洞检出准确率稳定在90%以上。赛事结束后团队直接将整套系统开源,供全球安全从业者学习使用,这也是DARPA各类科研项目一贯倡导的开放思路,把前沿安全能力向行业释放。
AI原生团队落地经验:安全工程师的AI增强工作流
专栏收录团队负责人分享的内部落地案例,一年前公司内部仅5%员工认可引入AI辅助审计,剩余人员普遍抵触,团队搭建三层AI能力体系AI-assisted、AI-augmented、AI-native,配套AI操作手册、能力成熟度矩阵、内部黑客松机制、安全技能仓库、受控插件沙箱市场。
目前团队沉淀94款插件、201项安全技能(skills)、84个专用智能体(specializedagents),AI辅助审计人员每周可定位200个以往人工容易遗漏的漏洞,开源trailofbits/skills项目对外开放模块化安全能力,Claude、Copilot等代码大模型加载后,可完成智能合约审计、污点传播分析、变异测试分拣等专业安全工作,把AI安全能力向中小开发者开放。
这里还要区分LLM与传统编译器的核心差异,LLM不具备确定性与语义约束保障,用作代码辅助工具可行,但脱离人工复核、形式化验证(formalverification)完全自主生成业务代码存在极高风险,专栏多次提醒企业不要直接落地全自动AI代码上线流程。
普通人与开发者可落地的基础防护方案
看完全链路风险不用过度焦虑,专栏配套给出分层可执行防御手段,普通AI使用者日常下载开源模型优先选择带safetensors格式权重的资源,拒绝来源不明的pickle文件;
个人开发者编写训练代码引入Semgrep规则,检测不安全序列化加载逻辑,使用Datasig核对训练数据集完整性;
企业搭建MLOps流程强制接入AIBOM管理,定期使用Anamorpher、Buttercup做自动化压力测试。
针对云端推理场景,优先权衡本地端侧运算与PCC私有云的隐私风险,现阶段同态加密不适合大规模业务,尽量缩短云端数据解密时长,针对自研AI硬件单独做底层漏洞审计,避免芯片实现漏洞引发批量信息泄露。
当下AI行业更多聚焦模型性能迭代、多模态能力升级,完整machine-learning安全链路长期存在大量空白,Trailofbits专栏持续公开无保留的研究报告、开源工具、漏洞复现案例,背后也延续了DARPA推动基础安全研究开放共享的理念。
博客链接:
https://blog.trailofbits.com/categories/machine-learning/
不管是零基础AI爱好者、独立开发者还是企业安全团队,都能顺着这套完整风险框架排查自身AI系统隐患,技术发展永远不能把安全作为后置补充,从数据、模型、流水线到硬件全环节前置防护,才能规避绝大多数可预见的AI攻击风险。
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:黑鸟 黑鸟 黑鸟《不止模型漏洞,AI全链路藏着你看不见的安全风险》
版权声明
本站仅做备份收录,仅供研究与教学参考之用。
读者将信息用于其他用途的,全部法律及连带责任由读者自行承担,本站不承担任何责任。









评论