【AI安全】AgentFlow把Agent安全改写成一张可执行的数据流地图

admin 2026-08-27 06:50:30 网络安全文章 来源:ZONE.CI 全球网 0 阅读模式

文章总结: AgentFlow是一种面向LLMAgent系统的流中心策略语言与框架,通过数据流标签和路径规则替代传统工具级权限控制。在949个注入案例中,失陷率从33.0%降至0.0%,聚合效用从46.7%提升至63.3%。核心机制包括带标签边、引用监控器和SMT验证器,将能力绑定到数据、任务、路径与接收者。建议团队绘制敏感数据流图,确保控制面超越动作级。 综合评分: 86 文章分类: AI安全,安全建设,安全运营


【AI安全】AgentFlow把Agent安全改写成一张可执行的数据流地图

原创

Oxo Security Oxo Security

Oxo Security

2026年8月27日 00:04 吉林

在小说阅读器读本章

去阅读

在公众号小说中沉浸阅读

一、949次注入把“动作合规”证伪了

AI 时代!人人都在深耕 AI 安全,你缺的就是这关键一步!

AI 正重塑安全边界,与其在门外徘徊,不如直接掌握主动权!

免费课程持续更新

https://space.bilibili.com/452583051/lists/7870008?type=season

2026年8月24日提交的论文 AgentFlow: A Flow-Centric Policy Language and Framework for Securing LLM Agent Systems,把问题放在了 949 个 AgentDojo 提示注入案例上:原型将已确认失陷率从 33.0% 降到 0.0%,聚合效用反而从 46.7% 提升到 63.3%。在 200 个 AgentDyn Dailylife 案例中,失陷率从 73.5% 降至 0.0%,效用只从 44.5% 轻微变化到 43.5%。📊

Oxo Security 的判断是:Agent 的危险不是某一个工具“看起来能不能调用”,而是敏感数据能否沿着多步任务流到不该到达的接收者。 单步审批只观察当下动作,却看不见一段邮件内容先进入总结器、再被委派给子 Agent、最后混入外发请求的完整路径。只要中间每一步都能给出合理解释,传统逐动作白名单就容易把一条泄露链拆成数个“合法片段”。🧩

论文还在 ASB 的直接提示注入测试中得到 0/1,200 的攻击成功结果,并对 InjecAgent、BIPIA、AgentHarm 与 MCPTox 做了回放检查。值得注意的是,作者明确把结果限定在策略能够观察和建模的行为以及已评测基准内;这不是对所有未知工具、隐藏通道或实现缺陷的通用免疫证明。🔍

| 评测面 | 无流策略基线 | AgentFlow | 应如何解读 | | — | — | — | — | | AgentDojo 注入案例 | 33.0% 已确认失陷 | 0.0% | 949 个案例、四套任务中的可见数据流被拦截 | | AgentDojo 聚合效用 | 46.7% | 63.3% | 策略并非简单“全拒绝” | | AgentDyn Dailylife | 73.5% 已确认失陷 | 0.0% | 200 个动态生活任务 | | ASB 直接注入 | 未给统一基线 | 0/1,200 | 仅代表该测试夹具内的策略可见攻击 |

对落地团队来说,第一项检查不是再添一条“禁止泄密”的系统提示,而是画出三类对象:敏感字段从哪里产生、可以经过哪些处理节点、哪些出口永远不能收到它。🗺️ 如果这张图画不出来,当前 Agent 的权限设计实际上也无法被审计。

二、标签化边把权限绑定到整条路径

AgentFlow 的策略对象不是自然语言中的“工具名称”,而是运行时的一条条带标签边。数据从用户输入、私有存储或工具结果进入系统后获得标签;每次读、写、调用、释放或委派都会形成一条边,引用监控器在动作发生前判断这条边是否满足流规则与路径规则。🚦

最小攻击链可以拆成五步:

  • 📥 Agent 读取一封含有注入指令的外部邮件,同时拥有日历或客户数据访问权;
  • 🏷️ 私有字段携带敏感标签进入工作状态,而不可信邮件携带来源标签;
  • 🤝 主 Agent 把任务委派给另一个拥有网络工具的子 Agent;
  • 🔀 子 Agent 生成一个表面合理的查询参数,把私有字段混入外发内容;
  • ⛔ 引用监控器根据路径与接收端约束,在真正产生网络副作用前拒绝这条边。

这里的关键是四组语义。第一,flow/path rule 约束数据能走到哪里以及经过什么路径;第二,task-scoped capability 让权限只在当前任务范围生效;第三,controlled release 明确何时可以解除某个标签,而不是让模型自己声称“已脱敏”;第四,stateful taint 让污染状态跨多个动作持续存在。🔗

这套机制把“允许调用网络工具”改写成“只允许不含客户字段的数据在本任务中抵达该网络出口”。 两句话看似接近,实际安全边界完全不同:前者把能力授给工具,后者把能力同时绑定数据、任务、路径与接收者。🛡️

论文还提供受限结构策略片段的 SMT 验证器。七个安全属性的验证时间都低于 0.5 秒,研究中人为植入的不安全策略变体全部被发现。形式验证在这里不是替代运行时拦截,而是提前回答:策略组合后是否仍存在一条满足约束却能把敏感数据送到危险终点的路径。🧮

团队可以立即做一次小型回归:挑选一个会读邮箱、查 CRM、写工单并访问 Web 的 Agent,为“客户邮箱”“工单密钥”“外部网页”和“子 Agent 委派”建立标签与边;随后注入一条要求把 CRM 片段拼进 URL 的指令。若系统只能记录“调用被批准”,却不能证明敏感标签没有抵达 URL 参数,就说明控制面仍停留在动作级。🧪

三、引用监控器与SMT验证器如何分工

🎯【引用监控器与SMT验证器如何分工】

这一节真正关键的不是「引用监控器与SMT验证器如何分工」这个概念本身,而是它背后的判断路径、执行边界和可复用方法。

它怎样落到真实安全团队的工作流里?哪些细节会直接影响 AI 代理的可靠性?

加入 Oxo AI Security 知识星球,可查看本节完整内容,系统掌握「引用监控器与SMT验证器如何分工」的完整拆解与实战用法。

📚 AI 文献解读:最前沿的 LLM 安全论文深度剖析。

🐛 AI 漏洞情报:第一时间掌握主流大模型的 0-day 漏洞与越狱方式。

🛡 AI 安全体系:从红队攻击到蓝队防御的全方位知识图谱。

🛠 AI 攻防工具:红队专属的自动化测试与扫描工具箱。

🚀立即加入 Oxo AI Security 知识星球,掌握 AI 安全攻防核心能力!


免责声明:

本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。

任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。

本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我

本文转载自:Oxo Security Oxo Security Oxo Security《【AI安全】AgentFlow把Agent安全改写成一张可执行的数据流地图》

评论:0   参与:  0