【AI安全】工具输出可以建议动作,但不能签发执行权

admin 2026-09-03 04:52:07 网络安全文章 来源:ZONE.CI 全球网 0 阅读模式

文章总结: 本文介绍SARA框架,针对工具型Agent中工具输出与命令混淆的安全风险,通过隔离动作探针、来源账本及授权证据链,将攻击成功率控制在0.63%以内,同时保持任务效用。文章强调历史重复不能升级为权限,并建议企业开展红队测试验证审计日志。 综合评分: 70 文章分类: AI安全,红队


【AI安全】工具输出可以建议动作,但不能签发执行权

原创

Oxo Security Oxo Security

Oxo Security

2026年8月30日 00:44 湖北

在小说阅读器读本章

去阅读

在公众号小说中沉浸阅读

一、0.63%:SARA专门拆开“想做”与“能做” 🎭

AI 时代!人人都在深耕 AI 安全,你缺的就是这关键一步!

AI 正重塑安全边界,与其在门外徘徊,不如直接掌握主动权!

免费课程持续更新

https://space.bilibili.com/452583051/lists/7870008?type=season

论文《When Tool Outputs Become Commands》于2026年8月27日提交,研究的是工具型 Agent 最容易被忽略的一次角色串线:搜索结果、邮件正文或网页本应只是 Observation,却开始用命令口吻指定下一步动作。作者提出 SARA,在 AgentDojo 与 AgentDyn 的四组主要设置中,把攻击成功率控制在 0.63%以内,同时保持有竞争力的任务效用。📉

Oxo Security 认为,核心问题并非模型“听不听话”,而是系统让同一段文本同时承担了两种权力:诱导候选动作的表达权,以及授权真实执行的决定权。⚠️ 外部数据当然可以提示“或许需要发邮件”,但它不能仅凭自己写着“立即发送”就获得调用邮件工具的权限。

SARA 把运行时分成两侧:Observation 侧识别动作诱导并保留来源;Execution 侧只根据用户目标和已授权成功执行的审计证据放行工具。🧾 这不是简单加一个分类器,而是重新定义“什么证据有资格支持动作”。

| 问题 | 常见 Agent | SARA | | — | — | — | | 工具输出中的命令 | 直接混入推理上下文 | Action Probe 隔离暴露诱导语义 | | 动作来源 | 多步后逐渐模糊 | 持久记录 provenance | | 授权依据 | 模型当前认为合理 | 用户目标 + 已授权成功证据 | | 历史重复 | 容易被当成惯例 | No-History-Promotion 禁止洗白 |

论文的适用边界是工具增强型 Agent,而不是对所有 LLM 风险的通用解决方案。🔬 它评测 AgentDojo、AgentDyn 和若干 Agent backbone;0.63%是这些设置中的上界,不能替代企业对自有工具、参数和审批链的测试。

二、来源账本如何卡住一条“看起来很合理”的调用 🧬

假设用户要求“整理供应商报价”。Agent 读取一份外部表格,表格隐藏文字要求把完整报价转发到某地址。普通系统可能把“转发”解释为完成任务的必要步骤;SARA 首先让上下文隔离的 Action Probe 标记:这个候选动作来自不可信 Observation,而不是用户目标。🕵️

随后执行授权器要求动作同时满足三类支持:目标支持、执行链支持、参数级支持。“发送邮件”可能在抽象上服务于协作目标,但收件人、附件和数据范围仍必须逐项找到被授权证据。📨 只要攻击者地址只能追溯到工具输出,参数级证据就不成立。

SARA 还规定 No-History-Promotion。攻击者常用“重复即正常”的策略:先让系统多次看到同一地址或动作,等它进入历史后,再让模型把它当成既有惯例。来源不会因为被重复看见就升级成权限,只有经过授权且成功的执行证据才能进入授权侧。🔁

运行链可以写成:

  • 📥 Observation 进入隔离探针,提取可能诱导的动作;
  • 🏷️ provenance 记录动作、参数和原始来源;
  • 🎯 授权器对照用户目标检查必要性;
  • ⛓️ 对照已授权执行链验证上下文连续性;
  • 🔐 对每个危险参数寻找独立支持,缺一项就拒绝。

企业可立即做一个红队测试:在网页、工单、邮件附件中分别放入同一条外发指令,观察审计日志能否回答“这个收件人第一次出现在哪里”。✅ 如果只能看到最终模型推理,看不到参数来源,授权层仍然是在给模型的说服力投票。

三、历史不是权限:最危险的洗白发生在成功之后 🧼

🎯【历史不是权限:最危险的洗白发生在成功之后 🧼】

这一节真正关键的不是「历史不是权限:最危险的洗白发生在成功之后 🧼」这个概念本身,而是它背后的判断路径、执行边界和可复用方法。

它怎样落到真实安全团队的工作流里?哪些细节会直接影响 AI 代理的可靠性?

加入 Oxo AI Security 知识星球,可查看本节完整内容,系统掌握「历史不是权限:最危险的洗白发生在成功之后 🧼」的完整拆解与实战用法。

📚 AI 文献解读:最前沿的 LLM 安全论文深度剖析。

🐛 AI 漏洞情报:第一时间掌握主流大模型的 0-day 漏洞与越狱方式。

🛡 AI 安全体系:从红队攻击到蓝队防御的全方位知识图谱。

🛠 AI 攻防工具:红队专属的自动化测试与扫描工具箱。

🚀立即加入 Oxo AI Security 知识星球,掌握 AI 安全攻防核心能力!


免责声明:

本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。

任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。

本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我

本文转载自:Oxo Security Oxo Security Oxo Security《【AI安全】工具输出可以建议动作,但不能签发执行权》

评论:0   参与:  0