【AI安全】把“克制”教给Agent:越权事件率从4.56%降到0.79%

admin 2026-08-23 04:31:28 网络安全文章 来源:ZONE.CI 全球网 0 阅读模式

文章总结: 本文介绍一篇论文,通过训练让Agent学习最小权限,将越权事件率从4.56%降至0.79%,安全成功率提升至98.48%。研究采用前置和后置审计方法,确保动作意图与效果符合任务权限包络。企业应重新设计Agent评估表,增加权限请求数量等指标,以区分精确完成与越权完成。 综合评分: 83 文章分类: AI安全,红队,安全运营,安全意识


【AI安全】把“克制”教给 Agent:越权事件率从 4.56% 降到 0.79%

原创

Oxo Security Oxo Security

Oxo Security

2026年8月21日 18:07 吉林

在小说阅读器读本章

去阅读

一、最小权限第一次不只是系统规则,也成了模型要学习的行为 🎓

AI 时代!人人都在深耕 AI 安全,你缺的就是这关键一步!

AI 正重塑安全边界,与其在门外徘徊,不如直接掌握主动权!

免费课程持续更新

https://space.bilibili.com/452583051/lists/7870008?type=season

论文 *Learning Least Privilege for Tool-Using Agents* 把一个长期被当作工程外壳的问题放进训练目标:Agent 不仅要完成任务,还要主动避免超出任务所需的权限和副作用。研究使用 Qwen3.5-4B,在 1,500 个训练任务上构造权限反馈,并用 500 个留出任务、2,896 个评测回合检验泛化。📚 结果显示安全成功率从 64.36% 提升到 98.48%,记录到的 excess-authority events 从 4.56% 降到 0.79%。这组数字说明模型可以学习“少做不必要的事”,而不必把安全完全寄托在拒绝执行上。

传统 Agent 基准通常只问“最后有没有完成目标”。只要文件被创建、工单被更新或服务被部署,中途多读了目录、多请求了权限、尝试了越界工具,往往不会扣分。🚦 论文改用任务充分权限包络:先定义完成当前任务所必需的最小动作集合,再把动作意图和真实环境效果分别对照这个包络。这样,成功与克制成为两个同时可测的维度。

| 研究设置 | 观测结果 | | — | — | | 1,500 个训练任务 | 用多样化工具任务学习权限边界 | | 2,896 个评测回合 | 同时观察完成质量与越权事件 | | 安全成功率 64.36% → 98.48% | 模型更常在边界内完成任务 | | 越权事件率 4.56% → 0.79% | 不必要授权、访问和副作用显著减少 |

重要边界是:论文证明的是特定模型、任务生成和审计定义下的可学习性,不是“训练后就不需要权限系统”。 🧱 系统级拒绝、沙箱、凭据隔离和人工审批仍是最后约束。模型学习到的克制更像降低触发危险动作的概率,并让正常任务更少撞上硬门槛。

对企业而言,最值得借鉴的不是直接复制一组训练数据,而是重新设计 Agent 评估表:完成任务得分之外,增加请求权限数量、读取资源范围、不可逆副作用和被拒绝动作尝试次数。🔍 如果平台只记录成功结果,就无法区分“用一把精确钥匙完成”与“先拿管理员权限再完成”。

二、前置审计看意图,后置审计看世界究竟发生了什么 🧭

论文把审计分成动作前和动作后两个确定性阶段。前置审计检查模型准备调用的工具、参数和资源是否落在任务充分权限包络内;后置审计读取终端、文件系统或 MCP 环境的真实状态,确认动作实际造成的效果。⚙️ 只审参数会漏掉工具内部的间接副作用,只审结果又可能错过已经发生但被回滚的越权尝试;两者必须配对。

完整闭环是:任务声明 → 计算充分权限包络 → Agent 提议动作 → 前置审计允许或阻断 → 工具执行 → 后置审计核对效果 → 将任务成功与越权价值一同写入训练信号。🧩 这与让模型自评“我是否安全”不同:审计器使用可执行规则和可观察环境状态,不接受自然语言辩解。

研究覆盖六类风险维度,可以映射到企业控制:资源范围是否过宽、权限等级是否过高、动作是否与当前步骤有关、是否产生不必要持久化、是否触碰敏感对象,以及失败后是否继续扩大尝试。🛡️ 最小权限不是一个静态角色名,而是随任务步骤变化的充分权限集合。 同一个 Agent 在“读取构建日志”和“回滚生产部署”两个阶段需要完全不同的权力。

  • 📥 把用户目标拆成可验证子任务,并为每步声明允许资源和动作。

  • 🔐 凭据按工具、环境和持续时间切片,不向模型暴露万能令牌。

  • 🧪 使用前置策略检查工具参数,使用后置传感器检查真实副作用。

  • 🧾 保存被阻断的尝试,而不是只保存成功调用,作为训练和审计证据。

  • 🚨 对删除、付款、外发和生产变更保持不可绕过的外部审批。

论文还进行 400 任务的继续训练实验,报告 excess-authority 指标再降低 6.99 个百分点,同时保持任务能力。📈 这支持一种实用路线:先让通用模型拥有工具能力,再用组织自己的权限包络和失败样本做小规模持续对齐,而不是每次都从零构建安全模型。

三、为什么“没有真正越权”仍可能是不合格的 Agent 🧪

🎯【为什么“没有真正越权”仍可能是不合格的 Agent 🧪】

这一节真正关键的不是「为什么“没有真正越权”仍可能是不合格的 Agent 🧪」这个概念本身,而是它背后的判断路径、执行边界和可复用方法。

它怎样落到真实安全团队的工作流里?哪些细节会直接影响 AI 代理的可靠性?

加入 Oxo AI Security 知识星球,可查看本节完整内容,系统掌握「为什么“没有真正越权”仍可能是不合格的 Agent 🧪」的完整拆解与实战用法。

📚 AI 文献解读:最前沿的 LLM 安全论文深度剖析。

🐛 AI 漏洞情报:第一时间掌握主流大模型的 0-day 漏洞与越狱方式。

🛡 AI 安全体系:从红队攻击到蓝队防御的全方位知识图谱。

🛠 AI 攻防工具:红队专属的自动化测试与扫描工具箱。

🚀立即加入 Oxo AI Security 知识星球,掌握 AI 安全攻防核心能力!


免责声明:

本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。

任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。

本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我

本文转载自:Oxo Security Oxo Security Oxo Security《【AI安全】把“克制”教给 Agent:越权事件率从 4.56% 降到 0.79%》

评论:0   参与:  0