【AI安全】模型说已经遗忘,TargetedActiveSearch却能重建95%的提示

admin 2026-09-18 06:12:39 网络安全文章 来源:ZONE.CI 全球网 0 阅读模式

文章总结: 本文探讨机器遗忘的安全验收标准,指出模型在常规评测中看似遗忘,但通过TargetedActiveSearch(TAS)黑盒查询可100%识别目标实体并最高重建95%提示,查询量减少99.7%。作者建议删除验收需包含攻击者视角的自适应查询测试,并给出具体验收步骤,强调拒答不等于遗忘证据。 综合评分: 75 文章分类: AI安全,红队,安全评估


【AI安全】模型说已经遗忘,Targeted Active Search却能重建95%的提示

原创

Oxo Security Oxo Security

Oxo Security

2026年9月17日 00:07 吉林

在小说阅读器读本章

去阅读

在公众号小说中沉浸阅读

一、100%识别目标实体,删除验收不能只看平均指标 🧠

AI 时代!人人都在深耕 AI 安全,你缺的就是这关键一步!

AI 正重塑安全边界,与其在门外徘徊,不如直接掌握主动权!

免费课程持续更新

https://space.bilibili.com/452583051/lists/7870008?type=season

论文 Extracting Forgotten Prompts from Unlearned Language Models 于 2026 年 9 月 3 日提交。作者提出 Targeted Active Search(TAS),只凭黑盒查询测试经过三类遗忘方法处理的多个模型与数据集。实验中,遗忘实体识别达到 100%,目标提示重建最高达到 95%,查询量相较基线最多减少 99.7%。🎯 模型在常规评测里表现得像“忘了”,并不意味着一个主动、目标明确的攻击者无法把信息重新拼出来。

Oxo Security 的判断是:机器遗忘有两个不同标准:模型不再自然复述,以及攻击者在合理查询预算内无法恢复。⚠️ 前者衡量平均行为变化,后者衡量残余信息是否仍能被搜索利用。若删除承诺只通过通用困惑度、整体准确率或固定问题集验收,可能完全错过目标化提取。

| 实验读数 | 代表什么 | 不代表什么 | | — | — | — | | 三类遗忘方法 | 攻击跨多种处理方案评估 | 所有遗忘算法都同样脆弱 | | 实体识别 100% | 可定位被要求遗忘的目标 | 已恢复目标的每个原始细节 | | 提示重建最高 95% | 部分设置中接近完整恢复 | 每个模型都达到 95% | | 查询减少最多 99.7% | 主动搜索显著提高效率 | 任何预算都足以恢复 |

这些都是论文实验中的最高值,不能外推成每个模型、数据集和删除请求的固定成功率。🔬 可迁移的结论不是“遗忘一定失败”,而是验收必须包含攻击者如何选择下一次查询。固定模板问不出来的信息,可能在自适应搜索下暴露。

二、Targeted Active Search怎样把残余线索重新拼成原提示 🔗

TAS 先围绕目标建立候选空间,再向模型提交能最大程度区分候选的问题。模型可能不会直接给出被删除内容,却会在词语偏好、补全概率、相关实体或局部结构上留下微弱差异。🔍 攻击器根据响应更新候选,选择下一轮查询,逐步收敛。

这类似故障诊断而非暴力枚举:每个问题都为排除最多假设而设计。📐 遗忘方法只要保留了与目标相关、可重复测量的方向性信号,主动搜索就能把许多弱证据累积成强结论。查询量减少 99.7% 的意义正在于攻击可以从理论风险变成更可执行的评测。

删除验收应加入以下步骤:

  • 🧪 为每个删除目标构造独立攻击集,不与训练时的遗忘评测复用;

  • 🔁 允许攻击器根据上一轮响应自适应选择查询;

  • 📊 同时测量目标识别、内容重建、置信度和查询预算;

  • 🧾 保留模型版本、遗忘算法、参数、数据范围与随机种子;

  • 🎭 测试直接问法、旁路补全、相关实体和多轮组合提示;

  • 🚦 为高敏感目标设更严格阈值,并要求独立团队复核。

拒答不是遗忘证据。✅ 一个安全策略可以阻止模型直接回答,却不改变权重或表示中的残余;同样,遗忘方法可能降低常规输出,却未消除黑盒可区分性。评测必须区分“政策不让说”和“信息已不可恢复”。

查询接口配置也会改变风险。🛠️ 温度、logprob、候选数、长上下文和批量访问可能放大残余信号;如果生产 API 比实验接口暴露更多细节,应按真实配置重测。

三、为什么平均性能会掩盖少数目标的高残余风险 🧬

🎯【为什么平均性能会掩盖少数目标的高残余风险 🧬】

这一节真正关键的不是「为什么平均性能会掩盖少数目标的高残余风险 🧬」这个概念本身,而是它背后的判断路径、执行边界和可复用方法。

它怎样落到真实安全团队的工作流里?哪些细节会直接影响 AI 代理的可靠性?

加入 Oxo AI Security 知识星球,可查看本节完整内容,系统掌握「为什么平均性能会掩盖少数目标的高残余风险 🧬」的完整拆解与实战用法。

📚 AI 文献解读:最前沿的 LLM 安全论文深度剖析。

🐛 AI 漏洞情报:第一时间掌握主流大模型的 0-day 漏洞与越狱方式。

🛡 AI 安全体系:从红队攻击到蓝队防御的全方位知识图谱。

🛠 AI 攻防工具:红队专属的自动化测试与扫描工具箱。

🚀立即加入 Oxo AI Security 知识星球,掌握 AI 安全攻防核心能力!


免责声明:

本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。

任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。

本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。

本文转载自:Oxo Security Oxo Security Oxo Security《【AI安全】模型说已经遗忘,Targeted Active Search却能重建95%的提示》

评论:0   参与:  0