文章总结: 本文提出特征差分隐私(FDP)框架,通过区分公共与私有特征,仅对私有特征施加差分隐私保护,在提供形式化隐私保障的同时降低效用损失。实验表明,FDP在扩散模型生成和分类任务中均优于传统DP,如在AFHQ数据集上将FID从286.7降至101.9。该方法适用于私有与公共特征边界清晰的场景,为隐私保护机器学习提供了更细粒度的技术思路。 综合评分: 85 文章分类: AI安全,数据安全,应用安全
从样本隐私到特征隐私:面向受保护属性的机器学习隐私新框架
原创
张尚伟 张尚伟
信息网络安全杂志
2026年9月20日 18:00 上海
在小说阅读器读本章
去阅读
在公众号小说中沉浸阅读
引子:差分隐私(Differential Privacy, DP)能够提供可量化、可审计的隐私保障,被视为隐私计算和机器学习安全中的重要工具。在机器学习模型训练中,传统差分隐私常把整条训练样本都纳入同等强度的保护范围,容易带来训练噪声增加、模型质量下降等效用损失,在图像生成和大规模学习任务中尤为明显。这项研究提出了基于特征差分隐私(Feature Differential Privacy, FDP)的新型框架,通过区分训练样本中的私有特征与公共特征,将保护重点放在敏感部分,在提供形式化隐私保障的前提下,探索降低效用损失的可行路径,为隐私保护机器学习提供了一种更细粒度的技术思路。
速览:该研究提出了特征差分隐私的严格定义。与传统DP将整条样本视为隐私单元不同,FDP通过公共特征映射将每个样本拆解为公开特征与需要保护的私有特征,仅在私有特征上要求差分隐私保障。论文给出了FDP在替换与插入或删除两种邻接定义下的完整定义,证明了其自适应组合性质,并建立了FDP与属性推断攻击之间的理论关联。
针对优化问题,作者发现特征DP通常无法从子采样中获得隐私放大。为此,论文将损失函数拆解为私有损失与公共损失之和,并为二者分别采样独立批次,从而保留了子采样的隐私放大增益。理论分析给出了凸损失下更紧的过额风险界。实验涵盖Purchase100和Criteo分类任务,以及AFHQ和LSUN扩散模型生成任务。实验结果表明,FDP在扩散模型生成和分类任务中均优于传统DP,在AFHQ数据集上,FDP将FID从DP的286.7大幅降至101.9,在LSUN上基于ε=0.5的严格预算下仍能生成接近非私有模型质量的清晰图像;在Purchase100分类任务中,FDP相较DP提升10%–20%的准确率,Criteo上亦有稳定增益。
深度解剖:这篇论文的价值首先在于,它考虑了隐私保护机器学习中的一个关键问题,即隐私保护越严格,模型效用往往越容易受到影响,而为了维持模型性能,又不得不适当放宽隐私约束。FDP 的提出并非削弱隐私保护,而是尝试重新划分保护边界,在敏感属性明确、公共信息丰富的场景下(如医疗影像、自动驾驶等),为兼顾形式化隐私保障与模型效用提供了一种新的技术路径。
其次,在方法设计上没有简单沿用现有DP-SGD 框架,而是针对影响效用提升的两个关键瓶颈进行了重新设计。一方面,通过引入辅助公共损失函数,将公共信息与私有信息在优化过程中进行解耦,在不改变优化目标的前提下降低私有部分的梯度敏感度;另一方面,通过公共梯度与私有梯度的独立采样机制,恢复了子采样隐私放大的适用条件,使模型能够更充分地利用公共信息,同时理论分析也给出了严格的隐私保障和收敛性保证。这种从隐私定义、优化目标到训练机制的一体化设计,使论文提出的方法不仅具有理论上的一致性,也具备较好的工程可实现性。
最后,作者将验证场景扩展到对训练噪声更为敏感的扩散模型,这类任务对训练噪声高度敏感,标准DP在该类任务中,AFHQ上FID高达286.7,图像完全不可识别。论文在AFHQ和LSUN两个数据集上的实验结果表明,在相同隐私预算下,FDP不仅能生成可识别的图像,FID指标也优于标准DP,甚至在LSUN卧室数据集上,即使隐私预算收紧至ε=0.5,FDP仍能生成接近非私有模型质量的清晰图像,这说明公共特征中蕴含的结构信息能够有效弥补噪声带来的性能损失。当然,FDP在Criteo数据集上的提升具有一定的局限,这说明FDP不是在所有场景下都能极大地改善效用,它取决于私有特征相对于公共特征的信息增量。
局限:这项研究所提出的FDP存在一定的应用边界。首先,FDP 的有效性建立在公共特征划分合理的前提之上。研究默认存在公共特征不会泄露受保护属性的前提条件,但这在实际应用并不一定完全成立。如果公共特征本身仍包含较强的身份辨识信息,或用于提取公共特征的预处理方法存在漏检、误检等问题,都可能导致敏感信息超出预期地暴露。因此,所提出的FDP 更适用于私有特征与公共特征边界相对清晰的场景,且当公共特征与私有特征存在较强相关性时,即使公共部分本身不属于保护对象,也可能通过关联推断影响隐私保护效果。论文虽然对此进行了讨论,但尚未给出系统性的解决方案,在理论和实验方面仍有进一步完善的空间。
启示:这项研究带来的首要启示在于,隐私保护粒度本身是一个值得研究的对象。对于敏感信息边界较为明确的场景,隐私定义应与数据特征和应用需求相匹配,以减少对非敏感信息的不必要保护,为兼顾隐私保障与模型效用提供了新的思路。其次,论文也提出了一系列值得进一步研究的问题,如公共特征的自动识别和提取、公共特征与私有特征之间相关性的刻画方法,以及如何将这一框架推广到文本、多模态等更复杂的数据类型,这些问题的解决,将直接影响FDP 在更多实际场景中的适用性。最后,从发展趋势来看,这项研究体现了隐私保护从统一保护向差异化保护发展的思路。
作者:米锦升、张尚伟(西北工业大学网络空间安全学院 副教授)
原文标题:Machine Learning with Privacy for Protected Attributes
原文作者:Saeed Mahloujifar, Chuan Guo, G. Edward Suh, Kamalika Chaudhuri
期刊/会议:2025 IEEE Symposium on Security and Privacy (S&P)
DOI
https://doi.org/10.1109/SP61157.2025.00179
版权与来源声明:本文依据《中华人民共和国著作权法》第二十四条之规定,为介绍、评选之目的,在此适当引用。原文版权归原作者所有。
信息网络安全
《信息网络安全》创刊于2001年,是由公安部主管,公安部第三研究所、中国计算机学会主办,面向国内外公开发行的国内首批信息安全类期刊之一,于2015年成为中国科技核心期刊,2017年成为中国科学引文数据库来源期刊,2018年成为中文核心期刊,2022年入选CCF计算领域高质量科技期刊分级目录。
中文核心期刊
中国科技核心期刊
中国科学引文数据库来源期刊
CCF计算领域高质量科技期刊
我们在不断努力和完善中,期待您的关注和支持!
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:信息网络安全杂志 张尚伟 张尚伟《从样本隐私到特征隐私:面向受保护属性的机器学习隐私新框架》
版权声明
本站仅做备份收录,仅供研究与教学参考之用。
读者将信息用于其他用途的,全部法律及连带责任由读者自行承担,本站不承担任何责任。








评论