Skip to main content
QUICK REVIEW

[论文解读] A Survey of Privacy-Preserving Model Explanations: Privacy Risks, Attacks, and Countermeasures

Thành Tâm Nguyên, Thanh Trung Huynh|arXiv (Cornell University)|Mar 31, 2024
Privacy-Preserving Technologies in Data被引用 4
一句话总结

本综述首次对模型解释中的隐私风险进行了全面分析,对解释的各类攻击(如成员推断、去匿名化)进行分类,并提出了差分隐私和对抗性训练等对策。该研究建立了隐私保护型解释技术的分类体系,并指出了在数据模态、理论基础和实际评估方面存在的关键研究空白。

ABSTRACT

As the adoption of explainable AI (XAI) continues to expand, the urgency to address its privacy implications intensifies. Despite a growing corpus of research in AI privacy and explainability, there is little attention on privacy-preserving model explanations. This article presents the first thorough survey about privacy attacks on model explanations and their countermeasures. Our contribution to this field comprises a thorough analysis of research papers with a connected taxonomy that facilitates the categorisation of privacy attacks and countermeasures based on the targeted explanations. This work also includes an initial investigation into the causes of privacy leaks. Finally, we discuss unresolved issues and prospective research directions uncovered in our analysis. This survey aims to be a valuable resource for the research community and offers clear insights for those new to this domain. To support ongoing research, we have established an online resource repository, which will be continuously updated with new and relevant findings. Interested readers are encouraged to access our repository at https://github.com/tamlhp/awesome-privex.

研究动机与目标

  • 为解决可解释人工智能(XAI)中与模型解释相关的隐私风险研究日益扩大的空白。
  • 基于解释类型和攻击目标,系统性地对针对模型解释的隐私攻击进行分类。
  • 分析现有对策,包括差分隐私和对抗性训练,以缓解解释中的隐私泄露问题。
  • 识别未解决的挑战,如攻击类型范围有限、对隐私泄露成因缺乏理论理解,以及在真实条件下评估不足。
  • 为未来隐私保护型XAI研究提供基础分类体系和研究路线图,并辅以开源代码库支持。

提出的方法

  • 对240余篇关于机器学习、XAI和对抗性攻击中隐私问题的文献进行系统性回顾,以识别模型解释中的隐私风险。
  • 开发一个多维分类体系,根据目标解释类型(如局部解释、反事实解释、特征重要性)、攻击目标(如成员推断、数据重建)和底层机制对隐私攻击进行分类。
  • 分析解释中隐私泄露的根本原因,包括模型架构、解释方法设计和数据敏感性。
  • 调研并分类针对解释系统的防御机制,如差分隐私、对抗性训练和输入扰动。
  • 在不同解释类型和数据模态(如表格数据、图像、图结构、音频)中评估隐私保护技术的有效性。
  • 建立一个开源、持续更新的代码库(https://github.com/tamlhp/awesome-privex),以支持持续研究和社区贡献。

实验结果

研究问题

  • RQ1针对模型解释的隐私攻击主要有哪些类型?它们在不同解释类型(如LIME、SHAP、反事实解释)之间有何差异?
  • RQ2模型解释中隐私泄露的根本原因是什么?模型架构和解释方法设计在这些风险中起到何种作用?
  • RQ3哪些对策——如差分隐私、对抗性训练或输入扰动——在保持解释保真度的同时最有效地保护隐私?
  • RQ4隐私风险在不同数据模态(如表格、图像、图结构、音频数据)中如何变化?它们各自面临哪些独特挑战?
  • RQ5在隐私保护型模型解释中,关键未解研究挑战是什么?尤其在理论基础、真实世界评估和更广泛模型覆盖方面?

主要发现

  • 成员推断攻击是模型解释中研究最广泛的隐私威胁,尤其针对局部解释和反事实解释。
  • 像LIME和SHAP这样的解释方法可能因依赖局部代理模型和特征扰动而意外泄露成员信息。
  • 差分隐私机制,特别是自适应噪声注入,可在降低隐私风险的同时保持模型可解释性,但可能损害解释保真度。
  • 图神经网络(GNNs)正成为隐私泄露的高风险领域,成员推断和去匿名化等攻击在GNN解释中正变得日益可行。
  • 尽管音频数据(如语音、健康信号)具有高度敏感性,且在医疗应用中日益普及,但基于音频的模型解释在隐私方面的研究仍严重不足。
  • 目前对为何某些解释更容易导致隐私泄露缺乏充分的理论理解,且极少有研究在真实部署条件(如大规模数据集、真实世界模型)下评估攻击。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。