Skip to main content
QUICK REVIEW

[论文解读] On the amplification of security and privacy risks by post-hoc explanations in machine learning models

Pengrui Quan, Supriyo Chakraborty|arXiv (Cornell University)|Jun 28, 2022
Adversarial Robustness in Machine Learning被引用 5
一句话总结

本文表明,机器学习中的事后解释会放大安全与隐私风险,通过使更高效的对抗性攻击成为可能。本文提出了三种新型的解释引导的逃避攻击——EGTA、EGSMA 和 EGSA,通过将解释作为梯度估计的先验信息,将查询次数最多减少 10 倍。同时,本文量化了解释带来的对抗性优势,即梯度方差的降低,并进一步展示了显著的成员推断泄露和模型提取增益。

ABSTRACT

A variety of explanation methods have been proposed in recent years to help users gain insights into the results returned by neural networks, which are otherwise complex and opaque black-boxes. However, explanations give rise to potential side-channels that can be leveraged by an adversary for mounting attacks on the system. In particular, post-hoc explanation methods that highlight input dimensions according to their importance or relevance to the result also leak information that weakens security and privacy. In this work, we perform the first systematic characterization of the privacy and security risks arising from various popular explanation techniques. First, we propose novel explanation-guided black-box evasion attacks that lead to 10 times reduction in query count for the same success rate. We show that the adversarial advantage from explanations can be quantified as a reduction in the total variance of the estimated gradient. Second, we revisit the membership information leaked by common explanations. Contrary to observations in prior studies, via our modified attacks we show significant leakage of membership information (above 100% improvement over prior results), even in a much stricter black-box setting. Finally, we study explanation-guided model extraction attacks and demonstrate adversarial gains through a large reduction in query count.

研究动机与目标

  • 系统表征事后解释如何在机器学习模型中暴露新的侧信道,供对抗性攻击利用。
  • 开发新型的解释引导的黑箱逃避攻击,以在保持高成功率的同时降低查询复杂度。
  • 将解释带来的对抗性优势量化为估计梯度方差的降低。
  • 重新评估基于解释的成员推断攻击,证明其泄露程度显著高于以往研究。
  • 研究解释对模型提取攻击的影响,表明查询次数显著减少。

提出的方法

  • 提出解释引导的迁移攻击(EGTA),利用解释作为迁移先验,以塑造梯度估计的搜索分布。
  • 引入解释引导的代理模型攻击(EGSMA),通过使用解释训练代理模型,以模仿受害模型的决策。
  • 开发解释引导的采样攻击(EGSA),利用解释定义梯度搜索分布的协方差矩阵,当解释中使用绝对梯度值时适用。
  • 通过高斯分布上的 KL 散度最小化,形式化地将解释带来的对抗性收益量化为估计梯度总方差的降低。
  • 在成员推断攻击中,使用 softmax 输出分数而非 logits 计算解释方差,以提高检测准确率。
  • 将模型提取效率与解释的均方值(MSV)联系起来,表明更高的 MSV 意味着更大的对抗性优势。

实验结果

研究问题

  • RQ1事后解释在多大程度上减少了成功进行黑箱逃避攻击所需的查询次数?
  • RQ2在严格的黑箱环境中,如何利用解释来提升成员推断攻击的效率?
  • RQ3解释质量与模型提取攻击中对抗性优势之间的定量关系是什么?
  • RQ4在解释方差计算中使用 softmax 分数而非 logits,对成员推断泄露有何影响?
  • RQ5能否使用信息论度量(如 KL 散度)正式量化解释带来的对抗性收益?

主要发现

  • 所提出的解释引导的逃避攻击相比基线方法,将查询次数最多减少 10 倍,显著提升了攻击的可行性。
  • 解释带来的对抗性优势与估计梯度总方差的降低直接相关,该关系通过 KL 散度最小化形式化表达。
  • 基于解释方差的成员推断攻击在成功率上相比以往工作提升超过 100%,即使在更严格的黑箱设置下也表现优异。
  • 解释引导的代理模型攻击(EGSMA)通过在解释引导的数据上训练代理模型,能够高度保真地模仿受害模型的决策。
  • 由解释引导的模型提取攻击表现出显著的查询减少,且对抗性优势与解释的均方值(MSV)强相关。
  • 本研究证实,解释作为丰富的侧信道,即使模型仅通过预测和解释对外暴露,也能显著削弱模型的安全性与隐私性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。