[论文解读] An Extension of Fano's Inequality for Characterizing Model Susceptibility to Membership Inference Attacks
本文将法诺不等式扩展至用于约束深度神经网络(DNN)上成员推断攻击(MIA)的成功概率,方法是利用模型输入与激活/输出之间互信息的度量。研究结果表明,互信息可作为MIA脆弱性的强预测因子,其在CIFAR-10、SVHN和GTSRB数据集上的经验相关系数分别达到0.966、0.996和0.955,从而为模型隐私评估提供理论基础坚实的新指标。
Deep neural networks have been shown to be vulnerable to membership inference attacks wherein the attacker aims to detect whether specific input data were used to train the model. These attacks can potentially leak private or proprietary data. We present a new extension of Fano's inequality and employ it to theoretically establish that the probability of success for a membership inference attack on a deep neural network can be bounded using the mutual information between its inputs and its activations. This enables the use of mutual information to measure the susceptibility of a DNN model to membership inference attacks. In our empirical evaluation, we show that the correlation between the mutual information and the susceptibility of the DNN model to membership inference attacks is 0.966, 0.996, and 0.955 for CIFAR-10, SVHN and GTSRB models, respectively.
研究动机与目标
- 为应对在私有或专有数据上训练的深度神经网络所面临的日益增长的隐私风险,特别是成员推断攻击(MIAs)威胁。
- 开发一种理论基础坚实、基于信息论的度量方法,用于量化DNN对MIAs的敏感性。
- 确立模型输入与输出/激活之间互信息可作为MIA成功概率的可靠代理指标。
- 为模型开发者和审计人员提供一种实用且可解释的隐私度量方法,以评估和提升模型的鲁棒性。
- 通过基于互信息的正则化方法,支持设计对隐私更具保护性的DNN。
提出的方法
- 提出法诺不等式的新型扩展,利用输入与模型输出/激活之间的互信息,对成员推断攻击的成功概率进行理论约束。
- 推导出依赖于条件熵和互信息的攻击成功率下限,其中互信息作为关键设计参数。
- 采用输入与顶层激活或梯度之间的互信息作为衡量DNN对MIAs敏感性的可测量指标。
- 在实际应用中使用基于神经网络的互信息估计器计算该指标,利用近期在可微分互信息估计方面的进展。
- 在黑盒和白盒MIA设置下,评估互信息与实际攻击成功率在多个基准数据集上的相关性。
- 通过将理论边界与CIFAR-10、SVHN和GTSRB数据集上的实证MIA成功率进行对比,验证理论边界的有效性。
实验结果
研究问题
- RQ1法诺不等式能否被扩展,以提供深度神经网络中成员推断攻击成功率的理论边界?
- RQ2模型输入与激活或输出之间互信息与实际MIA成功率的相关程度如何?
- RQ3互信息能否作为量化DNN对成员推断攻击敏感性的可靠且实用的度量指标?
- RQ4该理论边界在真实世界深度学习模型中,针对多样化数据集的紧致程度如何?
- RQ5互信息能否作为正则化目标,用于训练对成员推断攻击具有内在更强鲁棒性的DNN?
主要发现
- 所提出的法诺不等式扩展,基于输入与模型输出/激活之间互信息,为成员推断攻击的成功概率提供了理论下界。
- 在CIFAR-10数据集上,输入与顶层输出/激活之间互信息与实际MIA成功率的相关系数达到0.966。
- 在SVHN数据集上,互信息与MIA成功率之间的相关系数达到0.996,表明其具有近乎完美的预测能力。
- 在GTSRB数据集上,互信息与MIA敏感性之间的相关系数为0.955,证实其在多样化数据分布下的稳健性。
- 当给定模型输出时,训练数据的条件熵较高时,该理论边界最具信息量,表明泄露有限。
- 结果表明,互信息可作为评估和提升DNN隐私性的实用且高效度量,支持开发更具鲁棒性的模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。