Skip to main content
QUICK REVIEW

[论文解读] Improving LIME Robustness with Smarter Locality Sampling

Sean Saito, Eugene Chua|arXiv (Cornell University)|Jun 22, 2020
Explainable Artificial Intelligence (XAI)参考文献 10被引用 9
一句话总结

本文提出 CTGAN-LIME,一种鲁棒的 LIME 变体,通过使用条件表格生成对抗网络(CTGAN)替代 LIME 的朴素高斯采样,生成更真实的合成数据以用于解释。通过训练 CTGAN 使判别器网络将合成样本误判为真实样本,该方法提升了对偏差和对抗性行为的检测能力——在识别有害模型行为方面,最高可达 99.94% 的 top-1 准确率,同时保持与原始 LIME 相当的解释质量。

ABSTRACT

Explainability algorithms such as LIME have enabled machine learning systems to adopt transparency and fairness, which are important qualities in commercial use cases. However, recent work has shown that LIME's naive sampling strategy can be exploited by an adversary to conceal biased, harmful behavior. We propose to make LIME more robust by training a generative adversarial network to sample more realistic synthetic data which the explainer uses to generate explanations. Our experiments demonstrate that our proposed method demonstrates an increase in accuracy across three real-world datasets in detecting biased, adversarial behavior compared to vanilla LIME. This is achieved while maintaining comparable explanation quality, with up to 99.94\% in top-1 accuracy in some cases.

研究动机与目标

  • 解决 LIME 在面对利用分布外(OOD)合成样本(通过朴素高斯采样生成)的对抗攻击时的脆弱性。
  • 提升基于 LIME 的可解释性在检测黑箱模型中偏差和有害行为方面的鲁棒性。
  • 在增强对抗性操纵抵抗能力的同时,保持高质量的解释。
  • 评估生成建模是否能在对抗性条件下生成更忠实的局部解释。

提出的方法

  • 将 LIME 的默认采样策略(从单位高斯分布中抽取合成数据)替换为学习生成真实合成表格数据的条件表格生成对抗网络(CTGAN)。
  • 通过在真实数据和 LIME 生成的合成数据上训练判别器网络,使 CTGAN 最大化判别器对生成样本为真实样本的置信度,从而训练 CTGAN。
  • 将训练好的 CTGAN 用作 LIME 中的数据采样器,确保合成样本沿真实数据流形分布,而非位于 OOD 区域。
  • 集成基于判别器的过滤步骤,通过拒绝低置信度的合成样本,进一步提升样本质量。
  • 通过使用 CTGAN 生成的样本优化局部加权平方损失,以提升局部保真度和鲁棒性。
  • 在三个真实世界数据集(COMPAS、German Credit 和 Communities and Crime)上应用该方法,使用随机森林作为黑箱模型。

实验结果

研究问题

  • RQ1用基于 GAN 的生成器替代 LIME 的朴素采样,是否能提升对利用 OOD 合成数据的对抗攻击的鲁棒性?
  • RQ2与原始 LIME 相比,使用 CTGAN 生成的样本是否能保持或提升解释质量?
  • RQ3在黑箱和白箱攻击设置下,CTGAN-LIME 在检测对抗模型中偏差行为方面的有效性如何?
  • RQ4引入判别器进行样本过滤在多大程度上增强了解释系统的鲁棒性?

主要发现

  • 在所有三个数据集上,CTGAN-LIME 在黑箱和白箱 Fooling-LIME 攻击设置下,检测偏差行为的准确率均高于原始 LIME。
  • 在白箱攻击设置下(攻击者可访问 CTGAN 模型),CTGAN-LIME 仍优于原始 LIME,准确率仅比基线略有下降。
  • CTGAN-LIME 的解释精确率与 LIME 相当,分别在 COMPAS 上为 73.27%,German Credit 上为 77.89%,Communities and Crime 上为 80.64%,表明解释质量未下降。
  • 在某些实验设置下,该方法在检测对抗性行为方面最高达到 99.94% 的 top-1 准确率,展现出强大的鲁棒性。
  • 定性主成分分析(PCA)显示,CTGAN 生成的样本比原始 LIME 的高斯采样点更贴近真实数据流形,后者呈现聚集且分布外的特征。
  • 基于判别器的过滤步骤进一步提升了 CTGAN-LIME 的准确率,证实其在增强样本真实性和系统鲁棒性方面的作用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。