Skip to main content
QUICK REVIEW

[论文解读] Bayes-TrEx: Model Transparency by Example

Serena Booth, Yilun Zhou|arXiv (Cornell University)|Feb 19, 2020
Adversarial Robustness in Machine Learning参考文献 63被引用 4
一句话总结

Bayes-TrEx 是一种模型无关的方法,通过生成符合数据分布的样本,提升神经网络的可解释性,包括可视化类别边界、识别分布内对抗样本并暴露模型的过度自信。该方法将分类器与数据生成器结合,生成在已知置信度水平下的代表性输入,在 CLEVR、MNIST 和 Fashion-MNIST 上验证了其有效性。

ABSTRACT

Post-hoc explanation methods are gaining popularity as tools for interpreting, understanding, and debugging neural networks. Most post-hoc methods explain decisions in response to individual inputs. These individual inputs are typically drawn from the test set; however, the test set may be biased or may only sparsely invoke some model behaviours. To address these challenges, we introduce Bayes-TrEx, a model-agnostic method for generating distribution-conforming examples of known prediction confidence. Using a classifier prediction and a data generator, Bayes-TrEx can be used to visualize class boundaries; to find in-distribution adversarial examples; to understand novel-class extrapolation; and to expose neural network overconfidence. We demonstrate Bayes-TrEx with rendered data (CLEVR) and organic data (MNIST, Fashion-MNIST). Code: this http URL.

研究动机与目标

  • 解决依赖稀疏或有偏测试集输入的后处理解释方法的局限性。
  • 实现对整个输入分布中模型行为的可视化,而不仅限于单个测试样本。
  • 通过在已知预测置信度水平下生成样本,暴露神经网络的过度自信。
  • 支持理解分布内对抗样本和新类别外推行为。
  • 提供一种适用于多种数据模态(包括合成数据与真实世界数据)的模型无关框架。

提出的方法

  • 利用预训练分类器与可微分数据生成器,合成符合数据分布的输入。
  • 使用贝叶斯推断,将数据生成器条件化于目标预测置信度水平,确保生成样本具有代表性。
  • 采用变分推断框架,优化生成器,使生成数据达到期望的置信度分数。
  • 将该方法应用于合成数据(CLEVR)和真实世界数据(MNIST、Fashion-MNIST)以验证泛化能力。
  • 通过在不同置信度水平下生成样本,可视化决策边界,揭示模型的不确定性和过度自信。
  • 通过在决策边界附近搜索具有高置信度预测的输入,实现对分布内对抗样本的发现。

实验结果

研究问题

  • RQ1我们能否生成反映已知模型置信度水平的代表性、符合数据分布的样本?
  • RQ2如何利用合成样本在完整输入分布上可视化类别边界和模型行为?
  • RQ3Bayes-TrEx 在多大程度上能够检测出以高置信度被错误分类的分布内对抗样本?
  • RQ4该方法如何以可控且可解释的方式暴露神经网络的过度自信?
  • RQ5该方法是否能在不同数据模态(包括合成与真实世界图像数据集)上实现泛化?

主要发现

  • Bayes-TrEx 有效生成了符合底层数据分布且达到指定预测置信度水平的数据样本。
  • 该方法通过在一系列置信度分数下生成输入,实现了决策边界的清晰可视化。
  • 它识别出以高置信度被错误分类的分布内对抗样本,揭示了模型的脆弱性。
  • 该方法通过生成预测概率高但实际错误的样本,有效暴露了模型的过度自信。
  • 该方法在不同数据类型间具有泛化能力,在合成数据(CLEVR)和真实世界数据(MNIST、Fashion-MNIST)上均表现出实用性。
  • 生成的样本为理解模型行为提供了可解释的洞察,包括对新类别外推和失效模式的分析。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。