Skip to main content
QUICK REVIEW

[論文レビュー] Bayes-TrEx: Model Transparency by Example

Serena Booth, Yilun Zhou|arXiv (Cornell University)|Feb 19, 2020
Adversarial Robustness in Machine Learning参考文献 63被引用数 4
ひとこと要約

Bayes-TrEx は、分類器とデータ生成器を統合することで、既知の信頼度レベルでの代表的入力を生成するモデルに依存しない手法であり、ニューラルネットワークの解釈性を向上させる。具体的には、クラス境界の可視化、分布内 adversarial 例の同定、モデルの過信の暴露を可能にする。CLEVR、MNIST、Fashion-MNIST で有効性を示した。

ABSTRACT

Post-hoc explanation methods are gaining popularity as tools for interpreting, understanding, and debugging neural networks. Most post-hoc methods explain decisions in response to individual inputs. These individual inputs are typically drawn from the test set; however, the test set may be biased or may only sparsely invoke some model behaviours. To address these challenges, we introduce Bayes-TrEx, a model-agnostic method for generating distribution-conforming examples of known prediction confidence. Using a classifier prediction and a data generator, Bayes-TrEx can be used to visualize class boundaries; to find in-distribution adversarial examples; to understand novel-class extrapolation; and to expose neural network overconfidence. We demonstrate Bayes-TrEx with rendered data (CLEVR) and organic data (MNIST, Fashion-MNIST). Code: this http URL.

研究の動機と目的

  • スパarsity やバイアスがかかるテストセット入力に依存する後処理解釈手法の限界を解消すること。
  • 個々のテストサンプルにとどまらず、入力の全分布にわたるモデルの挙動を可視化すること。
  • 既知の予測信頼度レベルでの例を生成することで、ニューラルネットワークの過信を暴露すること。
  • 分布内 adversarial 例と新規クラスへの外挿の理解を支援すること。
  • 合成データおよび実世界データを含む多様なデータモダリティに適用可能なモデルに依存しないフレームワークを提供すること。

提案手法

  • 事前学習済み分類器と微分可能なデータ生成器を活用し、データ分布に適合する入力を合成する。
  • ベイズ推論を用いて、ターゲットの予測信頼度レベルを条件としてデータ生成器を制御し、生成例が代表的であることを保証する。
  • 変分推論フレームワークを用いて生成器を最適化し、生成データが所望の信頼度スコアを達成するようにする。
  • 一般化を検証するため、合成データ(CLEVR)と実世界データ(MNIST、Fashion-MNIST)の両方のデータセットにこの手法を適用する。
  • 信頼度レベルにわたる例を生成することで意思決定境界を可視化し、モデルの不確実性や過信を明らかにする。
  • 意思決定境界付近で高信頼度の予測を持つ入力を探索することで、分布内 adversarial 例の発見を可能にする。

実験結果

リサーチクエスチョン

  • RQ1既知のモデル信頼度レベルを反映する代表的で分布適合の例を生成することは可能か?
  • RQ2合成例を用いて、入力の全分布にわたる意思決定境界とモデル挙動をどのように可視化できるか?
  • RQ3Bayes-TrEx は、高信頼度で誤分類される分布内 adversarial 例をどの程度検出できるか?
  • RQ4この手法は、制御可能で解釈可能な方法でニューラルネットワークの過信をどのように露呈するか?
  • RQ5このアプローチは、合成データおよび実世界の画像データセットを含む、さまざまなデータモダリティに一般化可能か?

主な発見

  • Bayes-TrEx は、下位のデータ分布に適合する例を生成すると同時に、所定の予測信頼度レベルを達成することができた。
  • さまざまな信頼度スコアにわたる入力を生成することで、意思決定境界の明確な可視化が可能になった。
  • 高信頼度で誤分類される分布内 adversarial 例を同定し、モデルの脆さを明らかにした。
  • 高確率で予測されるが実際には誤りである例を生成することで、モデルの過信を効果的に露呈した。
  • この手法はデータタイプに一般化でき、合成データ(CLEVR)および実世界データ(MNIST、Fashion-MNIST)の両方で有効性を示した。
  • 生成された例は、新規クラスへの外挿や故障モードを含む、モデル挙動の解釈可能なインサイトを提供した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。