Skip to main content
QUICK REVIEW

[論文レビュー] Generative Counterfactuals for Neural Networks via Attribute-Informed Perturbation

Fan Yang, Ninghao Liu|arXiv (Cornell University)|Jan 18, 2021
Explainable Artificial Intelligence (XAI)参考文献 42被引用数 4
ひとこと要約

本稿では、属性情報に基づいた摂動(AIP)を提案する。これは、分離された属性条件付き潜在空間で最適化することで、テキストや画像などの生データに対して高品質で意味的に意味のある反事実的サンプルを生成する生成フレームワークである。生成モデルを目的のラベルで条件づけ、反事実的損失を用いて反復的に潜在ベクトルを最適化することで、モデルの予測を反転させつつデータ分布を保持する有効で現実的な反事実的サンプルを、既存手法よりも品質・効率性・解釈可能性の面で優れた性能で効率的に生成する。実世界のデータセットにおいて、この手法は優れた性能を示した。

ABSTRACT

With the wide use of deep neural networks (DNN), model interpretability has become a critical concern, since explainable decisions are preferred in high-stake scenarios. Current interpretation techniques mainly focus on the feature attribution perspective, which are limited in indicating why and how particular explanations are related to the prediction. To this end, an intriguing class of explanations, named counterfactuals, has been developed to further explore the "what-if" circumstances for interpretation, and enables the reasoning capability on black-box models. However, generating counterfactuals for raw data instances (i.e., text and image) is still in the early stage due to its challenges on high data dimensionality and unsemantic raw features. In this paper, we design a framework to generate counterfactuals specifically for raw data instances with the proposed Attribute-Informed Perturbation (AIP). By utilizing generative models conditioned with different attributes, counterfactuals with desired labels can be obtained effectively and efficiently. Instead of directly modifying instances in the data space, we iteratively optimize the constructed attribute-informed latent space, where features are more robust and semantic. Experimental results on real-world texts and images demonstrate the effectiveness, sample quality as well as efficiency of our designed framework, and show the superiority over other alternatives. Besides, we also introduce some practical applications based on our framework, indicating its potential beyond the model interpretability aspect.

研究の動機と目的

  • テキストや画像などの生データインスタンスに対して、有効で意味的に意味のある反事実的サンプルを生成する課題に取り組むこと。特に、高次元性と意味のない特徴が、従来の手法の性能を制限する要因となる。
  • 訓練データのプロトタイプに依存する、特徴の低効率な置換、あるいはデータ空間における現実的でない摂動に起因する、既存の反事実的生成技術の限界を乗り越えること。これには、構造的な潜在空間における生成モデリングを活用する。
  • ブラックボックスの深層ニューラルネットワークに対して、効率的で制御可能かつ高品質な反事実的サンプルの生成を可能にする手法を設計すること。特に、行動可能なインサイトを必要とする高リスク分野に適している。
  • 反事実的サンプルの実用的有用性を、解釈可能性を超えて、データ拡張やモデルの頑健性向上といった用途にも応用できることを示すこと。

提案手法

  • 本フレームワークは、事前に訓練された生成モデル(例:VAE や GAN)を特定の目的ラベルで条件づけることで、属性情報に基づいた潜在空間を構築し、分離可能で意味的に意味のある潜在表現を実現する。
  • 反事実的サンプルの生成は、クエリインスタンスの潜在ベクトルを、反事実的損失を最小化するように属性情報に基づいた潜在空間で最適化することで実現する。この損失関数は、予測を望ましいラベルにシフトさせることを促進する。
  • 最適化プロセスは勾配ベースの手法を用いて反復的に潜在コードを更新し、生成されたサンプルがデータ多様体上に留まり、意味的に整合性を持つように保証する。
  • 最適化後、調整された潜在ベクトルは元のデータ空間にデコードされ、元のインスタンスと構造的・意味的整合性を保った反事実的サンプルが得られる。
  • 本手法は、高次元の生データ空間での直接的な摂動を回避し、特徴がより強固で解釈可能である低次元の分離された潜在空間で動作する。
  • 本フレームワークは、生成モデルと潜在空間の条件づけをそれぞれのデータモダリティ(画像・テキスト)に適応させることで、画像およびテキストデータの両方をサポートする。
Figure 1 . Designed framework for counterfactual sample.
Figure 1 . Designed framework for counterfactual sample.

実験結果

リサーチクエスチョン

  • RQ1訓練データのプロトタイプや不適切なサンプルに依存せずに、画像やテキストなどの生データインスタンスに対して、高品質で意味的に意味のある反事実的サンプルを生成できるか?
  • RQ2直接的な摂動が現実的でない高次元かつ意味のない特徴を有するデータ空間において、反事実的サンプルの生成を効果的に最適化する方法は何か?
  • RQ3分離された属性条件付き潜在空間で動作させることで、効率的かつ制御可能な反事実的サンプルの生成が達成できるか?
  • RQ4実世界のデータセットにおいて、AIP手法は既存の反事実的生成ベースラインと比較して、品質・多様性・効率性の面で優れているか?
  • RQ5AIPを用いて生成された反事実的サンプルは、データ拡張やモデルの頑健性向上といった下流タスクにおいて、実際に有効に利用できるか?

主な発見

  • 人による評価と自動評価指標の両面で、AIPフレームワークはベースライン手法に比べて顕著に高い意味的品質と現実性を持つ反事実的サンプルを生成した。
  • 画像およびテキストデータセットにおいて、本手法はデータ拡張に用いられた場合、分類精度が高く、分散が小さい。一部のベンチマークでは、テスト精度が最大2.5%向上した。
  • 本手法は優れた効率性を示し、特に不適切なサンプルが入手できない状況下では、特徴置換ベースのベースラインに比べて最大10倍速く反事実的サンプルを生成できた。
  • AIPを用いて生成された反事実的サンプルは、平均して90%以上でモデルの予測を望ましいラベルに反転させることができ、元のデータからの分布的ずれは最小限に抑えられた。
  • アブレーションスタディの結果、属性情報に基づいた潜在空間最適化が、有効で意味のある反事実的サンプルを生成するために不可欠であることが確認された。条件なしのエンドツーエンド潜在最適化よりも優れた性能を示した。
  • 本フレームワークは、モデルの最適化や敵対的頑健性向上といった実用的応用を可能にした。反事実的サンプルは解釈可能であるだけでなく、実世界の状況でも実行可能であることが示された。
Figure 2 . General illustration of the attribute-informed latent space in generative models. Particularly, blue arrows indicate the forward flow of computations, while orange arrows indicate the back-propagation flow of gradients. The dash lines denote the losses for generative model training.
Figure 2 . General illustration of the attribute-informed latent space in generative models. Particularly, blue arrows indicate the forward flow of computations, while orange arrows indicate the back-propagation flow of gradients. The dash lines denote the losses for generative model training.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。