Skip to main content
QUICK REVIEW

[論文レビュー] DISSECT: Disentangled Simultaneous Explanations via Concept Traversals

Asma Ghandeharioun, Been Kim|arXiv (Cornell University)|May 31, 2021
Explainable Artificial Intelligence (XAI)参考文献 49被引用数 4
ひとこと要約

DISSECTは、最小限の教師信号を用いて生成器、識別器、概念分離器を共同で訓練することで、分離された概念遷移(個々の概念の影響が段階的に増加する生成画像の系列)を生成する生成的説明手法を提案する。これにより、個々の概念の変化がモデル予測に与える影響を明らかにし、反事後的推論を可能にし、多様なデータセットにおいて高い現実性、分離性、安定性を達成する。

ABSTRACT

Explaining deep learning model inferences is a promising venue for scientific understanding, improving safety, uncovering hidden biases, evaluating fairness, and beyond, as argued by many scholars. One of the principal benefits of counterfactual explanations is allowing users to explore "what-if" scenarios through what does not and cannot exist in the data, a quality that many other forms of explanation such as heatmaps and influence functions are inherently incapable of doing. However, most previous work on generative explainability cannot disentangle important concepts effectively, produces unrealistic examples, or fails to retain relevant information. We propose a novel approach, DISSECT, that jointly trains a generator, a discriminator, and a concept disentangler to overcome such challenges using little supervision. DISSECT generates Concept Traversals (CTs), defined as a sequence of generated examples with increasing degrees of concepts that influence a classifier's decision. By training a generative model from a classifier's signal, DISSECT offers a way to discover a classifier's inherent "notion" of distinct concepts automatically rather than rely on user-predefined concepts. We show that DISSECT produces CTs that (1) disentangle several concepts, (2) are influential to a classifier's decision and are coupled to its reasoning due to joint training (3), are realistic, (4) preserve relevant information, and (5) are stable across similar inputs. We validate DISSECT on several challenging synthetic and realistic datasets where previous methods fall short of satisfying desirable criteria for interpretability and show that it performs consistently well and better than existing methods. Finally, we present experiments showing applications of DISSECT for detecting potential biases of a classifier and identifying spurious artifacts that impact predictions.

研究の動機と目的

  • 深層学習モデルのための反事後的例を現実的で、分離され、安定的であるように生成する従来の説明手法の限界を解消すること。
  • 1つの概念だけを変化させる画像の系列を生成することで、ユーザーが「もし〜だったらどうなるか」のシナリオを探索し、各概念が分類器の意思決定にどのように影響するかを明らかにすること。
  • ユーザー定義の概念や大量のアノテーションに依存せずに、分類器の内蔵概念表現を自動で発見すること。
  • 生成された説明における現実性、分離性、予測への影響、安定性を同時に最適化すること。

提案手法

  • DISSECTは、現実性、分離性、予測への影響をバランスさせる多目的損失関数を用いて、生成器、識別器、概念分離器を共同で訓練する。
  • 本手法は、概念遷移(CT)を生成する——各ステップで1つの分離された概念の影響が分類器の出力に段階的に増加する画像の系列である。
  • 分類器の予測信号を生成器のガイドとして用いることで、事前に概念のアノテーションがなくても、モデルの内部的概念理解を発見可能となる。
  • 主な構成要素として、対照学習を用いて分離性を強制する概念分離器と、関連する入力情報の保持を目的とした再構成損失を含む。
  • 訓練目的には、アドバーシャル損失(現実性のため)、再構成損失(情報保持のため)、および概念固有の損失(予測への影響を保証するため)が含まれる。
  • DISSECTは生成器の品質にかかわらず頑健であり、不完全なGANでさえも、強力な生成モデルと組み合わせた場合に高い説明品質を維持する。

実験結果

リサーチクエスチョン

  • RQ1生成モデルは、類似する入力においても現実的で安定的でありながら、個々の概念を分離する反事後的説明を生成できるか?
  • RQ2人為的な概念定義や大量のアノテーションに依存せずに、意味的で影響力があり、分離された概念を発見できるか?
  • RQ3生成器、識別器、分離器の共同訓練は、単独の生成モデルや後処理による説明手法と比較して、説明の質をどのように向上させるか?
  • RQ4DISSECTは、皮膚科分類における手術マークの依存性など、分類器の隠れたバイアスや誤った特徴をどの程度明らかにできるか?
  • RQ5基礎となるGANの品質やハイパーパrameterの選択が、生成された概念遷移の現実性、分離性、影響力にどの程度影響を及えるか?

主な発見

  • DISSECTは、ベースアーキテクチャでFIDスコアが42.109まで低下するほど非常に現実的な概念遷移を生成し、類似する入力においても高い安定性を維持する。
  • 本手法は強力な分離性を達成しており、3D Shapes、SynthDerm、CelebAデータセットの全概念において、概念遷移(CT)重要度スコアが0.8以上である。
  • DISSECTは、黒色腫分類における手術マークのような誤った特徴を効果的に同定し、バイアス検出の有効性を示している。
  • 不完全な生成器品質(例:xxsmallアーキテクチャ)でさえも、概念の重要度と明確性に高い性能を維持しており、生成品質に対して頑健であることが示された。
  • CelebAデータセットでは、CTにおける概念検出で99.868%の精度と98.63%の再現率を達成し、高い安定性と影響力スコアを示した。
  • GANオンリーベースライン(分離や説明の目的なし)は完全に失敗し、精度と再現率が0%であった。これにより、共同訓練目的の必要性が明確になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。