Skip to main content
QUICK REVIEW

[論文レビュー] Counterfactual Generation and Fairness Evaluation Using Adversarially Learned Inference

Saloni Dash, Amit Sharma|arXiv (Cornell University)|Sep 17, 2020
Explainable Artificial Intelligence (XAI)参考文献 24被引用数 5
ひとこと要約

この論文は、既知の因果グラフを組み込んだ条件付き対抗的学習推論(c-ALI)フレームワークを用いて、意味的に意味のある画像摂動を生成する因果認識型反事後的生成手法を提案する。本手法は、Morpho-MNISTおよびCelebAで、ターゲット属性とその因果的従属属性を変更しながら他の特徴を保持する反事後的例を効果的に生成でき、顔の魅力度分類器における頑健な公平性評価を可能にする。

ABSTRACT

Recent studies have reported biases in machine learning image classifiers, especially against particular demographic groups. Counterfactual examples for an input---perturbations that change specific features but not others---have been shown to be useful for evaluating explainability and fairness of machine learning models. However, generating counterfactual examples for images is non-trivial due to the underlying causal structure governing the various features of an image. To be meaningful, generated perturbations need to satisfy constraints implied by the causal model. We present a method for generating counterfactuals by incorporating a known causal graph structure in a conditional variant of Adversarially Learned Inference (ALI). The proposed approach learns causal relationships between the specified attributes of an image and generates counterfactuals in accordance with these relationships. On Morpho-MNIST and CelebA datasets, the method generates counterfactuals that can change specified attributes and their causal descendants while keeping other attributes constant. As an application, we apply the generated counterfactuals from CelebA images to evaluate fairness biases in a classifier that predicts attractiveness of a face.

研究の動機と目的

  • 画像分類器における意味的な反事後的例を、属性間の潜在的因果関係を尊重する形で生成する課題に対処すること。
  • 現実的で因果的に一貫性のある属性変更を反映する反事後的例を生成することで、公平性評価を向上させること。
  • 指定された特徴とその因果的従属属性を変更する一方で、非ターゲット属性を保持する手法の開発。
  • 生成された反事後的例を用いて、顔の魅力度分類器における公平性バイアスを検出および定量すること。

提案手法

  • 本手法は、Adversarially Learned Inference (ALI) を条件付きバージョン(c-ALI)に拡張し、反事後的生成をガイドする既知の因果グラフ構造を統合する。
  • 条件付き生成器と判別器を用いて、因果グラフの制約下での画像属性の同時分布をモデル化する。
  • 生成器は、因果的依存関係を尊重し、関係のない特徴を保持しながら、特定の属性を摂動することで反事後的画像を学習的に生成する。
  • トレーニング中に因果グラフからの構造的制約を強制し、変更が操作された属性の因果的従属属性にのみ伝播することを保証する。
  • 対抗的学習を用いてエンドツーエンドにトレーニングされ、判別器は本物の画像と生成された反事後的画像を区別する。
  • 本手法は、Morpho-MNISTおよびCelebAで評価され、ターゲット属性とその因果的従属属性を変更しながら他の属性を一定に保つ反事後的例を生成した。

実験結果

リサーチクエスチョン

  • RQ1既知の因果グラフを生成プロセスに組み込むことで、画像データにおける反事後的生成を因果的に一貫性を持たせることは可能か?
  • RQ2指定された属性とその因果的従属属性を変更する際、非ターゲット属性をどれほど効果的に保持できるか?
  • RQ3生成された反事後的例は、訓練済みの画像分類器における公平性バイアスをどの程度検出できるか?
  • RQ4因果構造の組み込みにより、非因果的ベースラインと比較して、生成された反事後的例の意味的妥当性と妥当性が向上するか?

主な発見

  • 提案手法は、Morpho-MNISTおよびCelebAで、指定された属性とその因果的従属属性を変更しながら他の属性を変化させない反事後的画像を効果的に生成した。
  • 反事後的例は、画像属性の背後にある因果構造を尊重しているため、意味的に意味のあるものであった。
  • CelebAでは、生成された反事後的例が顔の魅力度分類器における顕著な公平性バイアスを明らかにした。特に、人種的・文化的属性が予測に与える影響が顕著に見られた。
  • 非因果的ベースラインと比較して、本手法は現実的でかつ因果関係に忠実な反事後的例を生成する点で優れた性能を示した。
  • 本フレームワークは、反事後的生成中に非ターゲット特徴を効果的に保持するという点で頑健性を示し、特定の属性変更を明確に分離できることを確認した。
  • 反事後的例を用いた評価により、人種的グループ間での魅力度予測の不平等さが明確に浮き彫りにされ、公平性に関する実用的洞察が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。