Skip to main content
QUICK REVIEW

[論文レビュー] What will it take to generate fairness-preserving explanations?

Jessica Dai, Sohini Upadhyay|arXiv (Cornell University)|Jun 24, 2021
Explainable Artificial Intelligence (XAI)参考文献 20被引用数 6
ひとこと要約

本論文は、ブラックボックスモデルの既存の説明手法が公平性の性質を十分に保つことができず、モデルにバイアスがある場合でさえも誤解を招く解釈を生むことがあると主張している。本稿では、元のLIME目的関数に公平性の保持項ψ(f,g)を追加することで、元のモデルの公平性行動をよりよく反映する説明を生成する修正されたLIME目的関数を提案している。実験を通じて、この手法がブラックボックスとその説明の間の公平性の不一致を低減することを示している。

ABSTRACT

In situations where explanations of black-box models may be useful, the fairness of the black-box is also often a relevant concern. However, the link between the fairness of the black-box model and the behavior of explanations for the black-box is unclear. We focus on explanations applied to tabular datasets, suggesting that explanations do not necessarily preserve the fairness properties of the black-box algorithm. In other words, explanation algorithms can ignore or obscure critical relevant properties, creating incorrect or misleading explanations. More broadly, we propose future research directions for evaluating and generating explanations such that they are informative and relevant from a fairness perspective.

研究の動機と目的

  • 現在の説明手法がブラックボックスモデルの公平性特性を保っているかどうかを調査すること。
  • 既存の説明技術が、意図的な悪意がなくとも、モデル意思決定における公平性関連行動を隠蔽または誤解を招く形で表現する方法を特定すること。
  • 忠実かつ公平であることを保証する説明の評価および生成のためのフレームワークを提案すること。
  • 説明手法の評価基準として公平性を根幹に据える広範な議論を開始すること。

提案手法

  • 忠実度および複雑さの項に加えて、公平性保持項ψ(f,g)を含む修正されたLIME目的関数を提案すること。
  • ブラックボックスの公平性行動と整合する説明を促進するために、LIME最適化にペナルティ項λ₂ψ(f,g)を統合すること。
  • 公平性指標として、グループ間の正例予測率の差を測定するデモグラフィックパリティ(DP)を用いること。
  • COMPASデータセット上の深層ニューラルネットワークブラックボックスに、修正された目的関数を適用して、公平性を保つ説明を生成すること。
  • LIMEにおけるパーソネーション数を変化させ、説明における公平性不一致の漸近的挙動を評価すること。
  • ブラックボックスと説明モデルの両方の公平性を比較するため、|DP(f(x)) − DP(E_f(x))|として公平性不一致を評価すること。

実験結果

リサーチクエスチョン

  • RQ1LIMEのような標準的説明手法は、ブラックボックスモデルの公平性特性を保っているのか?
  • RQ2説明手法は、意図的な悪意がなくとも、モデル意思決定におけるバイアスをどの程度隠蔽または誤解を招く形で表現するのか?
  • RQ3公平性を説明生成の目的関数に形式的に統合するにはどうすればよいか?
  • RQ4パーソネーション数の増加が、ブラックボックスと説明モデル間の公平性不一致に与える影響は何か?

主な発見

  • 忠実度が高くても、標準的LIMEによって生成された説明は、ブラックボックスモデルと比べて顕著な公平性不一致を示すことがある。
  • 公平性ペナルティ項を含む修正LIME目的関数は、COMPASデータセット全体で平均的な公平性不一致を低減する。
  • パーソネーション数が増加するにつれて、標準的LIME説明における公平性不一致は漸近的に減少し、安定性が向上することが示された。
  • 公平性を考慮したアプローチにより、ブラックボックスのデモグラフィックパリティと説明モデルのデモグラフィックパリティの乖離が有意に低減された。
  • 結果から、公平性に配慮した説明生成は実現可能であり、今後の評価基準としての核心的意義を有することが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。