Skip to main content
QUICK REVIEW

[論文レビュー] Model Selection's Disparate Impact in Real-World Deep Learning Applications

Jessica Zosa Forde, A. Feder Cooper|arXiv (Cornell University)|Apr 1, 2021
Artificial Intelligence in Healthcare and Education参考文献 30被引用数 9
ひとこと要約

この論文は、深層学習におけるモデル選択が、AUCなどの全体的な性能指標が安定している場合でも、文化的背景にかかわらず差別の的影響を引き起こす可能性があることを示している。ChestX-Ray8にCheXNetを適用した結果、異なる乱数シードで訓練されたモデル間で、男性と女性における真正陽性率(TPR)に顕著なばらつきが生じ、最大で0.2892に達する差が確認された。これは、公平性の結果に人間の影響を受ける指標選択の役割を浮き彫りにしている。

ABSTRACT

Algorithmic fairness has emphasized the role of biased data in automated decision outcomes. Recently, there has been a shift in attention to sources of bias that implicate fairness in other stages in the ML pipeline. We contend that one source of such bias, human preferences in model selection, remains under-explored in terms of its role in disparate impact across demographic groups. Using a deep learning model trained on real-world medical imaging data, we verify our claim empirically and argue that choice of metric for model comparison, especially those that do not take variability into account, can significantly bias model selection outcomes.

研究の動機と目的

  • 人間の影響を受けるモデル選択、特に性能指標の選択が、現実の深層学習応用において文化的背景にかかわらず差別的影響を引き起こすメカニズムを調査すること。
  • 同じハイパーパrameterを使用して訓練されたが異なる乱数シードを用いた複数のモデル間で、サブグループ(例:男性対女性の患者)の性能にどの程度のばらつきが生じるかを検討すること。
  • AUCのような安定した全体的な性能指標が公平性を示していると仮定することの問題を、医療画像分野のような高リスク分野において挑戦すること。
  • 特に現実のデータセットにおいて、公平性評価におけるモデル選択プロセスと指標の監視を強化するよう提言すること。
  • 集約指標を超えてサブグループの性能を考慮する、より責任ある、透明性があり、頑健なモデル選択プロセスの導入を求めること。

提案手法

  • 同じハイパーパrameterと事前学習済みImageNet重みを使用し、乱数シードのみを変えてChestX-Ray8データセットに50個のCheXNetを訓練した。
  • すべての実行で同じオプティマイザーとトレーニング手順を使用し、モデルの差は主に異なる乱数シードによるバッチシャッフルに起因した。
  • 各モデルについて、低発症率状況での再現率を重視するために、訓練セット上でF1スコアを最大化する予測しきい値を選択した。
  • 男性および女性のテストサブセットごとに、それぞれの所見について真正陽性率(TPR)を測定し、サブグループの性能差を評価した。
  • モデル間での全体的なAUCとTPRを比較し、文化的背景にかかわらず性能と公平性の一貫性を評価した。
  • 複数のモデルにおける男性と女性間のTPR差のばらつきを分析し、観察された最大値と範囲を特定した。

実験結果

リサーチクエスチョン

  • RQ1AUCのような単一の性能指標に基づくモデル選択が、文化的背景にかかわらずサブグループの性能差をどの程度隠してしまうのか?
  • RQ2同じハイパーパrameterで訓練され、異なる乱数シードを用いた複数のモデル間で、男性および女性患者の真正陽性率(TPR)にどの程度のばらつきが生じるのか?
  • RQ3全体的なモデル性能(AUC)が安定している状況下でも、サブグループの性能差(例:男性と女性のTPR差)が顕著に現れる可能性はあるか?
  • RQ4モデル選択指標の選択が、特に低発症率の医療画像分野における公平性の結果にどのように影響を与えるのか?
  • RQ5アンサンブルや自動化手法を用いることで、モデル選択におけるサブグループ性能のばらつきをどの程度低減できるのか?

主な発見

  • AUCの値がモデル間で一貫しているにもかかわらず(マスの所見では最大範囲が0.0227)、男性と女性の真正陽性率(TPR)の差が顕著に変動した。
  • どのモデルにおいても観察された男性と女性間のTPR差の最大値は0.2892に達し、全体的な性能が安定している場合でも重大な公平性リスクを示している。
  • 1つの所見について、モデル間でのTPR差の範囲は最大0.2258に達した。これは、モデル選択の仕方によって公平性問題が強化されたり、軽減されたりする可能性があることを示している。
  • サブグループ性能のばらつきと全体的なAUCには相関がなかった。これは、集約指標が公平性に関連する差を捉えていないことを示している。
  • 類似した全体的な性能を示すモデルでも、男性および女性の患者サブグループでの行動に顕著な違いが見られた。これは、集約指標にのみ基づいてモデルを導入するリスクを強調している。
  • 本研究は、モデル選択が中立的なプロセスではないことを明らかにした。人間の好みが影響を及ぼす指標選択の選択肢が、データやモデルアーキテクチャが固定されていても、差別的影響を引き起こす可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。