Skip to main content
QUICK REVIEW

[論文レビュー] Fairness in Learning-Based Sequential Decision Algorithms: A Survey

Xueru Zhang, Mingyan Liu|arXiv (Cornell University)|Jan 14, 2020
Explainable Artificial Intelligence (XAI)被引用数 4
ひとこと要約

本調査は、学習ベースの逐次的意思決定における公平性を検討し、過去の意思決定が将来のデータに影響しない設定と影響する設定の2つに区別する。公平性の介入、特に団体公平性制約(例:デモグラフィックパリティ)が、時間の経過とともに表現の不均衡を悪化させ、特徴量の分布歪みを悪化させることがあることが示された。これは、意思決定が個人の行動を変化させる場合に顕著である。

ABSTRACT

Algorithmic fairness in decision-making has been studied extensively in static settings where one-shot decisions are made on tasks such as classification. However, in practice most decision-making processes are of a sequential nature, where decisions made in the past may have an impact on future data. This is particularly the case when decisions affect the individuals or users generating the data used for future decisions. In this survey, we review existing literature on the fairness of data-driven sequential decision-making. We will focus on two types of sequential decisions: (1) past decisions have no impact on the underlying user population and thus no impact on future data; (2) past decisions have an impact on the underlying user population and therefore the future data, which can then impact future decisions. In each case the impact of various fairness interventions on the underlying population is examined.

研究の動機と目的

  • 意思決定が将来のデータに影響する逐次的意思決定システムにおける公平性介入の長期的影響を分析すること。
  • 2つの設定を区別すること:(1) 意思決定が将来のデータに影響しない場合、(2) 意味決定が母集団そのものを変化させ、結果として将来のデータ分布を変える場合。
  • デモグラフィックパリティや等しいオッズなどの公平性制約が、時間の経過とともに団体の代表性と特徴量の進化に与える影響を調査すること。
  • 意思決定と集団行動の間のフィードバックループが、バイアスを強化または悪化させるリスクを浮き彫りにすること。
  • フィードバック駆動環境における公平性をモデル化するための強化学習およびMDPベースのフレームワークの体系的レビューを提供すること。

提案手法

  • 状態に個人の特徴量と感受性属性を含むマルコフ意思決定過程(MDPs)を用いて、逐次的意思決定をモデル化する。行動は意思決定を表す。
  • 意思決定が特徴量分布に与える影響を示す2つのシナリオを導入する:(1) 意味決定による損失の認識により団体の構成比が変化する、(2) 劣位なグループに属する人々が損失を減らすために行動を変化させ、結果として特徴量分布が変化する。
  • 時間変動する特徴量分布下でのデモグラフィックパリティ(DP)や等しいオッズ(EqOpt)などの公平性制約を分析する。
  • 数学的モデリングにより、意思決定のフィードバックによって特徴量分布が変化する場合、公平性介入が表現の不均衡を加速させることを示す。
  • jabbari2017fairnessおよびwen2019fairnessの強化学習フレームワークを応用し、長期的報酬の公平性と団体公平性制約を統合する。
  • 学習収束への影響を評価し、公平性要件が厳しくなるほど、近似的最適性に到達するまでの時間が著しく延長されることを示す。

実験結果

リサーチクエスチョン

  • RQ1意思決定が将来のデータに影響する場合、逐次的意思決定における公平性介入が長期的な団体代表性の不均衡にどのように影響するか?
  • RQ2個人が繰り返し不平等な意思決定に直面した際に、劣位なグループの特徴量分布はどのように変化するか?
  • RQ3デモグラフィックパリティや等しいオッズなどの公平性制約が、フィードバック駆動システムにおいて長期的にバイアスを悪化させる可能性があるか?
  • RQ4意思決定と集団行動の相互作用が、既存の不均衡を強化または拡大するフィードバックループをどのように形成するか?
  • RQ5特徴量分布が時間の経過とともに変化する状況において、公平性に配慮した強化学習アルゴリズムは、性能と公平性の結果においてどのように異なるか?

主な発見

  • 意思決定が母集団に影響する場合、デモグラフィックパリティ(DP)や等しいオッズ(EqOpt)などの公平性介入は、長期的に表現の不均衡を悪化させる可能性がある。
  • 劣位なグループに属する人々が意思決定に起因する損失を減らすために行動を変化させると、その特徴量分布が歪み、結果としてさらなる不利な状況を招くことがある。
  • 意思決定からのフィードバックと進化する特徴量分布の組み合わせが、特に団体公平性制約下でバイアスを拡大するフィードバックループを生み出す。
  • 公平性制約が存在する場合でも、公平性要件が厳しくなるほど、強化学習フレームワークにおいて近似的最適な意思決定ルールに到達するまでの時間が著しく延長される。
  • 意思決定が団体の構成比や特徴量分布を変化させる状況では、静的分布を仮定する公平性介入は、長期的な不平等を防ぐのに失敗する可能性がある。
  • 本研究は、静的公平性定義だけでは逐次的システムにおける公平性を保証できないことを示しており、集団のフィードバックを動的にモデル化することが不可欠である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。