Skip to main content
QUICK REVIEW

[論文レビュー] Group Fairness in Bandit Arm Selection

Candice Schumann, Zhi Lang|arXiv (Cornell University)|Dec 9, 2019
Advanced Bandit Algorithms Research参考文献 37被引用数 5
ひとこと要約

本稿では、グループレベルのバイアス項を学習することで、アーム報酬における社会的バイアスを是正するコンテキスト付きマルチアームバンディットアルゴリズム、GroupFairTopIntervalを提案する。これにより、感受性グループ間でのより公平なリソース配分が可能になる。理論的レグレットバウンドを提示し、合成データおよび実世界のデータセットにおいて、公平性とパフォーマンスの両方で改善が確認されている。

ABSTRACT

We propose a novel formulation of group fairness with biased feedback in the contextual multi-armed bandit (CMAB) setting. In the CMAB setting, a sequential decision maker must, at each time step, choose an arm to pull from a finite set of arms after observing some context for each of the potential arm pulls. In our model, arms are partitioned into two or more sensitive groups based on some protected feature(s) (e.g., age, race, or socio-economic status). Initial rewards received from pulling an arm may be distorted due to some unknown societal or measurement bias. We assume that in reality these groups are equal despite the biased feedback received by the agent. To alleviate this, we learn a societal bias term which can be used to both find the source of bias and to potentially fix the problem outside of the algorithm. We provide a novel algorithm that can accommodate this notion of fairness for an arbitrary number of groups, and provide a theoretical bound on the regret for our algorithm. We validate our algorithm using synthetic data and two real-world datasets for intervention settings wherein we want to allocate resources fairly across groups.

研究の動機と目的

  • 社会的要因や測定要因によるバイアスが生じるコンテキスト付きマルチアームバンディットにおけるグループ公平性を扱う。
  • 保護されたグループ間での潜在的バイアスを考慮した、報酬とレグレットの新しい定式化を形式化する。
  • 低レグレットと個々のアームの差別化を維持しながら、このバイアスを学習し是正するアルゴリズムを開発する。
  • 資源配分の介入設定を含む合成データおよび実世界のデータセット上で、このアプローチを検証する。

提案手法

  • グループレベルの社会的バイアス項を推定することで、観測報酬を補正する新しい報酬定義を提案する。
  • 感受性グループ間の公平性制約を組み込んだ、レグレットの定式化を導入する。
  • 上位信頼区間を用いてバイアス補正報酬を適用し、探索と活用のバランスを取るGroupFairTopIntervalというアルゴリズムを設計する。
  • グループ公平性を考慮しつつ、最適なアームを特定するための区間推定技術を採用する。
  • 歴史的フィードバックに基づいて線形モデルを用いてバイアス項を推定する。これは、観測がバイアスを含んでも、実際にはグループが同等に効果的であると仮定する。
  • 標準的なCMAB手法を拡張し、推定されたバイアスを用いて信頼区間を調整することで、公平性を統合する。

実験結果

リサーチクエスチョン

  • RQ1バイアスのあるフィードバックが存在するコンテキスト付きバンディットにおいて、グループ公平性をどのように形式的に定義できるか?
  • RQ2バイアスの大きさを事前に知らない状況でも、アルゴリズムが社会的バイアスを学習し是正できるか?
  • RQ3バイアスのあるフィードバック下で、公平性に配慮したバンディットアルゴリズムの理論的レグレットバウンドは何か?
  • RQ4提案されたアルゴリズムは、既存の公平性アプローチと比較して、公平性とパフォーマンスの両面で優れているか?
  • RQ5アルゴリズムは、高パフォーマンスの個々のアームを区別しつつも、公平性を維持できるか?

主な発見

  • 提案されたGroupFairTopIntervalアルゴリズムは、アーム数の平方根とバイアス補正の精度の逆数に比例する理論的レグレットバウンドを達成する。
  • 合成データ上で得られた実証的結果から、標準的なバンディットベースラインと比較して、グループレベルの報酬格差が顕著に低減されていることが示された。
  • マイクロレンディングやタレントソーシングを含む実世界のデータセットにおいて、アルゴリズムは競争力のある累積報酬を維持しながら、より優れた公平性指標を達成した。
  • アルゴリズムはフィードバックから社会的バイアス項を正しく学習し、真の報酬が分かっていなくても是正が可能であることを示した。
  • アドホックなしきい値設定や均等なランダムグループ選択と比較して、公平性とレグレットの両面で性能が優れている。
  • 遅延またはノイズの多い真のフィードバックに対しても、本手法は頑健であるため、ローン資金提供や採用などの長期的意思決定システムに適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。