Skip to main content
QUICK REVIEW

[論文レビュー] Fair Contextual Multi-Armed Bandits: Theory and Experiments

Yifang Chen, Alex Cuellar|arXiv (Cornell University)|Dec 13, 2019
Advanced Bandit Algorithms Research参考文献 21被引用数 9
ひとこと要約

本稿では、各ユーザーが最小保証率で選択されるよう保証する公平性制約を満たしつつ、文脈情報を活用してパフォーマンスを向上させる公平な文脈的マルチアームバンディットアルゴリズムを提案する。FTRLフレームワークを用い、適応的正則化を導入することで、敵対的損失生成下でもサブラインアーリグレットと有界な公平性違反を達成する。実験的検証により、多様なユーザーが関与する文脈において、公平性とパフォーマンスのトレードオフが改善されたことが示された。

ABSTRACT

When an AI system interacts with multiple users, it frequently needs to make allocation decisions. For instance, a virtual agent decides whom to pay attention to in a group setting, or a factory robot selects a worker to deliver a part. Demonstrating fairness in decision making is essential for such systems to be broadly accepted. We introduce a Multi-Armed Bandit algorithm with fairness constraints, where fairness is defined as a minimum rate that a task or a resource is assigned to a user. The proposed algorithm uses contextual information about the users and the task and makes no assumptions on how the losses capturing the performance of different users are generated. We provide theoretical guarantees of performance and empirical results from simulation and an online user study. The results highlight the benefit of accounting for contexts in fair decision making, especially when users perform better at some contexts and worse at others.

研究の動機と目的

  • 複数のユーザーにタスクを割り当てるAI意思決定における公平性を扱う。特に、ユーザーが文脈に応じてパフォーマンスが異なる状況を想定する。
  • 固定または定常的な損失分布を仮定せずに、各ユーザーに対して最小選択率(公平性制約)を強制するマルチアームバンディットアルゴリズムを設計すること。
  • ユーザーとタスクに関する文脈的情報を統合することで、パフォーマンスを向上させつつ公平性を維持すること。
  • 文脈分布が未知である場合でも、レグレットと公平性違反に関する理論的保証を提供すること。
  • シミュレーションおよび文化的に多様な参加者を対象としたオンラインユーザースタディを通じて、手法の実証的検証を行うこと。

提案手法

  • 探索と公平性のバランスを図るために、エントロピー関数 $\psi(p) = p\ln p$ を用いた正則化子を備えたFollow-the-Regularized-Leader (FTRL) フレームワークを採用する。
  • エポックベースの学習を採用し、適応的正則化パラメータ $\eta_k = \sqrt{M\ln K / (\tau_k K)}$ を用いて、時間経過に伴うポリシー分布の精錬を図る。
  • バンディット設定における確率的フィードバックを処理するため、損失推定子 $\hat{l}_t(i) = l_t(i)/(p_t^{j_t}(i) \cdot \mathbf{1}\{i_t = i\})$ を構築する。
  • 公平性制約 $\sum_j q(j)p^j(i) \geq v$ をすべてのアーム $i$ に対して満たすポリシー分布の集合 $\Omega_k$ を維持する。
  • 二段階アプローチを採用:まずデータから文脈分布 $q$ を推定し、次に各エポックごとにレグレットを最小化する制約付き最適化問題を解く。
  • 制約の順守度を測定するため、公平性違反指標 $\text{Vio} = \mathbb{E}\left[\frac{1}{T}\sum_t \max\left\{0, v - \min_i \sum_j q(j)p_t^j(i)\right\}\right]$ を適用する。

実験結果

リサーチクエスチョン

  • RQ1ユーザーのパフォーマンスが文脈に依存する状況において、文脈的マルチアームバンディットで公平性を形式的にどのように強制できるか。
  • RQ2敵対的損失生成下でも、すべてのユーザーに対して最小選択率を保証しつつ、サブラインアーリグレットを維持できるバンディットアルゴリズムは存在するか。
  • RQ3文脈的情報を統合することで、タスク割り当てにおけるパフォーマンスと公平性のトレードオフにどのような影響を与えるか。
  • RQ4ユーザーが異なる文脈で優れたパフォーマンスを発揮する場合、公平性制約はパフォーマンスにどのような影響を及えるか。
  • RQ5損失生成に統計的仮定を設けない非定常的または敵対的環境下でも、アルゴリズムはどのように動作するか。

主な発見

  • 提案アルゴリズムは、$O(\sqrt{TMK\ln K})$ のレグレットと、$O\left(\sqrt{\frac{M\ln(TM)}{T}} + \frac{M\ln(TM)\ln T}{T}\right)$ の公平性違反を達成し、強力なパフォーマンスと公平性を両立する。
  • すべての文脈で優位なユーザーが存在する状況では、公平性を高めるとパフォーマンスが悪化する傾向が確認され、この二つに inherently 存在するトレードオフが裏付けられた。
  • 頻繁に出現する文脈で優れたパフォーマンスを発揮するユーザーが存在する場合、文脈分布が最小選択率を満たしている限り、公平性制約はパフォーマンスにほとんど影響しない。
  • 敵対的環境下では、公平性が有益であることが示された。特に、Fair UCB のような楽観的アルゴリズムでは、楽観的境界の過剰な利用が抑制される。
  • ユーザーが文脈に応じて補完的強みを示す状況では、文脈に依存するアルゴリズムが非文脈的ベースラインを著しく上回ることが、ユーザースタディで確認された。
  • ユーザースタディの結果、文脈に応じて異なる強みを示す参加者ペairに対して、Fair CB が最良のパフォーマンスを達成した。これは、文脈に依存する公平性の価値を強力に示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。