[論文レビュー] Fairness of Exposure in Stochastic Bandits
本稿では、確率的マルチアームバンディットおよび線形バンディットにおける露出割り当ての公平性を扱う FairX バンディットフレームワークを提案する。各アームがその実績に応じた露出を得ることを保証する。公平性レグレットと報酬レグレットの目的関数を導入し、サブラインアーなレグレットバウンドを達成しながら、実績に基づく公平性を確保するフェアなUCBおよびトムソンサンプリングアルゴリズムを開発した。実験では、合成データおよび実世界のデータセットにおいて有効であることを確認した。
Contextual bandit algorithms have become widely used for recommendation in online systems (e.g. marketplaces, music streaming, news), where they now wield substantial influence on which items get exposed to the users. This raises questions of fairness to the items -- and to the sellers, artists, and writers that benefit from this exposure. We argue that the conventional bandit formulation can lead to an undesirable and unfair winner-takes-all allocation of exposure. To remedy this problem, we propose a new bandit objective that guarantees merit-based fairness of exposure to the items while optimizing utility to the users. We formulate fairness regret and reward regret in this setting, and present algorithms for both stochastic multi-armed bandits and stochastic linear bandits. We prove that the algorithms achieve sub-linear fairness regret and reward regret. Beyond the theoretical analysis, we also provide empirical evidence that these algorithms can fairly allocate exposure to different arms effectively.
研究の動機と目的
- 従来のバンディットアルゴリズムが高報酬アームに不正に有利に働く「勝者獲得型露出問題」を解消すること。
- 各アームの露出がその実績(平均報酬の増加関数として定義される)に比例することを保証することで、露出割り当てにおける公平性を形式化すること。
- バンディット学習における二重の目的関数として、公平性レグレットと報酬レグレットを導入・分析すること。
- 確率的マルチアームバンディットおよび線形バンディットの両者に対して、フェアなUCBおよびトムソンサンプリングアルゴリズムを設計・理論的解析すること。
- 提案されたアルゴリズムが、低報酬レグレットを維持しながら公平な露出割り当てを達成することを実験的に検証すること。
提案手法
- アームの実績をその平均報酬の増加関数として定義し、露出をバンディット方策における選択確率として定義する。
- 公平性レグレットを、実際の露出と実績に比例する露出との乖離として定式化し、報酬レグレットを最適ユーザー効用からの乖離として定式化する。
- 実績と露出の不均衡に基づいた公平性に配慮した信頼区間補正を組み込んだフェアなUCBアルゴリズムを設計する。
- 期待露出における公平性を維持するために調整された事後分布からサンプリングするフェアなトムソンサンプリングアルゴリズムを設計する。
- 線形モデルとリッジ回帰を用いたパrameter推定により、確率的線形バンディット設定にフェアなUCBおよびTSフレームワークを拡張する。
- すべてのアルゴリズムに対して、探索重み、事前分散、正則化項を含むハイパーパrameterをグリッドサーチで最適化する。
実験結果
リサーチクエスチョン
- RQ1報酬を最大化しつつ、アームの実績に比例した公平な露出割り当てを保証できるバンディットアルゴリズムを設計できるか?
- RQ2提案された FairX バンディットフレームワークにおける公平性および報酬の理論的レグレットバウンドはどのように証明できるか?
- RQ3従来のバンディットと比較して、公平性に配慮したアルゴリズムは露出の平等性およびユーザー反応最適化においてどのように異なるか?
- RQ4線形バンディットにおけるモデルの不適合性は、公平性レグレットの収束に影響を与えるか?その影響をどのように軽減できるか?
- RQ5公平性に配慮したアルゴリズムは、多様な実世界および合成データセットにおいて、サブラインアーな公平性および報酬レグレットを維持できるか?
主な発見
- 提案されたフェアなUCBおよびフェアなTSアルゴリズムは、確率的マルチアームバンディットおよび線形バンディットの両設定において、サブラインアーな公平性レグレットおよび報酬レグレットを達成した。
- 公平性レグレットはアームの最小実績および実績関数のリプシッツ定数に依存し、理論的下界が導出された。
- イーストおよびメディアミルデータセットにおける実験結果から、FairXアルゴリズムが実績に基づく公平性を効果的に制御しながら、低報酬レグレットを維持していることが示された。
- Yahoo! データセットでは、5日間のウィンドウでハイパーパrameterをチューニングし、次の5日間でテストしたが、FairXアルゴリズムは頑健な公平性と低レグレットを維持した。
- イーストからの合成データにおけるwell-specifiedな線形モデル設定では、理論通り√Tスケーリングに従い、公平性レグレットが収束した。理論的バウンドの妥当性が確認された。
- 理論的レグレットバウンドが類似しているにもかかわらず、実践的にはTSベースのアルゴリズムがUCBベースのものよりも計算上の利点を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。