Skip to main content
QUICK REVIEW

[論文レビュー] Group-Fair Online Allocation in Continuous Time

Semih Çaycı, Swati Gupta|arXiv (Cornell University)|Jun 11, 2020
Advanced Bandit Algorithms Research参考文献 47被引用数 11
ひとこと要約

本稿は、ランダムなタスク完了時間とデッドラインを伴うグループ間の公平なリソース割り当てのための連続時間オンライン学習フレームワークを提案する。時間予算制約下で、双対昇上最適化を用いて、$\tilde{O}(B^{-1/2})$ のレグレットバウンドを達成する。報酬最大化、マックスミニ公平、比例公平な割り当ては、統一された効用最大化定式化の特殊ケースとして一般化される。

ABSTRACT

The theory of discrete-time online learning has been successfully applied in many problems that involve sequential decision-making under uncertainty. However, in many applications including contractual hiring in online freelancing platforms and server allocation in cloud computing systems, the outcome of each action is observed only after a random and action-dependent time. Furthermore, as a consequence of certain ethical and economic concerns, the controller may impose deadlines on the completion of each task, and require fairness across different groups in the allocation of total time budget $B$. In order to address these applications, we consider continuous-time online learning problem with fairness considerations, and present a novel framework based on continuous-time utility maximization. We show that this formulation recovers reward-maximizing, max-min fair and proportionally fair allocation rules across different groups as special cases. We characterize the optimal offline policy, which allocates the total time between different actions in an optimally fair way (as defined by the utility function), and impose deadlines to maximize time-efficiency. In the absence of any statistical knowledge, we propose a novel online learning algorithm based on dual ascent optimization for time averages, and prove that it achieves $ ilde{O}(B^{-1/2})$ regret bound.

研究の動機と目的

  • ランダムなタスク完了時間とハードデッドラインを伴うオンライン逐次意思決定における公平性を扱う。特に、オンライン採用やクラウドコンピューティングのような文脈を想定する。
  • 報酬最大化とグループ公平性を、異種のタスク完了分布にわたってバランスさせる連続時間効用最大化フレームワークを定式化する。
  • 報酬や完了時間分布の統計的知識を事前に持たないオンライン学習アルゴリズムを設計する。
  • デッドラインを割り当て方針に組み込むことで、時間効率を高め、合計時間予算$B$の浪費を防ぐ。
  • 総報酬とグループ間の公平性の間の、理論的保証付きのトレードオフを達成する。レグレットと制約違反の両面で保証を提供する。

提案手法

  • 行動(採用意思決定)がランダムな完了時間を伴い、デッドラインまでに完了しなければ報酬が得られない連続時間効用最大化問題として問題を定式化し、時間予算$B$を設定する。
  • 報酬最大化、マックスミニ公平、比例公平な割り当てを特殊ケースとして回復できる一般化された効用関数を定義する。
  • ラグランジュ双対性を用いて、効用と時間制約のバランスを取る最適なオフライン方策を導出する。双対変数は公平性の重みを表す。
  • 観測された完了時間と報酬に基づいて双対変数を更新する、時間平均的性能を目的とした新しいオンライン学習アルゴリズムを提案する。
  • リャプノフドリフト解析を用いて、レグレットと制約違反をバウンドし、最適効用への収束が$\tilde{O}(B^{-1/2})$のレグレットで保証されることを証明する。
  • いかなる因果的方策に対しても、決定段階数$N^\pi(B)$の高確率的バウンドを確立し、$B$に対して$\Theta(B)$であることを示す。これにより、時間予算が効率的に使用されていることが保証される。

実験結果

リサーチクエスチョン

  • RQ1グループ公平性は、ランダムなタスク完了時間とデッドラインを伴う連続時間オンライン割り当てに、どのように形式的に統合できるか?
  • RQ2時間予算と公平性制約下で、効用を最大化する最適なオフライン方策は何か?
  • RQ3報酬や完了時間分布の事前知識が一切ないオンラインアルゴリズムを設計でき、サブ線形レグレットを達成できるか?
  • RQ4固定時間予算下でのリソース割り当てにおいて、デッドラインの導入が時間効率をどのように向上させるか?
  • RQ5総報酬と公平性の間のトレードオフは何か?また、その定量的バウンドは、レグレットと制約違反の観点からどのように定式化できるか?

主な発見

  • 提案されたフレームワークは、報酬最大化、マックスミニ公平、比例公平な割り当てを、統一された連続時間効用最大化定式化の特殊ケースとして回復する。
  • 最適なオフライン方策は、効用と公平性のバランスを取るために、行動間で時間を配分する。デッドラインは時間効率を最大化するために使用される。
  • オンラインアルゴリズムは、統計的仮定なしに$\tilde{O}(B^{-1/2})$のレグレットバウンドを達成する。これは時間予算$B$に対してサブ線形である。
  • 公平性の制約違反は$O(1/\sqrt{B \log B})$のレートで満たされ、公平性が漸近的に維持されることを保証する。
  • 決定段階数$N^\pi(B)$は高確率で$\Theta(B)$である。これは、時間予算が効率的に使用されていることを確認する。
  • パラメータ$V = \Theta(\sqrt{N / \log N})$を選び、$N = \Theta(B)$とすると、効用において最適値との差が$O(\sqrt{\log N / N})$に抑えられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。