[論文レビュー] Dominate or Delete: Decentralized Competing Bandits with Uniform Valuation.
本稿では、報酬が未知の腕をめぐるエージェント間の競合を扱う均一評価下での分散型アルゴリズムである ame を提案する。このアルゴリズムは段階的探索、非優越腕に対する動的UCB、および協調のための純粋な活用を用い、報酬ギャップや時間枠の知識を必要とせず、$O(\log T / \Delta^2)$ のレグレットを達成する。これにより、マッチングバンディット分野における一部の未解決問題が解決される。
We study regret minimization problems in a two-sided matching market where uniformly valued demand side agents (a.k.a. agents) continuously compete for getting matched with supply side agents (a.k.a. arms) with unknown and heterogeneous valuations. Such markets abstract online matching platforms (for e.g. UpWork, TaskRabbit) and falls within the purview of matching bandit models introduced in Liu et al. \cite{matching_bandits}. The uniform valuation in the demand side admits a unique stable matching equilibrium in the system. We design the first decentralized algorithm - \fullname\; ( ame), for matching bandits under uniform valuation that does not require any knowledge of reward gaps or time horizon, and thus partially resolves an open question in \cite{matching_bandits}. ame\; works in phases of exponentially increasing length. In each phase $i$, an agent first deletes dominated arms -- the arms preferred by agents ranked higher than itself. Deletion follows dynamic explore-exploit using UCB algorithm on the remaining arms for $2^i$ rounds. {Finally, the preferred arm is broadcast in a decentralized fashion to other agents through {\em pure exploitation} in $(N-1)K$ rounds with $N$ agents and $K$ arms.} Comparing the obtained reward with respect to the unique stable matching, we show that ame\; achieves $O(\log(T)/\Delta^2)$ regret in $T$ rounds, where $\Delta$ is the minimum gap across all agents and arms. We provide a (orderwise) matching regret lower-bound.
研究の動機と目的
- 未知の腕評価値を有する分散型二面的マッチング市場におけるレグレット最小化の課題に取り組む。
- 報酬ギャップや時間枠の事前知識が不要なアルゴリズムを設計し、Liuら(2023)が提起した未解決問題に応える。
- レグレットを最小化しつつ、エージェント間の効率的協調を分散的に実現する。
- 既知の下界のオーダーと一致する理論的レグレットバウンドを確立する。
提案手法
- アルゴリズムは長さが指数的に増加する段階に分けられ、適応的探索と活用を可能にする。
- 各段階において、エージェントは上位のエージェントに優越する腕を削除し、有効な行動空間を縮小する。
- 残りの非優越腕に対して、$2^i$ ラウンドにわたりUCBアルゴリズムを適用し、探索と活用のバランスを取る。
- 探索終了後、エージェントは$(N-1)K$ ラウンドにわたり純粋な活用により好みの腕をブロードキャストし、分散型協調を確保する。
- 均一評価構造を活用することで、エージェントが一意の安定マッチングに収束することを保証する。
- 中央集権的制御を避けて、ローカル意思決定とブロードキャストメカニズムに依存する設計である。
実験結果
リサーチクエスチョン
- RQ1報酬ギャップや時間枠の事前知識がなくても、分散型アルゴリズムが均一評価下のマッチングバンディットでサブリニアなレグレットを達成できるか?
- RQ2均一評価下の分散型マッチングバンディットにおけるレグレットの根本的限界は何か?
- RQ3中央集権的制御や共有ランダムネスがなければ、エージェントが効率的に好みの腕に協調できるか?
- RQ4段階的探索を用いた動的探索・活用戦略は、最適なレグレットスケーリングを達成できるか?
- RQ5提案されたアルゴリズムは、理論的下界とオーダーで一致するレグレットバウンドを達成できるか?
主な発見
- ameアルゴリズムは、$T$ ラウンドで$O(\log T / \Delta^2)$ のレグレットを達成する。ここで$\Delta$ はエージェントと腕の間の最小報酬ギャップである。
- 導出されたマッチング下界と一致するため、オーダーワイズ最適なレグレットバウンドである。
- 時間枠や報酬ギャップパラメータの事前知識が不要である。
- 長さが指数的に増加する段階的探索の使用により、すべてのエージェントにおける効率的学習が保証される。
- 各段階で優越する腕を削除することで、有効な行動空間が縮小され、学習効率が向上する。
- $(N-1)K$ ラウンドにわたり純粋な活用による分散型協調により、中央集権的制御なしに安定マッチングへの収束が可能となる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。