Skip to main content
QUICK REVIEW

[論文レビュー] Beyond $\log^2(T)$ Regret for Decentralized Bandits in Matching Markets

Soumya Basu, Karthik Abinav Sankararaman|ArXiv.org|Mar 12, 2021
Advanced Bandit Algorithms Research参考文献 25被引用数 5
ひとこと要約

本稿では、片側フィードバックを伴う二面的マッチング市場における分散型バンディットアルゴリズムを提案し、一般市場では $O(K\log^{1+\varepsilon}(T))$ のレグレットを達成し、一意性整合性下では $O(NK\log T)$ のレグレットを達成する。これは、従来の $O(\log^2 T)$ および $O(\exp(N^4)\log^2 T)$ の境界を改善する。本手法はフェーズベースの探索に加え、グローバルおよびローカルなアーム削除を用いて衝突とランクの非均一性を解消する。

ABSTRACT

We design decentralized algorithms for regret minimization in the two-sided matching market with one-sided bandit feedback that significantly improves upon the prior works (Liu et al. 2020a, 2020b, Sankararaman et al. 2020). First, for general markets, for any $\varepsilon > 0$, we design an algorithm that achieves a $O(\log^{1+\varepsilon}(T))$ regret to the agent-optimal stable matching, with unknown time horizon $T$, improving upon the $O(\log^{2}(T))$ regret achieved in (Liu et al. 2020b). Second, we provide the optimal $Θ(\log(T))$ agent-optimal regret for markets satisfying uniqueness consistency -- markets where leaving participants don't alter the original stable matching. Previously, $Θ(\log(T))$ regret was achievable (Sankararaman et al. 2020, Liu et al. 2020b) in the much restricted serial dictatorship setting, when all arms have the same preference over the agents. We propose a phase-based algorithm, wherein each phase, besides deleting the globally communicated dominated arms the agents locally delete arms with which they collide often. This local deletion is pivotal in breaking deadlocks arising from rank heterogeneity of agents across arms. We further demonstrate the superiority of our algorithm over existing works through simulations.

研究の動機と目的

  • 片側バンディットフィードバック下での二面的マッチング市場において、より良いレグレット境界を達成する分散型アルゴリズムを設計すること。
  • 完全に分散型の設定において、従来の手法が達成できるのはエージェント最悪または部分最適なレグレットにとどまることの制限を克服すること。
  • ローカルなアーム削除を導入することで、分散型バンディット学習におけるランクの非均一性と衝突のデッドロックを解消すること。
  • CA-UCB や UCB-D3 といった既存手法と比較して、理論的および実験的優位性を示すこと。
  • 一意性整合性下での最適なレグレット境界を確立し、制限が厳しい順序独占仮定を超えて拡張すること。

提案手法

  • エージェントがフェーズごとにアームを探索し、推定された好みに基づいて安定マッチングにコミットするフェーズベースの探索・次にコミットプロトコル(Phased ETC)を提案する。
  • ローカルな衝突に基づくアーム削除を導入:衝突が頻発するアームをエージェントが削除することで、干渉を低減し、ランクの非均一性に起因するデッドロックを解消する。
  • グローバルな通信を用いて全エージェントにわたる支配されるアームを削除し、ローカルな削除を補完することで、探索の効率を向上させる。
  • 各フェーズにおいて、探索と活用のバランスを取るために、上界信頼区間(UCB)インデックスを用いる。
  • UCB-D3 の拡張として、ローカルな削除を統合した UCB-D4 を設計し、非均一なアームランクに対応してレグレット性能を向上させる。
  • 指数的増加($c_0^{i}$)と乗数を用いてフェーズ長を調整し、大規模なインスタンスにおける初期レグレットと収束速度のバランスを取る。

実験結果

リサーチクエスチョン

  • RQ1片側フィードバックを伴う一般の二面的マッチング市場において、分散型バンディットアルゴリズムはサブ・ログ²T レグレットを達成できるか?
  • RQ2順序独占仮定を超えて、分散型設定で最適な $O(NK\log T)$ レグレットを達成できるか?
  • RQ3異なったアームに対するエージェントのランクの非均一性を持つ市場において、ローカルな衝突に基づくアーム削除は性能をどのように向上させるか?
  • RQ4一意性整合性が分散型バンディットマッチングにおけるレグレット境界とアルゴリズム設計に与える影響は何か?
  • RQ5適応的フェーズ長とローカルな削除を併用したフェーズベースの探索は、理論的およびシミュレーション的に CA-UCB や UCB-D3 よりも優れているか?

主な発見

  • 提案された Phased ETC アルゴリズムは、任意の $\varepsilon > 0$ に対して一般市場で $O(K\log^{1+\varepsilon}(T))$ のレグレットを達成し、CA-UCB の $O(\exp(N^4)\log^2 T)$ の境界を改善する。
  • 一意性整合性下では、UCB-D4 が $O(NK\log T)$ のレグレットを達成し、これはかつて順序独占設定でのみ知られていた最適境界と一致する。
  • シミュレーションでは、一意性整合性がない一般インスタンスにおいても UCB-D4 がサブ線形レグレットを達成しており、現在の解析を超える理論的境界の可能性を示唆する。
  • CA-UCB は追加のフィードバックがあるにもかかわらず、高い衝突レグレットを被っているため、分散型設定では衝突の解消がレグレットの主要因であることが示唆される。
  • 指数的増加($c_0 = 1.5$ で Phased ETC、$c_0 = 1.2$ で UCB-D4)によるチューニングされたフェーズ長は、大規模インスタンス($N=11$, $K=15$)において初期レグレットを顕著に低減し、収束を改善する。
  • UCB-D4 における通信レグレットは $(K-1+|\mathcal{B}_{jk^*}|)\log_{c_0}(T/c_1)$ で有界であり、ローカルな削除が通信オーバーヘッドとレグレットを低減することを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。