Skip to main content
QUICK REVIEW

[論文レビュー] Competing Bandits in Matching Markets

Lydia T. Liu, Horia Mania|arXiv (Cornell University)|Jun 12, 2019
Advanced Bandit Algorithms Research参考文献 29被引用数 8
ひとこと要約

本稿は、片側が確率的報酬を通じて好みを学ぶ二面的マッチング市場における競合的バンディットモデルを導入し、マルチアームバンディットをアームの好みと競争を含める形に拡張する。中央集権的および分散型のETCおよびUCBアルゴリズムを提案し、問題依存のリグレット境界がO(log n)であることを証明。中央集権的UCBはインcentive-compatibleであることが示され、不確実性下でも安定的かつ効率的な市場結果を保証する。

ABSTRACT

Stable matching, a classical model for two-sided markets, has long been studied with little consideration for how each side's preferences are learned. With the advent of massive online markets powered by data-driven matching platforms, it has become necessary to better understand the interplay between learning and market objectives. We propose a statistical learning model in which one side of the market does not have a priori knowledge about its preferences for the other side and is required to learn these from stochastic rewards. Our model extends the standard multi-armed bandits framework to multiple players, with the added feature that arms have preferences over players. We study both centralized and decentralized approaches to this problem and show surprising exploration-exploitation trade-offs compared to the single player multi-armed bandits setting.

研究の動機と目的

  • 繰り返し確率的相互作用を通じて好みを学ぶ片側が存在する二面的市場をモデル化し、実世界のオンライン労働およびサービスプラットフォームを捉える。
  • 学習(バンディット)と市場安定性(マッチング)の相互作用、特に競争と不確実性下での関係を形式化する。
  • 探索と活用のトレードオフに起因するリグレットを最小限に抑える一方で、安定したマッチング結果を達成するアルゴリズムを開発する。
  • アームに好みがあり、最も好まれたエージェントのみが報酬を受けるような状況下でのリグレットを分析する。
  • 中央集権的および分散型の学習プロトコルにおいて、リグレットと安定性に関する理論的保証を確立する。

提案手法

  • アームの好みを含むマルチエージェントバンディットにExplore-then-Commit(ETC)アルゴリズムを拡張し、二段階プロセス(探索段階と活用段階)を採用する。
  • アームの好みを組み込み、安定性を維持する中央集権的UCBの変種を導入。信頼区間を競合的状況に適合させる。
  • 安定マッチングに基づいて、エージェント最適およびマーケット最適という2つのリグレットの概念を定義し、学習の非効率性を測定する。
  • 確率的集中不等式を用いて、とくにレアアームの場合の衝突と報酬推定誤差を制限する。
  • Gumbel-Max表現を用いて不確実性下での安定マッチング結果をモデル化し、バンディットのリグレットとマッチング安定性を結びつける。
  • 中央集権的UCBがインcentive-compatibleであることを証明し、アルゴリズム下でエージェントが好みを真実に報告する動機付けが得られることを示す。

実験結果

リサーチクエスチョン

  • RQ1アーム(例:リソースや雇用者)がエージェントに対して好みを持つ二面的市場において、マルチアームバンディット学習をどのように適合させられるか。
  • RQ2アームの好みと衝突制約がある競合的マルチエージェントバンディット設定で、達成可能なリグレット境界は何か。
  • RQ3中央集権的および分散型アルゴリズムは、探索リグレットを最小限に抑えながら安定した市場結果を達成できるか。
  • RQ4片側の好みの不確実性が、長期的な利得と市場全体の安定性にどのように影響するか。
  • RQ5不確実性下で安定マッチングに収束するインcentive-compatibleな学習アルゴリズムを設計することは可能か。

主な発見

  • 分散型ETCアルゴリズムは、エージェントごとにO(log n)の問題依存リグレットを達成し、プレイヤー数、アーム数、好みの重複度に依存する境界を持つ。
  • 中央集権的UCBはO(log n)の問題依存リグレットを達成し、インcentive-compatibleであることが証明され、安定マッチングにおける真実の報告を保証する。
  • 分散型ETCのリグレット境界には、探索時間Hに従って減少する指数関数的項が含まれており、アーム選択の成功確率を反映している。
  • モデルは、片側の不確実性が他のエージェントの長期的利得を低下させることを示し、学習における戦略的外部性を強調する。
  • 中央集権的UCBアルゴリズムは安定マッチング構成に速やかに収束し、リグレットと安定性保証の両面でETCを上回る。
  • 結果は、アームの好みが不確実な設定にも拡張可能であるが、本稿では単純化のためアームの好みが既知であると仮定している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。