Skip to main content
QUICK REVIEW

[論文レビュー] Optimal No-regret Learning in Repeated First-price Auctions

Yanjun Han, Zhengyuan Zhou|arXiv (Cornell University)|Mar 22, 2020
Advanced Bandit Algorithms Research参考文献 55被引用数 15
ひとこと要約

本稿では、入札者が勝利した入札のみを観測する、フィードバックが遮断された繰り返し第一価格オークションにおける、初めての最適なレギュレートなし学習アルゴリズムを提示する。オークションのフィードバック構造と報酬関数を活用することで、確率的個人的価値下で近似的に最適な $Õ(\sqrt{T}\log^{2.5}T)$ のレギュレートを達成し、敵対的価値下で $O(\sqrt{T}\log^3 T)$ のレギュレートを達成する。この設定におけるタイトな学習保証を確立する。

ABSTRACT

We study online learning in repeated first-price auctions where a bidder, only observing the winning bid at the end of each auction, learns to adaptively bid in order to maximize her cumulative payoff. To achieve this goal, the bidder faces censored feedback: if she wins the bid, then she is not able to observe the highest bid of the other bidders, which we assume is extit{iid} drawn from an unknown distribution. In this paper, we develop the first learning algorithm that achieves a near-optimal $\widetilde{O}(\sqrt{T})$ regret bound, by exploiting two structural properties of first-price auctions, i.e. the specific feedback structure and payoff function. We first formulate the feedback structure in first-price auctions as partially ordered contextual bandits, a combination of the graph feedback across actions (bids), the cross learning across contexts (private values), and a partial order over the contexts. We establish both strengths and weaknesses of this framework, by showing a curious separation that a regret nearly independent of the action/context sizes is possible under stochastic contexts, but is impossible under adversarial contexts. In particular, this framework leads to an $O(\sqrt{T}\log^{2.5}T)$ regret for first-price auctions when the bidder's private values are \emph{iid}. Despite the limitation of the above framework, we further exploit the special payoff function of first-price auctions to develop a sample-efficient algorithm even in the presence of adversarially generated private values. We establish an $O(\sqrt{T}\log^3 T)$ regret bound for this algorithm, hence providing a complete characterization of optimal learning guarantees for first-price auctions.

研究の動機と目的

  • 入札者が勝利した入札のみを観測する繰り返し第一価格オークションにおいて、近似的に最適なレギュレートを達成する学習アルゴリズムを開発すること。
  • 入札者が勝利した際に最高の競合入札が観測されない、遮断されたフィードバックの課題に対処すること。
  • 確率的および敵対的個人的価値設定下での第一価格オークションにおける学習の根本的限界を特定すること。
  • 第一価格オークションのフィードバックと報酬構造をモデル化するための、部分的に順序付けられた文脈的バンディットの新フレームワークを確立すること。
  • 確率的ケースでは情報理論的下界と一致するタイトなレギュレートバウンドを提供し、敵対的ケースでは最適なレギュレートバウンドを確立すること。

提案手法

  • 第一価格オークションのフィードバックと報酬構造をモデル化するための、部分的に順序付けられた文脈的バンディットと呼ばれる一般化されたバンディットフレームワークを導入する。
  • 相関する報酬を扱い、敵対的設定下での推定精度を向上させるための、新規の区間分割スキームを開発する。
  • 重要度サンプリングと上限信頼区間を組み合わせて、探索と活用のバランスを取る、マスターアルゴリズム ML-IS-UCB を使用する。
  • ベルンシュタイン不等式と集中不等式を用いて、報酬および確率推定の推定誤差を制御する。
  • 累積逆カウントをバインドするための鍵となる組合せ的補題(補題16)を活用し、タイトなレギュレート解析を可能にする。
  • ホールドアウトサンプルを用いて、競合入札の分布を推定し、UCB構築における信頼区間を制御する。

実験結果

リサーチクエスチョン

  • RQ1遮断されたフィードバック(入札者が勝利した際に最高の競合入札が観測されない)がある繰り返し第一価格オークションにおいて、レギュレートなしの学習アルゴリズムを設計することは可能か?
  • RQ2確率的個人的価値下で、繰り返し第一価格オークションにおける最適なレギュレートは何か?
  • RQ3敵対的設定下で、行動数および文脈数に依存しないレギュレートを達成することは可能か?
  • RQ4第一価格オークションのフィードバックと報酬構造は、標準的なバンディットモデルと比較して、どのように改善された学習保証を可能にするか?
  • RQ5敵対的個人的価値下で、第一価格オークションにおける学習の根本的限界は何か?

主な発見

  • 個人的価値が独立同一に分布する場合、本稿は第一価格オークションで $O(\sqrt{T}\log^{2.5}T)$ のレギュレートバウンドを達成し、これはほぼ最適である。
  • 敵対的個人的価値下では、提案されたアルゴリズムが $O(\sqrt{T}\log^3 T)$ のレギュレートを達成し、対数要因を除いて情報理論的下界と一致する。
  • 部分的に順序付けられた文脈的バンディットのフレームワークは、グラフフィードバック、文脈間のクロスリーニング、および文脈の部分的順序の相互作用を捉えている。
  • 興味深い分離が確立された:確率的文脈下では行動および文脈サイズにほぼ依存しないレギュレートが可能であるが、敵対的文脈下では不可能である。
  • 解析により、提案された ML-IS-UCB ポリシーが、重要度サンプリングと区間分割の組み合わせにより、報酬推定の高確率集中を達成することが証明された。
  • 累積逆カウントをバインドするための組合せ的補題(補題16)が開発され、証明され、解析におけるタイトなレギュレート制御を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。