Skip to main content
QUICK REVIEW

[論文レビュー] Stateful Posted Pricing with Vanishing Regret via Dynamic Deterministic Markov Decision Processes

Yuval Emek, Ron Lavi|arXiv (Cornell University)|May 4, 2020
Advanced Bandit Algorithms Research被引用数 5
ひとこと要約

本稿は、敵対的評価値のもとで状態付き投稿価格設定のための新しいオンライン学習フレームワークを導入し、動的決定的マルコフ決定過程(Dd-MDP)を用いて、消えるレジット(vanishing regret)を達成する。あるオラクルが任意のポリシーを有界な損失でシミュレートできる場合、サブ線形レジットが達成可能であることを証明しており、オンラインジョブスケジューリングと動的二部マッチングへの応用では、それぞれ $ O(\sqrt{CW T \log|\Gamma|}) $ および $ O(W^{1/4}T^{3/4}\sqrt{\log|\Gamma|}) $ のレジットバウンドが得られる。

ABSTRACT

In this paper, a rather general online problem called dynamic resource allocation with capacity constraints (DRACC) is introduced and studied in the realm of posted price mechanisms. This problem subsumes several applications of stateful pricing, including but not limited to posted prices for online job scheduling and matching over a dynamic bipartite graph. As the existing online learning techniques do not yield vanishing-regret mechanisms for this problem, we develop a novel online learning framework defined over deterministic Markov decision processes with dynamic state transition and reward functions. We then prove that if the Markov decision process is guaranteed to admit an oracle that can simulate any given policy from any initial state with bounded loss -- a condition that is satisfied in the DRACC problem -- then the online learning problem can be solved with vanishing regret. Our proof technique is based on a reduction to online learning with switching cost, in which an online decision maker incurs an extra cost every time she switches from one arm to another. We formally demonstrate this connection and further show how DRACC can be used in our proposed applications of stateful pricing.

研究の動機と目的

  • 容量制約下で敵対的オンライン学習における状態付き価格設定メカニズムのギャップに対処すること。既存の手法では、この条件下で消えるレジットを達成できない。
  • 実世界の電子商取引およびクラウドプラットフォームにおける状態付き価格設定を捉えることができる、動的在庫と容量制約を伴うオンラインリソース割り当て問題(DRACC)を形式化すること。
  • 任意のポリシーを有界な損失でシミュレートできるオラクルが存在する場合に、消えるレジットを達成可能な、動的決定的マルコフ決定過程(Dd-MDP)に基づく新しいオンライン学習フレームワークを開発すること。
  • オンラインジョブスケジューリングと動的二部グラフ上のマッチングという2つの主要な応用へのフレームワークの適用を示すこと。
  • 敵対的評価値のもとで、これらの応用に対するタイトなレジットバウンドを確立し、従来の確率的または状態なしモデルの制限を克服すること。

提案手法

  • 動的在庫と敵対的評価値を伴うオンラインリソース割り当て問題としてDRACC問題を導入し、価格が容量および状態制約を満たす必要があることを明確にする。
  • 状態付き価格設定をモデル化するための新しい意思決定抽象化として、時間に依存する状態遷移と報酬関数を有する動的決定的マルコフ決定過程(Dd-MDP)を提案する。
  • Dd-MDP問題をスイッチングコスト付きオンライン学習に還元することで、既知のレジット最小化手法の利用を可能にする。
  • 任意の初期状態から任意のポリシーを有界な損失でシミュレートできるオラクルが存在する場合、Dd-MDPフレームワークで消えるレジットが達成可能であることを証明する。
  • スイッチングコストオンライン学習との関連を活用し、ポリシーの逸脱と状態の進化に関する新しい解析を通じて、レジットバウンドを導出する。
  • フレームワークを2つの具体的な応用に適用する:オンラインジョブスケジューリング(OJS)と動的二部グラフ上のマッチング(MDBG)。これらがすべてDRACCに還元可能であることを示す。

実験結果

リサーチクエスチョン

  • RQ1供給が制限され、過去の意思決定が現在の状態に影響を与える敵対的評価値のもとで、状態付き投稿価格設定メカニズムにおいて消えるレジットを達成できるか?
  • RQ2動的状態遷移と報酬を伴う一般のオンライン学習フレームワークは存在するか? これにより、容量制約下でもサブ線形レジットが達成可能か?
  • RQ3Dd-MDPフレームワークを用いて、状態付き価格設定問題をスイッチングコスト付き既知のオンライン学習問題に還元できるか?
  • RQ4提案されたフレームワークを用いて、敵対的評価値のもとでオンラインジョブスケジューリングおよび動的二部マッチングに対してどの程度のレジットバウンドが達成可能か?
  • RQ5提案されたメカニズムは、時間、容量、ポリシー空間サイズのスケーリングに関して、近似的に最適なレジットスケーリングを達成できるか?

主な発見

  • 提案されたメカニズムは、DRACC問題に対して消えるレジットを達成し、任意のTラウンドインスタンスおよび任意のポリシー集合Γに対して、Tに関してサブ線形レジットを達成する。
  • オンラインジョブスケジューリング(OJS)では、レジットが $ O\left(\sqrt{CW \cdot T \log|\Gamma|}\right) $ で抑えられ、これは近似的に最適であり、先行研究を改善する。
  • 動的二部グラフ上のマッチング(MDBG)では、レジットが $ O\left(W^{1/4}T^{3/4}\sqrt{\log|\Gamma|}\right) $ で抑えられ、複雑な状態付き設定への適用性が示される。
  • フレームワークはスイッチングコスト付きオンライン学習に還元され、動的状態および報酬関数を伴う新しい文脈で既存のレジット最小化ツールの利用を可能にする。
  • 有界損失ポリシー・オラクルの存在が、消えるレジットを保証するのに十分であり、このフレームワークは幅広い実用的価格設定問題に適用可能である。
  • 結果として、状態付き価格設定は、確率的仮定や無制限の供給に依存せずに、敵対的環境でも効果的に取り扱えることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。