Skip to main content
QUICK REVIEW

[論文レビュー] Deterministic MDPs with Adversarial Rewards and Bandit Feedback

Raman Arora, Ofer Dekel|arXiv (Cornell University)|Oct 16, 2012
Advanced Bandit Algorithms Research参考文献 22被引用数 15
ひとこと要約

この論文は、敵対的報酬とバンドイットフィードバックを伴う決定的マルコフ決定過程(MDP)に対するオンライン学習アルゴリズム、MarcoPoloを紹介する。制限の厳しい一連の連鎖(unichain)仮定を必要とせず、最良の固定決定的方策に対するレグレットバウンドを O(T^(3/4)√log T) に達成する。これにより、構造的ダイナミクスを持つより広範なMDPのクラスに適用可能となる。

ABSTRACT

We consider a Markov decision process with deterministic state transition dynamics, adversarially generated rewards that change arbitrarily from round to round, and a bandit feedback model in which the decision maker only observes the rewards it receives. In this setting, we present a novel and efficient online decision making algorithm named MarcoPolo. Under mild assumptions on the structure of the transition dynamics, we prove that MarcoPolo enjoys a regret of O(T^(3/4)sqrt(log(T))) against the best deterministic policy in hindsight. Specifically, our analysis does not rely on the stringent unichain assumption, which dominates much of the previous work on this topic.

研究の動機と目的

  • 報酬が敵対的に選ばれ、部分的フィードバックしか得られない決定的MDPにおけるオンライン意思決定を扱う。
  • 任意の報酬系列に対してもサブ線形レグレットを達成する効率的なアルゴリズムを開発する。
  • 従来の敵対的MDPにおけるバンドイットフィードバックの研究で制限を受けるunichain仮定の必要性を取り除く。
  • 時間に伴い最適でないスケーリングを示すレグレットバウンドを提供し、一般性と適用可能性の面で先行研究を改善する。

提案手法

  • アルゴリズム MarcoPolo は、敵対的報酬とバンドイットフィードバックを伴う決定的MDPにおけるオンライン学習を目的として設計されている。
  • 構造的探索方策を用いて、レグレットと不確実性のバランスを取る新しい探索戦略を活用している。
  • 観測された報酬と遷移ダイナミクスに適応する、信頼区間に基づく更新ルールを組み込んでいる。
  • 方策選択と探索誤差の寄与を分離するレグレット分解技術を用いている。
  • 遷移ダイナミクスにやや弱い構造的仮定(例えば、共通の状態・行動到達可能性構造の存在)を前提としている。
  • バンドイットフィードバック設定と決定的遷移に適合させた、指数的重みアルゴリズムの変種を方策選択に用いている。

実験結果

リサーチクエスチョン

  • RQ1敵対的報酬とバンドイットフィードバックを伴う決定的MDPに対して、効率的なオンライン学習アルゴリズムを設計できるか?
  • RQ2一連の連鎖構造を仮定しない状況で、この設定で達成可能な最適なレグレットバウンドは何か?
  • RQ3部分的フィードバックしか得られない状況で、探索と活用を効果的にバランスさせることは可能か?
  • RQ4強い構造的仮定がなければ、レグレットが O(T^(2/3)) よりも良好にスケーリングできるか?
  • RQ5MDPの遷移ダイナミクスにやや弱い仮定を置いた場合、O(T^(3/4)√log T) のレグレットバウンドを達成することは可能か?

主な発見

  • MarcoPolo は、後悔の観点から最良の固定決定的方策に対するレグレットバウンドを O(T^(3/4)√log T) に達成する。
  • レグレットバウンドはTに関してサブ最適であるが、一般性の面で先行手法に比べ顕著な改善を示している。
  • アルゴリズムはunichain仮定を必要とせず、従来の敵対的MDP研究における主要な制限要因を回避している。
  • 遷移ダイナミクスにやや弱い構造的仮定(例えば、共通の到達可能性構造の存在)のもとで解析が成立する。
  • 計算複雑性が状態数と行動数に対して多項式スケールするため、効率的で実用的である。
  • この結果は、確率的でなく、一連の連鎖構造もない決定的MDPにおいても、サブ線形レグレットが達成可能であることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。