Skip to main content
QUICK REVIEW

[論文レビュー] Optimizing Quantiles in Preference-based Markov Decision Processes

Hugo Gilbert, Paul Weng|arXiv (Cornell University)|Dec 1, 2016
Advanced Database Systems and Queries被引用数 7
ひとこと要約

本稿では、期待累積報酬の代替としてリスク回避的またはワンショット意思決定の文脈において特に有用な分位数基準に基づく最適方策を計算するための新規アルゴリズムを提案する。この手法は、ターゲット報酬関数を用いた期待報酬問題の系列を解くために、関数的後退帰納法を用いた二分探索を採用している。主な貢献は、性能のしきい値を高い確率で満たす方策を保証する方法であり、ランダムMDPとデータセンター制御問題の両方で実験的検証がなされ、期待値ベースの方策よりも優れたロバスト性を示した。

ABSTRACT

In the Markov decision process model, policies are usually evaluated by expected cumulative rewards. As this decision criterion is not always suitable, we propose in this paper an algorithm for computing a policy optimal for the quantile criterion. Both finite and infinite horizons are considered. Finally we experimentally evaluate our approach on random MDPs and on a data center control problem.

研究の動機と目的

  • MDPにおける期待累積報酬という意思決定基準の限界、特にリスク回避的またはワンショット意思決定の文脈での課題に対処すること。
  • 累積報酬分布の指定された分位数を最適化する方策を計算する手法を開発すること。これにより、所定の割合の軌道に対して高い信頼性を確保できるようにする。
  • 有限および無限時間のMDPにおける分位数基準に基づく最適方策の理論的性質を確立すること。
  • 提案手法のアルゴリズムを合成MDPと実世界のデータセンター制御問題に対して実験的に評価し、期待値ベースの方策と比較すること。
  • クラウドサービスや金融分野など、順序的好みや尾部リスクに対するロバスト性が重要な文脈において、MDPの適用範囲を拡張すること。

提案手法

  • 分位数最適化問題は、分位数しきい値を反映するターゲット報酬関数を用いて、期待報酬問題の系列に再定式化される。
  • 分位数値の範囲で二分探索を実行し、各反復で関数的後退帰納法を用いて期待報酬MDPを解く。
  • 関数的後退帰納法は、分位数目的を符号化する報酬変換に適応して値関数を再帰的に計算する。
  • 反復的にしきい値を精緻化することで、収束時にϵ-最適な方策を返す。
  • この手法は有限および無限時間MDPの両方をカバーでき、方策の存在性と最適性に関する理論的保証を備えている。
  • アプローチはランダムMDPとデータセンター制御問題に実装・評価され、累積報酬分布を用いて方策の性能を比較した。

実験結果

リサーチクエスチョン

  • RQ1報酬分布が非対称であっても、MDPにおける累積報酬のτ-分位数を最大化する方策を計算可能か?
  • RQ2分位数基準を、MDPにおける標準的な期待報酬問題の系列にどのように還元できるか?
  • RQ3有限および無限時間設定における分位数基準に基づく最適方策が示す理論的性質は何か?
  • RQ4分位数最適化方策の性能は、期待値最適化方策と比較して信頼性およびロバスト性の観点でどのように異なるか?
  • RQ5本手法は、99.9%などの高い分位数が重要な実世界の問題、例えばデータセンター制御に、効果的にスケーリング可能か?

主な発見

  • 提案手法は、分位数基準のϵ-最適方策を、期待報酬問題の系列に対する二分探索を用いて効果的に計算できた。
  • データセンター制御問題において、分位数最適化方策は期待値最適化方策よりも著しく優れており、99%のユーザーに対して高いパフォーマンスを確保した。
  • 分位数最適化方策の下での累積報酬分布は高い報酬に偏っており、悪質な結果のリスクが低減された。
  • 理論的分析により、有限および無限時間MDPにおいて、分位数基準に最適な決定的かつマルコフ的方策が存在することが確認された。
  • 関数的後退帰納法により、変換された報酬関数の下での値関数が効率的に計算可能となり、中程度のサイズの問題に対してもスケーラブルであることが示された。
  • 実験結果から、特に実世界の応用で一般的な非対称な報酬分布において、分位数最適化方策は期待値最適化方策よりもよりロバストであることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。