Skip to main content
QUICK REVIEW

[論文レビュー] Hindsight Learning for MDPs with Exogenous Inputs

Sean R. Sinclair, Felipe Vieira Frujeri|arXiv (Cornell University)|Jul 13, 2022
Age of Information Optimization被引用数 4
ひとこと要約

本論文は、外部要因(外生的要因)によってのみ不確実性が生じるマーカフ・意思決定過程(Exo-MDP)におけるデータ効率の良い強化学習フレームワーク、懐かしい学習(Hindsight Learning, HL)を提案する。過去の外生的入力を活用して意思決定を後から再評価することで、HLは、データ要件を著しく削減し、マルチ・セクレタリー問題、航空会社の収益管理、および実世界のクラウドVM割り当てタスクにおいて、ヒューリスティック手法や最先端の強化学習アルゴリズムを上回る性能を発揮する。

ABSTRACT

Many resource management problems require sequential decision-making under uncertainty, where the only uncertainty affecting the decision outcomes are exogenous variables outside the control of the decision-maker. We model these problems as Exo-MDPs (Markov Decision Processes with Exogenous Inputs) and design a class of data-efficient algorithms for them termed Hindsight Learning (HL). Our HL algorithms achieve data efficiency by leveraging a key insight: having samples of the exogenous variables, past decisions can be revisited in hindsight to infer counterfactual consequences that can accelerate policy improvements. We compare HL against classic baselines in the multi-secretary and airline revenue management problems. We also scale our algorithms to a business-critical cloud resource management problem -- allocating Virtual Machines (VMs) to physical machines, and simulate their performance with real datasets from a large public cloud provider. We find that HL algorithms outperform domain-specific heuristics, as well as state-of-the-art reinforcement learning methods.

研究の動機と目的

  • 制御不能な外部的不確実性を伴うリソース管理問題における強化学習のデータ非効率性という課題に取り組む。
  • 外部入力(例:VMリクエスト、需要の変動)のみが不確実性を引き起こすExo-MDPとしてそのような問題をモデル化する。
  • 歴史的な外生的入力を再利用して、過去の意思決定の反事後的結果を生成する新しい学習フレームワークを開発し、より効率的な方策改善を実現する。
  • 合成的および実世界のシナリオにおいて、ドメイン特化ヒューリスティックおよび最先端の強化学習手法を上回るHindsight Learningの優れた性能を実証する。
  • 本番環境の生産データを用いて大規模かつビジネスに重要なクラウドVM割り当て問題にこの手法をスケーリングし、実用的適用性と頑健性を検証する。

提案手法

  • エージェントの行動とは独立した、内生的状態と外生的入力に依存するシステムダイナミクスを持つExo-MDPとしてリソース管理問題を形式化する。
  • 観測された外生的入力の系列を用いて、過去の意思決定の反事後的報酬を計算する「懐かしいプランナ」を導入し、新たな環境インタラクションなしに方策改善を可能にする。
  • これらの反事後的結果から学習することでベイズ最適選択子を模倣するHindsight Learningアルゴリズムを設計し、分散を低減し収束を加速する。
  • Exo-MDPにおける価値関数を分解する価値分解技術を適用し、高次元の状態および入力空間におけるスケーラブルな学習を可能にする。
  • VMおよび物理マシンの特徴を表現するためにグラフニューラルネットワーク(GNN)を用い、複雑な割り当て構成にわたる一般化を可能にする。
  • VMのサイズとライフタイムに基づいて優先順位を付けるスケーラブルな懐かしいヒューリスティックを実装し、平均で4%未満のデュアルギャップを達成し、ほぼ最適性能を実現する。

実験結果

リサーチクエスチョン

  • RQ1観測された外生的入力を用いて過去の意思決定を懐かしい視点から再評価することで、外生的不確実性下の逐次的意思決定におけるデータ効率が向上するか?
  • RQ2Hindsight Learningは、マルチ・セクレタリー問題および航空会社の収益管理問題において、古典的ヒューリスティックおよび最先端の強化学習手法と比較してどのように性能を発揮するか?
  • RQ3Hindsight Learningは、高次元で連続的な時間的入力を伴う実世界の大規模クラウドリソース割り当てにどの程度スケーリング可能か?
  • RQ4実世界のVM割り当てにおいて、提案された懐かしいヒューリスティックは最適解にどの程度近いか、またその経験的ギャップはどの程度か?
  • RQ5Hindsight Learningは、実世界のデータを用いた本番規模のクラウド環境において、エンドツーエンドの強化学習およびヒューリスティックベースラインを上回る性能を発揮できるか?

主な発見

  • 実世界のVM割り当てタスクにおいて、Hindsight Learningは負の逆パッキング密度指標で 0.18 ± 0.093 の性能を達成し、DQN(-1.00 ± 0.41)およびMAC(-0.38 ± 0.033)を著しく上回った。
  • Hindsight MACアルゴリズムはパッキング密度を 0.05% 減少させ、次善のベースラインDQNが 0.05% 減少させたのと比較して1.5倍の改善を達成した。
  • スタイリズドVM割り当て環境では、Hindsight MACはパッキング密度に 0.05% の改善をもたらしたが、最良のベースライン(MAC)はわずか -0.03% にとどまり、明確なデータ効率の優位性が示された。
  • 24の実世界クラスタを対象に平均して4.33%のデュアルギャップを達成し、個々のギャップは1.17%から20.07%の範囲に分布しており、大多数のケースでほぼ最適性に近いことが示された。
  • 合成的および実世界の両シナリオにおいて、Hindsight LearningはDQN、ポリシー勾配、ACを含むすべてのベースラインを、すべての指標で上回り、一貫した優位性を示した。
  • 次善のベースラインと比較して、パッキング密度の低減において1.5倍の改善を達成したため、クラウドデータセンターにおけるリソース断片化とエネルギーコストの低減に強い実用的影響を及ぼす可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。