Skip to main content
QUICK REVIEW

[論文レビュー] Learning MDPs from Features: Predict-Then-Optimize for Sequential Decision Problems by Reinforcement Learning

Kai Wang, Sanket Shah|arXiv (Cornell University)|Jun 6, 2021
Adversarial Robustness in Machine Learning被引用数 5
ひとこと要約

この論文は、強化学習の最適性条件—ベルマン方程式とポリシー勾配—を予測モデルの学習パイプラインに埋め込むことで、決定焦点学習をマルコフ決定過程(MDP)としてモデル化された順序的意思決定問題に拡張する。大規模な状態・行動空間や高次元のポリシーによる計算の非効率性を克服するため、不偏サンプリングと低ランクヘシアン近似を提案し、二段階学習と比較して未観測のMDPにおける一般化性能を顕著に向上させる。

ABSTRACT

In the predict-then-optimize framework, the objective is to train a predictive model, mapping from environment features to parameters of an optimization problem, which maximizes decision quality when the optimization is subsequently solved. Recent work on decision-focused learning shows that embedding the optimization problem in the training pipeline can improve decision quality and help generalize better to unseen tasks compared to relying on an intermediate loss function for evaluating prediction quality. We study the predict-then-optimize framework in the context of sequential decision problems (formulated as MDPs) that are solved via reinforcement learning. In particular, we are given environment features and a set of trajectories from training MDPs, which we use to train a predictive model that generalizes to unseen test MDPs without trajectories. Two significant computational challenges arise in applying decision-focused learning to MDPs: (i) large state and action spaces make it infeasible for existing techniques to differentiate through MDP problems, and (ii) the high-dimensional policy space, as parameterized by a neural network, makes differentiating through a policy expensive. We resolve the first challenge by sampling provably unbiased derivatives to approximate and differentiate through optimality conditions, and the second challenge by using a low-rank approximation to the high-dimensional sample-based derivatives. We implement both Bellman--based and policy gradient--based decision-focused learning on three different MDP problems with missing parameters, and show that decision-focused learning performs better in generalization to unseen tasks.

研究の動機と目的

  • テスト用MDPで軌道が入手できない状況下で、環境の特徴からMDPパラメータを学習する課題に対処すること。
  • 大規模な状態空間および行動空間のため、MDPの最適性条件を微分可能にする計算の非効率性を克服すること。
  • モデルフリー強化学習における高次元ニューラルネットワークポリシーの微分にかかる高コストを低減すること。
  • 予測精度ではなく最終的決定の質を直接最適化することで、未観測のMDPへの一般化性能を向上させること。
  • 深層強化学習を用いて、静的最適化から順序的意思決定へと意思決定焦点学習を拡張すること。

提案手法

  • MDPの最適性条件(ベルマン誤差最小化とポリシー勾配最大化)を、微分可能となるようにKarush–Kuhn–Tucker(KKT)条件として定式化する。
  • 不偏サンプリングを用いてKKT条件の一次および二次微分を近似し、MDPを介したバックプロパゲーションを可能にする。
  • サンプルベースのヘシアン行列に対して低ランク近似を適用することで、高次元ポリシー空間におけるメモリおよび計算コストを削減する。
  • エンドツーエンド学習が可能な、ベルマンベースおよびポリシー勾配ベースの意思決定焦点学習フレームワークを実装する。
  • オンラインロールアウトを必要とせず、未学習のテストMDPにおけるポリシー性能を評価するため、オフライン非政策評価(OPE)を用いる。
  • 予測精度を最適化するのではなく最終的決定の質を最適化する本手法を、予測精度を最適化する二段階アプローチと比較する。

実験結果

リサーチクエスチョン

  • RQ1未知のパラメータを有するMDPに対して、意思決定焦点学習を順序的意思決定問題に効果的に拡張できるか?
  • RQ2状態空間および行動空間が大規模または連続的である場合、MDPの最適性条件をどのように微分可能にするか?
  • RQ3高次元ニューラルネットワークポリシーの強化学習におけるバックプロパゲーションを効率的に行うために、どのような計算近似が必要か?
  • RQ4予測精度に基づく二段階学習と比較して、意思決定焦点学習は未観測のMDPへの一般化性能が優れているか?
  • RQ5異なるヘシアン近似法(単位行列、Woodbury)は、意思決定焦点強化学習における性能と安定性にどのように影響を与えるか?

主な発見

  • 未観測のテストMDPにおけるオフライン非政策評価(OPE)性能において、意思決定焦点学習は、3つのベンチマーク問題すべてで二段階学習を上回る。
  • 軌道がランダムな場合、ベルマンベースの手法はポリシー勾配ベースの手法よりも一貫してより良い一般化性能を示す。これは、価値関数のカバー範囲が広いためである。
  • 近似的に最適な軌道が与えられる場合、ポリシー勾配ベースの手法は、最適経路に沿った累積報酬を直接最適化するため、より優れた性能を発揮する。
  • 単位行列ヘシアン近似は、精度が低いものの、非凸なOPE目的関数における局所最適解からの脱出を助ける高い分散のおかげで、時としてより優れた性能を示すことがある。
  • Woodburyによる低ランクヘシアン近似は、精度と計算コストの間で良好なトレードオフを実現し、フルヘシアン計算と比較して実行時間とメモリ使用量を削減する。
  • 大規模なポリシー空間(例:100エポック以上)ではフルヘシアン計算が非効率的である一方、低ランク近似はポリシー次元に対して線形にスケーリング可能であり、学習を可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。