Skip to main content
QUICK REVIEW

[論文レビュー] Fitted Q-Learning for Relational Domains

Srijita Das, Sriraam Natarajan|arXiv (Cornell University)|Jun 10, 2020
Reinforcement Learning in Robotics参考文献 34被引用数 6
ひとこと要約

本論文は、関係的マーカフド決定過程(RMDP)におけるQ値とベルマン残差の近似に、関係的回帰木(RRT)と勾配ブースティングを用いる、最初の関係的フィットドQ学習アルゴリズムであるGBQLおよびRBFQを導入する。この手法は、ドメインモデルを一切使用せず、少ない軌道数でも優れた一般化性能を達成し、ほとんどのタスクでRRTを上回る性能を示す一方で、ベルマン誤差は低く抑えられる。

ABSTRACT

We consider the problem of Approximate Dynamic Programming in relational domains. Inspired by the success of fitted Q-learning methods in propositional settings, we develop the first relational fitted Q-learning algorithms by representing the value function and Bellman residuals. When we fit the Q-functions, we show how the two steps of Bellman operator; application and projection steps can be performed using a gradient-boosting technique. Our proposed framework performs reasonably well on standard domains without using domain models and using fewer training trajectories.

研究の動機と目的

  • 変数のオブジェクト数や複雑な関係性を持つ関係的領域において、逐次的かつ特徴量の数が変動するため、命題的アプローチが失敗する価値関数近似の課題に対処すること。
  • 関係的マーカフド決定過程(RMDP)における近似動的プログラミングのための、モデルフリーかつスケーラブルなアプローチを開発すること。
  • ドメインモデルや広範な特徴工学に依存せずに、関係的タスク間での有効な一般化を可能にすること。
  • 古典的手法(例:タイルコーディング、集約手法)を、関係的かつ勾配ブースティングの枠組み内で統合すること。
  • 関係的勾配ブースティングが、要因分解された関係的状態空間においてQ関数およびベルマン残差を効果的に学習できることを示すこと。

提案手法

  • Q値とベルマン残差を関係的回帰木(RRT)で表現することで、記号的かつ構造が可変な状態・行動空間における関数近似を可能にする。
  • 勾配ブースティングを用いて、ベルマン誤差を最小化するRRTを反復的に学習し、各木が直前のアンサンブルの残差誤差を補正する。
  • ベルマン作用素の適用と射影ステップを、それぞれ木の評価と勾配ブースティング回帰によって実行する。
  • 各新しいRRTが、現在のQ近似の残差誤差に基づいて学習される、非パラメトリックかつ逐次的な学習アプローチを採用する。
  • RRTのルートからリーフへのパスとしての関係的特徴を活用し、グランドイングなしに関係的構造間での一般化を可能にする。
  • 関数近似メカニズムを一階論理表現に拡張することで、命題的フィットドQ学習を関係的領域に拡張する。

実験結果

リサーチクエスチョン

  • RQ1勾配ブースティングを用いた関係的回帰木は、オブジェクトおよび関係の数が変動する関係的領域において、Q値を効果的に近似できるか?
  • RQ2限られた学習データを用いた関係的強化学習タスクにおいて、提案手法は標準的なRRTよりも優れた一般化性能を示すか?
  • RQ3ベルマン誤差とゴール到達成功確率という観点から、GBQLおよびRBFQの性能はRRTと比べてどの程度か?異なる関係的領域で評価する。
  • RQ4ドメインモデルやエキスパート軌道を一切使用せずに、競争力のある性能を達成できるか?
  • RQ5Q関数の近似ではなくベルマン残差の直接近似(RBFQ)により、Q学習(GBQL)に比べて収束性や安定性が向上するか?

主な発見

  • GBQLおよびRBFQは、4つのタスクのうち3つでRRTを上回るテストセット性能を達成し、優れた一般化能力を示した。
  • Unstackタスクでは、RBFQが未学習の軌道における累積報酬の分散が低く、複雑な報酬設計下でもより安定していることを示した。
  • RBFQは重要な状態では低いベルマン誤差を維持したが、全体の誤差は高かったため、局所的とグローバルな近似精度のトレードオフが生じていると考えられた。
  • GBQLは、エキスパート軌道のフィードバックに応じて初期段階でベルマン誤差が速やかに減少したため、人間によるフィードバックに素早く反応する特性を示した。
  • RBFQのベルマン誤差は一部のケース(例:Logisticsドメイン)で増加した。これは、累積的な基底関数の組み合わせによる射影ステップの不安定性に起因すると考えられた。
  • 階層的ONタスクではRRTがGBQLおよびRBFQを上回ったが、差は統計的に有意ではなかったため、階層的構造の学習に限界がある可能性を示唆した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。