Skip to main content
QUICK REVIEW

[論文レビュー] Relational Abstractions for Generalized Reinforcement Learning on Symbolic Problems

Rushang Karia, Siddharth Srivastava|arXiv (Cornell University)|Apr 27, 2022
Neural Networks and Applications被引用数 4
ひとこと要約

本論文は、状態軌道から自動生成された特徴を用いて、一般化可能で関係的なQ関数を学習する関係的深層強化学習手法を提案する。深層学習と関係的抽象化を活用することで、物体数や名前が異なるより大きな問題インスタンスへのゼロショット転移が可能となり、標準的な強化学習と比較してサンプルの複雑性が桁違いに低減される。

ABSTRACT

Reinforcement learning in problems with symbolic state spaces is challenging due to the need for reasoning over long horizons. This paper presents a new approach that utilizes relational abstractions in conjunction with deep learning to learn a generalizable Q-function for such problems. The learned Q-function can be efficiently transferred to related problems that have different object names and object quantities, and thus, entirely different state spaces. We show that the learned generalized Q-function can be utilized for zero-shot transfer to related problems without an explicit, hand-coded curriculum. Empirical evaluations on a range of problems show that our method facilitates efficient zero-shot transfer of learned knowledge to much larger problem instances containing many objects.

研究の動機と目的

  • 物体数の増加に伴い指数関数的に増大する記号的かつ要因分解された状態空間への強化学習のスケーリングの課題に対処すること。
  • 手動で設計されたカリキュラムを必要とせずに、異なる物体名や数量を持つ問題インスタンス間でのポリシーの効率的転移を可能にすること。
  • 関係構造を捉える一般化可能なQ関数を学習し、より大きなインスタンスへのゼロショット転移を可能にすること。
  • 状態空間の変化に伴うサンプルの複雑性を、状態軌道から自動で導出された特徴を活用することで、確率的で記号的な環境で低減すること。

提案手法

  • 本手法は、物体数や名前が異なる問題インスタンス間で一般化できる関係的Q関数を深層学習で近似する。
  • 手動で設計された特徴や解析的モデルを必要とせず、状態軌道のシーケンスから自動的に特徴リストを生成する。
  • 物体数の変動を飛躍的に越えてインスタンス間転移を可能にする一般化された強化学習(GRL)フレームワークを用いてQ関数を訓練する。
  • 多層パーセプトロン(MLP)を用いて関係的特徴を処理することで、効率的な推論とポリシーの一般化を実現する。
  • 小さな問題インスタンスで学習し、知識をより大きなインスタンスに転送するためのループ戦略(ループジャンプ戦略)を採用し、明示的なカリキュラム設計なしに学習を加速する。
  • 状態遷移から得られる記述論理(DL)に基づく特徴を活用して、関係的構造とダイナミクスを捉える。

実験結果

リサーチクエスチョン

  • RQ1解析的アクションモデルへのアクセスなしに、記号的MDP設定における深層Q関数を学習可能か?
  • RQ2状態軌道から自動生成された関係的特徴が、より大きな問題インスタンスへの有効なゼロショット転移を可能にするか?
  • RQ3提案されたGRLフレームワークは、標準的な強化学習と比較して、確率的で記号的な環境におけるサンプルの複雑性を低減するか?
  • RQ4学習されたQ関数は、物体名や数量の変更に対してどの程度一般化可能か?
  • RQ5ループジャンプ戦略は、手動で設計されたカリキュラムなしに、効果的な転移を可能にするか?

主な発見

  • 提案手法は、標準的なQ学習と比較して、より大きな問題インスタンスにおけるサンプリング要件を複数桁低減する。
  • 一般化されたQ関数により、状態空間がまったく異なる物体数や名前を持つ問題インスタンスへのゼロショット転移が可能になる。
  • 特に難易度が高く複雑なタスクにおいて、既存の転移手法よりも優れた性能を示す。
  • 状態軌道から自動生成された特徴は、強力な性能を達成するのに十分であり、解析的モデルや手動で設計された特徴の必要性を低減または排除できる。
  • ループジャンプ戦略により、ドメイン固有の知識や手動で設計された難易度評価を必要とせずに、効果的なカリキュラム学習が可能になる。
  • 本手法は、Sysadmin(n)問題を含む複数の記号的ドメインで堅牢な性能を示し、単純なポリシーを大規模なインスタンスに一般化できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。