Skip to main content
QUICK REVIEW

[論文レビュー] Active Finite Reward Automaton Inference and Reinforcement Learning Using Queries and Counterexamples

Zhe Xu, Bo Wu|arXiv (Cornell University)|Jun 28, 2020
Machine Learning and Algorithms参考文献 36被引用数 8
ひとこと要約

本稿では、非マルコフ的で有界な報酬関数をモデル化するため、トレーニング中にL*-スタイルのクエリを用いて有限報酬オートマトンを推論する、アクティブ強化学習フレームワークAFRAI-RLを提案する。報酬関数の推論を強化学習によって回答されるメンバーシップクエリと同等性クエリを通じて、探索を能動的に誘導することで、JIRP-SAT、LRM-QRM、PPO2といった最先端のベースラインと比較して、最適方策への収束が最大88.8%速くなる。Office WorldおよびMinecraft環境における複雑な順序依存報酬構造を持つタスクで有効である。

ABSTRACT

Despite the fact that deep reinforcement learning (RL) has surpassed human-level performances in various tasks, it still has several fundamental challenges. First, most RL methods require intensive data from the exploration of the environment to achieve satisfactory performance. Second, the use of neural networks in RL renders it hard to interpret the internals of the system in a way that humans can understand. To address these two challenges, we propose a framework that enables an RL agent to reason over its exploration process and distill high-level knowledge for effectively guiding its future explorations. Specifically, we propose a novel RL algorithm that learns high-level knowledge in the form of a finite reward automaton by using the L* learning algorithm. We prove that in episodic RL, a finite reward automaton can express any non-Markovian bounded reward functions with finitely many reward values and approximate any non-Markovian bounded reward function (with infinitely many reward values) with arbitrary precision. We also provide a lower bound for the episode length such that the proposed RL approach almost surely converges to an optimal policy in the limit. We test this approach on two RL environments with non-Markovian reward functions, choosing a variety of tasks with increasing complexity for each environment. We compare our algorithm with the state-of-the-art RL algorithms for non-Markovian reward functions, such as Joint Inference of Reward machines and Policies for RL (JIRP), Learning Reward Machine (LRM), and Proximal Policy Optimization (PPO2). Our results show that our algorithm converges to an optimal policy faster than other baseline methods.

研究の動機と目的

  • 深層強化学習におけるデータ非効率性と解釈不能性、特に非マルコフ的報酬関数の文脈でそれらを解決すること。
  • 強化学習エージェントが環境との相互作用から高レベルの報酬構造(有限報酬オートマトン)を能動的に推論できるようにすること。
  • アクティブなオートマトン推論をQ学習と統合することで、エピソード的強化学習におけるサンプル効率と収束速度を向上させること。
  • エピソード長に対する下限が与えられた場合の収束に関する理論的保証を提供すること。
  • 複雑で順序依存的な報酬依存関係を有する環境において、最先端の手法を上回る性能を示すこと。

提案手法

  • フレームワークはL*学習アルゴリズムにインspiredされたアクティブな推論メカニズムを用い、強化学習エージェントが学習者として機能し、環境/強化学習エンジンが教師として機能する。
  • 2つのQ関数を維持する:1つは探索中にメンバーシップクエリに答えるためのインcentiveを提供し、もう1つは同等性クエリのための方策評価に使用する。
  • 状態行動列が特定の報酬をもたらすかどうかをクエリすることで、軌道から有限報酬オートマトンを推論し、非マルコフ的報酬関数の表現を可能にする。
  • 推論されたオートマトンは方策学習をガイドするものであり、エージェントが長期的な報酬構造を推論し、トレーニング中に自己是正を行うことを可能にする。
  • 任意の有限個の値をとる有界な非マルコフ的報酬関数は正確に表現可能であり、無限個の値をとるような関数は任意の精度で近似可能であることを証明する。
  • 最適方策への確実な収束を保証するための、エピソード長の理論的下限を導出する。

実験結果

リサーチクエスチョン

  • RQ1アクティブな有限報酬オートマトン推論は、非マルコフ的強化学習におけるサンプル効率と収束速度を向上させることができるか?
  • RQ2有限報酬オートマトンは、有限個の値をとる任意の有界な非マルコフ的報酬関数を正確に表現できるか?
  • RQ3有限報酬オートマトンは、無限個の値をとる任意の有界な非マルコフ的報酬関数を任意の精度で近似できるか?
  • RQ4本手法が最適方策にほぼ確実に収束するための最小エピソード長は何か?
  • RQ5共同推論や受動的推論と比較して、報酬オートマトンのアクティブ推論は収束速度と性能において優れているか?

主な発見

  • オフィスワールドのタスク1では、AFRAI-RLは約0.2百万ステップで最適方策に収束したが、JIRP-SAT、LRM-QRM、PPO2は収束に失敗した。
  • オフィスワールドのタスク2では、AFRAI-RLは約180万ステップで収束したが、すべてのベースラインは収束に失敗した。
  • オフィスワールドのタスク3では、AFRAI-RLは400万ステップで収束した。JIRP-SAT(450万ステップ)を上回り、LRM-QRMおよびPPO2は収束に失敗した。
  • マイクラフトワールドでは、タスク1でAFRAI-RLは19万ステップ、タスク2で17万ステップで収束したが、すべてのベースラインは収束に失敗した。
  • 最良の状況において、本手法はあらゆるベースラインよりも最大88.8%速く収束し、他の手法が収束できない状況でも収束を達成した。
  • 理論的分析により、エピソード長が導出された下限を超える場合、本手法は最適方策にほぼ確実に収束することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。