Skip to main content
QUICK REVIEW

[論文レビュー] Joint Inference of Reward Machines and Policies for Reinforcement Learning

Zhe Xu, Ivan Gavran|arXiv (Cornell University)|Sep 12, 2019
Receptor Mechanisms and Signaling被引用数 12
ひとこと要約

本稿では、高レベルの報酬構造が初期状態で不明な状況下での強化学習において、報酬マシンと方策を同時に学習する反復的アルゴリズムであるJoint Inference of Reward Machines and Policies (JIRP) を提案する。JIRP は、強化学習エピソードからの反例を用いて仮説を段階的に改善し、報酬マシンの状態間で Q 関数を転送することで、ほぼ確実に最適方策に収束し、自律走行、オフィス内ナビゲーション、Minecraft タスクなどのスパarsrewards環境において、標準的な Q 学習や階層的強化学習を上回る性能を発揮する。

ABSTRACT

Incorporating high-level knowledge is an effective way to expedite reinforcement learning (RL), especially for complex tasks with sparse rewards. We investigate an RL problem where the high-level knowledge is in the form of reward machines, i.e., a type of Mealy machine that encodes the reward functions. We focus on a setting in which this knowledge is a priori not available to the learning agent. We develop an iterative algorithm that performs joint inference of reward machines and policies for RL (more specifically, q-learning). In each iteration, the algorithm maintains a hypothesis reward machine and a sample of RL episodes. It derives q-functions from the current hypothesis reward machine, and performs RL to update the q-functions. While performing RL, the algorithm updates the sample by adding RL episodes along which the obtained rewards are inconsistent with the rewards based on the current hypothesis reward machine. In the next iteration, the algorithm infers a new hypothesis reward machine from the updated sample. Based on an equivalence relationship we defined between states of reward machines, we transfer the q-functions between the hypothesis reward machines in consecutive iterations. We prove that the proposed algorithm converges almost surely to an optimal policy in the limit if a minimal reward machine can be inferred and the maximal length of each RL episode is sufficiently long. The experiments show that learning high-level knowledge in the form of reward machines can lead to fast convergence to optimal policies in RL, while standard RL methods such as q-learning and hierarchical RL methods fail to converge to optimal policies after a substantial number of training steps in many tasks.

研究の動機と目的

  • 高レベルのタスク構造がエージェントの初期段階で入手できないスパース報酬強化学習の課題に対処すること。
  • 反復的に報酬マシンと方策を共同で推論する手法を開発し、サンプル効率と収束速度を向上させること。
  • 経験と反例を通じて、隠れたタスク階層とサブタスク間の構造的関係を同定できるようにすること。
  • 最小限の報酬マシン推論と十分なエピソード長の下で、最適方策へのほぼ確実な収束を証明すること。
  • 自律走行や Minecraft タスクを含む複雑なスパース報酬環境において、標準的な Q 学習や階層的強化学習を上回ること。

提案手法

  • 報酬マシンの仮説と RL エピソードのサンプルを維持し、観測された報酬が現在の仮説と矛盾する反例を用いて、両者を段階的に改善する。
  • 現在の報酬マシン仮説から Q 関数を導出し、これらの Q 関数を用いて標準的な Q 学習更新を実行する。
  • 実際の報酬が現在の報酬マシンによって予測されたものと異なる反例エピソードを収集し、サンプルに追加することで、仮説の推論を改善する。
  • オートマトン学習技術を用いて、更新されたエピソードサンプルから、より正確な報酬マシン仮説を推論する。
  • 連続する報酬マシン仮説の同等状態間で Q 関数を転送することで、学習を加速し、サンプル効率を向上させる。
  • 効率的な報酬マシン推論のための多項式時間学習アルゴリズムと、推論頻度を制御する定期的なバッチ更新戦略を採用する。

実験結果

リサーチクエスチョン

  • RQ1高レベルのタスク構造が初期に不明な状況下で、強化学習エージェントが報酬マシンと最適方策を同時に推論できるか。
  • RQ2RL エピソードからの反例をどのように効果的に活用し、報酬マシン仮説を段階的に改善できるか。
  • RQ3共同推論フレームワークにおいて、最適方策へのほぼ確実な収束を保証する条件は何か。
  • RQ4連続する報酬マシンの同等状態間での Q 関数の転送が、学習効率をどのように向上させるか。
  • RQ5提案手法が、スパース報酬環境において、標準的な Q 学習や階層的強化学習をどの程度上回るか。

主な発見

  • 自動車走行シナリオでは、JIRP は 100,000 回の訓練ステップで最適方策に収束したが、ベースライン手法は 200 万ステップを経過しても累積報酬がほぼゼロのままに留まった。
  • オフィスワールドおよび Minecraft シナリオの両方で、JIRP は最適平均累積報酬に達したが、ベースライン手法は同じ訓練期間において最適性能の約 60% にとどまった。
  • 最終段階の反復で推論された報酬マシンは、『工作機械を使用する前に木材を入手すること』や『材料を収集した後に工場を使用すること』といった必要なタスク順序と依存関係を正確に捉えていた。
  • 反例収集の活用により仮説の品質が顕著に向上し、後続の段階での報酬マシンがタスク構造と報酬論理を正しくモデル化していた。
  • 連続する報酬マシンの同等状態間での Q 関数転送が、収束の高速化とサンプル複雑性の低減に寄与した。
  • 本アルゴリズムは、ナビゲーション、資源収集、工作タスクを含む多様な環境で頑健性を示し、ベースライン手法に対して一貫した性能向上を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。