Skip to main content
QUICK REVIEW

[論文レビュー] A Composable Specification Language for Reinforcement Learning Tasks

Kishor Jothimurugan, Rajeev Alur|arXiv (Cornell University)|Aug 21, 2020
Formal Methods in Verification被引用数 21
ひとこと要約

本論文は、高レベルの論理的述語を用いて複雑な強化学習(RL)タスクを定義する、合成可能な仕様言語を提案する。この言語はタスクモニタを介して、報酬関数と拡張された状態空間にコンパイルする。このアプローチにより、非マルコフ的タスクに対する最適方策の学習が効率的に行える。Spectrlはベンチマークで97%を超える成功率を達成し、TLTL や CCE といった最先端のベースラインを上回った。

ABSTRACT

Reinforcement learning is a promising approach for learning control policies for robot tasks. However, specifying complex tasks (e.g., with multiple objectives and safety constraints) can be challenging, since the user must design a reward function that encodes the entire task. Furthermore, the user often needs to manually shape the reward to ensure convergence of the learning algorithm. We propose a language for specifying complex control tasks, along with an algorithm that compiles specifications in our language into a reward function and automatically performs reward shaping. We implement our approach in a tool called SPECTRL, and show that it outperforms several state-of-the-art baselines.

研究の動機と目的

  • 複雑なRLタスクにおける複数の目的と制約を伴う、スパarsな脆い報酬関数を手動で設計する課題に対処すること。
  • 低レベルの行動シーケンスを必要とせず、直感的で合成可能な論理的述語を用いてタスクを指定できるようにすること。
  • 中間的進捗に対する部分的報酬と、非マルコフ的タスクのための記憶に依存する状態拡張を自動的に生成すること。
  • 安全制約を伴う複雑で順序付けられたタスクにおいて、サンプル効率と成功確率の面で既存のRLベースラインを上回ること。
  • 高レベルのタスク仕様をトレーニング可能なRL問題に変換するコンパイラーのようなパイプラインを提供すること。

提案手法

  • ドメイン固有言語を用いて、状態述語(例:到達、回避、燃料 > 0)のシーケンスとしてタスクを achieve および ensure 句として表現する。
  • タスク仕様から自動的に合成されるタスクモニタ(有限オートマトン)が、部分タスクの進行状況を追跡し、状態間で記憶を維持する。
  • モニタ状態がエージェントの観測空間に拡張され、方策がタスク進行状況を推論できるようにする。
  • 中間的サブタスクの完了や仕様シーケンスの進行に対して、部分的報酬を割り当てることで報酬形状化を実施する。
  • 報酬関数は、決定的MDPにおいて最適方策が保持されるようにコンパイルされる。実験結果は確率的設定でも有効性を示している。
  • 標準的なRLアルゴリズム(例:ARS)と統合するために、形状化された報酬関数と拡張された状態空間を生成する。

実験結果

リサーチクエスチョン

  • RQ1高レベルで合成可能な仕様言語は、複数の目的と制約を伴う複雑なRLタスクの仕様化と学習を改善できるか?
  • RQ2タスク構造から報酬形状化を体系的に導出することで、サンプル効率と収束性を向上させられるか?
  • RQ3非マルコフ的仕様を処理し、記憶に依存する制御方策を可能にするタスクモニタを自動生成できるか?
  • RQ4仕様を形状報酬に自動コンパイルすることで、仕様の意味論を直接報酬として使用するのと比較して優れているか?
  • RQ5特に深くネストされたシーケンシング構造を伴う場合、仕様の複雑さの増大に伴い、この手法はスケーリングできるか?

主な発見

  • Spectrlはベンチマークスイートのすべてのタスクで97%以上の成功率を達成し、TLTL や CCE といった最先端のベースラインを上回った。
  • 報酬形状化なしでは、Spectrlは最終モニタ状態にランダムサンプリングで偶然到達しない限り方策を学習できず、形状化の必要性を示した。
  • 記憶を要するタスク(例:$φ_5$, $φ_6$, $φ_7$)において、Spectrlは単一状態方策に依存するCCE や TLTL を著しく上回った。非マルコフ的タスクではこれらが失敗した。
  • Spectrlは仕様サイズに応じて良好にスケーリングされ、最大7つのネストされたシーケンシング演算子を含む場合でも、サンプル複雑度の増加が著しくなかった。
  • カートポール環境では、SpectrlはTLTL よりもタスクを速く学習し、CCE よりも優れた性能を示した。CCEは有効な方策を学習できなかった。
  • 障害物回避や燃料維持といった複数の制約に対しても、Spectrlは頑健性を示した。CCEの性能は著しく低下した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。