Skip to main content
QUICK REVIEW

[論文レビュー] Interpretable Model-based Hierarchical Reinforcement Learning using Inductive Logic Programming

Duo Xu, Faramarz Fekri|arXiv (Cornell University)|Jun 21, 2021
Reinforcement Learning in Robotics参考文献 42被引用数 6
ひとこと要約

本論文は、誘導的論理プログラミング(ILP)を用いて解釈可能な記号的遷移モデルを学習する階層的強化学習フレームワークを提案する。これにより、モデルベース強化学習におけるデータ効率性と解釈可能性が向上する。事前に環境ダイナミクスの知識がなくても、状態遷移の論理的規則を学習することで、ベースラインと比較して学習を30–40%高速化し、異なる環境間での構成的一般化を可能にする。

ABSTRACT

Recently deep reinforcement learning has achieved tremendous success in wide ranges of applications. However, it notoriously lacks data-efficiency and interpretability. Data-efficiency is important as interacting with the environment is expensive. Further, interpretability can increase the transparency of the black-box-style deep RL models and hence gain trust from the users. In this work, we propose a new hierarchical framework via symbolic RL, leveraging a symbolic transition model to improve the data-efficiency and introduce the interpretability for learned policy. This framework consists of a high-level agent, a subtask solver and a symbolic transition model. Without assuming any prior knowledge on the state transition, we adopt inductive logic programming (ILP) to learn the rules of symbolic state transitions, introducing interpretability and making the learned behavior understandable to users. In empirical experiments, we confirmed that the proposed framework offers approximately between 30\% to 40\% more data efficiency over previous methods.

研究の動機と目的

  • 長期間のタスクにおける深層強化学習(RL)の低いデータ効率性と解釈不能性を改善すること。
  • 環境ダイナミクスの事前知識がなくても、記号的状態遷移を用いたハイレベルな計画を可能にすること。
  • 誘導的論理プログラミング(ILP)を用いて記号的遷移モデルを学習することで、サンプル効率を向上させること。
  • 人間が読める論理的規則を通じて解釈可能性を提供すること。
  • 記号的規則の転送により、未観測の環境への構成的一般化を可能にすること。

提案手法

  • 長期間のタスクを分解するため、ハイレベルエージェント、サブタスクソルバー、記号的遷移モデルを備えた階層的RLを活用する。
  • 誘導的論理プログラミング(ILP)を用いて、状態ダイナミクスの事前知識がなくても、実環境との相互作用から自動的に記号的遷移規則を学習する。
  • ∂ILPアルゴリズムに精錬操作を導入し、より効率的に節を生成し、意味のない規則を回避する。
  • 記号的遷移モデルを用いて、実環境との相互作用を減らしながらハイレベルポリシーの学習を可能にする。
  • タブラ式Q学習とPPOをそれぞれハイレベルおよびローレベルポリシーの学習に組み合わせ、記号的規則がサブタスク計画をガイドする。
  • 状態条件やサブゴール達成を論理形式で表現する記号的述語(例:CurAct, Connect, isRed)を定義する。

実験結果

リサーチクエスチョン

  • RQ1環境ダイナミクスの事前知識がなくても、モデルベース階層的RLにおける記号的遷移モデルをILPで効果的に学習できるか?
  • RQ2記号的遷移規則の学習が、長期間のRLタスクにおけるデータ効率性をどのように向上させるか?
  • RQ3記号的モデルが、異なる数のサブゴールを持つ新しい環境への一般化をどの程度可能にするか?
  • RQ4学習された論理的規則が、エージェントの意思決定プロセスの解釈可能で検証可能な説明を提供できるか?
  • RQ5∂ILPに精錬を統合することで、規則学習の品質と効率性はどのように向上するか?

主な発見

  • 提案手法は、グリッドワールドおよびロボットナビゲーションタスクの両方で、ベースラインの階層的RL手法と比較して約30–40%高いデータ効率性を達成した。
  • ロボットナビゲーション環境では、ローレベルポリシーが準最適であっても、階層的ベースラインと比較して学習時間を約40%短縮した。
  • 訓練中に学習した記号的遷移モデルは、より多くの円や色を持つテスト環境でも高速な学習を可能にし、強力な構成的一般化を示した。
  • ILPから得られた規則は、例えば「赤を黄色より前に訪問する」といった制約を明示的にエンコードしており、解釈可能で、システムの透明性を示した。
  • ∂ILPへの精錬の統合により、意味のない節の数が減少し、事前に定義された規則テンプレートの必要性が排除された。
  • 記号的モデルにより、ローレベルポリシーが完全に訓練される前からもハイレベルエージェントが効果的に計画を立てることができ、全体の学習が加速した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。