Skip to main content
QUICK REVIEW

[논문 리뷰] Interpretable Model-based Hierarchical Reinforcement Learning using Inductive Logic Programming

Duo Xu, Faramarz Fekri|arXiv (Cornell University)|2021. 06. 21.
Reinforcement Learning in Robotics참고 문헌 42인용 수 6
한 줄 요약

이 논문은 계층적 강화학습 프레임워크를 제안하며, 유도적 논리 프로그래밍(ILP)을 사용해 해석 가능한 기호적 전이 모델을 학습함으로써 모델 기반 강화학습에서 데이터 효율성과 해석 가능성 향상. 사전 지식 없이 상태 전이에 대한 논리적 규칙을 학습함으로써 기준 대비 30–40% 빠른 학습을 달성하고, 다양한 환경 간의 조합적 일반화를 가능하게 한다.

ABSTRACT

Recently deep reinforcement learning has achieved tremendous success in wide ranges of applications. However, it notoriously lacks data-efficiency and interpretability. Data-efficiency is important as interacting with the environment is expensive. Further, interpretability can increase the transparency of the black-box-style deep RL models and hence gain trust from the users. In this work, we propose a new hierarchical framework via symbolic RL, leveraging a symbolic transition model to improve the data-efficiency and introduce the interpretability for learned policy. This framework consists of a high-level agent, a subtask solver and a symbolic transition model. Without assuming any prior knowledge on the state transition, we adopt inductive logic programming (ILP) to learn the rules of symbolic state transitions, introducing interpretability and making the learned behavior understandable to users. In empirical experiments, we confirmed that the proposed framework offers approximately between 30\% to 40\% more data efficiency over previous methods.

연구 동기 및 목표

  • 장기적인 작업을 위한 딥 강화학습(RL)에서 낮은 데이터 효율성과 해석 가능성 부족 문제를 해결하기 위해.
  • 환경 역학에 대한 사전 지식 없이도 기호적 상태 전이를 사용한 고수준 계획을 가능하게 하기 위해.
  • 유도적 논리 프로그래밍(ILP)을 통해 기호적 전이 모델을 학습시켜 샘플 효율성을 향상시키기 위해.
  • 상태 전이를 기술하는 인간이 읽을 수 있는 논리적 규칙을 통해 해석 가능성 도입하기 위해.
  • 기호적 규칙 전이를 통해 새로운 환경에 대한 조합적 일반화를 가능하게 하기 위해.

제안 방법

  • 장기적인 작업을 분해하기 위해 고수준 에이전트, 하위작업 해결기, 기호적 전이 모델을 포함한 계층적 강화학습을 활용.
  • 실제 환경 상호작용에서 유도적 논리 프로그래밍(ILP)을 사용해 사전 지식 없이 기호적 전이 규칙을 자동으로 학습.
  • ∂ILP 알고리즘에 정련 연산을 도입하여 더 효율적으로 문장을 생성하고 의미 없는 규칙을 방지.
  • 기호적 전이 모델을 활용해 기호 모델 기반으로 고수준 정책 학습을 수행함으로써 실제 환경 상호작용을 감소.
  • 고수준 정책 학습을 위해 표본 기반 Q-학습과 저수준 정책 학습을 위해 PPO를 조합하며, 기호 규칙이 하위작업 계획을 지시.
  • 상태 조건과 하위목표 달성 여부를 논리 형태로 표현하기 위해 기호 술어(예: CurAct, Connect, isRed) 정의.

실험 결과

연구 질문

  • RQ1환경 역학에 대한 사전 지식 없이도 모델 기반 계층적 강화학습에서 ILP를 효과적으로 사용해 기호적 전이 모델을 학습시킬 수 있는가?
  • RQ2기호적 전이 규칙을 학습시키는 것이 장기적인 작업에서의 데이터 효율성에 어떻게 기여하는가?
  • RQ3기호적 모델이 다양한 하위목표 수를 가진 새로운 환경으로의 일반화에 얼마나 효과적인가?
  • RQ4학습된 논리적 규칙이 에이전트의 의사결정 과정에 대해 해석 가능하고 검증 가능한 설명을 제공할 수 있는가?
  • RQ5∂ILP에 정련을 통합함으로써 규칙 학습의 품질과 효율성이 어떻게 향상되는가?

주요 결과

  • 제안된 방법은 그리드월드 및 로봇 주행 작업 모두에서 기준 대비 약 30–40% 높은 데이터 효율성을 달성.
  • 로봇 주행 환경에서, 저수준 정책이 부분적으로 최적화되어 있어도 기준 계층적 강화학습 대비 학습 시간을 약 40% 감소.
  • 학습 중에 학습된 기호적 전이 모델은 더 많은 원과 색상이 있는 테스트 환경에서도 더 빠른 학습을 가능하게 하여 강력한 조합적 일반화를 보여줌.
  • ILP에서 유도된 규칙는 (예: 빨간색을 노란색보다 먼저 방문)와 같은 제약 조건을 명시적으로 인코딩했으며, 이는 시스템의 투명성을 보여줌.
  • ∂ILP에 정련을 통합함으로써 의미 없는 문장의 수가 감소하고 사전 정의된 규칙 템플릿이 필요 없어짐.
  • 기호적 모델 덕분에 저수준 정책이 완전히 학습되기 전에도 고수준 에이전트가 효과적으로 계획을 수립할 수 있었으며, 이는 전체 학습 속도 향상에 기여함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.