[논문 리뷰] Hierarchical Reinforcement Learning with Abductive Planning
이 논문은 복잡하고 부분 관찰 가능한 환경에서 샘플 효율성을 향상시키기 위해 추론 기반 기호 계획법과 딥 강화 학습을 통합한 계층적 강화 학습 프레임워크를 제안한다. 히르브란드 기반 추론 대신 ILP 기반 추론을 사용함으로써, 사용자가 정의한 보상 함수를 지원하고 알려지지 않은 상태 공간에서도 작동할 수 있으며, 다수의 목표를 가진 마인크래프트 유사 환경에서 학습 속도를 크게 향상시킨다.
One of the key challenges in applying reinforcement learning to real-life problems is that the amount of train-and-error required to learn a good policy increases drastically as the task becomes complex. One potential solution to this problem is to combine reinforcement learning with automated symbol planning and utilize prior knowledge on the domain. However, existing methods have limitations in their applicability and expressiveness. In this paper we propose a hierarchical reinforcement learning method based on abductive symbolic planning. The planner can deal with user-defined evaluation functions and is not based on the Herbrand theorem. Therefore it can utilize prior knowledge of the rewards and can work in a domain where the state space is unknown. We demonstrate empirically that our architecture significantly improves learning efficiency with respect to the amount of training examples on the evaluation domain, in which the state space is unknown and there exist multiple goals.
연구 동기 및 목표
- 과도한 시도-오류 과정으로 인해 실생활의 큰 복잡한 도메인에서 강화 학습의 비효율성 문제를 해결한다.
- 히르브란드 정리에 의존하는 기존 기호 계획법의 한계를 극복하여 사용자가 정의한 보상 함수를 처리할 수 없음을 해결한다.
- 기존 지식을 활용한 추론을 통해 상태 공간이 알려지지 않은 도메인과 다수의 목표를 가진 환경에서 계획을 수행할 수 있도록 한다.
- 고수준 정책 학습을 이끄는 데 기여하기 위해 기호적 추론 기반 계획법과 딥 강화 학습을 통합함으로써 학습 효율성을 향상시킨다.
제안 방법
- 고수준 계획자는 ILP로 공식화된 추론을 사용하여 히르브란드 유니버스가 필요 없이 기호 지식에 기반한 추론을 가능하게 한다.
- 추론 기반 추론은 사용자가 정의한 평가 함수(보상 기대치 포함)를 기반으로 고수준 계획을 생성하여 도메인 특화 지식을 통합할 수 있다.
- 고수준 계획자는 하위 목표 시퀀스(예: 코일 찾기, Furnace로 이동)를 생성하고 이를 저수준 PPO 에이전트가 실행한다.
- 동일한 관측 결과에 대해 추론 결과를 캐시하여 저장하고 재사용함으로써 계획 속도를 향상시킨다.
- 기호적 추론 기반 계획법과 PPO 기반 딥 강화 학습을 통합하여 고수준 계획자가 저수준 정책 학습을 이끈다.
- 이 아키텍처는 임의 길이의 계획을 지원하며, 증명 그래프를 사용해 추론 과정의 해석 가능성을 높인다.
실험 결과
연구 질문
- RQ1ILP 기반 추론에 기반한 추론 기반 계획법이 복잡하고 부분 관찰 가능한 도메인에서 계층적 강화 학습의 샘플 효율성을 향상시킬 수 있는가?
- RQ2히르브란드 기반 추론이 아닌 기호적 계획자가 상태 공간이 알려지지 않은 환경에서 효과적으로 작동할 수 있는가?
- RQ3사용자가 정의한 보상 함수를 기호적 계획에 효과적으로 통합하여 고수준 정책 학습을 이끌 수 있는가?
- RQ4추론 기반 계획법의 통합이 표준 계층적 강화 학습에 비해 학습 속도와 성능에 어떤 영향을 미치는가?
주요 결과
- ABDUCTIVE는 5,000 에피소드 동안 기준 모델보다 유의미하게 높은 누적 보상을 기록하여 뛰어난 학습 효율성을 입증했다.
- 추론 기반 계획자는 이해하기 쉬운 그래프 기반의 해답 가설을 생성하여 임의 길이의 계획과 비행동작 지식(예: 물체의 성질)에 대한 추론을 가능하게 했다.
- 특히 다수의 목표와 알려지지 않은 상태 공간을 가진 환경에서 표준 계층적 강화 학습 기준 모델보다 샘플 효율성 면에서 뛰어난 성능을 보였다.
- 고수준 계획이 성능 저하 요소가 되었으며, 일부 추론 단계는 수 초가 걸릴 수 있었지만, 캐싱 덕분에 반복 관측에 대한 반응 시간이 향상되었다.
- 사용자가 정의한 평가 함수를 통해 보상에 대한 사전 지식를 효과적으로 활용하여 계획 과정에서 목표 우선순위를 설정할 수 있었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.