[논문 리뷰] PEORL: Integrating Symbolic Planning and Hierarchical Reinforcement Learning for Robust Decision-Making
이 논문은 불확실한 환경에서 강건한 의사결정을 가능하게 하기 위해 상징적 계획과 계층적 강화학습(HRL)을 통합한 PEORL 프레임워크를 제안한다. 상징적 계획을 반복적으로 사용하여 학습된 옵션을 통해 HRL을 안내하고, 경험을 되돌려가게 하여 계획을 개선함으로써 PEORL은 정책 학습 속도를 가속화하고 계획의 강건성을 향상시킨다. 택시 및 격자도메인 벤치마크에서 단독 RL, HRL, 계획 에이전트보다 높은 누적 보상과 더 적은 실행 실패를 기록하며 우수한 성능을 보였다.
Reinforcement learning and symbolic planning have both been used to build intelligent autonomous agents. Reinforcement learning relies on learning from interactions with real world, which often requires an unfeasibly large amount of experience. Symbolic planning relies on manually crafted symbolic knowledge, which may not be robust to domain uncertainties and changes. In this paper we present a unified framework {\em PEORL} that integrates symbolic planning with hierarchical reinforcement learning (HRL) to cope with decision-making in a dynamic environment with uncertainties. Symbolic plans are used to guide the agent's task execution and learning, and the learned experience is fed back to symbolic knowledge to improve planning. This method leads to rapid policy search and robust symbolic plans in complex domains. The framework is tested on benchmark domains of HRL.
연구 동기 및 목표
- 순수한 강화학습(RL)은 광범위한 경험을 필요로 하며, 상징적 계획은 도메인의 불확실성에 대해 강건성이 부족한 점을 해결하기 위해.
- 상징적 계획의 정적 성격을 극복하기 위해 RL의 경험을 활용해 계획을 동적으로 개선하기 위해.
- 사전 정의된 또는 히وري스틱 옵션에 의존하지 않고, 상징적 계획을 통해 HRL에서 자동으로 옵션을 탐색하기 위해.
- 특히 실행 실패나 불확실한 도메인 세부 정보 처리에 있어, RL에서 학습된 지식을 통합함으로써 상징적 계획의 강건성을 향상시키기 위해.
- 계획과 HRL 간의 双방향 피드백 루프를 구축하여 정책 성능과 계획 품질을 동시에 향상시키기 위해.
제안 방법
- 프레임워크는 도메인의 동역학을 공식적으로 모델링할 수 있도록 행동과 제약 조건에 대한 일반지식을 표현하기 위해 액션 언어 ${\cal BC}$를 사용한다.
- 제약 충족 집합 솔버(Clingcon)는 초기 상태와 목표로부터 상징적 계획을 생성하며, 이를 HRL에 적합한 결정론적 순서의 확률적 옵션으로 매핑한다.
- 계층적 R-학습이 사용되며, 정책 학습을 안내하기 위해 평균 조정 보상 $R$과 누적 평균 보상(이득 보상) $\rho$의 두 값을 최적화한다.
- 이득 보상 $\rho$는 Clingcon을 통해 상징적 계획을 개선하는 피드백 신호로 사용되며, 반복적인 개선을 통해 고급도의 계획을 발견할 수 있도록 한다.
- 이 과정은 반복적이다: 개선된 상징적 계획이 새로운 옵션을 생성하고, 이를 통해 추가적인 RL 학습이 이루어지며, 더 이상 향상된 계획이 없을 때까지 반복된다.
- 학습된 경험에 기반해 새로운 옵션과 계획이 유연하게 생성될 수 있도록 하여, 사전에 정의된 옵션에 의존하지 않는 동적 적응을 지원한다.
실험 결과
연구 질문
- RQ1복잡한 환경에서 정책 탐색을 가속화하기 위해 상징적 계획을 계층적 강화학습에 안내로 활용할 수 있는가?
- RQ2강화학습 피드백을 통해 도메인의 불확실성과 실행 실패 상황에서도 상징적 계획의 강건성과 품질을 향상시킬 수 있는가?
- RQ3수동으로 코딩된 또는 히وري스틱 옵션에 의존하지 않고, 상징적 계획을 통해 계층적 강화학습에서 의미 있는 옵션을 자동으로 탐색할 수 있는가?
- RQ4계획과 학습의 이중 방향 통합이 단독 RL 또는 계획 에이전트와 비교해 누적 보상과 계획 신뢰성에 어떤 영향을 미치는가?
- RQ5강화학습에서 학습된 경험을 얼마나 활용해 상징적 지식을 개선하고, 비용이 많이 드는 실패를 피하거나 숨겨진 보상을 활용하는 계획을 생성할 수 있는가?
주요 결과
- 택시 도메인에서 PEORL 에이전트는 RL 에이전트나 계획 에이전트가 발견하지 못한 보상이 추가로 발생하는 상태(4,4)를 탐지하여, 상당히 높은 누적 보상을 기록했다.
- PEORL 에이전트는 누적 보상 측면에서 RL 에이전트와 HRL 에이전트를 모두 앞서며, 수렴 속도가 빠르고 학습 곡선의 분산이 낮았다.
- 격자도메인에서 PEORL 에이전트는 벽에 부딪히는 것을 안정적으로 피하고 푸시 동작을 성공적으로 수행함으로써, 보상과 일관성 측면에서 RL 에이전트를 능가했다.
- PEORL 에이전트는 학습된 지식을 활용해 계획의 강건성을 향상시켜 실행 실패를 줄였지만, 계획 전용 에이전트(P-에이전트)는 학습 능력 부족으로 높은 실패율을 보였다.
- 상징적 계획과 R-학습 간의 반복 피드백 루프는 초기 상징적 지식에 포함되지 않은 새로운 고가치 상태와 동작을 탐지하는 데 기여하여 적응 능력을 향상시켰다.
- 프레임워크는 R-학습을 통해 상징적 계획과 HRL을 통합함으로써, 은닉 보상과 불확실한 동역학을 포함한 도메인에서 더 강건하고 효율적인 의사결정을 가능하게 함을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.