Skip to main content
QUICK REVIEW

[논문 리뷰] Active Finite Reward Automaton Inference and Reinforcement Learning Using Queries and Counterexamples

Zhe Xu, Bo Wu|arXiv (Cornell University)|2020. 06. 28.
Machine Learning and Algorithms참고 문헌 36인용 수 8
한 줄 요약

이 논문은 비마르코프성이고 유한한 보상 함수를 모델링하기 위해 훈련 중에 L*-스타일의 질의를 사용하여 유한 보상 오ート마타를 추론하는 활성 강화학습 프레임워크인 AFRAI-RL을 제안한다. 강화학습을 통해 답변되는 멤버십 질의와 등가성 질의를 통해 탐색을 능동적으로 이끌어내는 방식으로, 최적의 정책으로의 수렴 속도가 상태기반 기준인 JIRP-SAT, LRM-QRM, PPO2보다 최대 88.8% 빠르며, 복잡한 순차적 보상 구조를 가진 Office World 및 Minecraft 환경 모두에서 성능을 확보한다.

ABSTRACT

Despite the fact that deep reinforcement learning (RL) has surpassed human-level performances in various tasks, it still has several fundamental challenges. First, most RL methods require intensive data from the exploration of the environment to achieve satisfactory performance. Second, the use of neural networks in RL renders it hard to interpret the internals of the system in a way that humans can understand. To address these two challenges, we propose a framework that enables an RL agent to reason over its exploration process and distill high-level knowledge for effectively guiding its future explorations. Specifically, we propose a novel RL algorithm that learns high-level knowledge in the form of a finite reward automaton by using the L* learning algorithm. We prove that in episodic RL, a finite reward automaton can express any non-Markovian bounded reward functions with finitely many reward values and approximate any non-Markovian bounded reward function (with infinitely many reward values) with arbitrary precision. We also provide a lower bound for the episode length such that the proposed RL approach almost surely converges to an optimal policy in the limit. We test this approach on two RL environments with non-Markovian reward functions, choosing a variety of tasks with increasing complexity for each environment. We compare our algorithm with the state-of-the-art RL algorithms for non-Markovian reward functions, such as Joint Inference of Reward machines and Policies for RL (JIRP), Learning Reward Machine (LRM), and Proximal Policy Optimization (PPO2). Our results show that our algorithm converges to an optimal policy faster than other baseline methods.

연구 동기 및 목표

  • 딥 강화학습에서 데이터 비효율성과 해석 불가능성 문제, 특히 비마르코프성 보상 함수에 대해 해결하고자 한다.
  • 강화학습 에이전트가 환경 상호작용을 통해 고수준의 보상 구조(유한 보상 오트마타)를 능동적으로 추론할 수 있도록 하고자 한다.
  • 활동적인 오트마타 추론을 Q-학습과 통합하여 에피소드 기반 강화학습의 샘플 효율성과 수렴 속도를 향상시키고자 한다.
  • 에피소드 길이에 하한선이 존재할 경우 수렴에 대한 이론적 보장을 제공하고자 한다.
  • 복잡한 순차적 보상 의존성을 가진 환경에서 최신 기술 대비 뛰어난 성능을 입증하고자 한다.

제안 방법

  • 프레임워크는 L* 학습 알고리즘을 영감으로 삼은 활성 추론 메커니즘을 사용하며, 강화학습 에이전트는 학습자 역할을 하며 환경/강화학습 엔진은 교사 역할을 한다.
  • 두 개의 Q-함수를 유지한다: 하나는 탐색 중 멤버십 질의에 응답하도록 유도하기 위한 것이고, 다른 하나는 등가성 질의를 평가하기 위한 것이다.
  • 유한 보상 오트마타는 상태-행동 시퀀스가 특정 보상을 유도하는지 여부를 질의함으로써 궤적에서 유추되며, 이는 비마르코프성 보상 함수의 표현을 가능하게 한다.
  • 유추된 오트마타는 정책 학습을 안내하는 데 사용되어 에이전트가 장기적 보상 구조를 고려하고 훈련 중에 자가 수정할 수 있도록 한다.
  • 이 방법은 유한한 값만을 가진 유한한 비마르코프성 보상 함수는 정확히 표현할 수 있으며, 무한한 값들을 가진 경우에도 임의로 정밀도를 높일 수 있음을 증명한다.
  • 최적의 정책으로 거의 확실히 수렴하기 위해, 에피소드 길이에 대한 이론적 하한선을 도출한다.

실험 결과

연구 질문

  • RQ1유한 보상 오트마타의 활성 추론은 비마르코프성 강화학습에서 샘플 효율성과 수렴 속도를 향상시킬 수 있는가?
  • RQ2유한한 값만을 가진 유한한 비마르코프성 보상 함수는 유한 보상 오트마타로 정확히 표현할 수 있는가?
  • RQ3무한한 값들을 가진 유한한 비마르코프성 보상 함수는 유한 보상 오트마타로 임의의 정밀도로 근사할 수 있는가?
  • RQ4최적의 정책으로 거의 확실히 수렴하기 위해 필요한 최소 에피소드 길이는 얼마인가?
  • RQ5활동적 보상 오트마타 추론은 공동 추론 또는 수동 추론 대비 수렴 속도와 성능 측면에서 어떻게 비교되는가?

주요 결과

  • Office World 시나리오에서 Task 1에 대해 AFRAI-RL은 약 0.2백만 훈련 스텝 내에 최적의 정책으로 수렴했고, JIRP-SAT, LRM-QRM, PPO2는 수렴하지 못했다.
  • Office World의 Task 2에서는 AFRAI-RL이 약 180만 스텝 내에 수렴했고, 모든 기준 기법들이 수렴하지 못했다.
  • Office World의 Task 3에서는 AFRAI-RL이 400만 스텝 내에 수렴했으며, JIRP-SAT(450만 스텝)를 능가했고, LRM-QRM과 PPO2는 수렴하지 못했다.
  • Minecraft 세계에서는 AFRAI-RL이 Task 1에 대해 19만 스텝, Task 2에 대해 17만 스텝 내에 수렴했고, 모든 기준 기법들이 수렴하지 못했다.
  • 최상의 경우, AFRAI-RL은 어떤 기준 기법보다 최대 88.8% 더 빠르게 수렴했으며, 다른 기법들이 수렴하지 못한 곳에서도 수렴을 달성했다.
  • 이론적 분석을 통해, 에피소드 길이가 유도된 하한선을 초과할 경우, 방법이 거의 확실히 최적의 정책으로 수렴함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.