Skip to main content
QUICK REVIEW

[논문 리뷰] Exploration Conscious Reinforcement Learning Revisited

Lior Shani, Yonathan Efroni|arXiv (Cornell University)|2018. 12. 13.
Reinforcement Learning in Robotics인용 수 5
한 줄 요약

이 논문은 탐색을 고려한 강화학습을 제안하며, 탐색을 외부 교란으로 간주하는 대신 고정된 탐색 메커니즘(예: ε-greedy 또는 가우시안 노이즈)에 대해 정책을 최적화함으로써 이를 해결한다. 문제를 서브티튜트 마르코프 결정 과정(surrogate MDP)으로 공식화하여 표본 효율성과 안정성이 향상된 학습을 가능하게 하며, 타블루러 및 딥 강화학습 환경에서 모두 실험적으로 성능 향상을 보였다. Atari 및 MuJoCo 환경 전반에서 개선된 성능을 기록하였다.

ABSTRACT

The Exploration-Exploitation tradeoff arises in Reinforcement Learning when one cannot tell if a policy is optimal. Then, there is a constant need to explore new actions instead of exploiting past experience. In practice, it is common to resolve the tradeoff by using a fixed exploration mechanism, such as $ε$-greedy exploration or by adding Gaussian noise, while still trying to learn an optimal policy. In this work, we take a different approach and study exploration-conscious criteria, that result in optimal policies with respect to the exploration mechanism. Solving these criteria, as we establish, amounts to solving a surrogate Markov Decision Process. We continue and analyze properties of exploration-conscious optimal policies and characterize two general approaches to solve such criteria. Building on the approaches, we apply simple changes in existing tabular and deep Reinforcement Learning algorithms and empirically demonstrate superior performance relatively to their non-exploration-conscious counterparts, both for discrete and continuous action spaces.

연구 동기 및 목표

  • 표준 강화학습 알고리즘이 탐색을 고정된 외부 메커니즘으로 간주하여 정책 학습이 최적화되지 않는 한계를 해결한다.
  • 주어진 탐색 체계 하에서 최적의 정책을 도출할 수 있는 탐색 인식 최적화 기준을 수립한다.
  • 탐색 인식 정책 학습 문제를 해소할 수 있는 서브티튜트 MDP로 환원함으로써 체계적인 알고리즘 설계를 가능하게 한다.
  • 기존 알고리즘에 탐색 인식을 통합함으로써 표본 효율성과 강건성을 향상시키며, 타블루러 및 딥 강화학습 환경에서의 성능을 개선한다.

제안 방법

  • 이산 및 연속 행동 공간에 대해 고정된 탐색 메커니즘에 의해 유도되는 제한된 정책 집합 위에서 최적화 문제로 탐색 인식 기준을 정의한다.
  • 원래 MDP의 탐색 인식 최적 정책와 일치하는 최적 정책을 가지는 서브티튜트 MDP를 구축한다.
  • 가치 기반 및 정책 기반의 두 가지 일반적인 알고리즘 접근 방식을 제안하여 탐색 인식 최적화 문제를 해결한다.
  • 기존 타블루러 및 딥 강화학습 알고리즘(DQN, SAC 등)에 탐색 인식을 통합하기 위해 타겟 네트워크나 정책 업데이트를 수정한다.
  • 현재 정책과 고정된 탐색 정책의 가중 조합을 사용하여 새로운 타겟 Q-값을 정의함으로써 탐색 제약 조건 하에서도 안정적인 학습을 가능하게 한다.
  • 약한 가정 하에서 제안된 알고리즘의 수렴성을 증명하며, 오차가 시간에 따라 감소하고 정책가 탐색 인식 최적 정책로 수렴함을 보여준다.

실험 결과

연구 질문

  • RQ1고정된 탐색 메커니즘 하에서 최적의 정책을 도출할 수 있는 원칙적인 최적화 기준을 정의할 수 있는가? (즉, 탐색이 정책 학습과 독립적이라고 가정하는 대신, 탐색을 고려한 기준을 도입할 수 있는가?)
  • RQ2탐색 인식 정책 학습 문제를 해석 가능한 표준 MDP 공식화로 환원할 수 있는가?
  • RQ3탐색 인식 학습에서 진정한 최적 정책에 대한 편향과 근사 오차에 대한 민감도 사이의 트레이드오프는 어떠한가?
  • RQ4값 업데이트 및 정책 업데이트에 탐색 인식을 명시적으로 통합함으로써 표준 강화학습 방법을 능가하는 실용적 알고리즘을 설계할 수 있는가?
  • RQ5탐색 인식 학습은 이산 및 연속 제어 과제 모두에서 표본 효율성과 성능 향상에 기여하는가?

주요 결과

  • 서브티튜트 MDP 공식화를 통해 유도된 탐색 인식 정책는 진정한 최적 정책에 대해 편향이 있지만, 함수 근사 오차에 대한 민감도가 크게 감소한다.
  • 표준 DQN 및 Rainbow 에이전트에 비해 Atari 환경에서 더 뛰어난 성능을 기록하였으며, 특히 보상이 희박한 환경에서 두각을 나타냈다.
  • MuJoCo를 사용한 연속 제어 과제에서는 탐색 인식 SAC 버전이 표준 SAC보다 표본 효율성과 최종 수익에서 뛰어난 성능을 보였으며, 특히 초기 학습 단계에서 두각을 나타냈다.
  • 표준 가정 하에서 제안된 알고리즘의 수렴성이 이론적으로 보장되었으며, 오차는 할인 인자 γ와 탐색 가중치 α에 비례하는 비율로 감소한다.
  • 실험 결과에 따르면 탐색 인식 학습은 Cliff-Walking와 같은 환경에서 표준 ε-greedy가 계곡 근처에서 위험한 행동을 유도하는 것을 완화함을 보였다.
  • 이 방법은 타블루러 및 딥 강화학습 환경 전반에 걸쳐 일반화되며, 타겟 업데이트에 탐색 메커니즘을 통합하는 것을 제외하고는 아키텍처 변경 없이 일관된 성능 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.