[논문 리뷰] Rewarding Episodic Visitation Discrepancy for Exploration in Reinforcement Learning
이 논문은 보상 기반의 에피소드 간 방문 불일치를 활용하여 지속적인 탐색 보너스를 생성하는 계산 효율적인 내재 탐색 방법인 Rewarding Episodic Visitation Discrepancy (REVD)를 제안한다. Rényi 산란을 기반으로 한 에피소드 간 방문 불일차를 사용하며, 무작위로 초기화된 상태 인코더와 k-최근접 이웃 추정기를 활용하여 보조 모델 및 표현 학습이 필요 없도록 하여 샘플 효율성을 크게 향상시키고, Atari 및 PyBullet 환경에서 최신 기술(SOTA)을 능가한다.
Exploration is critical for deep reinforcement learning in complex environments with high-dimensional observations and sparse rewards. To address this problem, recent approaches proposed to leverage intrinsic rewards to improve exploration, such as novelty-based exploration and prediction-based exploration. However, many intrinsic reward modules require sophisticated structures and representation learning, resulting in prohibitive computational complexity and unstable performance. In this paper, we propose Rewarding Episodic Visitation Discrepancy (REVD), a computation-efficient and quantified exploration method. More specifically, REVD provides intrinsic rewards by evaluating the Rényi divergence-based visitation discrepancy between episodes. To make efficient divergence estimation, a k-nearest neighbor estimator is utilized with a randomly-initialized state encoder. Finally, the REVD is tested on Atari games and PyBullet Robotics Environments. Extensive experiments demonstrate that REVD can significantly improves the sample efficiency of reinforcement learning algorithms and outperforms the benchmarking methods.
연구 동기 및 목표
- 깊은 강화학습에서 내재 보상의 감소 문제, 특히 희박한 보상과 고차원 환경에서의 도전 과제를 해결하기 위해.
- 복잡한 표현 학습과 보조 모델이 필요 없는 계산 효율적인 탐색 방법을 개발하기 위해.
- 에피소드 수준에서 탐색 향상 정도를 측정할 수 있는 정량적 지표를 제공하기 위해.
- 모델 복잡도를 증가시키지 않고도 이산 및 연속 제어 과제에서 샘플 효율성과 정책 성능을 향상시키기 위해.
제안 방법
- REVD는 연속된 에피소드의 상태 방문 분포 간 Rényi 산란을 기반으로 내재 보상을 계산한다.
- 현재 및 이전 에피소드의 상태에 대해 k-최근접 이웃(k-NN) 추정기를 적용하여 산란을 추정한다.
- 사전 학습된 또는 학습된 표현이 필요 없도록, 무작위로 초기화된 상태 인코더를 사용하여 상태를 임bedding한다.
- 에피소드 메모리나 데이터베이스가 필요 없어, 에피소드 간 지속 가능한 탐색 유도가 가능하다.
- 내재 보상은 두 연속된 에피소드에서 상태와 그 이웃 간의 k-NN 거리 차이에서 유도된다.
- 핵심 아키텍처를 수정하지 않고 표준 강화학습 알고리즘(PPO, A2C 등)과 통합된다.
실험 결과
연구 질문
- RQ1에피소드 간 방문 불일치를 기반으로 한 계산 효율적인 탐색 방법이 기존 내재 보상 방법보다 샘플 효율성에서 뛰어나게 성능을 냈는가?
- RQ2메모리나 표현 학습에 의존하지 않고도 REVD가 에피소드 간 강력한 탐색 유도를 유지하는가?
- RQ3희박한 보상 환경에서 RE3, RIDE, NGU와 같은 최신 기술(SOTA)과 비교해 REVD의 성능과 안정성은 어떠한가?
- RQ4REVD는 이산(Atari) 및 연속 제어(PyBullet) 과제 모두에서 학습 효율성을 향상시킬 수 있는가?
- RQ5제안된 방문 불일치 지표는 에피소드 수준의 탐색 향상 정도를 신뢰할 수 있고 정량적으로 측정 가능한가?
주요 결과
- REVD는 모든 6종의 Atari 게임에서 밀도 높은 보상과 희박한 보상 환경에서 샘플 효율성을 크게 향상시켰으며, PPO+RIDE, PPO+RE3, 및 일반 PPO를 능가했다.
- Atari의 희박한 보상 설정에서, REVD는 Assault 환경에서 진동하는 학습 곡선을 기록하여 강력하고 지속적인 탐색 유도를 보였다.
- PyBullet 로봇 환경에서, PPO+REVD는 Walker 2D에서 평균 에피소드 수익이 가장 높았고, Hopper 및 Humanoid 과제에서는 가장 빠른 수렴 속도를 기록했다.
- Cart Pole 과제에서는 PPO+REVD가 환경 스텝 수를 최소로 사용하여 과제를 해결하여 뛰어난 샘플 효율성을 입증했다.
- A2C+REVD는 Half Cheetah 및 Humanoid 포함 모든 PyBullet 과제에서 일반 A2C를 능가하여, REVD가 다양한 강화학습 알고리즘에 걸쳐 뛰어난 강건성을 보임을 확인했다.
- 모든 평가된 과제에서 밀도 높은 보상과 희박한 보상 설정 모두에서 REVD는 벤치마크 방법을 일관되게 능가하여 그 효과성과 일반화 능력을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.