[논문 리뷰] Reinforcement Learning with Probabilistically Complete Exploration
이 논문은 희박 보상 강화 학습 환경에서 정책 초기화를 위한 고품질 시범을 생성하기 위해 빠르게 탐색하는 랜덤 트리(RRT) 계획을 사용하는 빠르게 랜덤으로 탐색하는 강화 학습(R3L)을 제안한다. 강화 학습 미세조정 이전에 RRT를 사용해 성공적인 경로를 찾음으로써 R3L는 표준 및 내재 탐색 방법에 비해 더 빠른 수렴, 더 낮은 샘플 복잡도, 향상된 강인성을 달성한다.
Balancing exploration and exploitation remains a key challenge in reinforcement learning (RL). State-of-the-art RL algorithms suffer from high sample complexity, particularly in the sparse reward case, where they can do no better than to explore in all directions until the first positive rewards are found. To mitigate this, we propose Rapidly Randomly-exploring Reinforcement Learning (R3L). We formulate exploration as a search problem and leverage widely-used planning algorithms such as Rapidly-exploring Random Tree (RRT) to find initial solutions. These solutions are used as demonstrations to initialize a policy, then refined by a generic RL algorithm, leading to faster and more stable convergence. We provide theoretical guarantees of R3L exploration finding successful solutions, as well as bounds for its sampling complexity. We experimentally demonstrate the method outperforms classic and intrinsic exploration techniques, requiring only a fraction of exploration samples and achieving better asymptotic performance.
연구 동기 및 목표
- 랜덤 탐색이 비효율적인 희박 보상 환경에서 강화 학습의 높은 샘플 복잡도 문제를 해결하기 위해.
- 랜덤 초기화에 대한 의존도를 줄이고 정책 그래디언트 방법의 랜덤 시드에 대한 강인성을 향상시키기 위해.
- 인간 전문 지식 없이도 효과적인 시범을 자동으로 생성할 수 있는 방법을 개발하기 위해.
- 강화 학습에서 탐색의 해의 완전성과 샘플링 복잡도에 대한 이론적 보장을 제공하기 위해.
- 표준 강화 학습 알고리즘인 TRPO와 DDPG의 점근적 성능과 수렴 속도를 향상시키기 위해.
제안 방법
- 상태 공간에서 탐색 문제로 강화 학습 탐색을 재정의하고, RRT를 사용해 성공적인 경로를 탐색한다.
- RRT 해에서 유도된 시범을 생성하여 기울기가 비영인 영역에서 정책 파라미터를 초기화한다.
- TRPO나 DDPG와 같은 일반적인 강화 학습 알고리즘을 사용해 RRT로 생성된 초기화 상태에서 정책을 미세조정한다.
- R3L가 확률적으로 완전하고 샘플링 복잡도에 대한 경계를 도출할 수 있는 이론적 보장을 제공한다.
- 편향이 없는 그래디언트 추정기와 함께 확률적 경사 하강법을 사용하고, 더 나은 초기화로 분산 감소를 고려한다.
- R3L의 탐색 타임스텝을 총 샘플 수에 포함시켜 탐색과 학습을 통합한다.
실험 결과
연구 질문
- RQ1RRT를 활용한 계획 기반 탐색이 희박 보상 강화 학습에서 샘플 복잡도를 크게 감소시킬 수 있는가?
- RQ2RRT로 생성된 시범으로 정책을 초기화하면 수렴 속도와 점근적 성능이 향상되는가?
- RQ3R3L는 TRPO와 같은 정책 그래디언트 방법의 랜덤 시드에 따른 변동성을 줄일 수 있는가?
- RQ4R3L는 나쁜 랜덤 초기화에 강인하며 내재 또는 랜덤 탐색 전략보다 더 효과적인가?
- RQ5R3L의 탐색 단계에 대해 해의 완전성과 샘플링 복잡도에 대해 어떤 이론적 보장을 제공할 수 있는가?
주요 결과
- 모든 테스트 환경에서 중앙값과 상위 사분위수 성능 측면에서 R3L는 바닐라 TRPO와 DDPG, VIME-TRPO를 모두 능가한다.
- R3L-TRPO와 R3L-DDPG는 기준선 방법에 비해 더 빠르게 수렴하고 더 높은 최종 할인되지 않은 수익을 달성한다.
- R3L의 하위 사분위수 성능은 기준선에 비해 유의미하게 높아, 랜덤 시드와 초기화에 대한 민감도가 낮아졌다.
- R3L는 표준 방법에 비해 탐색 샘플 수의 일부분만으로도 충분하며, 결과에서 탐색 단계가 명확하게 표시되어 있다.
- R3L의 사전 훈련은 DDPG의 본질적 불안정성을 완화시켜 성능 저하 후 복구를 가능하게 한다.
- 정보가 풍부한 기울기 영역에서 초기화함으로써 점근적 성능을 향상시키고 정책 그래디언트 업데이트의 분산을 감소시킨다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.