[논문 리뷰] On-Policy Deep Reinforcement Learning for the Average-Reward Criterion
이 논문은 장기 평균 보상 기준을 직접 최적화함으로써 계속되는 작업을 위한 새로운 온정책 딥 강화학습 알고리즘, 평균 보상 TRPO (ATRPO)를 제안한다. 평균 정책 발산과 케멘디의 상수를 기반으로 이론적으로 타당한 정책 향상 경계를 유도하여 단조적 정책 향상을 가능하게 하며, 이는 도전적인 MuJoCo 환경에서 표준 TRPO보다 뚜렷이 뛰어난 성능을 보인다. 특히 고차원 제어 작업에서 두각을 나타낸다.
We develop theory and algorithms for average-reward on-policy Reinforcement Learning (RL). We first consider bounding the difference of the long-term average reward for two policies. We show that previous work based on the discounted return (Schulman et al., 2015; Achiam et al., 2017) results in a non-meaningful bound in the average-reward setting. By addressing the average-reward criterion directly, we then derive a novel bound which depends on the average divergence between the two policies and Kemeny's constant. Based on this bound, we develop an iterative procedure which produces a sequence of monotonically improved policies for the average reward criterion. This iterative procedure can then be combined with classic DRL (Deep Reinforcement Learning) methods, resulting in practical DRL algorithms that target the long-run average reward criterion. In particular, we demonstrate that Average-Reward TRPO (ATRPO), which adapts the on-policy TRPO algorithm to the average-reward criterion, significantly outperforms TRPO in the most challenging MuJuCo environments.
연구 동기 및 목표
- 표준 딥 강화학습 알고리즘이 할인 수익을 최적화하는 데 반해, 실제 세계의 계속되는 작업은 장기 평균 보상 최대화가 요구됨으로써 발생하는 괴리 문제를 해결한다.
- 기존의 할인 설정에서 유도된 정책 향상 경계가 평균 보상 MDP에 적용될 때 겪는 한계를 극복한다.
- 장기 평균 보상 차이에 대한 새로운 하한을 사용하여 평균 보상 기준을 직접 최적화하는 이론적으로 타당한 온정책 알고리즘을 개발한다.
- 표준 TRPO에 비해 고차원적이고 도전적인 MuJoCo 제어 벤치마크에서 제안된 방법의 실용적 슈퍼리오리티를 입증한다.
- 현대 딥 강화학습 파ip라인, 특히 온정책 알고리즘에 평균 보상 최적화를 통합할 수 있는 프레임워크를 수립한다.
제안 방법
- 두 정책 간 평균 보상의 차이에 대한 새로운 하한을 유도하며, 이는 평균 정책 발산과 마코프 체인의 혼합 시간을 측정하는 케멘디의 상수에 의존한다.
- 이 경계를 최대화하면 평균 보상에서 단조적 향상이 이루어지며, 이는 할인 보상 설정으로부터의 정책 향상 정리가 평균 보상 설정으로 확장됨을 보여준다.
- 신뢰 영역 정책 최적화(TRPO) 알고리즘을 평균 보상 기준에 맞게 수정하여 평균 보상 TRPO(ATRPO) 알고리즘을 도출한다.
- 가치 함수 근사에 일반화된 이점 추정(GAE)을 사용하고, 배치별로 이점을 정규화하여 학습 안정성을 높인다.
- 무한 수평선 동역학을 시뮬레이션하고 할인 방법과의 공정한 비교를 가능하게 하기 위해 MuJoCo 환경에 리셋 비용 메커니즘을 구현한다.
- 동일한 초모수와 난수 시드를 사용하여 ATRPO와 TRPO를 학습 및 평가하며, 다양한 길이의 평가 트레이젝터리를 사용해 성능 안정성을 평가한다.
실험 결과
연구 질문
- RQ1할인 수익 기반 경계가 실패하는 맥락에서, 평균 보상 기준에 대해 이론적으로 타당한 정책 향상 경계를 도출할 수 있는가?
- RQ2딥 강화학습에서 계속되는 작업에 대해 평균 보상 기준을 직접 최적화하는 것이 큰 할인 인자 사용보다 더 나은 성능을 내는가?
- RQ3고차원 MuJoCo 제어 작업에서 ATRPO는 표준 TRPO에 비해 샘플 효율성과 최종 성능 측면에서 어떻게 비교되는가?
- RQ4무한 수평선 동역학을 시뮬레이션하기 위해 사용하는 리셋 비용과 같은 초모수에 ATRPO의 성능이 민감한가?
- RQ5제안된 평균 보상 프레임워크는 TRPO와 같은 현대적인 온정책 딥 강화학습 알고리즘과 효과적으로 조합될 수 있는가?
주요 결과
- 평균 보상 설정에 대해 유도된 정책 향상 경계는 의미가 있으며, 이는 이전의 할인 기반 경계가 실패하는 맥락에서 단조적 향상을 보장한다.
- ATRPO는 모든 MuJoCo 환경에서 TRPO를 뚜렷이 능가하며, 특히 Humanoid와 Ant와 같은 가장 도전적인 작업에서 성능 향상이 두드러진다.
- 리셋 비용을 넓게 변화시켜도 ATRPO는 강건한 성능을 유지하며, 시뮬레이션 설정에서의 초모수 선택에 대한 민감성이 낮음을 보여준다.
- 리셋 비용이 있는 경우와 없는 경우 모두 TRPO보다 ATRPO가 뛰어난 성능을 보이며, 이는 개선 효과가 리셋 메커니즘 때문이 아니라 근본적인 평균 보상 최적화 덕분임을 입증한다.
- ATRPO와 TRPO의 성능 격차는 더 긴 평가 트레이젝터리(예: 10,000단계)에서 더욱 커지며, 이는 ATRPO가 할인 기반 기준보다 장기적 행동을 더 잘 포착함을 확인한다.
- 이론적 경계에 케멘디의 상수를 사용함으로써 체인 혼합의 의미 있는 측정값을 제공하며, 이는 이론적 성질과 실용적 알고리즘 설계를 연결한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.