Skip to main content
QUICK REVIEW

[논문 리뷰] Off-Policy Deep Reinforcement Learning by Bootstrapping the Covariate Shift

Carles Gelada, Marc G. Bellemare|arXiv (Cornell University)|2019. 01. 27.
Reinforcement Learning in Robotics참고 문헌 20인용 수 6
한 줄 요약

이 논문은 확률단체 위에 투영이 필요 없도록 할인 인자와 소프트 정규화 페널티를 도입함으로써 가치 함수 발산 문제를 해결하는 안정적인 오프-폴리시 딥 강화학습 방법인 할인된 COP-TD를 제안한다. 아케이드 게임에서 평가한 결과, 특히 Pong과 다섯 개의 아케이드 환경에서 기준 오프-폴리시 방법보다 안정성과 성능이 향상됨.

ABSTRACT

In this paper we revisit the method of off-policy corrections for reinforcement learning (COP-TD) pioneered by Hallak et al. (2017). Under this method, online updates to the value function are reweighted to avoid divergence issues typical of off-policy learning. While Hallak et al.'s solution is appealing, it cannot easily be transferred to nonlinear function approximation. First, it requires a projection step onto the probability simplex; second, even though the operator describing the expected behavior of the off-policy learning algorithm is convergent, it is not known to be a contraction mapping, and hence, may be more unstable in practice. We address these two issues by introducing a discount factor into COP-TD. We analyze the behavior of discounted COP-TD and find it better behaved from a theoretical perspective. We also propose an alternative soft normalization penalty that can be minimized online and obviates the need for an explicit projection step. We complement our analysis with an empirical evaluation of the two techniques in an off-policy setting on the game Pong from the Atari domain where we find discounted COP-TD to be better behaved in practice than the soft normalization penalty. Finally, we perform a more extensive evaluation of discounted COP-TD in 5 games of the Atari domain, where we find performance gains for our approach.

연구 동기 및 목표

  • 비선형 함수 근사가 적용될 때 오프-폴리시 딥 강화학습에서 발생하는 불안정성과 수렴 문제를 해결하기 위해.
  • 딥 네트워크에 적용했을 때 COP-TD의 한계—특히 확률단체 위에 투영이 필요하고 수축 사상 성질이 부족한 점—을 극복하기 위해.
  • 공변수 이탈 기반 전이 재가중을 통해 리play 기반 오프-폴리시 설정에서 샘플 효율성과 학습 안정성을 향상시키기 위해.
  • 할인된 COP-TD와 소프트 정규화의 효과를 검증하기 위해, 특히 아케이드 2600 도메인에서의 성능을 평가하기 위해.

제안 방법

  • 이론적 안정성을 향상시키고 가치 함수 오차가 무한대로 발산하는 것을 방지하기 위해, COP-TD 업데이트 규칙에 할인 인자 γ̂를 도입함.
  • 계산 비용이 높은 확률단체 위에 투영하는 단계를 대체할 수 있는 온라인으로 최소화할 수 있는 소프트 정규화 페널티를 제안함.
  • 깊은 신경망을 사용하여 공변수 이탈 비율 c(s) = d_π(s)/d_μ(s)를 예측함. 여기서 d_π와 d_μ는 각각 타겟 정책과 행동 정책 하의 정적 상태 분포임.
  • 예측된 비율을 사용해 시간 차이 업데이트를 재가중함으로써, 오프-폴리시 데이터의 분포 이탈을 효과적으로 보정함.
  • 공변수 이탈 예측을 샘플링 우선순위로 사용하여 우선순위 기반 경험 재생을 적용함으로써 데이터 효율성을 향상시킴.
  • Pong과 다섯 개의 아케이드 게임을 사용해 실증 평가를 수행하였으며, 다양한 하이퍼파라미터와 샘플링 방식 간의 성능을 비교함.

실험 결과

연구 질문

  • RQ1COP-TD에 할인 인자를 도입함으로써 딥 강화학습에서 안정성과 수렴 성질이 향상되는가?
  • RQ2소프트 정규화 페널티는 확률단체 위에 명시적인 투영이 필요 없이 성능을 유지할 수 있는가?
  • RQ3예측된 공변수 이탈 비율이 복잡한 환경에서 타겟 정책 하의 실제 상태 확률과 얼마나 관련이 있는가?
  • RQ4공변수 이탈을 우선순위 신호로 사용함으로써 오프-폴리시 학습에서 샘플 효율성이 향상되는가?
  • RQ5할인 인자 γ̂의 선택이 예측된 비율과 최종 에이전트 성능에 어떤 영향을 미치는가?

주요 결과

  • 할인된 COP-TD는 원래의 COP-TD와 소프트 정규화 기준선보다 Pong 환경에서 더 뛰어난 안정성과 성능을 보였으며, 특히 균일 샘플링 조건에서 두드러짐.
  • 소프트 정규화 페널티는 학습 불안정성을 줄였지만, Pong과 전체 아케이드 스위트에서 할인된 COP-TD에 비해 성능이 열 劣함.
  • 실증 결과에 따르면 예측된 비율 c(s)는 타겟 정책 π 하에서 가능성이 높은 상태(예: 성공적인 볼 리턴)와 가능성이 낮은 상태(예: 상대편이 골을 넣을 위험한 상태)를 효과적으로 구분함.
  • 낮은 c(s) 값을 가진 상태들은 주로 에이전트가 지고 있거나 질 위험이 있는 상태들임을 확인함으로써, 모델이 의미 있는 분포 이탈을 학습하고 있음을 확인함.
  • 공변수 이탈을 우선순위 신호로 사용함으로써 학습 효율성이 향상되었으며, 게임에 따라 효과가 다름. 특히 균일 샘플링 조건에서 스페이스 인베이더에서 두드러진 성과 기록.
  • 평균 예측 비율은 증가하는 γ̂와 함께 단조롭게 감소함을 확인함. 이는 비율이 0으로 붕괴할 위험이 있음을 시사하지만, γ̂ = 0.9999일 때조차 발산 현상은 관찰되지 않음.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.