Skip to main content
QUICK REVIEW

[논문 리뷰] Action Noise in Off-Policy Deep Reinforcement Learning: Impact on Exploration and Performance

Jakob Hollenstein, Sayantan Auddy|arXiv (Cornell University)|2022. 06. 08.
Reinforcement Learning in Robotics인용 수 6
한 줄 요약

이 논문은 연속 제어를 위한 오프-폴리시 딥 강화 학습에서 행동 노이즈의 영향을 조사하며, 가우시안 및 옴스타인-울렌벡 노이즈 유형과 스케일을 비교한다. 노이즈 스케일을 훈련 중에 줄이는 것이 성능과 내성에 유리하다는 것을 발견했으며, 상태공간 커버리지 효율을 더 잘 평가하기 위해 새로운 상태공간 커버리지 지표 X_Urel을 제안한다.

ABSTRACT

Many Deep Reinforcement Learning (D-RL) algorithms rely on simple forms of exploration such as the additive action noise often used in continuous control domains. Typically, the scaling factor of this action noise is chosen as a hyper-parameter and is kept constant during training. In this paper, we focus on action noise in off-policy deep reinforcement learning for continuous control. We analyze how the learned policy is impacted by the noise type, noise scale, and impact scaling factor reduction schedule. We consider the two most prominent types of action noise, Gaussian and Ornstein-Uhlenbeck noise, and perform a vast experimental campaign by systematically varying the noise type and scale parameter, and by measuring variables of interest like the expected return of the policy and the state-space coverage during exploration. For the latter, we propose a novel state-space coverage measure $\operatorname{X}_{\mathcal{U} ext{rel}}$ that is more robust to estimation artifacts caused by points close to the state-space boundary than previously-proposed measures. Larger noise scales generally increase state-space coverage. However, we found that increasing the space coverage using a larger noise scale is often not beneficial. On the contrary, reducing the noise scale over the training process reduces the variance and generally improves the learning performance. We conclude that the best noise type and scale are environment dependent, and based on our observations derive heuristic rules for guiding the choice of the action noise as a starting point for further optimization.

연구 동기 및 목표

  • 오프-폴리시 딥 강화 학습에서 행동 노이즈 유형(Gaussian 대비 Ornstein-Uhlenbeck)과 스케일이 탐색 및 학습 성능에 미치는 영향을 조사하기 위해.
  • 훈련 시간에 걸쳐 행동 노이즈의 영향을 감소시키는(노이즈 스케줄) 것이 정책 성능과 분산에 미치는 영향을 평가하기 위해.
  • 경계 추정 오류를 완화하는 데 더 강력한 상태공간 커버리지 지표 X_Urel을 개발하고 검증하기 위해.
  • 환경 특성에 기반한 행동 노이즈 설정을 선택하기 위한 히우리스틱 가이드라인을 유도하기 위해.
  • 여섯 가지 연속 제어 벤치마크에서 DDPG, TD3, SAC, detSAC를 다양한 노이즈 조건 하에서 경험적으로 비교하기 위해.

제안 방법

  • 여러 알고리즘과 환경을 통해 행동 노이즈 유형(Gaussian, Ornstein-Uhlenbeck), 스케일(σ = 0.1에서 1.7까지), 노이즈 감소 스케줄(β 감쇠)을 체계적으로 변화시킨다.
  • 기존 지표에 비해 상태공간 경계 근처의 추정 오류에 덜 민감한 새로운 상태공간 커버리지 측정법 X_Urel을 제안한다.
  • 산만한 실험 캠페인을 통해 여섯 가지 환경(Mountain-Car, Inverted-Pendulum-Swingup, Reacher, Hopper, Walker2D, Half-Cheetah)을 활용한다.
  • 기대 수익을 성능 측정 기준으로, 상태공간 커버리지로 탐색 성능을 측정하며, 10회 독립 실행의 중앙값 수익과 사분자구간을 사용한다.
  • 훈련 중 노이즈 영향 요소 β를 감소시켜 탐색적 행동에서 이용적 행동으로의 전환을 시뮬레이션한다.
  • 공정한 비교를 위해 이전 연구(Raffin, 2020)에서 최적화된 초모수를 사용하여 노이즈 설정의 영향을 고립한다.

실험 결과

연구 질문

  • RQ1오프-폴리시 DRL에서 가우시안과 옴스타인-울렌벡 행동 노이즈의 선택이 학습 성능와 상태공간 커버리지에 미치는 영향은 무엇인가?
  • RQ2행동 노이즈 스케일을 증가시키는 것이 다양한 환경에서 상태공간 커버리지와 최종 정책 성능에 미치는 영향는 무엇인가?
  • RQ3훈련 시간에 걸쳐 노이즈 영향(β)을 감소시키는 것이 학습 성능 향상과 분산 감소에 기여하는가?
  • RQ4제안된 X_Urel 지표는 이전 커버리지 측정법 대비 경계 효과에 대해 얼마나 더 강력한가?
  • RQ5환경 역학과 탐색 요구사항에 기반해 행동 노이즈 유형과 스케일을 선택하기 위한 히우리스틱 규칙는 무엇인가?

주요 결과

  • 가우시안 및 옴스타인-울렌벡 노이즈의 선택은 환경에 따라 달라지며, 어느 것도 보편적으로 우월하지 않다. 특히 Mountain-Car와 같은 환경에서는 성능 차이가 뚜렷하게 관찰된다.
  • 행동 노이즈 스케일을 증가시키면 상태공간 커버리지가 일관되게 증가하지만, 종종 최종 학습 성능를 저하시켜 탐색의 광범위성과 학습 효율성 사이의 트레이드오프를 보여준다.
  • 훈련 시간에 걸쳐 노이즈 영향 요소 β를 감소시키는 것은 대부분의 환경에서 성능 향상에 기여하며, 실행 간 성능 분산을 크게 감소시킨다.
  • 제안된 X_Urel 지표는 이전 측정법 대비 상태공간 경계 근처의 점들에 대한 민감도를 낮춰 더 강력한 상태공간 커버리지 추정을 제공한다.
  • 노이즈 설정에서 가장 중요한 요소는 노이즈 스케일 σ이다: 덜 커버리지가 필요한 경우 작은 스케일이 바람직하며, 더 넓은 탐색이 필요할 경우 큰 스케일을 사용할 수 있다.
  • 목표 지점에 도달하는 궤적을 발견한 후에는 노이즈 영향의 스케줄적 감소를 일반 전략으로 권장한다. 이는 내성과 성능 향상에 기여한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.