Skip to main content
QUICK REVIEW

[논문 리뷰] ANS: Adaptive Network Scaling for Deep Rectifier Reinforcement Learning Models

Yueh-Hua Wu, Fan-Yun Sun|arXiv (Cornell University)|2018. 09. 06.
Reinforcement Learning in Robotics참고 문헌 22인용 수 3
한 줄 요약

이 논문은 딥 ReLU 기반 강화학습 에이전트의 성능을 햖스키기 위해 훈련 중 보상 스케일을 동적으로 조정하는 방법인 적응형 네트워크 스케일링(ANS)을 제안한다. ANS는 ReLU 네트워크가 최적의 보상 스케일을 자동으로 발견할 수 있도록 하여 고정 스케일 및 ELU, 시그모이드와 같은 다른 활성화 함수보다 뛰어난 성능을 발휘한다. Actor-critic 모델에서 특히 그렇다.

ABSTRACT

This work provides a thorough study on how reward scaling can affect performance of deep reinforcement learning agents. In particular, we would like to answer the question that how does reward scaling affect non-saturating ReLU networks in RL? This question matters because ReLU is one of the most effective activation functions for deep learning models. We also propose an Adaptive Network Scaling framework to find a suitable scale of the rewards during learning for better performance. We conducted empirical studies to justify the solution.

연구 동기 및 목표

  • 보상 스케일링이 딥 ReLU 기반 강화학습 모델에 미치는 영향, 특히 死신 ReLU 문제와의 관계를 조사하기 위해.
  • 포화되지 않는 활성화 함수인 ReLU가 직관적으로 포화 활성화 함수의 결과와는 반대로 더 큰 보상 스케일에서 유리한지 여부를 판단하기 위해.
  • 재훈련이 필요 없이 최적의 보상 스케일을 자동으로 찾는 방법을 개발하여 샘플 효율성과 최종 성능을 향상시키기 위해.
  • actor-critic 프레임워크 내에서 다양한 활성화 함수(ReLU, ELU, Leaky-ReLU, 시그모이드, 탄젠트)에 대한 보상 스케일링의 영향을 평가하기 위해.

제안 방법

  • 누적 보상 향상에 기반해 훈련 중 보상 스케일을 동적으로 조정하는 적응형 네트워크 스케일링(ANS) 프레임워크를 제안한다.
  • 누적 수익이 향상되면 스케일 요소가 곱셈적으로 증가하고, 정체가 지속되면 감소하며, 설정 가능한 파라미터 $ c_{\text{inc}} $ 및 $ c_{\text{dec}} $ 를 사용한다.
  • 네트워크 아키텍처를 수정하지 않으며 최적 스케일에 대한 사전 지식이 필요 없이 DDPG 및 A2C와 같은 actor-critic 알고리즘에 ANS를 통합한다.
  • 최근 $ T $ 에피소드 또는 프레임 동안의 성능을 기반으로 스케일 조정 여부를 판단하기 위해 허용 오차 기준 $ T $ 를 사용한다.
  • 활성화 포화와 훈련 안정성의 지표로 삼기 위해 사기성 ReLU 유닛의 비율(가짜 사망 ReLU)을 모니터링한다.
  • 진동을 방지하기 위해 스케일링 요소 업데이트를 부드럽게 하기 위해 $ \beta = 0.9 $ 의 감쇠 메커니즘을 사용한다.

실험 결과

연구 질문

  • RQ1보상 스케일링은 ReLU 기반 딥 강화학습 모델의 성능에 어떤 영향을 미치며, 시그모이드나 탄젠트와 같은 포화 활성화 함수의 행동과 다를까?
  • RQ2딥 RL 에이전트에서 보상 스케일링과 사망 ReLU 문제 사이의 관계는 무엇인가?
  • RQ3Leaky-ReLU 및 ELU와 같은 비포화 활성화 함수는 RL 훈련에서 다양한 보상 스케일에 어떻게 반응하는가?
  • RQ4재훈련 없이도 훈련 중 최적의 보상 스케일을 자동으로 발견할 수 있는 적응 메커니즘을 설계할 수 있는가?

주요 결과

  • ANS는 성능을 크게 향상시킨다: ANS를 적용한 DDPG는 HalfCheetah-v2에서 평균 수익 9393.24를 기록하여 원본 ReLU DDPG(7944.54)와 ELU(7899.17)를 모두 능가한다.
  • ANS를 적용한 A2C는 HalfCheetah-v2에서 3689.64를 기록하여 모든 다른 활성화 함수와 Pop-Art(−455.57)를 뛰어넘었다.
  • 고정된 보상 스케일 없이도 ANS를 적용한 ReLU 네트워크는 ELU, 시그모이드, 탄젠트를 사용한 모델보다도 더 뛰어난 샘플 효율성과 최종 성능을 보였다.
  • ReLU에 최적의 보상 스케일은 일반적으로 예상보다 크며, ANS는 스케일을 64까지 증가시켰다가 감소시키는 경향이 있어 더 큰 스케일이 학습에 유리함을 시사한다.
  • 가짜 사망 ReLU 유닛의 비율은 보상 스케일과 최종 누적 수익과 강하게 상관되어 있어, 이는 활성화 포화와 훈련 안정성의 유용한 진단 지표로 검증되었다.
  • 평균이 0이고 분산이 1인 조건을 강제하는 Pop-Art는 ANS와 원본 ReLU 모델보다도 성능이 열 劣하므로, ReLU를 사용하는 actor-critic 방법에 있어서는 최적의 방법이 아님을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.