Skip to main content
QUICK REVIEW

[논문 리뷰] An Empirical Study on Hyperparameters and their Interdependence for RL Generalization

Xingyou Song, Yilun Du|arXiv (Cornell University)|2019. 06. 02.
Neural Networks and Applications참고 문헌 11인용 수 9
한 줄 요약

이 논문은 딥 강화학습(Deep RL)에서 초파ram터 간의 상호의존성과 일반화에 미치는 영향을 조사하며, 학습-테스트 기울기 정렬을 분석하기 위한 핵심 지표로 기울기余弦유사도(GCS)를 사용한다. 연구 결과, 할인 인자(γ), 확률성, 정규화와 같은 초파라미터는 상호 독립적이지 않으며, 이들의 상호작용은 일반화에 크게 영향을 미친다. 비단조화적인 GCS 패턴은 종종 테스트 성능의 불안정성과 열악한 결과를 예측한다.

ABSTRACT

Recent results in Reinforcement Learning (RL) have shown that agents with limited training environments are susceptible to a large amount of overfitting across many domains. A key challenge for RL generalization is to quantitatively explain the effects of changing parameters on testing performance. Such parameters include architecture, regularization, and RL-dependent variables such as discount factor and action stochasticity. We provide empirical results that show complex and interdependent relationships between hyperparameters and generalization. We further show that several empirical metrics such as gradient cosine similarity and trajectory-dependent metrics serve to provide intuition towards these results.

연구 동기 및 목표

  • 고립된 튜닝을 넘어서 딥 RL의 초파라미터가 일반화 성능에 미치는 영향을 이해하는 것.
  • γ, 확률성, 정규화와 같은 초파라미터가 일반화에 미치는 영향이 상호직교하는지 아니면 상호의존적인지 조사하는 것.
  • 기울기 여시유사도(GCS)와 같은 궤적 기반 지표가 일반화 실패를 예측하는 데 유용한지 평가하는 것.
  • GCS가 RL에서 손실 표면의 매끄러움과 학습 안정성의 대체 지표로 얼마나 견고한지 평가하는 것.
  • 데이터 증강과 보상 함수의 복잡성이 GCS가 일반화 예측자로서의 신뢰성에 미치는 영향을 탐색하는 것.

제안 방법

  • 초파라미터 θ에 대한 분포에서 샘플링된 학습 및 테스트 MDP를 기반으로 RL 일반화를 지도학습의 유사성으로 수리적으로 정의한다.
  • 학습 및 테스트 정책 기울기 간의 기울기 여시유사도(GCS)를 주요 지표로 사용하여 정렬성과 표면의 매끄러움을 평가한다.
  • 편향을 최소화하기 위해 일관된 초파라미터를 사용한 PPO 및 정책 기울기 알고리즘을 적용한다.
  • 최적화 역학과 안정성을 분석하기 위해 기울기 노름, 분산 및 ℓ₂ 가중치 노름을 측정한다.
  • 관측값에 무작위 형태 추가를 통해 데이터 증강을 적용하고, 그 기울기 정렬에 미치는 영향을 분석한다.
  • CoinRun 및 RandomMazes와 같은 환경에서 γ와 확률성을 다양하게 조절하여, 이들의 조합이 테스트 성능 및 GCS에 미치는 영향을 연구한다.

실험 결과

연구 질문

  • RQ1γ, 행동 확률성, 정규화와 같은 초파라미터가 RL 일반화에 영향을 미치는 방식에서 상호의존성은 어떻게 작용하는가?
  • RQ2기울기 여시유사도(GCS)가 RL에서 테스트 성능의 불안정성을 신뢰성 있게 예측할 수 있는 정도는 어느 정도인가?
  • RQ3보상 함수의 복잡성이 증가하면 GCS와 테스트 성능 간 상관관계가 약화되는가?
  • RQ4확률성이 γ의 허용 가능한 범위를 높여, 높은 테스트 성능를 달성하는 데 영향을 미치는가?
  • RQ5기울기 여시유사도(GCS)와 같은 궤적 기반 지표는 RL 학습에서 과적합 또는 날카로운 최소값의 조기 징후를 감지할 수 있는가?

주요 결과

  • 많은 초파라미터는 상호직교하지 않으며, 한 초파라미터의 영향이 다른 초파라미터의 영향의 단조성과 반대로 바뀔 수 있다.
  • 비단조화적으로 감소하는 GCS 패턴은 불안정한 테스트 성능과 성능 저하와 강하게 상관되며, 종종 돌연한 실패 이전에 나타난다.
  • 확률성이 수렴 이전에도 기울기 노름을 크게 감소시켜 더 안정적인 최적화 경로를 나타낸다.
  • 낮은 테스트 성능를 유도하는 높은 γ 값은 에이전트가 하위 최적 정책로 수렴함으로써 학습 분포에 과적합됨을 시사한다.
  • 미로와 같은 복잡한 환경에서는 확률성이 고성능 테스트 성능를 얻을 수 있는 γ 값의 범위를 넓혀주며, 탐색 능력과 내성적 안정성이 향상됨을 나타낸다.
  • 보상 함수가 더 복잡해지면(GCS가 다층 CNN을 사용하는 등), GCS는 단조롭게 감소하지만 테스트 성능와의 상관관계를 상실한다. 이는 GCS가 고복잡도 조건에서는 항상 신뢰할 수 없다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.