Skip to main content
QUICK REVIEW

[논문 리뷰] Measuring the Reliability of Reinforcement Learning Algorithms

Stephanie C. Y. Chan, Samuel H. Fishman|arXiv (Cornell University)|2019. 12. 10.
Reinforcement Learning in Robotics참고 문헌 29인용 수 41
한 줄 요약

이 논문은 시간, 실행 수, 고정 정책 롤아웃에 걸친 분산과 위험을 정량화하는 일련의 오픈 소스 신뢰성 메트릭과 비교를 위한 비모수 통계 테스트를 정의한다.

ABSTRACT

Lack of reliability is a well-known issue for reinforcement learning (RL) algorithms. This problem has gained increasing attention in recent years, and efforts to improve it have grown substantially. To aid RL researchers and production users with the evaluation and improvement of reliability, we propose a set of metrics that quantitatively measure different aspects of reliability. In this work, we focus on variability and risk, both during training and after learning (on a fixed policy). We designed these metrics to be general-purpose, and we also designed complementary statistical tests to enable rigorous comparisons on these metrics. In this paper, we first describe the desired properties of the metrics and their design, the aspects of reliability that they measure, and their applicability to different scenarios. We then describe the statistical tests and make additional practical recommendations for reporting results. The metrics and accompanying statistical tools have been made available as an open-source library at https://github.com/google-research/rl-reliability-metrics. We apply our metrics to a set of common RL algorithms and environments, compare them, and analyze the results.

연구 동기 및 목표

  • 시드, 환경, 구현 간의 높은 가변성으로 인해 RL에서 신뢰성을 정량화할 필요성을 촉구한다.
  • 훈련 중 및 학습 후 다양한 가변성 측면을 포착하는 범용 신뢰성 메트릭을 정의한다.
  • 분산과 위험을 구분하고, 훈련 중 평가와 학습 후 평가를 구분한다.
  • 엄격하고 비교 가능한 신뢰성 분석을 가능하게 하는 통계 도구와 보고 권고를 제공한다.

제안 방법

  • 세 가지 가변성 축을 정의한다: 훈련 중 시간에 따른 가변성, 훈련 중 실행 간 가변성, 학습 후 고정 정책 롤아웃의 가변성.
  • 각 축에 대해 두 가지 가변성 측정치를 사용한다: 분산(중위값 대비 IQR 같은 강건한 통계)과 위험(CVaR)을 사용하여 꼬리 두꺼움을 포착한다.
  • 훈련 곡선을 트렌드 제거하고 슬라이딩 윈도우 내에서 IQR을 적용하여 시간에 따른 분산을 계산한다.
  • 성능의 1차 차이에 대한 CVaR을 사용하여 시간의 단기적 위험을 계산한다.
  • 실행 중 최대값 대비 다운드로우에 대한 CVaR을 사용하여 시간의 장기적 위험을 계산한다.
  • 실행 간 분산은 저통과 필터링된 실행 성능들의 IQR로 계산하고, 실행 간 위험은 실행 간 CVaR로 계산한다.
  • 고정 정책 롤아웃 간 분산은 고정 정책 롤아웃들의 IQR로, 고정 정책 롤아웃 간 위험은 이 롤아웃들에 대한 CVaR로 계산한다.
  • 평가 주기에 대한 불변성을 다루고 비교를 위해 부트스트래핑 신뢰구간과 치환 검정을 사용한다.
  • 공정한 비교를 가능하게 하려면 모든 메트릭을 창 크기, 필터링, 평가 주기 등을 명확히 지정하고 정규화하여 보고할 것을 권고한다.

실험 결과

연구 질문

  • RQ1환경과 시드에 걸친 평균/중앙값 성능을 넘어 RL의 신뢰성은 어떻게 정량화될 수 있는가?
  • RQ2알고리즘과 환경 간의 신뢰성 메트릭을 비교하기 위한 강건한 통계 도구는 무엇인가?
  • RQ3신뢰성 패턴이 중앙값 성능과 일치하는가 아니면 벗어나 있는가, 그리고 환경별 분석이 강점/약점을 드러낼 수 있는가?
  • RQ4연구 간 공정하고 재현 가능한 비교를 가능하게 하려면 결과를 어떻게 보고해야 하는가?

주요 결과

  • 신뢰성 메트릭은 중앙값 성능으로 포착되지 않는 차이를 자주 드러내며, 평균 성능이 강한 알고리즘이 신뢰성이 떨어질 수 있고 그 반대의 경우도 있다.
  • 연속 제어 실험에서 SAC와 TD3는 훈련 중 신뢰성이 강하지만 학습 후 신뢰성 측면에서 훈련 성능에 비해 성능이 떨어질 수 있다.
  • Atari 실험에서 Rainbow가 더 나은 중앙값 성능일 수 있지만 IQN이 여러 메트릭에서 더 강한 신뢰성을 보일 수 있다.
  • 신뢰성 패턴은 환경에 따라 달라질 수 있어 집계 결과와 함께 환경별 분석의 가치를 강조한다.
  • 신뢰성 메트릭과 통계 도구의 채택을 돕기 위한 오픈 소스 파이썬 패키지가 이 연구와 함께 제공된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.