Skip to main content
QUICK REVIEW

[논문 리뷰] Simplifying Deep Reinforcement Learning via Self-Supervision

Daochen Zha, Kwei-Herng Lai|arXiv (Cornell University)|2021. 06. 10.
Reinforcement Learning in Robotics참고 문헌 45인용 수 12
한 줄 요약

이 논문은 자기 레이블링된 고보상 트레이젝터리에 대한 단순한 지도 학습 회귀를 사용하여 딥 강화학습 에이전트를 훈련하는 자기지도 강화학습(SSRL)을 제안한다. 반복적으로 고보상 에피소드를 수집하고 이를 지도 학습으로 모방함으로써 SSRL은 정책 기울기나 가치 네트워크 없이도 안정적이고 샘플 효율적인 정책 향상을 달성하며, 다양한 환경에서 PPO와 DQN에 비해 훈련 안정성과 속도에서 뛰어나거나 동등한 성능을 보인다.

ABSTRACT

Supervised regression to demonstrations has been demonstrated to be a stable way to train deep policy networks. We are motivated to study how we can take full advantage of supervised loss functions for stably training deep reinforcement learning agents. This is a challenging task because it is unclear how the training data could be collected to enable policy improvement. In this work, we propose Self-Supervised Reinforcement Learning (SSRL), a simple algorithm that optimizes policies with purely supervised losses. We demonstrate that, without policy gradient or value estimation, an iterative procedure of ``labeling" data and supervised regression is sufficient to drive stable policy improvement. By selecting and imitating trajectories with high episodic rewards, SSRL is surprisingly competitive to contemporary algorithms with more stable performance and less running time, showing the potential of solving reinforcement learning with supervised learning techniques. The code is available at https://github.com/daochenzha/SSRL

연구 동기 및 목표

  • 딥 강화학습의 불안정성과 높은 분산 문제를 지도 학습 기법의 안정성에 기반해 해결하고자 한다.
  • 지난 학습 기반 손실만으로도 강화학습에서 안정적이고 효과적인 정책 향상이 가능할지 조사하고자 한다.
  • 훈련 중 전문가 데이터가 없을 경우 고품질의 시연 데이터를 식별하는 과제를 해결하고자 한다.
  • 복잡한 정책 기반 또는 가치 기반 딥 RL 알고리즘의 간단하고 확장 가능하며 효율적인 대안을 개발하고자 한다.

제안 방법

  • SSRL은 반복적인 두 단계 과정을 사용한다: (1) 현재 정책에서 롤아웃을 수집하고 에피소드 수익 기반으로 상위 성능을 보인 트레이젝터리를 선별하고, (2) 선별된 고보상 트레이젝터리에 대해 지도 학습 회귀를 통해 새로운 정책을 훈련시킨다.
  • 이 알고리즘은 최고 성능을 보인 에피소드를 '시범'으로 간주하고 가치 함수나 정책 기울기 신호 없이 이를 모방하는 지도 학습을 수행한다.
  • 랭킹 버퍼는 과거의 고보상 트레이젝터리를 저장하고 재사용하여 샘플 효율성과 학습 안정성을 향상시킨다.
  • 이 방법은 오프-폴리시 방식으로 작동하여 이전 정책 버전에서 수집된 데이터를 새로운 정책 훈련에 활용할 수 있다.
  • 이 방법은 누적 보상이 가장 높은 트레이젝터리를 식별하고 우선순위를 정하는 단순한 랭킹 기반 선택 메커니즘에 의존한다.
  • 정책 네트워크는 선별된 트레이젝터리의 상태-행동 쌍에 대해 표준 지도 학습 회귀 손실(예: 평균 제곱 오차)을 사용하여 훈련된다.

실험 결과

연구 질문

  • RQ1정책 기울기나 가치 추정 없이 순수한 지도 학습 접근 방식이 강화학습에서 안정적이고 효과적인 정책 향상을 달성할 수 있는가?
  • RQ2전문가 시범 데이터가 없을 경우 고품질의 시범 데이터를 자동으로 식별하고 정책 훈련에 활용할 수 있는가?
  • RQ3자기지도를 통해 반복적으로 시범 세트를 개선함으로써 정책 향상이 단조롭게 이루어지는가?
  • RQ4이 자기지도 접근 방식이 PPO와 DQN과 같은 기존의 모델-프리 강화학습 알고리즘에 비해 샘플 효율성과 훈련 안정성에서 동등하거나 뛰어난 성능을 낼 수 있는가?

주요 결과

  • SSRL은 훈련 중 거의 단조로운 정책 향상을 달성하여 표준 딥 RL 알고리즘에 비해 뛰어난 안정성을 보였다.
  • Atari Pong와 같은 환경에서 SSRL은 PPO와 DQN과 동등하거나 뛰어난 성능을 보였으며, 실행 시간이 훨씬 적게 소요되었다.
  • 이 알고리즘은 이산 및 연속 제어 작업을 포함한 고차원 이미지 입력 환경에서도 경쟁력 있는 샘플 효율성과 안정적인 학습 성능를 보였다.
  • 어려운 탐색 영역에서는 카운트 기반 탐색을 사용한 SSRL이 목표에 성공하는 반면, A2C는 실패하여, 희박한 보상 환경에서의 강건성을 입증했다.
  • 이 방법은 계산적으로 경량이며 쉽게 구현할 수 있으며, 최소한의 하이퍼파rameter 튜닝이 필요하고 가치 함수 추정이 불필요하다.
  • 이론적 분석을 통해 SSRL은 결정성 MDP에서 정책 향상 보장을 보장함으로써 그 경험적 성공에 대한 공식적 기반을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.