Skip to main content
QUICK REVIEW

[논문 리뷰] Continuous-action Reinforcement Learning for Playing Racing Games: Comparing SPG to PPO

Mario Holubar, Marco Wiering|arXiv (Cornell University)|2020. 01. 15.
Reinforcement Learning in Robotics참고 문헌 16인용 수 8
한 줄 요약

이 논문은 OpenAI Gym용 연속 제어 레이싱 환경을 소개하고, 무작위로 생성된 트랙에서 자동차를 제어하는 데 있어 샘플드 정책 기울기(SPG)와 근접 정책 최적화(PPO)를 비교한다. SPG에 대한 가중치가 부여된 행동 샘플링 확장과 성능을 훼손하지 않으면서 학습 속도를 향상시키는 하이브리드 경험 재현 기법을 제안하며, 경험 재현 기법을 적용한 SPG가 PPO를 능가하는 것으로 밝혀졌고, PPO는 연속 행동 공간에서 경험 재현 기법의 이점을 얻지 못함을 확인하였다.

ABSTRACT

In this paper, a novel racing environment for OpenAI Gym is introduced. This environment operates with continuous action- and state-spaces and requires agents to learn to control the acceleration and steering of a car while navigating a randomly generated racetrack. Different versions of two actor-critic learning algorithms are tested on this environment: Sampled Policy Gradient (SPG) and Proximal Policy Optimization (PPO). An extension of SPG is introduced that aims to improve learning performance by weighting action samples during the policy update step. The effect of using experience replay (ER) is also investigated. To this end, a modification to PPO is introduced that allows for training using old action samples by optimizing the actor in log space. Finally, a new technique for performing ER is tested that aims to improve learning speed without sacrificing performance by splitting the training into two parts, whereby networks are first trained using state transitions from the replay buffer, and then using only recent experiences. The results indicate that experience replay is not beneficial to PPO in continuous action spaces. The training of SPG seems to be more stable when actions are weighted. All versions of SPG outperform PPO when ER is used. The ER trick is effective at improving training speed on a computationally less intensive version of SPG.

연구 동기 및 목표

  • 딥 강화 학습 알고리즘을 평가하기 위한 새로운 확장 가능한 연속 행동 레이싱 환경을 개발하기 위해.
  • 복잡하고 현실과 유사한 역학적 특성을 지닌 연속 제어 환경에서 SPG와 PPO의 성능을 비교하기 위해.
  • 연속 행동 공간에서 경험 재현 기법이 PPO와 SPG에 미치는 영향을 조사하기 위해.
  • 학습 속도를 향상시키면서 성능를 유지하는 데 목적이 있는 새로운 하이브리드 경험 재현 기법을 제안하고 평가하기 위해.
  • SPG의 학습 안정성과 성능을 향상시키기 위한 새로운 가중치 기반 행동 샘플링 방법을 도입하고 테스트하기 위해.

제안 방법

  • 속도, 조향, 트랙 제약 조건을 포함한 실제 자동차 역학을 시뮬레이션하는 연속 상태 및 행동 공간을 갖춘 OpenAI Gym 내 커스터마이징 레이싱 환경을 개발하였다.
  • 행동를 샘플링하고 정책를 업데이트하기 위해 Q-값 네트워크를 사용한 SPG를 구현하였으며, 정책 업데이트 시 높은 가치를 가진 행동을 우선시하는 가중치 기반 샘플링 전략을 적용하였다.
  • 연속 행동 공간에서 경험 재현 기법을 사용할 수 있도록 로그 공간에서 작동하도록 PPO를 수정하여, 오래된 행동 확률을 재가중하는 방식으로 구현하였다.
  • 학습을 두 단계로 나누는 하이브리드 경험 재현 기법을 제안하였으며, 첫 번째 단계에서는 경험 버퍼의 전이 데이터로 학습하고, 두 번째 단계에서는 최근 경험 데이터로 학습함으로써 학습 속도를 가속화하면서도 성능를 유지하였다.
  • 액터 및 크리틱 네트워크에 활성화 함수로 tanh를 사용한 다층퍼셉트론(MLP)을 사용하였으며, 각 에피소드마다 별도의 최적화 단계와 미니배치 SGD를 적용하였다.
  • 통계적 탄탄성과 공정성을 확보하기 위해 서로 다른 무작위로 생성된 레이싱 트랙을 사용하여 각 알고리즘에 대해 다섯 번의 독립적인 실행을 수행하였다.

실험 결과

연구 질문

  • RQ1경험 재현 기법은 연속 행동 강화 학습 과제에서 PPO의 학습 성능을 향상시키는가?
  • RQ2가중치 기반 행동 샘플링 전략은 연속 제어 환경에서 SPG의 안정성과 성능을 향상시키는가?
  • RQ3오래된 경험과 최근 경험을 조합하는 하이브리드 경험 재현 기법은 SPG의 학습 속도와 최종 성능에 어떤 영향을 미치는가?
  • RQ4경험 재현 기법이 적용된 경우, SPG는 연속 행동 레이싱 환경에서 PPO를 능가하는가?
  • RQ5제안된 로그 공간 기반 PPO 변형은 연속 행동 공간에서 경험 재현 기법의 효과적인 사용을 얼마나 잘 가능하게 하는가?

주요 결과

  • 경험 재현 기법은 연속 행동 공간에서 PPO의 성능 향상에 기여하지 않으며, 표준 및 로그 공간 기반 변형 모두 유사한 결과를 보이며 재현 기법으로부터 유의미한 성능 향상을 얻지 못함.
  • 하이브리드 경험 재현 기법은 SPG의 학습 속도를 크게 향상시키며, 최종 성능를 유지하거나 초월함으로써 표준 및 다중 에포크 SPG 변형보다 뛰어난 성능를 보임.
  • SPG에서 가중치 기반 행동 샘플링은 성능 정점 수를 줄이고 분산을 낮추어 더 안정적인 학습을 이끌어내지만, 최종 성능 향상에는 크게 기여하지 않음.
  • 경험 재현 기법을 적용한 SPG는 모든 설정에서 PPO를 일관되게 능가하며, 하이브리드 재현 기법을 사용할 경우 빠른 1에포크 SPG 변형이 느린 다중 에포크 버전과 동일한 성능를 달성함.
  • PPO는 경험 재현 기법의 이점을 얻지 못하며, 혼합된 재현 데이터를 사용하는 로그 공간 기반 변형은 기울기 폭발 문제로 인해 장기적인 학습이 불가능함.
  • 다중 에포크 SPG 변형은 1에포크 버전보다 더 불안정하며, 더 자주 부정적인 보상 정점이 나타남을 확인하여, SPG에 대해 단순한 학습 스케줄링 방식이 더 바람직할 수 있음.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.