Skip to main content
QUICK REVIEW

[논문 리뷰] Expert-augmented actor-critic for ViZDoom and Montezumas Revenge

Michal Garmulewicz, Henryk Michalewski|arXiv (Cornell University)|2018. 09. 10.
Reinforcement Learning in Robotics참고 문헌 25인용 수 6
한 줄 요약

이 논문은 ACKTR와 전문가 트레이젝터리에서의 지도학습을 통합한 전문가 보강형 액터-크리틱 방법을 제안하여 희박 보상 환경에서의 탐색을 향상시킨다. 이 방법은 몬테주마의 레비우스에서 최신 기준 성능을 기록하며 일관되게 27,000점 이상을 기록하고, 일부 실행에서는 전문가 데이터를 초월한다. 또한 커리큘럼 학습 없이 ViZDoom의 MyWayHome 미로에서 효율적인 학습을 가능하게 한다.

ABSTRACT

We propose an expert-augmented actor-critic algorithm, which we evaluate on two environments with sparse rewards: Montezumas Revenge and a demanding maze from the ViZDoom suite. In the case of Montezumas Revenge, an agent trained with our method achieves very good results consistently scoring above 27,000 points (in many experiments beating the first world). With an appropriate choice of hyperparameters, our algorithm surpasses the performance of the expert data. In a number of experiments, we have observed an unreported bug in Montezumas Revenge which allowed the agent to score more than 800,000 points.

연구 동기 및 목표

  • 강화학습에서 희박 보상 문제를 해결하기 위해, 무작위 탐색이 비효율적이고 샘플 비효율적인 환경에서의 과제를 다루기 위해.
  • 몬테주마의 레비우스 및 ViZDoom의 MyWayHome와 같은 환경에서 샘플 효율성과 탐색을 향상시키기 위해, 희박 보상이 학습을 방해하는 문제를 개선하기 위해.
  • 반복적인 전문가 상호작용 없이도 전문가 시범을 모델-프리 액터-크리틱 프레임워크에 통합할 수 있는 실용적인 방법을 개발하기 위해.
  • 전문가 보강 학습이 고수준 계획이 요구되고 희박 보상이 존재하는 환경에서 전문가 성능을 초월할 수 있는지 평가하기 위해.

제안 방법

  • 이 방법은 사전 기록된 전문가 트레이젝터리에서의 지도학습 기반 단일 전문가 모방 손실 항목과 ACKTR 알고리즘을 통합한다.
  • 핵심 혁신은 전문가 데이터를 정 politi gradient 업데이트에 통합하는 단일 공식(식 1)을 사용하여 오차가 누적되지 않도록 하면서 탐색을 이끌어내는 것이다.
  • 전문가 손실은 전문가 데이터의 미니배치에 적용되며, 정규화 파라미터 λ_expert 가 정책 업데이트에 미치는 영향을 조절한다.
  • 학습 안정성과 수렴성을 향상시키기 위해, 크로네커-분해 자연 기울기 최적화를 통한 트러스트 영역 접근 방식을 사용한다.
  • 고정된 전문가 시범과 커리큘럼 없이 몬테주마의 레비우스 및 ViZDoom의 MyWayHome에서 평가한다.
  • γ = 0.995 및 λ_expert = 0.125, 0.25, 또는 0.5와 같은 하이퍼파라미터를 조정하여 성능을 최적화한다.

실험 결과

연구 질문

  • RQ1전문가 보강형 액터-크리틱 학습이 희박 보상 환경에서 전문가 시범에 비해 뛰어난 성능을 내는가?
  • RQ2전문가 데이터를 ACKTR와 조합함으로써 몬테주마의 레비우스와 같은 환경에서 샘플 효율성과 탐색이 향상되는가?
  • RQ3커리큘럼 학습이나 추가 보조 보상 없이도 이 방법이 ViZDoom의 MyWayHome 미로에서 효과적인 탐색을 학습할 수 있는가?
  • RQ4λ_expert 와 γ 에 있어 전문가 손실과 정책 기울기 손실 간 최적의 균형은 무엇인가?
  • RQ5이 방법은 보고되지 않은 환경 버그를 이용하는가, 그리고 전문가 트레이젝터리 이상의 성능을 달성할 수 있는가?

주요 결과

  • 전문가 보강형 액터-크리틱 방법은 몬테주마의 레비우스에서 평균 점수 27,052점을 기록했으며, 최고 성능의 실행에서는 804,900점에 도달하여 평가의 86%에서 전문가 트레이젝터리를 초월했다.
  • 일부 실행에서 에이전트는 몬테주마의 레비우스에서 보고되지 않은 버그를 악용하여 최고 804,900점의 점수를 기록했다.
  • 이 방법은 전문가 시범이 거의 완벽한 상황에서도 뿐만 아니라 575점에 그친 행동 클로닝보다 뛰어난 성능을 보였다.
  • ViZDoom의 MyWayHome 미로에서, 전문가 보강 방법은 500만 번의 행동 이내에 뛰어난 성능을 달성했고, 커리큘럼 학습 없이도 모델-프리 ACKTR 기준선은 실패했다.
  • 최적의 하이퍼파라미터는 γ = 0.995 및 λ_expert = 0.125였으며, λ_expert 가 너무 높거나 너무 낮을 경우 성능이 크게 떨어졌다.
  • 중간 정책을 사용할 경우 16%의 경우에서 전문가 데이터 자체보다 뛰어난 성능을 기록했고, 최고 성능 정책을 사용할 경우 86%의 경우에서 전문가 데이터를 초월했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.