Skip to main content
QUICK REVIEW

[논문 리뷰] Internal Model from Observations for Reward Shaping

Daiki Kimura, Subhajit Chaudhury|arXiv (Cornell University)|2018. 06. 02.
Reinforcement Learning in Robotics참고 문헌 28인용 수 13
한 줄 요약

이 논문은 전문가 전용 상태 경로(예: 게임 영상)에서 내부 예측 모델을 학습하여 액션 레이블이 필요 없이 조밀한 내재 보상(reward)을 생성하는 강화학습 방법을 제안한다. 실제 상태와 예측된 상태 간의 차이를 측정함으로써, 에이전트는 전문가 시연에 가까운 행동을 유도하기 위해 보상을 형상화한다. 이는 슈퍼 마리오 브라더스 및 플래피 버드와 같은 환경에서 희박한 보상이나 수작업으로 만든 보상보다 더 빠르고 안정적인 학습을 달성한다.

ABSTRACT

Reinforcement learning methods require careful design involving a reward function to obtain the desired action policy for a given task. In the absence of hand-crafted reward functions, prior work on the topic has proposed several methods for reward estimation by using expert state trajectories and action pairs. However, there are cases where complete or good action information cannot be obtained from expert demonstrations. We propose a novel reinforcement learning method in which the agent learns an internal model of observation on the basis of expert-demonstrated state trajectories to estimate rewards without completely learning the dynamics of the external environment from state-action pairs. The internal model is obtained in the form of a predictive model for the given expert state distribution. During reinforcement learning, the agent predicts the reward as a function of the difference between the actual state and the state predicted by the internal model. We conducted multiple experiments in environments of varying complexity, including the Super Mario Bros and Flappy Bird games. We show our method successfully trains good policies directly from expert game-play videos.

연구 동기 및 목표

  • 강화학습에서 희박하거나 가용하지 않은 보상 함수 문제를 해결하기 위해.
  • 액션 시퀀스에 접근할 수 없더라도 전문가 상태 경로만으로도 모방 학습을 가능하게 하기 위해.
  • 내부 예측 모델링을 활용해 정책 학습을 이끄는 보상 형상화 방법을 개발하기 위해.
  • 비디오 시연만으로도 조밀하고 의미 있는 보상 신호를 도출할 수 있음을 입증하기 위해.

제안 방법

  • 에이전트는 전문가 플레이 비디오의 상태 시퀀스에서 다음 프레임을 예측하는 3D-CNN 기반 내부 모델을 학습한다.
  • 내부 모델은 액션 또는 보상 정보 없이 상태 경로만으로 훈련된다.
  • 강화학습 중에 에이전트는 실제 다음 상태와 내부 모델의 예측 상태 간의 L2 거리의 음수를 보상으로 계산한다.
  • 무의미한 해법(예: 초기 상태에서 멈춰 있는 것)을 방지하기 위해 임계값 기반 메커니즘이 적용된다.
  • 보상 함수는 조밀하고 내재된 형태로 설계되어 전문가 유사 상태 전이를 유도한다.
  • 이 방법은 슈퍼 마리오 브라더스 및 플래피 버드와 같은 환경에서 DQN, DDPG, PPO를 사용해 시연 영상만으로 평가된다.

실험 결과

연구 질문

  • RQ1액션 또는 보상 신호 없이 게임 영상의 전문가 상태 경로만으로 강화학습 에이전트가 양호한 정책을 학습할 수 있는가?
  • RQ2내부 모델 예측 기반 보상 형상화 방법의 성능이 수작업으로 만든 조밀한 보상과 궁금증 기반 방법과 비교해 어떻게 되는가?
  • RQ3내부 모델이 조밀하고 의미 있는 보상 신호를 생성하여 희박한 보상보다 더 빠르고 안정적인 학습을 가능하게 할 수 있는가?
  • RQ4다양한 작업 복잡도를 가진 다른 환경에서 내부 모델의 일반화 능력은 어느 정도인가?
  • RQ5초기화 조건 ζ와 같은 초모수에 대해 이 방법의 민감도는 어떻게 되며, 모델 아키텍처는 성능에 어떤 영향을 미치는가?

주요 결과

  • 제안된 방법은 슈퍼 마리오 브라더스 환경에서 수작업으로 만든 조밀한 보상과 궁금증 기반 방법보다 더 빠른 학습 수렴을 달성했다.
  • 희박한 보상 조건에서는 300만 스텝 후에도 평균 위치가 650에 머물러 목표에 일관되게 도달하지 못한 반면, 제안된 방법은 더 신뢰성 있게 뛰어난 성능을 보였다.
  • 내부 모델 기반 보상은 궁금증 기반 및 점수 기반 보상보다 학습 속도와 최종 정책 품질 측면에서 뛰어났다.
  • 이 방법은 액션 주석이나 보상 신호 없이도 비디오 시연만으로 에이전트를 성공적으로 훈련시켰다.
  • 임계값 ζ의 사용은 초기 상태에서 정지하는 등의 무의미한 정책을 방지하는 데 핵심적이었다.
  • 깊은 네트워크와 고해상도 입력을 사용할수록 성능이 향상되어 향후 최적화 여정이 남아 있음을 시사했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.