Skip to main content
QUICK REVIEW

[논문 리뷰] A new Potential-Based Reward Shaping for Reinforcement Learning Agent

Babak Badnava, Mona Esmaeili|arXiv (Cornell University)|2019. 02. 17.
Reinforcement Learning in Robotics인용 수 4
한 줄 요약

이 논문은 에이전트의 학습 과정 자체에서 지식을 추출하기 위해 에피소드 누적 보상값을 사용하여 보상 구조를 동적으로 형상화하는 새로운 보상 기반 보상 형상화 방법을 제안한다. 상대적 성능(예: 최고/최악의 에피소드 대비) 기반으로 잠재 함수를 모델링함으로써, 단일 및 다중 작업 강화 학습 환경에서 학습 속도를 가속화하고, Breakout 및 Pong과 같은 아케이드 게임에서 학습 속도와 최종 성능에 있어 뚜렷한 향상을 보였다.

ABSTRACT

Potential-based reward shaping (PBRS) is a particular category of machine learning methods which aims to improve the learning speed of a reinforcement learning agent by extracting and utilizing extra knowledge while performing a task. There are two steps in the process of transfer learning: extracting knowledge from previously learned tasks and transferring that knowledge to use it in a target task. The latter step is well discussed in the literature with various methods being proposed for it, while the former has been explored less. With this in mind, the type of knowledge that is transmitted is very important and can lead to considerable improvement. Among the literature of both the transfer learning and the potential-based reward shaping, a subject that has never been addressed is the knowledge gathered during the learning process itself. In this paper, we presented a novel potential-based reward shaping method that attempted to extract knowledge from the learning process. The proposed method extracts knowledge from episodes' cumulative rewards. The proposed method has been evaluated in the Arcade learning environment and the results indicate an improvement in the learning process in both the single-task and the multi-task reinforcement learner agents.

연구 동기 및 목표

  • 전이 학습 및 보상 형상화 분야에서 아직 미비하게 다뤄진, 학습 과정 자체에서 지식을 추출하는 데에 있어 격차를 해소하기 위해.
  • 과거 에피소드의 성능 피드백을 활용하여 향후 학습을 이끄는 방법을 개발하기 위해.
  • 최적 정책을 변경하지 않고 샘플 효율성과 학습 속도를 향상시키기 위해.
  • 각 작업이 자체 최적의 잠재 함수를 유지할 수 있도록 다중 작업 강화 학습으로 방법을 확장하기 위해.
  • 표준 기준 기반 방법을 사용하여 아케이드 학습 환경에서 방법의 실증적 타당성을 검증하기 위해.

제안 방법

  • 이 방법은 에이전트의 에피소드 보상 R^ep(i)를 상한 R_u^ep(t,i) 및 하한 R_l^ep(t,i)에 대해 상대적으로 기반으로 한 잠재 함수 φ(s,a,t,i)를 정의한다.
  • R(s,a) ≠ 0일 경우, 잠재 함수는 φ(s,a,t,i) = 1 + (R^ep(i) - R_u^ep(t,i)) / (R_u^ep(t,i) - R_l^ep(t,i)) 로 구성되며, 그렇지 않으면 0이다.
  • 표준 PBRS 공식을 사용하여 보상 형상화 함수 F를 잠재 함수에서 유도한다: F(s,s') = γφ(s') - φ(s), 최적 정책을 유지한다.
  • 학습 중에 에피소드 보상 범위의 누적 추정치를 사용하여 잠재 함수를 동적으로 업데이트한다.
  • 이 방법은 어떤 강화 학습 알고리즘과도 호환되며, Q-학습 및 정책 기반 강화 학습 방법에 적용된다.
  • 다중 작업 강화 학습의 경우, 잠재 함수에 작업별 전용 파라미터를 사용한다(식 23), 각 작업이 자체 최적 정책을 유지하도록 보장한다.

실험 결과

연구 질문

  • RQ1에이전트의 학습 과정에서 추출된 지식—특히 에피소드 누적 보상값—은 강화 학습에서 샘플 효율성을 향상시킬 수 있는가?
  • RQ2상대적 성능(예: 최고 대비 최악의 에피소드) 기반으로 보상을 형상화할 경우 학습 속도와 최종 정책 품질에 어떤 영향을 미치는가?
  • RQ3제안된 방법은 각 작업의 최적 정책를 유지하면서 다중 작업 강화 학습으로 효과적으로 확장될 수 있는가?
  • RQ4이 방법은 Breakout 및 Pong과 같은 희박 보상 환경에서 표준 기준 기반 방법보다 우수한 성능을 보일 수 있는가?

주요 결과

  • Breakout 환경에서, 제안된 방법은 두 기준 기반 방법보다 학습 곡선 아래 면적에서 더 높은 성능을 기록하여 더 빠른 학습과 더 나은 최종 성능을 보였다.
  • Pong 환경에서는 다소의 향상이 있었으며, 한 기준 기반 방법보다 더 큰 곡선 아래 면적을 기록했지만, Breakout만큼 뚜렷한 성과 향상은 관찰되지 않았다.
  • Pong과 Breakout를 동시에 학습하는 다중 작업 에이전트의 경우, 보상 형상화 없이 사용된 기준 기반 방법 대비 평균 성능이 더 뛰어났다.
  • PBRS 이론에 따라 유효한 잠재 함수를 사용함으로써, 모든 테스트 환경에서 최적 정책을 성공적으로 유지하였다.
  • 최대 및 최소 에피소드 보상값이 사전에 알려져 있거나, 학습 중에 추정되는 두 가정 하에, 이 방법은 강건성을 보였다.
  • 결과적으로, 에피소드 수준의 성능에서 추출된 자기 지식이 강화 학습에서 학습 속도와 정책 품질을 크게 향상시킬 수 있음을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.