Skip to main content
QUICK REVIEW

[논문 리뷰] Reinforcement Learning by Comparing Immediate Reward

Punit Pandey, Deepshikha Pandey|arXiv (Cornell University)|2010. 09. 14.
Reinforcement Learning in Robotics참고 문헌 2인용 수 5
한 줄 요약

이 논문은 누적 보상 신호에 의존하지 않고 현재의 즉각적 보상과 이전 단계의 보상을 비교하여 행동을 선택하는 새로운 Q-학습 변종을 제안한다. 과거 성능 대비 더 높은 즉각적 보상을 제공하는 행동을 우선시함으로써, 최적의 Q-값에 수렴하는 데 필요한 에피소드 수를 줄이며, 표준 Q-학습에 비해 20×20 그리드 월드 환경에서 더 빠른 학습을 보여준다.

ABSTRACT

This paper introduces an approach to Reinforcement Learning Algorithm by comparing their immediate rewards using a variation of Q-Learning algorithm. Unlike the conventional Q-Learning, the proposed algorithm compares current reward with immediate reward of past move and work accordingly. Relative reward based Q-learning is an approach towards interactive learning. Q-Learning is a model free reinforcement learning method that used to learn the agents. It is observed that under normal circumstances algorithm take more episodes to reach optimal Q-value due to its normal reward or sometime negative reward. In this new form of algorithm agents select only those actions which have a higher immediate reward signal in comparison to previous one. The contribution of this article is the presentation of new Q-Learning Algorithm in order to maximize the performance of algorithm and reduce the number of episode required to reach optimal Q-value. Effectiveness of proposed algorithm is simulated in a 20 x20 Grid world deterministic environment and the result for the two forms of Q-Learning Algorithms is given.

연구 동기 및 목표

  • 누적 보상에 의존하고 간헐적으로 음수 보상을 받는 데 기인한 표준 Q-학습의 느린 수렴 문제를 해결하기 위해.
  • 강화 학습 작업에서 최적의 Q-값에 도달하기 위해 필요한 에피소드 수를 줄이기 위해.
  • 상대적 보상 비교를 사용하여 행동 선택을 하는 모델에 의존하지 않는, 상호작용 가능한 학습 방법을 개발하기 위해.
  • 상대적 보상 기반 학습의 효과성을 결정적인 그리드 월드 환경에서 평가하기 위해.

제안 방법

  • 알고리즘은 현재의 즉각적 보상과 바로 이전 행동의 보상을 비교한다.
  • 행동는 현재의 즉각적 보상이 이전 행동의 보상보다 높을 경우에만 선택된다.
  • Q-값 갱신 규칙은 상대적 보상 비교를 통합하여 시간이 지남에 따라 향상되는 것을 선호하도록 수정된다.
  • 방법은 표준 Q-학습과 유사한 모델에 의존하지 않는 설정에서 작동하지만, 수정된 탐색 및 선택 전략을 사용한다.
  • 알고리즘은 성능을 시뮬레이션하고 평가하기 위해 결정적인 20×20 그리드 월드 환경을 사용한다.
  • 성능는 최적의 Q-값에 도달하기 위해 필요한 에피소드 수로 측정되며, 제안된 방법과 표준 Q-학습 간 비교된다.

실험 결과

연구 질문

  • RQ1과거 보상과의 비교를 통해 즉각적 보상을 평가함으로써 강화 학습의 학습 속도가 향상되는가?
  • RQ2상대적 보상 기반 선택 메커니즘이 최적의 Q-값에 도달하기 위해 필요한 에피소드 수를 줄일 수 있는가?
  • RQ3결정적인 그리드 월드 환경에서 제안된 알고리즘이 표준 Q-학습에 비해 어떻게 성능을 내는가?
  • RQ4보상 비교는 수렴 안정성과 성능에 어떤 영향을 미치는가?

주요 결과

  • 제안된 상대적 보상 기반 Q-학습 알고리즘은 표준 Q-학습보다 더 적은 에피소드 수로 최적의 Q-값에 수렴한다.
  • 이전 단계보다 낮거나 정체된 즉각적 보상을 제공하는 행동을 피함으로써 알고리즘이 더 빠른 학습을 보인다.
  • 20×20 그리드 월드 환경에서 새로운 방법은 최적 성능에 도달하기 위해 필요한 에피소드 수를 크게 줄였다.
  • 결과는 상대적 보상 비교가 모델에 의존하지 않는 강화 학습에서 학습 효율성을 향상시킨다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.