Skip to main content
QUICK REVIEW

[논문 리뷰] Average-reward model-free reinforcement learning: a systematic review and literature mapping

Vektor Dewanto, George Dunn|arXiv (Cornell University)|2020. 10. 18.
Reinforcement Learning in Robotics참고 문헌 106인용 수 17
한 줄 요약

이 논문은 표본 평균 보상 모델-프리(reward) 강화학습에 대한 체계적 리뷰와 문헌 맵핑을 제시하며, 이전 연구에서 표본 가치 반복 이외의 정책 반복 및 함수 근사 방법을 포함하여 범위를 확장한다. 주요 연구 격차를 특정하고, 특히 함수 근사 설정에서의 정책 반복 개발 부족과 탐색 및 가치 함수 근사 문제를 제기하며, 분야의 종합적인 분류 체계와 향후 연구 방향을 제시한다.

ABSTRACT

Reinforcement learning is important part of artificial intelligence. In this paper, we review model-free reinforcement learning that utilizes the average reward optimality criterion in the infinite horizon setting. Motivated by the solo survey by Mahadevan (1996a), we provide an updated review of work in this area and extend it to cover policy-iteration and function approximation methods (in addition to the value-iteration and tabular counterparts). We present a comprehensive literature mapping. We also identify and discuss opportunities for future work.

연구 동기 및 목표

  • 1996년 Mahadevan의 서베이를 초월하여 평균 보상 무모델 강화학습에 대한 최신이고 종합적인 리뷰를 제공하기 위해.
  • 값 반복 및 표본 방법에 그치지 않고 정책 반복 및 함수 근사 방법까지 범위를 확장하기 위해.
  • 메타 분류도 및 표를 활용하여 기존 문헌을 체계적으로 맵핑하여 방법 간의 관계를 명확히 하기 위해.
  • 특히 탐색, 가치 함수 근사, 비에르고딕(MDP)에 대한 적용성 문제와 같은 열린 연구 문제를 특정하고 논의하기 위해.
  • 배치 학습, 분포적 시각, 다중 체인 MDP 등 아직 탐색되지 않은 분야를 강조하여 향후 연구를 이끌기 위해.

제안 방법

  • 논문은 유한 상태 및 행동 공간을 가진 모델-프리, 무한 수명, 평균 보상 강화학습에 중점을 두고 체계적 문헌 리뷰를 수행한다.
  • 기존 연구를 값 반복 및 정책 반복 기반으로 분류하고, 표본 및 함수 근사 설정을 별도로 분석한다.
  • 기여도 근사, 가치 함수 근사, 행동-가치 근사 기반으로 방법 간의 관계를 보여주는 네 가지 문헌 맵(분류 체계)를 제시한다.
  • 평균 보상 Q-학습, RVI 유사 알고리즘, 유전도 트레이스를 갖춘 액터-크리틱 방법의 핵심 수식을 도입하고 분석한다.
  • 정책 기반 강화학습 방법에서의 세 가지 이점 근사 선택 사례를 비교 분석하고, 액터-크리틱 학습에서 유전도 트레이스의 역할을 논의한다.
  • 동적 프rogramming 및 마르코프 결정 과정 이론적 기반을 활용하여 강화학습 방법을 맥락화한다.

실험 결과

연구 질문

  • RQ1왜 평균 보상 무모델 강화학습에서, 특히 함수 근사 설정에서 정책 반복 기반 연구가 값 반복보다 훨씬 적은가?
  • RQ2액터-크리틱 방법에서 뒤쪽 시각 유전도 트레이스는 기울기 기반 업데이트의 모멘텀과 어떻게 의미 있게 연결될 수 있는가?
  • RQ3평균 보상 강화학습에서 가치 함수 근사를 위한 가장 효과적인 기저 함수는 무엇이며, 그 선택은 성능에 어떤 영향을 미치는가?
  • RQ4정책 기반 강화학습 알고리즘에서 사용 가능한 세 가지 이점 근사 방법 중에서 샘플 효율성과 수렴성에 가장 유익한 것은 무엇인가?
  • RQ5평균 보상 강화학습은 다중 체인 MDP나 연속 상태 공간으로 확장될 수 있으며, 이러한 확장에 대한 이론적 기초는 무엇인가?

주요 결과

  • 특히 함수 근사 설정에서 평균 보상 강화학습의 정책 반복 방법은 값 반복에 비해 크게 탐색되지 않았다.
  • 값 반복 기반 방법, 예를 들어 평균 보상 Q-학습은 탐색에 민감하며, 학습 안정화를 위해 최적의 기여도 오프셋을 신중하게 다뤄야 한다.
  • 액터-크리틱 방법에서의 유전도 트레이스는 SGD에서의 모멘텀과 유사하여 시간적 신뢰도 할당과 최적화 역학 간의 깊은 연결을 시사한다.
  • 이점 근사 방법의 선택은 정책 기반 강화학습 성능에 상당한 영향을 미치며, 모든 환경에서 유일한 최적 방법은 존재하지 않는다.
  • 다중 체인 MDP에 대한 기존의 무모델 평균 보상 강화학습 방법은 존재하지 않으며, 연속 상태 공간에 대해서도 제한된 연구만 존재하여 주요 열린 과제로 남아 있다.
  • 논문은 할인 보상 방법이 종종 평균 보상 강화학습의 대체 수단으로 사용되지만, 이는 현재 문헌에서 다루지 않은 근사 오차를 유발한다는 점을 밝혀냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.