Skip to main content
QUICK REVIEW

[논문 리뷰] Importance Weighted Transfer of Samples in Reinforcement Learning

Andrea Tirinzoni, Andrea Sessa|arXiv (Cornell University)|2018. 05. 28.
Reinforcement Learning in Robotics참고 문헌 19인용 수 19
한 줄 요약

이 논문은 중요도 가중치를 부여한 피팅된 Q-반복법(Importance Weighted Fitted Q-Iteration, IWFQI)을 제안한다. IWFQI는 다수의 소스 태스크에서 수집한 경험 샘플을 타겟 태스크로 전이하기 위해, 각 샘플이 타겟 MDP 하에서의 가능성에 기반해 중요도 가중치를 할당하는 배치 강화학습 방법이다. 보상 및 전이 동역학을 가우시안 프로세스로 모델링함으로써, IWFQI는 관련성 없거나 해로운 샘플을 적응적으로 낮게 평가하여, 최신 기술 대비 더 뛰어난 성능과 부정적 전이에 대한 강건성을 확보한다.

ABSTRACT

We consider the transfer of experience samples (i.e., tuples < s, a, s', r >) in reinforcement learning (RL), collected from a set of source tasks to improve the learning process in a given target task. Most of the related approaches focus on selecting the most relevant source samples for solving the target task, but then all the transferred samples are used without considering anymore the discrepancies between the task models. In this paper, we propose a model-based technique that automatically estimates the relevance (importance weight) of each source sample for solving the target task. In the proposed approach, all the samples are transferred and used by a batch RL algorithm to solve the target task, but their contribution to the learning process is proportional to their importance weight. By extending the results for importance weighting provided in supervised learning literature, we develop a finite-sample analysis of the proposed batch RL algorithm. Furthermore, we empirically compare the proposed algorithm to state-of-the-art approaches, showing that it achieves better learning performance and is very robust to negative transfer, even when some source tasks are significantly different from the target task.

연구 동기 및 목표

  • 배치 강화학습에서 다수의 소스 태스크에서의 경험 샘플을 타겟 태스크로 전이하는 문제를 해결하기 위해.
  • 소스 태스크와 타겟 태스크 간의 분포 차이를 기반으로 각 소스 샘플의 관련성을 자동으로 추정함으로써 부정적 전이를 줄이기 위해.
  • 이론적으로 탄탄한, 모델 기반의 방법으로서 중요도 가중치를 사용해 학습 효율성과 강건성을 향상시키기 위해.
  • 고전적 RL 벤치마크와 실제 수자원 저류지 제어 문제에서의 방법에 대해 실증적으로 검증하기 위해.

제안 방법

  • 이 방법은 수집된 샘플들로부터 소스 태스크와 타겟 태스크의 보상 및 전이 모델을 비모수적 방식으로 가우시안 프로세스를 사용해 추정한다.
  • 각 소스 샘플이 타겟 MDP 하에서의 가능성에 기반해 보상 모델과 전이 모델에 대한 두 종류의 중요도 가중치를 계산한다.
  • 중요도 가중치는 수정된 피팅된 Q-반복 알고리즘에 통합되며, 분포 이탈을 고려해 가중치가 부여된 샘플들을 사용해 Q-함수를 갱신한다.
  • 이 방법은 모든 샘플을 완전히 전이할 수 있으며, 추정된 관련성에 따라 기여도를 동적으로 조정한다.
  • 모델 불확실성 하에서도 안정성을 향상시키기 위해 중요한도 가중치를 계산하는 데 강력한 통계적 추정 절차를 사용한다.
  • 공통된 동역학이 필요 없이, 소스 태스크와 타겟 태스크가 동역학과 보상 함수에서 다를 경우를 다룰 수 있도록 방법을 확장한다.

실험 결과

연구 질문

  • RQ1다수의 소스 태스크에서 수집된 경험 샘플의 관련성을 자동으로 추정하여 타겟 태스크로 전이하는 방법은 무엇인가?
  • RQ2보상 및 전이 동역학의 모델 기반 추정에 기반한 중요도 가중치는 배치 RL에서 편향을 줄이고 학습 성능을 향상시키는 데 기여하는가?
  • RQ3선택적 전이 및 전체 전이 기반 베이스라인 대비 제안된 방법은 부정적 전이에 대해 얼마나 강건한가?
  • RQ4일반적인 MDP 가정 하에서 가중치가 부여된 피팅된 Q-반복 알고리즘의 渐近적 정확성에 대한 이론적 근거는 무엇인가?

주요 결과

  • 수자원 저류지 제어 과제에서 IWFQI는 Fitted Q-Iteration와 RBF 전이(RBT)를 모두 능가하며, 첫 번째 학습 연도부터 거의 최적의 성능를 달성한다.
  • 격자 세계 도메인에서, 일부 소스 태스크가 타겟과 크게 다를 경우에도 IWFQI는 최신 기술 기반 베이스라인보다 더 빠른 수렴과 낮은 평균 비용을 달성한다.
  • 이 방법은 부정적 전이에 대해 강건하다: 소스 태스크가 유사하지 않을 경우, IWFQI는 관련성 없는 샘플을 자동으로 낮게 평가하여 편향과 분산을 최소화한다.
  • 실증 결과는 모델 유사성에 기반한 효과적인 샘플 가중치 부여 덕분에, 제한된 타겟 데이터 조건에서도 IWFQI가 높은 성능을 유지함을 보여준다.
  • 이론적 분석은 일반적인 MDP 가정 하에서 알고리즘의 渐近적 정확성을 확인하였으며, 중요도 가중치 기반 메커니즘에 대해 유한 샘플 경계를 도출하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.