Skip to main content
QUICK REVIEW

[논문 리뷰] Reducing sampling error in batch temporal difference learning

Brahma S. Pavse|arXiv (Cornell University)|2020. 05. 01.
Reinforcement Learning in Robotics인용 수 4
한 줄 요약

이 논문은 표본 추출 오차를 보정하기 위해 중요도 표본 추출을 사용하여 TD(0)의 표본 추출 오차를 수정하는 배치 시간 차분 학습 알고리즘인 PSEC-TD(0)을 제안한다. 이는 진정한 평가 정책 분포와 경험적 행동 빈도 간의 격차를 보정한다. PSEC-TD(0)은 더 낮은 오차 고정점을 수렴하고 여러 작업에서 가치 함수 추정의 평균 제곱 오차를 크게 감소시킴을 보여준다.

ABSTRACT

Temporal difference (TD) learning is one of the main foundations of modern reinforcement learning. This thesis studies the use of TD(0), a canonical TD algorithm, to estimate the value function of a given evaluation policy from a batch of data. In this batch setting, we show that TD(0) may converge to an inaccurate value function because the update following an action is weighted according to the number of times that action occurred in the batch -- not the true probability of the action under the evaluation policy. To address this limitation, we introduce policy sampling error corrected-TD(0) (PSEC-TD(0)). PSEC-TD(0) first estimates the empirical distribution of actions in each state in the batch and then uses importance sampling to correct for the mismatch between the empirical weighting and the correct weighting for updates following each action. We refine the concept of a certainty-equivalence estimate and argue that PSEC-TD(0) converges to a more desirable fixed-point than TD(0) for a fixed batch of data. Finally, we conduct a thorough empirical evaluation of PSEC-TD(0) on three batch value function learning tasks in a variety of settings and show that PSEC-TD(0) produces value function estimates with lower mean squared error than the standard TD(0) algorithm

연구 동기 및 목표

  • 표본 추출 행동 빈도가 진정한 정책 확률이 아닌 데 기인한 편향된 가중치로 인해 표준 배치 TD(0)가 가치 함수 추정에 부정확함을 초래하는 문제를 해결한다.
  • 정책 표본 추출 오차를 보정하여 배치 학습에서 TD(0)의 고정점 수렴을 향상시킨다.
  • 진정한 평가 정책과 더 잘 일치하도록 확실성-등가 추정 개념을 개선하는 방법을 개발한다.
  • 실험적으로 제안된 방법이 표준 TD(0)에 비해 가치 함수 추정에서 더 낮은 평균 제곱 오차를 제공함을 입증한다.

제안 방법

  • 배치 데이터로부터 각 상태에 대한 경험적 행동 분포를 추정하여 각 행동이 얼마나 자주 관측되었는지 기록한다.
  • 진정한 평가 정책 확률과 경험적 행동 빈도 간의 비율을 기반으로 중요도 표본 추출을 적용하여 TD 업데이트를 재가중한다.
  • 수정된 중요도 가중치를 사용하여 시간 차분 업데이트 규칙을 조정하여 업데이트가 진정한 정책 분포를 반영하도록 보장한다.
  • 평가 정책 하에서 진정한 가치 함수에 더 가까운 고정점을 수렴하는 수정된 TD(0) 업데이트를 제안한다.
  • 배치 데이터의 표본 추출 편향을 고려한 개선된 확실성-등가 추정을 도입한다.
  • 추정 오차를 줄이면서도 수렴 안정성과 수렴 성질을 유지하도록 알고리즘을 설계한다.

실험 결과

연구 질문

  • RQ1배치 TD(0)에서 표본 추출 오차를 보정하면 가치 함수의 더 정확한 고정점 추정치를 얻을 수 있는가?
  • RQ2중요도 표본 추출이 배치 TD 학습에서 경험적 행동 빈도로 인한 편향을 효과적으로 완화할 수 있는가?
  • RQ3다양한 배치 가치 함수 학습 작업에서 PSEC-TD(0)은 표준 TD(0)에 비해 평균 제곱 오차가 어떻게 다른가?
  • RQ4주어진 배치 데이터에 대해 제안된 방법이 표준 TD(0)보다 더 바람직한 고정점으로 수렴하는가?
  • RQ5PSEC-TD(0)의 성능 향상은 다양한 환경과 데이터 분포에서 일관되게 유지되는가?

주요 결과

  • 표본 추출 편향 보정으로 인해 PSEC-TD(0)은 표준 TD(0)보다 진정한 가치 함수에 더 가까운 고정점을 수렴한다.
  • 세 가지 배치 학습 작업 전반에서 PSEC-TD(0)은 표준 TD(0)에 비해 가치 함수 추정에서 유의미하게 낮은 평균 제곱 오차를 달성한다.
  • 중요도 표본 추출은 배치 환경에서 경험적 행동 빈도와 진정한 정책 분포 간 격차를 효과적으로 줄인다.
  • PSEC-TD(0)의 개선된 확실성-등가 추정은 표준 방법보다 더 정확한 가치 함수 근사치를 도출한다.
  • 실험적 평가 결과, 다양한 환경과 데이터 구성에서 PSEC-TD(0)은 TD(0)에 비해 일관된 성능 향상을 확인할 수 있다.
  • 이 방법은 배치 학습 환경에서 수렴 안정성을 희생시키지 않고도 추정 정확도를 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.