Skip to main content
QUICK REVIEW

[논문 리뷰] Sparse Feature Selection Makes Batch Reinforcement Learning More Sample Efficient

Botao Hao, Yaqi Duan|arXiv (Cornell University)|2020. 11. 08.
Advanced Bandit Algorithms Research참고 문헌 61인용 수 10
한 줄 요약

이 논문은 배치 강화 학습에서 Lasso와 그룹 Lasso를 통한 희소 특징 선택을 제안하여 표본 효율성을 향상시킨다. 관련 특징에 집중함으로써, 전체 임베딩 차원이 아닌 관련 특징의 수에 비례하여 선형적으로 증가하는 유한 표본 오차 경계를 달성하여 고차원 설정에서 표본 복잡도를 크게 감소시킨다.

ABSTRACT

This paper provides a statistical analysis of high-dimensional batch Reinforcement Learning (RL) using sparse linear function approximation. When there is a large number of candidate features, our result sheds light on the fact that sparsity-aware methods can make batch RL more sample efficient. We first consider the off-policy policy evaluation problem. To evaluate a new target policy, we analyze a Lasso fitted Q-evaluation method and establish a finite-sample error bound that has no polynomial dependence on the ambient dimension. To reduce the Lasso bias, we further propose a post model-selection estimator that applies fitted Q-evaluation to the features selected via group Lasso. Under an additional signal strength assumption, we derive a sharper instance-dependent error bound that depends on a divergence function measuring the distribution mismatch between the data distribution and occupancy measure of the target policy. Further, we study the Lasso fitted Q-iteration for batch policy optimization and establish a finite-sample error bound depending on the ratio between the number of relevant features and restricted minimal eigenvalue of the data's covariance. In the end, we complement the results with minimax lower bounds for batch-data policy evaluation/optimization that nearly match our upper bounds. The results suggest that having well-conditioned data is crucial for sparse batch policy learning.

연구 동기 및 목표

  • 표준 방법이 낮은 표본 효율성으로 애로를 겪는 고차원 상태 공간에서의 배치 강화 학습 문제에 대응한다.
  • 특징 표현의 희소성에 기반하여 오프-폴리시 정책 평가(OPE)와 배치 정책 최적화에서 차원의 저주를 극복한다.
  • 큰 후보 특징 풀에서 유의미한 특징들만 선택함으로써 표본 효율적인 학습을 달성하는 이론적으로 탄탄한 방법을 개발한다.
  • 분포 불일치와 특징 희소성에 따라 달라지는, 전체 차원 복잡도에 의존하지 않는 날카운 인스턴스에 의존하는 오차 경계를 수립한다.
  • 희소성 가정 하에 제안된 방법의 통계적 최적성을 검증하기 위해 최소최대 하한을 제공한다.

제안 방법

  • L1-정규화된 선형 회귀를 적용하여 오프-폴리시 평가에서 가치 함수를 추정하는 Lasso-Fitted Q-Evaluation(Lasso-FQE) 방법을 제안하며, 특징 선택에서 희소성을 유도한다.
  • 모델 선택 후 추정기를 도입하여 그룹 Lasso를 사용해 특징을 선택한 후 Fitted Q-평가를 적용함으로써 Lasso의 편향을 줄이고 추정 정확도를 향상시킨다.
  • 선택된 특징 부분공간에 제한된 상태에서 행동 데이터와 목표 정책의 점유 측도 사이의 분포 불일치를 측정하는 분산 함수를 정의한다.
  • 배치 정책 최적화를 위한 Lasso Fitted Q-Iteration 분석을 수행하며, 관련 특징 수와 데이터 공분산 행렬의 제약된 최소 고유값의 비율에 따라 오차 경계를 유도한다.
  • 적응형 특징 선택 하에서 추정 오차의 고확률 경계를 도출하기 위해 새로운 농도 불등식과 마틴게일 추론을 사용한다.
  • 희소성 가정 하에 제안된 방법의 통계적 최적성을 확인하기 위해 최소최대 하한을 수립한다.

실험 결과

연구 질문

  • RQ1희소 특징 선택은 고차원 배치 강화 학습에서 표본 효율성을 향상시킬 수 있는가?
  • RQ2정규화 방법의 선택(Lasso 대 그룹 Lasso)이 오프-폴리시 정책 평가에서 추정 편향과 오차에 어떤 영향을 미치는가?
  • RQ3행동 정책와 목표 정책 간의 분포 불일치가 OPE 오차에 어느 정도 영향을 미치며, 이는 특징 선택을 통해 완화될 수 있는가?
  • RQ4데이터 공분산 행렬의 제약된 최소 고유값은 희소 정책 학습의 표본 복잡도를 결정하는 데 어떤 역할을 하는가?
  • RQ5제안된 희소 배치 RL에 대한 상한 경계는 통계적으로 날카로운가? 그리고 기본 하한과 비교해보면 어떠한가?

주요 결과

  • Lasso-Fitted Q-Evaluation 방법은 관련 특징 수와 제약된 최소 고유값에 비례하여 선형적으로 증가하는 유한 표본 오차 경계를 달성하며, 전체 차원 d에 대한 다항식 의존성이 없다.
  • 그룹 Lasso를 사용한 모델 선택 후 추정기는 분포 불일치를 감안한 분산 함수에 따라 더 날카운, 인스턴스에 의존하는 오차 경계를 제공한다.
  • 선택된 특징 공간에서의 분산 항은 전체 공간에서의 것보다 크게 작아지며, 이는 희소 특징 선택이 분포 불일치를 감소시킴을 보여준다.
  • 배치 정책 최적화의 경우, 정책 오차의 ℓ∞-노름은 관련 특징 수와 데이터 공분산 행렬의 제약된 최소 고유값의 비율에 비례하여 선형적으로 증가한다.
  • 최소최대 하한은 상한과 거의 일치하며, 이는 제안된 방법이 희소성과 잘 조절된 데이터 가정 하에 통계적으로 최적임을 확인한다.
  • 결과적으로 잘 조절된 데이터—특히 유리한 제약된 최소 고유값을 갖는 데이터—가 희소 배치 정책 학습의 표본 효율성에 핵심적임을 규명한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.