Skip to main content
QUICK REVIEW

[논문 리뷰] Modeling transition dynamics in MDPs with RKHS embeddings of conditional distributions

Steffen Grünewälder, Luca Baldassarre|arXiv (Cornell University)|2011. 12. 20.
Reinforcement Learning in Robotics참고 문헌 20인용 수 4
한 줄 요약

이 논문은 전이 확률을 명시적으로 모델링하지 않고도 가치 함수를 추정하기 위해 조건부 분포의 재생 커널 힐버트 공간(RKHS) 임베딩을 사용하는 비모수 강화학습 방법을 제안한다. 기대값을 선형 복잡도로 RKHS 내적 형태로 표현함으로써, 연속적이고 부분 관측 가능한 환경에서도 효율적인 가치 함수 추정이 가능해지며, 펜듈럼 및 이미지 기반 탐색 작업에서 가우시안 프로세스 기반 최소 제곱 정책 반복법보다 우수한 성능을 보였다.

ABSTRACT

We propose a new, nonparametric approach to estimating the value function in reinforcement learning. This approach makes use of a recently developed representation of conditional distributions as functions in a reproducing kernel Hilbert space. Such representations bypass the need for estimating transition probabilities, and apply to any domain on which kernels can be defined. Our approach avoids the need to approximate intractable integrals since expectations are represented as RKHS inner products whose computation has linear complexity in the sample size. Thus, we can efficiently perform value function estimation in a wide variety of settings, including finite state spaces, continuous states spaces, and partially observable tasks where only sensor measurements are available. A second advantage of the approach is that we learn the conditional distribution representation from a training sample, and do not require an exhaustive exploration of the state space. We prove convergence of our approach either to the optimal policy, or to the closest projection of the optimal policy in our model class, under reasonable assumptions. In experiments, we demonstrate the performance of our algorithm on a learning task in a continuous state space (the under-actuated pendulum), and on a navigation problem where only images from a sensor are observed. We compare with least-squares policy iteration where a Gaussian process is used for value function estimation. Our algorithm achieves better performance in both tasks.

연구 동기 및 목표

  • 전이 확률을 명시적으로 추정하지 않고도 마코프 결정 과정(MDP)에서 가치 함수 추정을 위한 비모수적 방법을 개발하는 것.
  • 커널 기반 표현을 사용하여 연속적이고 부분 관측 가능한 상태 공간에서 효율적인 가치 함수 학습을 가능하게 하는 것.
  • 표본 수에 대해 선형 스케일링을 보이는 RKHS 내적 형태로 기대값을 표현하여 계산 복잡도를 감소시키는 것.
  • 합리적인 가정 하에 모델 클래스 내 최적 정책 또는 그 가장 가까운 사영으로 수렴하도록 보장하는 것.
  • 복잡한 제어 및 시각 기반 작업에서 기존 방법(예: 가우시안 프로세스 기반 최소 제곱 정책 반복법)에 비해 성능 향상을 입증하는 것.

제안 방법

  • 조건부 분포를 재생 커널 힐버트 공간(RKHS) 내 함수로 표현함으로써, 밀도 추정을 명시적으로 하지 않고도 비모수적 모델링이 가능하다.
  • 기대값을 RKHS 내적 형태로 계산함으로써 표본 수에 대해 선형적으로 스케일링되며, 비용이 많이 드는 수치적 적분을 피할 수 있다.
  • 모든 상태 공간 탐색이 필요로 하지 않는 학습 데이터셋에서 직접 조건부 분포 표현을 학습한다.
  • 커널 방법을 활용해 상태-행동 공간 내 유사도를 정의함으로써, 커널을 정의할 수 있는 다양한 도메인에 적용 가능하다.
  • 관측된 표본에서 평가된 커널 함수들의 선형 조합으로 표현되는 표현 정리(representer theorem)를 사용해 가치 함수를 추정한다.
  • 기본 가정 하에 수렴성이 확립되어, 표준 정규성 조건 하에 최적 정책 또는 모델 클래스 내 가장 가까운 근사로 수렴함을 보였다.

실험 결과

연구 질문

  • RQ1RKHS에 의한 조건부 분포 임베딩은 전이 확률을 명시적으로 모델링하지 않고도 MDP에서 효율적이고 비모수적 가치 함수 추정을 가능하게 할 수 있는가?
  • RQ2RKHS 내적 표현은 기대값의 선형 시간 계산을 가능하게 하여 연속적이고 고차원 설정에서의 확장성 향상에 기여하는가?
  • RQ3이 방법은 오직 센서 관측치만 제공되는 부분 관측 환경으로 일반화 가능한가?
  • RQ4RKHS 기반 방법은 연속적 제어 및 시각 기반 탐색에서 가우시안 프로세스 기반 최소 제곱 정책 반복법보다 성능가 우수한가?
  • RQ5이 방법은 어떤 조건에서 모델 클래스 내 최적 정책 또는 그 가장 가까운 사영으로 수렴하는가?

주요 결과

  • 제안된 방법은 연속 상태 공간의 비제어 펜듈럼 제어 작업에서 가우시안 프로세스 기반 최소 제곱 정책 반복법보다 더 뛰어난 성능을 달성했다.
  • 이미지 기반 센서 관측치를 입력으로 사용함으로써 부분 관측 강화학습을 성공적으로 처리하였으며, 시각 기반 탐색에서의 강건성을 입증했다.
  • RKHS 내적 계산 덕분에 가치 함수 추정이 표본 수에 대해 선형적으로 스케일링되어 대규모 데이터셋에서도 효율적인 학습이 가능했다.
  • 기본 정규성 조건 하에 표준 가정 하에 최적 정책 또는 모델 클래스 내 가장 가까운 사영으로 수렴함을 보여 이론적으로 신뢰할 수 있었다.
  • 실험 결과, 조건부 분포의 커널 기반 표현이 밀도 추정 없이도 정확한 가치 함수 추정을 가능하게 함을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.