Skip to main content
QUICK REVIEW

[논문 리뷰] A Spectral Approach to Off-Policy Evaluation for POMDPs

Yash Nair, Nan Jiang|arXiv (Cornell University)|2021. 09. 22.
Optimization and Search Problems참고 문헌 15인용 수 4
한 줄 요약

이 논문은 은닉 상태의 다중 단계 관측 가능 대체물(Proxy)을 활용하여 이전 연구에서 요구하는 엄격한 가역성 가정을 완화함으로써 POMDP에서 이완된 조건 하에 오프-폴리시 평가를 위한 스펙트럼 방법을 제안한다. 과거 및 미래의 역사 확장을 통해 고유분해를 적용함으로써 추정 정확도와 일반화 능력이 향상되며, 이와 동시에 이전 연구에서 요구하는 충분성 가정을 대체로 더 약한 질량, 양성, 고유성 조건을 갖춘 새로운 중요도 샘플링 알고리즘을 제공한다.

ABSTRACT

We consider off-policy evaluation (OPE) in Partially Observable Markov Decision Processes, where the evaluation policy depends only on observable variables but the behavior policy depends on latent states (Tennenholtz et al. (2020a)). Prior work on this problem uses a causal identification strategy based on one-step observable proxies of the hidden state, which relies on the invertibility of certain one-step moment matrices. In this work, we relax this requirement by using spectral methods and extending one-step proxies both into the past and future. We empirically compare our OPE methods to existing ones and demonstrate their improved prediction accuracy and greater generality. Lastly, we derive a separate Importance Sampling (IS) algorithm which relies on rank, distinctness, and positivity conditions, and not on the strict sufficiency conditions of observable trajectories with respect to the reward and hidden-state structure required by Tennenholtz et al. (2020a).

연구 동기 및 목표

  • 일괄적인 모멘트 행렬의 가역성에 의존하는 기존 오프-폴리시 평가(OPE) 방법의 한계를 해결한다.
  • 관측 공간이 은닉 상태 공간을 초과하는 더 풍부한 관측 공간을 允허함으로써 일반화 능력을 향상시킨다.
  • 희귀 또는 확률이 0인 사건에 문제가 생기는 것을 방지하기 위해 조건부 확률이 아닌 결합 확률을 추정하는 방법을 개발한다.
  • 은닉 상태의 강력한 가역성 가정에 의존도를 줄이기 위해 관측 가능 대체물을 과거 및 미래 경로로 확장한다.
  • 이전 연구에서 요구하는 엄격한 충분성 가정을 피하기 위해 질량, 양성, 고유성 조건에 기반한 새로운 중요도 샘플링 알고리즘을 유도한다.

제안 방법

  • PSRs와 HMMs에서 영감을 얻은 스펙트럼 분해 기법을 사용하여 관측 가능한 궤적에서 은닉 상태 분포를 식별한다.
  • 혼란 요인 주변의 역사 및 미래 창을 확장하여 다중 단계 관측 가능 대체물을 구성함으로써 질량 조건을 향상시킨다.
  • 행렬의 가역성이 필요 없이도 은닉 상태 분포를 식별하기 위해 모멘트 행렬의 고유분해(예: $P^r_{i,z_i}$, $Q^r_{i,z_i,z_{i+1}}$)를 활용한다.
  • 전체 질량 특성과 관측 가능한 결합 분포의 모어-펜로즈 역행렬을 활용하여 $P^b(U_{0:H}| au^o_H)$를 식별한다.
  • 식별된 가중치 $W(v, au^o)$를 기반으로 $P^b(r_i|u_i)$, $P^b(u_{0:H}| au^o)$, 및 $ ilde{ ho}_b(u_{0:H})$로부터 새로운 중요도 샘플링 추정기를 구성한다.
  • 은닉 상태의 일관된 순서를 확보하기 위해 고유성 가정(가정 10)을 적용함으로써 확률 추정치의 정확한 정렬을 가능하게 한다.

실험 결과

연구 질문

  • RQ1다중 단계 관측 가능 대체물을 사용함으로써 POMDP OPE에서 일괄 모멘트 행렬의 가역성 요구 조건을 완화시킬 수 있는가?
  • RQ2과거 및 미래 경로로 확장된 관측 가능 대체물이 오프-폴리시 가치 추정의 식별 가능성과 정확도를 향상시키는가?
  • RQ3질량, 양성, 고유성 조건에 기반하여 이전 연구에서 요구하는 충분성 가정을 피할 수 있는 새로운 중요도 샘플링 알고리즘을 도출할 수 있는가?
  • RQ4제안된 스펙트럼 OPE 추정기의 성능은 기존 방법 대비 예측 정확도와 내구성 측면에서 어떻게 비교되는가?
  • RQ5이 방법은 은닉 상태 공간보다 더 큰 관측 공간을 갖는 POMDP에 얼마나 잘 일반화되는가?

주요 결과

  • 제안된 스펙트럼 OPE 방법은 고차원 관측이 존재하는 환경에서 기존 방법보다 향상된 예측 정확도를 달성한다.
  • 다중 단계 역사 및 미래를 사용함으로써 일괄 모멘트 행렬의 가역성 요구 조건을 완화함으로써 실제 POMDP에 더 널리 적용 가능해졌다.
  • 조건부 확률이 아닌 결합 확률을 추정함으로써 희귀 또는 확률이 0인 조건 사건 문제를 피할 수 있다.
  • 고유분해 기반의 식별 절차는 이전 연구보다 더 약한 가정 하에서도 $P^b(r_i|u_i)$ 및 $P^b(u_{0:H}| au^o_H)$의 일관된 추정을 가능하게 한다.
  • 새로운 중요도 샘플링 알고리즘은 질량, 양성, 고유성 조건 하에서 식별 가능하며, Tennenholtz 등(2020a)이 요구하는 엄격한 충분성 가정을 피한다.
  • 실증 검증을 통해 확장된 대체물 접근법이 다양한 환경에서 더 안정적이고 정확한 OPE 추정치를 제공하는 것으로 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.