Skip to main content
QUICK REVIEW

[논문 리뷰] Confounding-Robust Policy Evaluation in Infinite-Horizon Reinforcement Learning

Nathan Kallus, Angela Zhou|arXiv (Cornell University)|2020. 02. 11.
Reinforcement Learning in Robotics참고 문헌 40인용 수 12
한 줄 요약

이 논문은 관측되지 않은 혼동요인에 의해 영향을 받는 무한할행 간섭학습 환경에서 이완정책 평가를 위한 혼동요인에 강건한 접근법을 제안한다. 감도 모델을 고려하여 정적 상태 점유 비율에 대해 최적화함으로써 정책 가치에 대한 날카로운 경계를 계산하며, 계산의 실현 가능성을 확보하기 위해 비볼록 프로젝션 기반 경사하강법을 사용하고, 데이터가 증가할수록 진짜 경계에 수렴함을 증명한다.

ABSTRACT

Off-policy evaluation of sequential decision policies from observational data is necessary in applications of batch reinforcement learning such as education and healthcare. In such settings, however, unobserved variables confound observed actions, rendering exact evaluation of new policies impossible, i.e., unidentifiable. We develop a robust approach that estimates sharp bounds on the (unidentifiable) value of a given policy in an infinite-horizon problem given data from another policy with unobserved confounding, subject to a sensitivity model. We consider stationary or baseline unobserved confounding and compute bounds by optimizing over the set of all stationary state-occupancy ratios that agree with a new partially identified estimating equation and the sensitivity model. We prove convergence to the sharp bounds as we collect more confounded data. Although checking set membership is a linear program, the support function is given by a difficult nonconvex optimization problem. We develop approximations based on nonconvex projected gradient descent and demonstrate the resulting bounds empirically.

연구 동기 및 목표

  • 관측되지 않은 혼동요인이 존재하여 정책 가치를 식별할 수 없는 관찰 기반 강화학습 환경에서 이완정책 평가의 과제를 해결하기 위해.
  • 관측되지 않은 혼동요인으로 인한 부분 식별성으로 인해 정책 가치에 대해 가능한 한 날카로운 경계를 계산하기 위한 방법을 개발하기 위해.
  • 혼동된 데이터로부터 민감도 인식 기반의 안정적이고 강건한 가치 추정을 제공함으로써 정책 학습의 신뢰성과 안전성을 확보하기 위해.
  • 실험이 비용이 많이 들거나 윤리적으로 문제가 되는 분야인 헬스케어 및 교육 분야에서의 실용적 적용을 가능하게 하기 위해.
  • 비관측 혼동요인이 존재하는 순차적 의사결정에서 무관측된 혼동요인에 의한 부분 식별성과 관측되지 않은 혼동요인에 강건한 이완정책 평가 기법 간 격차를 메우기 위해.

제안 방법

  • 무한할행 MDP에서 관측되지 않은 혼동요인에 대한 감도 모델을 통합한 부분적으로 식별 가능한 추정 방정식을 수립한다.
  • 추정 방정식과 감도 모델에 일치하는 모든 정적 상태 점유 비율에 대해 최적화함으로써 정책 가치에 대한 경계를 도출한다.
  • 경계 계산에 필요한 어려운 지지함수 최적화를 근사하기 위해 비볼록 프로젝션 기반 경사하강법을 사용한다.
  • 표본화된 경우의 계산 부담을 줄이기 위해 재정의 기법을 활용하지만, 함수 근사 설정에서는 여전히 도전 과제가 남아 있다.
  • 선형 함수 근사에서 모델 잘못 설정 문제를 다루기 위해 타당성 완화 기법을 도입하지만, 이는 경계의 날카로움을 감소시킬 수 있다.
  • 관측되지 않은 혼동요인이 존재하는 3x3 격자 환경과 다양한 감도 매개변수를 사용하여 접근법을 실증적으로 검증한다.

실험 결과

연구 질문

  • RQ1관측 데이터가 관측되지 않은 상태에 의해 혼동될 경우, 목표 정책의 가치에 대해 날카로운 경계를 계산할 수 있는가?
  • RQ2이 경계들이 관측되지 않은 혼동요인에 대해 강건하면서도 계산적으로 실현 가능하게 유지될 수 있는가?
  • RQ3경계 계산에 필요한 비볼록 지지함수를 효과적으로 근사할 수 있는 최적화 기법은 무엇인가?
  • RQ4함수 근사 설정에서 모델 잘못 설정 상황에서 이 방법은 어떻게 스케일링되고 성능을 발휘하는가?
  • RQ5데이터 크기가 증가함에 따라 경계는 얼마나 정보적이고 안정적인가?

주요 결과

  • 제안된 방법은 혼동된 데이터의 양이 증가할수록 정책 가치에 대한 날카로운 경계로 수렴함을 보이며, 渐近적 타당성을 보장한다.
  • 3x3 격자 환경에서의 실증 결과는 감도 매개변수의 범위에 걸쳐 경계가 여전히 정보적인 것으로 나타났으며, 1.10에서 5.47까지 총 25개의 Γ 값으로 구성된 격자에서 검증되었다.
  • 비볼록 프로젝션 기반 경사하강법은 단조성과 해 캐싱을 결합할 경우 안정적이고 효과적인 근사 전략을 제공한다.
  • Gurobi를 통한 전역 최적화 결과는 프로젝션 기반 경사하강법의 신뢰성을 확인하였으며, 실질적인 성능 격차는 미미했다.
  • 중간 크기의 문제에 대해서는 표준 하드웨어(예: 16GB RAM을 갖춘 맥북 프로)에서도 계산적으로 실현 가능하다.
  • SDP 완화 기법은 이론적으로 타당하지만, 척도가 너무 커져서 실용적으로 사용하기 어려운 수준(O(|S|⁹|A|⁹/²))에 이르렀다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.