[논문 리뷰] Offline Reinforcement Learning with Instrumental Variables in Confounded Markov Decision Processes
이 논문은 관측되지 않은 혼동요인과 제한된 데이터 커버리지 문제를 해결하기 위해 도구변수(IV)를 사용하여 혼돈된 마르코프 결정 과정(offline reinforcement learning)를 위한 방법을 제안한다. IV 기반의 가치함수 식별과 보정된 중요도 샘플링(MIS), 그리고 편향성 원칙을 융합함으로써, 최소한의 가정 하에 유한 샘플 하위최적성 경계 $O(\log(NT)(NT)^{-1/2})$ 를 달성한다. 이는 i.i.d. 또는 정상적 데이터가 없더라도 성립한다.
We study the offline reinforcement learning (RL) in the face of unmeasured confounders. Due to the lack of online interaction with the environment, offline RL is facing the following two significant challenges: (i) the agent may be confounded by the unobserved state variables; (ii) the offline data collected a prior does not provide sufficient coverage for the environment. To tackle the above challenges, we study the policy learning in the confounded MDPs with the aid of instrumental variables. Specifically, we first establish value function (VF)-based and marginalized importance sampling (MIS)-based identification results for the expected total reward in the confounded MDPs. Then by leveraging pessimism and our identification results, we propose various policy learning methods with the finite-sample suboptimality guarantee of finding the optimal in-class policy under minimal data coverage and modeling assumptions. Lastly, our extensive theoretical investigations and one numerical study motivated by the kidney transplantation demonstrate the promising performance of the proposed methods.
연구 동기 및 목표
- 관측되지 않은 혼동요인으로 인해 기존의 비혼돈성 가정이 무효화되는 오프라인 강화학습 문제에 대응한다.
- 특히 상태 또는 행동 공간이 클 경우에 더해져 제약이 심한 데이터 커버리지 가정을 완화한다.
- 관측 가능한 데이터에서 인과적 영향을 식별하기 위해 도구변수를 사용하여 혼돈된 MDP에서의 정책 학습을 가능하게 한다.
- 최소한의 모델링 및 커버리지 가정 하에 유한 샘플 하위최적성 보장을 갖춘 이론적으로 탄탄한 방법을 개발한다.
- i.i.d. 또는 정상적 데이터가 필요 없이 최적 정책 수렴을 달성함으로써 실제 환경에 더 넓은 적용 가능성을 확보한다.
제안 방법
- 무한할행의 혼돈된 MDP에 대해 도구변수를 활용한 가치함수(VF) 기반 식별을 통해 새로운 벨만 방정식을 유도한다.
- 도구변수를 활용한 보정된 중요도 샘플링(MIS) 기반 식별을 개발하여 직접적으로 총 보상의 기대값 $J(\pi)$ 를 추정한다.
- 도구변수와 편향성 원칙을 통합한 추정 방정식을 기반으로 상태가치함수에 대한 최소-최대 추정기(min-max estimator)를 제안한다.
- 추정기의 손실 함수를 바탕으로 최소-최대 추정기의 신뢰구간을 구성하며, 추정기의 균일한 범위를 요구하지 않는다.
- 신뢰구간 내에서 가장 보수적인 기대 총보상 추정치를 최대화함으로써 최선의 정책을 선택하기 위해 편향성 원칙을 활용한다.
- VF 기반과 MIS 기반 식별을 조합하여 이중 강건한 추정기(doubly robust estimator)를 제안함으로써 모델 오_SPECIFICATION에 대한 강건성을 향상시킨다.
실험 결과
연구 질문
- RQ1유한할행의 관측 데이터만으로 혼돈된 MDP에서 도구변수를 사용하여 가치함수와 기대 총보상이 식별 가능한가?
- RQ2약한 데이터 커버리지 조건 하에서 편향성 원칙을 도구변수 기반 식별과 통합하여 오프라인 강화학습에서의 유한 샘플 하위최적성 보장을 확보할 수 있는가?
- RQ3데이터가 i.i.d. 또는 정상적이지 않은 경우에 제안된 방법의 이론적 수렴 성질은 어떠한가?
- RQ4VF 기반과 MIS 기반 식별을 병합하면 단독으로 사용할 경우보다 더 강건하고 정확한 정책 학습 방법을 얻을 수 있는가?
- RQ5관측되지 않은 혼동요인이 존재하고 데이터 커버리지가 제한적인 상황에서 제안된 방법이 기존 오프라인 강화학습 방법을 능가할 수 있는가?
주요 결과
- 제안된 방법은 최적의 클래스 정책을 찾는 데 있어 $O(\log(NT)(NT)^{-1/2})$ 의 유한 샘플 하위최적성 경계를 달성하며, $N$ 또는 $T$ 가 증가함에 따라 이 경계는 0으로 수렴한다.
- 이 방법은 데이터가 i.i.d. 또는 정상적 분포에서 유래된 것이 아님을 전제로 하며, 기하적 에르고딕 시퀀스에 대한 새로운 농도 부등식을 기반으로 한다.
- 수치적 결과는 편향성 원칙을 적용한 IV 기반 방법(pess_IV)이 행동 정책보다 훨씬 우수한 정책을 학습함을 보여주며, 모든 기준점보다 뚜렷이 뛰어나다.
- pess_IV 방법은 no_pess_IV보다 더 높고 안정적인 기대 총보상을 달성함으로써, 편향성 원칙과 도구변수의 조합이 유의미한 이점을 제공함을 입증한다.
- 도구변수를 사용하지 않는 방법들(pess_no_IV 및 no_pess_no_IV)은 행동 정책를 능가하지 못함을 확인하였으며, 이는 혼동요인이 존재할 경우 도구변수의 필수성을 강조한다.
- 이중 강건한 추정기는 VF 기반과 MIS 기반 식별의 장점을 융합하여, 모델 오_SPECIFICATION 상황에서도 더 강건하고 뛰어난 정책 학습 성능을 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.