[논문 리뷰] Combining Parametric and Nonparametric Models for Off-Policy Evaluation
이 논문은 강화학습에서 이완정책 평가(off-policy evaluation, OPE)를 향상시키기 위해 매개변수적 모델과 비매개변수적 모델을 동적으로 조합하는 믹스처 오브 엑스퍼트(MoE) 프레임워크를 제안한다. 국소적 모델 오차를 추정하고 각 단계에서 최적의 모델을 선택하기 위한 계획 알고리즘을 사용함으로써, 전체 가치 추정 오차를 감소시켜 다양한 도메인에서 개별 모델과 최신의 중요도 샘플링 방법을 모두 능가한다.
We consider a model-based approach to perform batch off-policy evaluation in reinforcement learning. Our method takes a mixture-of-experts approach to combine parametric and non-parametric models of the environment such that the final value estimate has the least expected error. We do so by first estimating the local accuracy of each model and then using a planner to select which model to use at every time step as to minimize the return error estimate along entire trajectories. Across a variety of domains, our mixture-based approach outperforms the individual models alone as well as state-of-the-art importance sampling-based estimators.
연구 동기 및 목표
- 단독으로 사용될 경우 매개변수적 모델은 편향의 위험을 안고 있고, 비매개변수적 모델은 데이터 희소성 문제를 겪는 이완정책 평가의 한계를 해결하기 위해.
- 매개변수적 및 비매개변수적 모델의 장점을 지능적으로 조합하여 이완정책 평가의 가치 추정 오차 기대치를 감소시키기 위해.
- 모델 선택을 각 단계에서 수행하는 누적 수익 오차를 최소화하는 계획 문제로 이완정책 평가를 재정의하기 위해.
- 각 전이 단계에서 가장 정확한 모델을 선택할 수 있도록 도와주는 국소적 모델 오차 추정자(estimator)를 제안하기 위해.
- 기존 방법들과 비교하여 유한한 데이터 환경에서도 일致성과 향상된 성능을 입증하기 위해.
제안 방법
- 모델이 각 시간 단계에서 매개변수적 모델과 비매개변수적 모델 중 하나를 선택하는 믹스처 오브 엑스퍼트(MoE) 아키텍처를 사용한다. 이 선택은 국소 오차 추정에 기반한다.
- 국소 모델 오차는 진짜 다음 상태와 예측된 다음 상태 간 유클리드 거리로 추정하며, 결정론적 동역학을 가정한다.
- 전체 수익 추정의 기대 오차를 최소화하는 데 목적이 있는 계획 알고리즘(MCTS 등)을 사용하여 모델의 순서를 선택한다.
- 계획자는 추정된 오차를 활용해 궤도 수준의 결정을 내리며, 단기적 오차만 최소화하는 이른바 '미래를 고려하지 않는' 선택을 피한다.
- 무한한 데이터의 극한에서 일관성이 있으며, 비매개변수적 방법의 편향 감소 효과와 매개변수적 모델의 일반화 능력을 결합한다.
- 오차 추정기를 상태 분포를 비교하도록 수정함으로써, 이 방법은 확률적 환경으로도 확장 가능하다.
실험 결과
연구 질문
- RQ1매개변수적 모델과 비매개변수적 모델을 동적으로 조합하는 것이, 개별적으로 사용할 경우보다 이완정책 가치 추정 오차를 줄일 수 있는가?
- RQ2장기적 오차를 고려하는 계획 기반 모델 선택 전략이, 단기적 또는 정적 모델 사용에 비해 더 나은 OPE 성능을 낼 수 있는가?
- RQ3국소적 모델 오차 추정치가 진짜 오차와 비교해 전체 수익 오차를 최소화하는 데 도움이 되는가?
- RQ4상태 공간 거리 측정법의 선택이 다양한 도메인에서 가치 추정 정확도에 어느 정도 영향을 미치는가?
- RQ5무한한 데이터 극한에서 일관된 성능을 달성하면서도, 유한한 데이터 설정에서도 낮은 오차를 유지할 수 있는가?
주요 결과
- 암 도메인에서는 MoE 모델이 상대적 가치 추정 RMSE 0.020을 기록하여 매개변수적 모델(0.021)과 비매개변수적 모델(0.027)을 모두 능가했다.
- HIV 도메인에서는 MoE 모델이 RMSE 0.64를 기록하여 비매개변수적 모델(0.88)보다 약간 우수했고, 중요도 샘플링 방법(1.0)보다는 크게 뛰어났다.
- 진짜 모델 오차가 제공된 경우, MoE 계획자는 가장 낮은 궤도 시뮬레이션 오차를 기록하여 오차 추정이 의사결정을 이끄는 데 효과적임을 입증했다.
- 진짜 오차에 접근할 수 없더라도 계획 도입으로 가치 추정 오차가 감소하여 오차 추정의 부정확성에 대한 강건성을 보였다.
- 계획을 통합한 MoE 접근법(MCTS-MoE)은 두 도메인 모두에서 가장 낮은 RMSE를 기록했으며, 암 도메인에서는 0.019, HIV 도메인에서는 0.63이었다. 이는 모든 기준 모델을 능가했다.
- 도메인에 적합한 거리 측정법(예: 가중 유클리드 거리)을 사용할 경우 가치 추정이 더욱 향상되었으며, 특히 보상에 미치는 영향이 상태 차원마다 다를 경우에 두드러졌다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.