[논문 리뷰] Average-Reward Off-Policy Policy Evaluation with Function Approximation
이 논문은 기울기 시간 차이 방법을 사용하여 치명적 삼위일체를 해소함으로써 함수 근사와 함께 평균 보상 정책 평가를 위한 두 가지 새로운 이완정책 알고리즘인 Diff-GQ1과 Diff-GQ2를 제안한다. 이 알고리즘들은 밀도 비율 추정이 필요 없이 차분 가치 함수 및 보상 률 추정에 대해 모두 증명 가능하게 수렴하는 최초의 선형 함수 근사 방법이며, 실험적 테스트에서 밀도 비율 기반 방법보다 뛰어난 성능을 보였다.
We consider off-policy policy evaluation with function approximation (FA) in average-reward MDPs, where the goal is to estimate both the reward rate and the differential value function. For this problem, bootstrapping is necessary and, along with off-policy learning and FA, results in the deadly triad (Sutton & Barto, 2018). To address the deadly triad, we propose two novel algorithms, reproducing the celebrated success of Gradient TD algorithms in the average-reward setting. In terms of estimating the differential value function, the algorithms are the first convergent off-policy linear function approximation algorithms. In terms of estimating the reward rate, the algorithms are the first convergent off-policy linear function approximation algorithms that do not require estimating the density ratio. We demonstrate empirically the advantage of the proposed algorithms, as well as their nonlinear variants, over a competitive density-ratio-based approach, in a simple domain as well as challenging robot simulation tasks.
연구 동기 및 목표
- 부트스트랩핑, 이완정책 데이터, 함수 근사가 함께 작용할 때 수렴하지 못하는 치명적 삼위일체 문제를 평균 보상 이완정책 학습에서 해결하기 위해.
- 이완정책 평균 보상 MDP에서 차분 가치 함수를 추정하기 위한 첫 번째 증명 가능하게 수렴하는 선형 함수 근사 알고리즘을 개발하기 위해.
- 밀도 비율 추정이 필요 없는 보상 률 추정을 위한 첫 번째 수렴 보장된 이완정책 선형 함수 근사 방법을 설계하기 위해.
- 표본 공간과 비선형 함수 근사 설정에서 경쟁적 밀도 비율 기반 방법인 GradientDICE와의 실험적 평가를 수행하기 위해.
제안 방법
- 기울기 TD 프레임워크를 평균 보상 설정으로 확장하기 위해 원-이중 최적화 접근법을 사용하여 Diff-GQ1과 Diff-GQ2를 제안한다.
- 단일 최적화 프레임워크 내에서 차분 가치 함수와 보상 률 추정을 모두 포함하는 수정된 벨만 오차 목표 함수를 사용한다.
- 이중 시간 척도의 확률적 기울기 업데이트를 적용한다: 하나는 벨만 오차와 관련된 이중 변수를 위한 것이고, 다른 하나는 원변수(가치 함수 및 보상 률 추정)를 위한 것이다.
- 특히 고차원 함수 근사 설정에서 수렴성과 안정성을 보장하기 위해 원변수에 릿지 정규화를 도입한다.
- 기본 가정(기약성, 비주기성, 특징 행렬 성질 등) 하에서 수렴 보장을 도출하며, 최적 해로 거의 확실히 수렴함을 보장한다.
- 밀도 비율 추정이 필요 없이 보상 률과 차분 가치 함수를 동시에 추정할 수 있도록 하는 새로운 MSPBE(Mean-Squared Projected Bellman Error) 공식을 도입한다.
실험 결과
연구 질문
- RQ1평균 보상 MDP에서 이완정책 선형 함수 근사가 밀도 비율 추정에 의존하지 않고 증명 가능하게 수렴하도록 할 수 있는가?
- RQ2할인 설정에서 유래한 기울기 기반 방법을 평균 보상 설정으로 성공적으로 적응시켜 치명적 삼위일체를 해결할 수 있는가?
- RQ3복잡한 환경에서 보상 률 추정을 위한 기반 가치 이완정책 알고리즘은 밀도 비율 기반 방법과 비교해 어떻게 성능을 내는가?
- RQ4제안된 방법은 신경망과 같은 비선형 함수 근사 설정에서도 안정성과 수렴성을 유지하는가?
주요 결과
- 제안된 Diff-GQ1과 Diff-GQ2 알고리즘은 평균 보상 MDP에서 차분 가치 함수를 추정하기 위한 최초의 증명 가능하게 수렴하는 이완정책 선형 함수 근사 방법이다.
- 밀도 비율 추정이 필요 없이 보상 률 추정에 대해서도 수렴성을 확보하여 이전 방법들과의 핵심적 우월성을 확보한다.
- 간단한 마르코프 체인 도메인에서 제안된 알고리즘이 밀도 비율 기반 방법인 GradientDICE보다 추정 정확도와 안정성 측면에서 뛰어난 성능을 보였다.
- 도전적인 MuJoCo 로봇 시뮬레이션 작업에서, 다양한 환경과 함수 근사 아키텍처(신경망 포함)에서 제안된 알고리즘이 GradientDICE를 일관되게 능가했다.
- 실험 결과, 헤시안 행렬 $F$가 양의 준정부성임 확률이 다양한 노이즈 수준에서도 높게 유지됨(예: $| ablaackslashmathcal{S}|| ablaackslashmathcal{A}|=100$일 때 0.93)을 확인하여 강건성을 입증했다.
- 신경망을 사용한 비선형 설정에서도 일관된 수렴을 보이며, 고차원 함수 근사에서도 안정적인 학습 행동을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.