[논문 리뷰] Doubly Robust Off-Policy Actor-Critic: Convergence and Optimality
이 논문은 값 함수와 밀도 비율 추정 오차에서 발생하는 편향을 줄이기 위해 双중으로 강건한 정책 그래디언트 추정기(DR)를 활용하는 단일 시간스케일 비정책(actor-critic) 알고리즘인 DR-Off-PAC을 제안한다. 이 알고리즘은 근사 오차에 대해 강건한 유지가 가능한 표본 복잡도 한계를 확보하며, 유한 시간 내 수렴을 보장하며, 단일 시간스케일 비정책 AC 방법에 대해 처음으로 종합적인 표본 복잡도 분석을 수립한다.
Designing off-policy reinforcement learning algorithms is typically a very challenging task, because a desirable iteration update often involves an expectation over an on-policy distribution. Prior off-policy actor-critic (AC) algorithms have introduced a new critic that uses the density ratio for adjusting the distribution mismatch in order to stabilize the convergence, but at the cost of potentially introducing high biases due to the estimation errors of both the density ratio and value function. In this paper, we develop a doubly robust off-policy AC (DR-Off-PAC) for discounted MDP, which can take advantage of learned nuisance functions to reduce estimation errors. Moreover, DR-Off-PAC adopts a single timescale structure, in which both actor and critics are updated simultaneously with constant stepsize, and is thus more sample efficient than prior algorithms that adopt either two timescale or nested-loop structure. We study the finite-time convergence rate and characterize the sample complexity for DR-Off-PAC to attain an $ε$-accurate optimal policy. We also show that the overall convergence of DR-Off-PAC is doubly robust to the approximation errors that depend only on the expressive power of approximation functions. To the best of our knowledge, our study establishes the first overall sample complexity analysis for a single time-scale off-policy AC algorithm.
연구 동기 및 목표
- 비정책 강화학습에서 정책 그래디언트 추정이 비정책 데이터를 사용할 경우 자주 발생하는 분포 불일치 문제를 해결한다. 이는 불안정성과 높은 편향을 초래한다.
- 값 함수와 밀도 비율 추정의 정확도가 떨어질 경우 높은 편향을 유발하는 기존 비정책 액터-크리틱 방법의 한계를 극복한다.
- 무한 시간 할당 할 마르코프 결정 과정(infinite-horizon discounted MDPs)을 대상으로, 네 개의 부수적 함수 중 적어도 두 개가 정확하게 추정될 경우 편향을 감소시키는 새로운 이중 강건한 정책 그래디언트 추정기를 개발한다.
- 무모델, 단일 시간스케일 크리틱 아키텍처를 설계하여, 무한 시간 할당 비정책 환경에서 부수적 함수를 효율적으로 순환적으로 추정한다.
- 이중 강건한 수렴 보장을 갖춘 단일 시간스케일 비정책 액터-크리틱 알고리즘에 대해 처음으로 유한 시간 표본 복잡도 분석을 수립한다.
제안 방법
- 네 개의 부수적 함수 중 어느 하나라도 정확하게 추정될 경우 편향 감소를 보장하는 이중 강건한 정책 그래디언트 추정기를 제안한다.
- 시간 차분 학습을 활용하여, 무한 시간 할당 비정책 설정에서 부수적 함수(예: 밀도 비율, Q-값, 그들의 도함수 등)를 순환적으로 추정하는 크리틱을 위한 방법을 도입한다.
- 상수 단계 크기로 액터와 크리틱을 동시에 업데이트하는 단일 시간스케일 액터-크리틱 프레임워크를 설계하여, 이중 시간스케일 또는 중첩 루프 방법보다 표본 효율성을 향상시킨다.
- 중요도 가중치와 값 함수 보정을 통해 분포 이동을 보정하는 이중 강건 추정기를 사용해 정책 그래디언트 업데이트를 공식화한다.
- 크리틱 추정 오차, 액터 업데이트 오차, 표본 분산 간의 상호작용을 분석하여 추정 오차와 수렴 오차에 대한 이론적 한계를 유도한다.
- 리아푸노프 스타일 분석을 사용하여 최적성 갭을 제한하고, 수렴 속도가 시간의 제곱근과 데이터셋 크기의 역수에 비례하며, 정확한 부수적 함수 추정 조건 하에서 잔여 편향 항이 사라짐을 보여준다.
실험 결과
연구 질문
- RQ1이중 강건한 정책 그래디언트 추정기는 모델이 없는 비정책 설정에서 무한 시간 할당 할 마르코프 결정 과정에 효과적으로 확장될 수 있는가?
- RQ2이중 강건한 추정기를 단일 시간스케일 액터-크리틱 프레임워크에 통합할 경우, 전체 수렴 과정에서 이중 강건성 특성이 유지되는가? 즉, 최적성 갭이 근사 오차에 대해 여전히 강건한가?
- RQ3이중 강건 추정을 갖춘 단일 시간스케일 비정책 액터-크리틱 알고리즘의 유한 시간 표본 복잡도는 얼마인가?
- RQ4제안된 알고리즘의 수렴 속도는 시간 T와 데이터셋 크기 N에 대해 어떻게 스케일링되는가?
- RQ5제안된 크리틱 아키텍처는 무한 시간 할당 비정책 설정에서 필요한 부수적 함수(예: 밀도 비율 및 값 함수 도함수 등)를 순환적이고 효율적으로 추정할 수 있는가?
주요 결과
- 제안된 DR-Off-PAC 알고리즘은 유한 시간 수렴 속도를 확보하며, 최적성 갭이 $\Theta(1/\sqrt{T}) + \Theta(1/\sqrt{N}) + \Theta(\epsilon_{\rho}\epsilon_{d_q} + \epsilon_{d_\rho}\epsilon_q + \epsilon_{\rho}\epsilon_q)$ 로 제한된다. 여기서 $T$ 는 반복 횟수이고 $N$ 은 데이터셋 크기이다.
- 알고리즘의 수렴은 이중 강건하다: 네 개의 부수적 함수(밀도 비율, 값 함수, 그들의 도함수) 중 어느 두 개가 정확하게 추정되면 최적성 갭은 사라진다.
- DR-Off-PAC의 표본 복잡도는 단일 시간스케일 비정책 액터-크리틱 방법의 맥락에서 처음으로 확립되었으며, 표준 가정 하에 수렴 속도가 $O(1/\sqrt{T})$ 임을 보였다.
- 알고리즘은 이중 강건한 그래디언트 추정기를 활용하여 개별 부수적 추정기의 정확도에 대한 의존도를 감소시켜 안정성과 낮은 편향을 유지한다.
- 이론적 분석을 통해 전체 수렴 오차가 부수적 함수 추정 오차의 곱에 의존함을 확인하였으며, 이는 개별 구성 요소가 완벽하지 않더라도 강건성을 보장한다.
- 순환적 크리틱 설계는 무한 시간 할당 설정에서 필요한 모든 부수적 함수를 효율적으로 모델-프리 방식으로 추정할 수 있도록 하여, 알고리즘의 실용적 구현을 지원한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.