[논문 리뷰] Temporal Difference Learning with Neural Networks - Study of the Leakage Propagation Problem
이 논문은 신경망을 사용한 시간차분(TD) 학습에서, 날카러운 가치 함수 불연속성 근처의 근사 오차가 전파되어 성능을 떨어뜨리는 현상인 누출 전파를 조사한다. 분석적·실험적으로 TD 학습이 부트스트래핑에 의해 오차가 확산되면서 몬테카를로 회귀보다 열악한 해에 수렴할 수 있음을 보이며, 보상 없이 표현 품질을 향상시키기 위해 비지도 후속 특징 학습을 통해 이를 완화하는 방법을 제안한다.
Temporal-Difference learning (TD) [Sutton, 1988] with function approximation can converge to solutions that are worse than those obtained by Monte-Carlo regression, even in the simple case of on-policy evaluation. To increase our understanding of the problem, we investigate the issue of approximation errors in areas of sharp discontinuities of the value function being further propagated by bootstrap updates. We show empirical evidence of this leakage propagation, and show analytically that it must occur, in a simple Markov chain, when function approximation errors are present. For reversible policies, the result can be interpreted as the tension between two terms of the loss function that TD minimises, as recently described by [Ollivier, 2018]. We show that the upper bounds from [Tsitsiklis and Van Roy, 1997] hold, but they do not imply that leakage propagation occurs and under what conditions. Finally, we test whether the problem could be mitigated with a better state representation, and whether it can be learned in an unsupervised manner, without rewards or privileged information.
연구 동기 및 목표
- 함수 근사가 있는 상태에서 TD 학습이 온-폴리시 평가에서 몬테카를로 회귀보다 열악한 해에 수렴할 수 있는 이유를 이해하는 것.
- 가치 함수의 날카러운 불연속성 근처에서의 열악한 근사로부터 발생하는 오차 전파(이를 '누출 전파'라고 부름)의 메커니즘을 조사하는 것.
- 보상 없이 학습된 더 나은 상태 표현이 이 병태를 완화할 수 있는지 평가하는 것.
- 비지도 표현 학습이 TD 오차 전파를 줄이고 추정 정확도를 향상시킬 수 있는지 탐색하는 것.
제안 방법
- 함수 근사 하에서 누출 전파를 공식적으로 입증하기 위해 단순한 가역 마르코프 체인을 분석한다.
- TD 손실 함수에서 오차 전파를 가능하게 하는 트레이드오프를 모델링하기 위해 딜레르트 및 유클리드 노름의 혼합을 사용한다.
- 몬테카를로 회귀를 사용해 후속 특징를 사전 훈련하여 상태 표현으로 활용하고, 이를 통해 오차 전파를 피하는 TD 학습을 수행한다.
- 궤도의 위상적 구조를 기반으로 한 비지도 보조 손실을 도입하여 유사하게 보이지만 속임수를 쓰는 상태를 구분할 수 있는 표현을 학습한다.
- 날카러운 불연속성이 존재하는 2D 탐색 환경에서, 개선된 표현을 사용한 TD와 사용하지 않은 TD를 비교하여 방법을 테스트한다.
- 즉각적인 보상과 다음 관측값을 예측하도록 특징를 훈련하는 표현 학습 설정을 사용하며, 보조 작업 학습에 영감을 받는다.
실험 결과
연구 질문
- RQ1신경망을 사용한 TD 학습이 온-폴리시 평가에서도 몬테카를로 회귀보다 열악한 해에 수렴하는 이유는 무엇인가?
- RQ2가치 함수의 날카러운 불연속성 근처에서 근사 오차가 전파되고 TD 추정치를 떨어뜨리는 조건은 무엇인가?
- RQ3비지도 표현 학습이 이러한 불연속성이 존재하는 상황에서 TD 가치 함수 추정 정확도를 향상시킬 수 있는가?
- RQ4보상 없이 궤도의 위상적 구조를 포착하는 상태 표현을 학습하는 것은 가능한가?
주요 결과
- 함수 근사 오차가 가치 함수의 날카러운 불연속성 근처에 존재할 경우, 심지어 단순한 가역 MDP에서도 TD 학습에서 누출 전파가 발생한다.
- 문제의 근본 원인은 Ollivier(2018)가 기술한 바와 같이 TD 손실 함수의 두 항 간의 갈등이며, Tsitsiklis와 Van Roy(1997)의 기존 일반화 경계로는 이를 제거할 수 없다.
- 특수 지식을 가진 표현(예: 후속 특징)은 추정 오차를 크게 줄이고 누출 전파를 완화시킬 수 있다.
- 즉각적인 보상과 다음 관측값을 예측하는 보조 작업을 활용한 비지도 표현 학습은 2D 탐색 과제에서 성능을 향상시키고 오차 전파를 줄인다.
- 원시 상태에 직접 TD 학습을 적용하는 것보다, 몬테카를로 회귀를 통해 사전 훈련한 후속 특징를 사용하는 본 논문의 방법이 더 정확한 가치 함수 추정을 가능하게 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.