[논문 리뷰] Representations for Stable Off-Policy Reinforcement Learning
이 논문은 전이 행렬의 기하학을 존중함으로써 이완정책 타임디피런스 학습에서 안정성을 보장하는 특정 상태 표현—특히 슈어 분해와 직교 크릴로프 기저—을 제안한다. 이 표현들은 향후 특징이나 보상 예측과 같은 보조 작업에 대한 확률적 경사 하강법을 통해 학습될 수 있으며, 근사 품질을 희생시키지 않은 채 형식적인 안정성 보장을 제공한다.
Reinforcement learning with function approximation can be unstable and even divergent, especially when combined with off-policy learning and Bellman updates. In deep reinforcement learning, these issues have been dealt with empirically by adapting and regularizing the representation, in particular with auxiliary tasks. This suggests that representation learning may provide a means to guarantee stability. In this paper, we formally show that there are indeed nontrivial state representations under which the canonical TD algorithm is stable, even when learning off-policy. We analyze representation learning schemes that are based on the transition matrix of a policy, such as proto-value functions, along three axes: approximation error, stability, and ease of estimation. In the most general case, we show that a Schur basis provides convergence guarantees, but is difficult to estimate from samples. For a fixed reward function, we find that an orthogonal basis of the corresponding Krylov subspace is an even better choice. We conclude by empirically demonstrating that these stable representations can be learned using stochastic gradient descent, opening the door to improved techniques for representation learning with deep networks.
연구 동기 및 목표
- 함수 근사가 적용될 경우 특히 딥 강화학습에서 이완정책 TD 학습의 불안정성 문제를 해결하기 위해.
- 이완정책 설정에서 TD(0)의 수렴을 보장하는 상태 표현을 형식적으로 특성화하기 위해.
- 전이 역학의 행렬 기하학을 통해 표현 학습과 가치 함수 알고리즘의 안정성 간의 연결 고리를 맺기 위해.
- 향후 특징이나 보상 예측과 같은 보조 작업이 증명 가능하게 안정적인 표현을 도출할 수 있음을 보여주기 위해.
- 그러한 안정적인 표현들이 딥 네트워크에서 확률적 경사 하강법을 사용하여 학습될 수 있음을 보여주기 위해.
제안 방법
- 값 함수 업데이트의 기대 동역학을 분석하여 표현 기하학에 초점을 맞춘 TD(0) 안정성 분석.
- 이완정책 데이터에서도 안정성을 보장하는 전이 행렬의 슈어 분해를 안정성의 근원으로 규명.
- 보상 함수가 알려져 있을 경우, 직교 크릴로프 기저를 안정적인 대안으로 제안.
- 다음 단계의 특징 값 예측은 슈어 기반 표현을, 향후 보상 예측은 크릴로프 기반 표현을 도출함을 보여줌.
- 신경망에서 이러한 표현을 학습하기 위해 보조 목표를 활용한 확률적 경사 하강법 사용.
- 상호상관이 없는 특징을 유지함으로써 안정성 보장을 유지하기 위해 수직성 제약 또는 페널티 적용.
실험 결과
연구 질문
- RQ1함수 근사가 적용된 이완정책 학습에서 TD(0)의 수렴을 보장하는 상태 표현은 무엇인가?
- RQ2전이 행렬의 기하학은 가치 함수 학습의 안정성에 어떻게 영향을 미치는가?
- RQ3보조 표현 학습 작업이 이완정책 강화학습에서 증명 가능하게 안정적인 표현을 도출할 수 있는가?
- RQ4딥 네트워크를 통해 데이터로부터 안정적인 표현을 얼마나 잘 학습할 수 있는가?
- RQ5이완정책 강화학습의 표현 학습에서 안정성, 근사 오차, 학습 가능성 간의 상충 관계는 무엇인가?
주요 결과
- 전이 행렬의 슈어 분해는 일반적인 경우에도 이완정책 학습에서 TD(0)의 증명 가능한 수렴 보장을 제공한다.
- 보상 함수에서 유도된 직교 크릴로프 기저는 원시가치 함수보다 더 안정적이고 더 나은 근사 성능을 보이는 대안을 제공한다.
- 비대칭 행렬에서의 변동에 민감하기 때문에 슈어 표현을 추정하는 것은 다른 분해보다 더 어렵다.
- 실제로는 크릴로프 기저가 슈어 분해보다 더 낮은 근사 오차와 높은 학습 가능성을 달성하지만, 이는 보상 함수의 사전 지식이 필요하다.
- 향후 특징 값 예측(Schur) 또는 향후 보상 예측(Krylov)은 확률적 경사 하강법을 통한 안정적 표현 학습을 가능하게 하는 효과적인 보조 작업이다.
- 신경망은 이러한 예측 보조 목표를 최적화하여 안정적인 표현을 성공적으로 학습함으로써 이 접근의 실용적 타당성을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.