[논문 리뷰] Reinforcement Learning under Model Mismatch
이 논문은 모델 불일치 하에서 모델 기반 강화학습이 아닌 샘플 접근만을 가진 모델 프리 모델리스터링 강화학습에 대해 강건한 마르코프 결정과정을 확장한다. 모델 불일치 하에서 약간의 최적 정책으로 수렴하는 Q-학습, SARSA, TD-학습의 강건한 변형을 제안하며, 표본 표기 및 함수 근사 설정 모두에서 수렴성을 보장한다. 이를 위해 새로운 평균 제곱 강건 투영 벨만 오차 손실과 확률적 경사 하강법을 사용한다.
We study reinforcement learning under model misspecification, where we do not have access to the true environment but only to a reasonably close approximation to it. We address this problem by extending the framework of robust MDPs to the model-free Reinforcement Learning setting, where we do not have access to the model parameters, but can only sample states from it. We define robust versions of Q-learning, SARSA, and TD-learning and prove convergence to an approximately optimal robust policy and approximate value function respectively. We scale up the robust algorithms to large MDPs via function approximation and prove convergence under two different settings. We prove convergence of robust approximate policy iteration and robust approximate value iteration for linear architectures (under mild assumptions). We also define a robust loss function, the mean squared robust projected Bellman error and give stochastic gradient descent algorithms that are guaranteed to converge to a local minimum.
연구 동기 및 목표
- 에이전트가 진정한 환경가 아니라 대체 모델에서 학습하는 모델 불일치 상황에서 강화학습을 다루기.
- 기존에 모델 기반 계획 전용이었던 강건 MDP 프레임워크를 샘플 접근만 가능한 모델 프리 강화학습 설정으로 확장하기.
- 클래식한 시간 차분 알고리즘(Q-학습, SARSA, TD)의 강건한 버전을 개발하여 약한 가정 하에서 수렴 가능성을 증명하기.
- 선형 및 비선형 아키텍처를 포함한 큰 MDP에 대해 함수 근사를 사용해 강건한 강화학습을 스케일링하고, 선형 및 비선형 아키텍처에서의 수렴성을 증명하기.
- 평균 제곱 강건 투영 벨만 오차(MSRPBE) 손실과 국소 수렴 보장을 갖춘 확률적 경사 하강 알고리즘을 도입하기.
제안 방법
- 추정된 모델 주변의 신뢰 영역을 사용해 전이 확률의 불확실성을 반영하는 강건 벨만 방정식 정의하기.
- 불확실성 집합 내에서 최악의 전이 동역학을 사용해 가치 함수를 갱신하는 강건 Q-학습, SARSA, TD-학습 알고리즘 제안하기.
- 함수 근사에 사용하기 위한 손실 함수로 평균 제곱 강건 투영 벨만 오차(MSRPBE)를 도입하며, MSPBE를 강건 설정으로 일반화한다.
- MSRPBE를 최소화하기 위한 확률적 경사 하강 알고리즘 개발하며, 부드러움과 약한 가정 하에서 국소 최소값 수렴 보장을 제공한다.
- 기존 연구들과 유사한 기술적 가정 하에서 선형 함수 근사기반 강건 근사 정책 및 가치 반복의 수렴성을 증명한다.
- 실험에서 불확실성 집합의 크기를 조정하기 위해 10겹 교차 검증과 선형 검색을 사용한다.
실험 결과
연구 질문
- RQ1모델 매개변수 대신 샘플만 이용 가능한 모델 프리 설정에서 강건한 강화학습 알고리즘을 개발할 수 있는가?
- RQ2모델 불일치 하에서 Q-학습, SARSA, TD-학습의 강건한 변형이 약간의 최적 정책으로 수렴하는가?
- RQ3선형 함수 근사기반 강건 근사 정책 및 가치 반복이 불확실성 하에서 좋은 해로 수렴할 수 있는가?
- RQ4MSPBE를 일반화하고 비선형 함수 근사 설정에서 수렴성을 보장하는 강건한 손실 함수가 존재하는가?
- RQ5실제로 불확실성 집합의 크기가 강건 강화학습 알고리즘 성능에 어떤 영향을 미치는가?
주요 결과
- 약한 할인 요인 가정 하에서 모델 불일치가 있을지라도 강건 Q-학습, SARSA, TD-학습이 약간의 최적 정책으로 수렴한다.
- 표준 Q-학습 등 노미널 알고리즘은 모델 불일치 하에서 최적의 강건 정책보다 임의로 열악한 정책으로 수렴할 수 있다.
- 기존 연구들과 유사한 기술적 가정 하에서 선형 함수 근사기반 강건 근사 정책 및 가치 반복이 수렴한다.
- 제안된 MSRPBE 손실 함수는 강건 최적 정책을 국소 최소값으로 가지며, 임의의 부드러운 함수 근사기반에서 확률적 경사 하강법이 국소 최소값으로 수렴한다.
- 실험 결과, 특히 작은에서 중간 수준의 모델 편향이 있을 경우, 강건 알고리즘이 누적 보상과 꼬리 분포 측면에서 노미널 알고리즘보다 뛰어난 성능을 보인다.
- 수렴 경계에서 β가 증가함에 따라 불확실성 집합이 유효한 확률 분포의 단체를 초과할 경우 성능이 저하된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.