Skip to main content
QUICK REVIEW

[논문 리뷰] Robust Constrained Reinforcement Learning for Continuous Control with Model Misspecification

Daniel J. Mankowitz, Dan A. Calian|arXiv (Cornell University)|2020. 10. 20.
Reinforcement Learning in Robotics참고 문헌 29인용 수 4
한 줄 요약

이 논문은 연속 제어에서 모델 부정확성에 의한 제약 조건을 다루기 위해 R3C와 RC 강화학습 목표를 제안한다. 여기서 정책는 예측되지 않은 상태 변형에 대해 강건성을 유지해야 하며, 동시에 제약 조건을 충족해야 한다. 강건한 제약 조건이 있는 MDP(마르코프 결정 과정)를 정의하고, 이에 해당하는 벨먼 연산자를 정의함으로써, 이 방법은 기준선 대비 여섯 개의 MuJoCo 작업에서 수익의 강건성과 제약 조건 충족도 향상을 보장하며 수렴성을 확보한다.

ABSTRACT

Many real-world physical control systems are required to satisfy constraints upon deployment. Furthermore, real-world systems are often subject to effects such as non-stationarity, wear-and-tear, uncalibrated sensors and so on. Such effects effectively perturb the system dynamics and can cause a policy trained successfully in one domain to perform poorly when deployed to a perturbed version of the same domain. This can affect a policy's ability to maximize future rewards as well as the extent to which it satisfies constraints. We refer to this as constrained model misspecification. We present an algorithm that mitigates this form of misspecification, and showcase its performance in multiple simulated Mujoco tasks from the Real World Reinforcement Learning (RWRL) suite.

연구 동기 및 목표

  • 학습 중에 관측되지 않은 상태 변형이 발생할 경우 정상 환경에서 학습된 정책가 성능 저하 또는 제약 위반을 겪는 제약 조건 부정확성(CMM) 문제를 해결하기 위해.
  • 배포 시 변형된 환경에서 성능 저하와 제약 위반에 대해 정책가 강건성을 유지하도록 보장하기 위해.
  • 불확실성 하에서 수익과 제약 조건 충족도를 동시에 최적화하는 통합된 강화학습 프레임워크를 개발하기 위해.
  • 최신 연속 제어 알고리즘(D4PG, DMPO)에 새로운 가치 함수와 벨먼 연산자 정의를 통해 모델 변형에 대한 강건성을 확장하기 위해.

제안 방법

  • 상태 전이의 불확실성을 전이 확률에 대한 애매함 집합으로 모델링하는 강건한 제약 조건 MDP(RC-MDP) 공식화를 제안한다.
  • 강건한 수익 강건 제약(R3C)과 강건 제약(RC)이라는 두 가지 새로운 강화학습 목표를 정의하여, 변형된 환경에서의 최악의 수익과 제약 조건 충족도를 최적화한다.
  • 액터-크리틱 알고리즘에서 정책 평가 시 고정점에 수렴하도록 보장하는 R3C 및 RC 벨먼 연산자를 도입한다.
  • D4PG와 DMPO 위에 R3C 및 RC의 알고리즘 변형을 구현하여, 정책 평가 단계에 강건한 가치 함수 업데이트를 통합한다.
  • 제약 조건을 강제하기 위해 라그랑주 승수를 사용하며, 제약 위반과 수익 극대화 사이의 균형을 유지하기 위해 라그랑주 승수를 동적으로 조정한다.
  • 실제 배포 시 알려지지 않은 변형이 발생할 수 있는 상황을 시뮬레이션하기 위해, 변형된 환경의 별도의 테스트 세트를 사용하여 강건성을 평가한다.

실험 결과

연구 질문

  • RQ1학습 중에 관측되지 않은 상태 변형이 발생할 경우, RL 에이전트가 제약 조건을 유지할 수 있는가?
  • RQ2모델 부정확성 존재 하에서 수익과 제약 조건 충족도의 강건 최적화는 학습 안정성과 성능에 어떤 영향을 미치는가?
  • RQ3제안된 R3C와 RC 목표는 표준 제약 조건이 있는 강화학습 대비 예측되지 않은 변형 환경에서 더 잘 일반화되는 정책을 도출하는가?
  • RQ4강건성은 제약 조건의 엄격함에 어떤 영향을 미치는가? 즉, 너무 경계하는 행동을 유도하는가?
  • RQ5강건한 제약 조건 충족도를 최적화할 때 라그랑주 승수는 학습 과정에서 어떻게 행동하는가?

주요 결과

  • R3C-DMPO와 RC-DMPO 알고리즘이 여섯 개의 MuJoCo 작업에서 기준선 전부를 압도하며, 정상 환경과 별도의 테스트 환경 모두에서 제약 조건 충족도를 유지한다.
  • 강건한 변형(R3C-DMPO, RC-DMPO)은 예측되지 않은 변형 환경에서 제약 조건 수익(J_C^π)을 기준선 대비 유의미하게 향상시켜, 새로운 변형에 대한 강건성을 입증한다.
  • 비강건 기준선(C-DMPO, R-DMPO)은 정상 학습 환경에선 성공했지만, 테스트 환경에서는 제약 조건을 충족하지 못한다.
  • 강건 알고리즘은 정상 환경에서 제약 조건이 충족되어도 라그랑주 승수가 0이 되지 않으며, 이는 불확실성 하에서도 제약 조건 강제가 활성화되어 있음을 나타낸다.
  • 학습 곡선은 강건 알고리즘이 제약 조건 처리에 더 보수적인 경향을 보이며, 제약 조건 수익이 항상 임계값 β 이하로 유지됨을 보여주며, 과도한 보수성의 가능성을 시사한다.
  • 제안된 R3C 및 RC 벨먼 연산자가 고정점으로 수렴함을 확인하여, 이 방법의 이론적 기반을 검증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.