[논문 리뷰] Policy Learning of MDPs with Mixed Continuous/Discrete Variables: A Case Study on Model-Free Control of Markovian Jump Systems
이 논문은 혼합 연속/이산 상태를 가진 하이브리드 MDP인 마코프 점프 선형 시스템(MJLS)에서 모델 프리 강화학습을 위한 데이터 기반 자연 정책 그래เดียน트 방법을 제안한다. 제어 이론을 활용한 정책 파rameterization와 기준값을 사용한 REINFORCE를 통해, 시스템 동역학이나 점프 전이 확률을 식별하지 않고도 최적의 상태 피드백 제어를 학습하며, 시뮬레이션에서 거의 최적의 성능을 달성한다.
Markovian jump linear systems (MJLS) are an important class of dynamical systems that arise in many control applications. In this paper, we introduce the problem of controlling unknown (discrete-time) MJLS as a new benchmark for policy-based reinforcement learning of Markov decision processes (MDPs) with mixed continuous/discrete state variables. Compared with the traditional linear quadratic regulator (LQR), our proposed problem leads to a special hybrid MDP (with mixed continuous and discrete variables) and poses significant new challenges due to the appearance of an underlying Markov jump parameter governing the mode of the system dynamics. Specifically, the state of a MJLS does not form a Markov chain and hence one cannot study the MJLS control problem as a MDP with solely continuous state variable. However, one can augment the state and the jump parameter to obtain a MDP with a mixed continuous/discrete state space. We discuss how control theory sheds light on the policy parameterization of such hybrid MDPs. Then we modify the widely used natural policy gradient method to directly learn the optimal state feedback control policy for MJLS without identifying either the system dynamics or the transition probability of the switching parameter. We implement the (data-driven) natural policy gradient method on different MJLS examples. Our simulation results suggest that the natural gradient method can efficiently learn the optimal controller for MJLS with unknown dynamics.
연구 동기 및 목표
- 혼합 연속 및 이산 상태 변수를 가진 하이브리드 MDP에서 정책 기반 강화학습의 과제를 해결한다.
- 이산 시간 마코프 점프 선형 시스템(MJLS)의 최적 제어를 랜덤 알고리즘의 벤치마크로 설정한다.
- 시스템 동역학이나 점프 전이 확률 파rameter를 식별할 필요가 없는 데이터 기반 정책 최적화 방법을 개발한다.
- 자연 정책 그래디언트와 REINFORCE 추정기 및 기준값을 사용하여 MJLS에서 최적의 제어기를 학습하는 데의 효과성을 입증한다.
- 기울기 투영을 통한 구조화된 제어기 설계를 탐색하며, 비구조화된 최적의 이득을 단순히 투영하는 데서의 한계를 보여준다.
제안 방법
- 점프 파라미터를 MJLS 상태에 통합하여 혼합 연속/이산 상태 공간을 가진 하이브리드 MDP를 구성한다.
- MJLS 제어 이론의 통찰을 활용해 제어 정책을 파arameter화하여 최적 제어 해법과의 구조적 일致성을 확보한다.
- 자연 정책 그래디언트(NPG) 방법을 하이브리드 MDP에 적응시키며, 단순 평균 기준값을 사용한 REINFORCE 정책 그래디언트 추정기를 활용한다.
- 시스템 식별 없이도 온-폴리시 롤아웃에서 정책 그래디언트를 추정하는 확률적 그래디언트 업데이트 규칙을 구현한다.
- 기울기 투영을 적용하여 제어기의 구조적 제약(예: 출력 피드백)을 유지하며 원하는 희박성 또는 액세스 제한을 보존한다.
- 초기 노이즈 분산을 통해 조정된 스텝 사이즈를 사용해 추정된 자연 그래디언트에 대한 반복적 정책 업데이트를 경사 하강법으로 수행한다.
실험 결과
연구 질문
- RQ1시스템 동역학과 스위칭 파라미터가 알려지지 않은 MJLS에 대해 모델 프리 정책 그래디언트 방법이 최적의 제어기를 효과적으로 학습할 수 있는가?
- RQ2혼합 연속 및 이산 상태 변수를 가진 하이브리드 MDP에서 표준 RL 기준 대비 자연 정책 그래디언트 방법의 성능은 어떻게 되는가?
- RQ3제어 이론에 기반한 정책 파arameterization는 MJLS 제어에서 샘플 효율성과 수렴성에 어떤 영향을 미치는가?
- RQ4전체 상태 피드백이 제공되지 않을 경우, 기울기 기반 최적화를 통해 구조화된 제어기를 효과적으로 학습할 수 있는가?
- RQ5비구조화된 최적의 제어기를 구조화된 공간에 단순히 투영하는 것이 좋은 제어기를 얻을 수 있는가, 아니면 능동적 학습이 필수적인가?
주요 결과
- REINFORCE와 평균 기준값을 사용한 자연 정책 그래디언트 방법은 시스템 동역학이나 점프 전이 확률을 식별하지 않고도 거의 최적의 제어기를 학습하는 데 성공했다.
- 2개의 모드를 가진 소규모 예제에서, 예측 비용은 피드백 없음(8.4861)에서 비구조화된 최적(2.5704)으로 감소했고, 100회 반복 후 구조화된 피드백에서는 6.2226로 감소하였다.
- 100개의 모드를 가진 대규모 시스템에서, 25,000~50,000개의 샘플 배치를 사용하여 정책 비용 추정의 상대 오차가 5% 이하로 낮게 유지되었다.
- 샘플 수가 증가함에 따라 정책 비용의 상대 오차가 감소하여 수렴성과 샘플 효율성이 입증되었다.
- 비구조화된 최적 제어기를 구조화된 공간(예: 출력 피드백)에 투영하는 것은 피드백 없음보다도 악화된 비용(13.3227)을 초래하여, 능동적 정책 학습의 필요성을 강조하였다.
- 계산 복잡도가 점프 모드의 방문 빈도에만 의존하므로, 연립 릭카티 방정식을 풀 필요 없이 시스템 크기에 대해 잘 스케일링됨을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.