[논문 리뷰] Decoupled Data Based Approach for Learning to Control Nonlinear Dynamical Systems
이 논문은 연속 상태 및 동작 공간을 가진 알려지지 않은 비선형 확률적 동적 시스템에서 최적 제어를 학습하기 위한 분리형 데이터 기반 제어(D2C) 알고리즘을 제안한다. 선형화를 통해 개방 루프 궤적 최적화와 폐쇄 루프 피드백 제어를 분리함으로써, D2C는 DDPG와 같은 최신의 딥 강화 학습 방법에 비해 훈련 시간을 크게 단축하고 데이터 효율성을 향상시키면서도 거의 최적의 성능를 달성한다.
This paper addresses the problem of learning the optimal control policy for a nonlinear stochastic dynamical system with continuous state space, continuous action space and unknown dynamics. This class of problems are typically addressed in stochastic adaptive control and reinforcement learning literature using model-based and model-free approaches respectively. Both methods rely on solving a dynamic programming problem, either directly or indirectly, for finding the optimal closed loop control policy. The inherent `curse of dimensionality' associated with dynamic programming method makes these approaches also computationally difficult. This paper proposes a novel decoupled data-based control (D2C) algorithm that addresses this problem using a decoupled, `open loop - closed loop', approach. First, an open-loop deterministic trajectory optimization problem is solved using a black-box simulation model of the dynamical system. Then, a closed loop control is developed around this open loop trajectory by linearization of the dynamics about this nominal trajectory. By virtue of linearization, a linear quadratic regulator based algorithm can be used for this closed loop control. We show that the performance of D2C algorithm is approximately optimal. Moreover, simulation performance suggests significant reduction in training time compared to other state of the art algorithms.
연구 동기 및 목표
- 모델이 알려지지 않은 연속 상태 및 동작 공간을 가진 비선형 동적 시스템에 대한 최적 제어 정책을 학습하는 데 도전한다.
- 고차원 시스템에서 차원의 극복(curse of dimensionality)으로 인해 동적 프ogramming가 계산적으로 비현실적이 되는 문제를 해결한다.
- 샘플 비효율성과 훈련 불안정성이 딥 강화 학습에서 흔한 점을 피하는 데이터 효율성, 신뢰성 있고 확장 가능한 제어 프레임워크를 개발한다.
- 모델에 의존하지 않는 강화 학습의 체계적 대안을 제공함으로써 실용적 구현을 가능하게 하며, 훈련 시간과 초파rameter 조정을 크게 줄인다.
- 안정적인 훈련 행동과 중간 정도의 시스템 노이즈에 대한 강인성을 확보한다.
제안 방법
- 먼저, 시스템의 블랙박스 시뮬레이션 모델을 사용하여 개방 루프 궤적 최적화 문제를 해결하며, 계획 단계에서는 역학을 알려진 것으로 간주한다.
- 둘째, 명목 궤적 주변의 무작위 입력-출력 변동 데이터를 수집하여 시스템 식별을 통해 선형 정수계(LTI) 모델을 식별한다.
- 식별된 LTI 모델을 사용하여 명목 궤적 주변의 폐쇄 루프 피드백 제어를 위한 선형 제곱조절기(LQR)를 설계한다.
- 명목 궤적 주변의 선형화를 활용하여 전체 동적 프로그래밍을 피하는 효율적인 LQR 기반 제어 합성 기법을 적용한다.
- 계획(개방 루프)과 제어(폐쇄 루프) 단계를 분리하여 계산 복잡도를 감소시키고 훈련 안정성을 향상시킨다.
- 진짜 시스템과의 상호작용을 최소화하여 데이터 효율성을 확보하며, 계획에는 시뮬레이션을, 시스템 식별에는 제한된 변동 데이터를 활용한다.
실험 결과
연구 질문
- RQ1분리형 접근 방식이 알려지지 않은 비선형 시스템에서 궤적 계획과 피드백 제어를 분리함으로써 데이터 효율성과 훈련 안정성을 향상시킬 수 있는가?
- RQ2모델 불확실성 하에서 D2C 방법이 제어 비용과 수렴성 측면에서 거의 최적의 성능를 얼마나 달성하는가?
- RQ3D2C는 DDPG와 같은 최신의 딥 강화 학습 알고리즘에 비해 훈련 시간, 데이터 효율성, 강인성 측면에서 어떻게 비교되는가?
- RQ4시스템 노이즈가 D2C 성능에 미치는 영향은 무엇이며, 모델에 의존하지 않는 강화 학습 방법과 비교해 강인성은 어떠한가?
- RQ5D2C 프레임워크는 시스템 모델에 대한 사전 지식 없이도 고차원 시스템으로 확장될 수 있는가?
주요 결과
- D2C는 거의 최적의 성능를 달성하며, 노이즈 매개변수에 대해 2차 항까지 최적이 되는 이론적 근거를 제시한다.
- D2C의 훈련 시간은 DDPG 대비 극적으로 단축되었으며, 최대 99%까지 감소하였다. 3링크 및 6링크 수영이 시스템에서 3배에서 4배 빠른 훈련 속도를 기록하였다.
- 6링크 수영이 시스템에서 D2C는 9,489.3초의 훈련 시간이 필요했고, DDPG는 88,160초가 소요되었으며, DDPG는 더 긴 기간 동안 훈련되었음에도 불구하고.
- D2C는 뛰어난 데이터 효율성을 보였으며, 특히 고차원 시스템에서 DDPG가 장기간 훈련 후 수렴하지 못하는 상황에서도 성공적인 정책 학습을 이룬다.
- D2C는 안정적이고 예측 가능한 훈련을 보였으며, DDPG 및 기타 딥 RL 알고리즘에서 흔한 초파rameter 조정 문제와 불안정성 문제를 피했다.
- 최대 제어 신호의 100%까지의 노이즈 수준에 대해 강인성을 유지하지만, 임계값을 초과하면 성능이 급격히 악화되어 고불확실성 하에서 피드백 설계 개선이 필요함을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.