[논문 리뷰] Learning Stabilizing Controllers of Linear Systems via Discount Policy Gradient
이 논문은 불확실한 선형 시스템을 안정화하기 위해 모델에 의존하지 않는 할인 정책 그래디언트 방법을 제안한다. 이 방법은 정책이 안정화 영역으로 유도되도록 적응적으로 할인 인자를 조정한다. 리아푸노프 이론과 데이터 기반 업데이트를 활용하여, 정확도 ε에 대해 O(log(1/ε))개의 트레이젝터리 내에서 수렴을 달성하며, 이는 이전 연구 대비 샘플 및 시뮬레이션 비용을 크게 감소시킨다.
Stability is one of the most fundamental requirements for systems synthesis. In this paper, we address the stabilization problem for unknown linear systems via policy gradient (PG) methods. We leverage a key feature of PG for Linear Quadratic Regulator (LQR), i.e., it drives the policy away from the boundary of the unstabilizing region along the descent direction, provided with an initial policy with finite cost. To this end, we discount the LQR cost with a factor, by adaptively increasing which gradient leads the policy to the stabilizing set while maintaining a finite cost. Based on the Lyapunov theory, we design an update rule for the discount factor which can be directly computed from data, rendering our method purely model-free. Compared to recent work \citep{perdomo2021stabilizing}, our algorithm allows the policy to be updated only once for each discount factor. Moreover, the number of sampled trajectories and simulation time for gradient descent is significantly reduced to $\mathcal{O}(\log(1/ε))$ for the desired accuracy $ε$. Finally, we conduct simulations on both small-scale and large-scale examples to show the efficiency of our discount PG method.
연구 동기 및 목표
- 모델에 의존하지 않는 강화 학습을 통해 불확실한 선형 시스템의 안정화를 해결한다.
- 정책 그래디언트 방법에서 수렴하기 위해 필요한 샘플 트레이젝터리 수와 시뮬레이션 시간을 줄인다.
- 최적화 중에 정책이 안정화 영역에 머물면서 유한한 비용을 유지할 수 있도록 보장한다.
- 리아푸노프 이론을 활용해 데이터 기반으로 할인 인자를 위한 순수한 데이터 기반 업데이트 규칙을 개발한다.
- 할인 인자 값당 단일 스텝 정책 업데이트를 가능하게 하여 최근의 방법들을 능가한다.
제안 방법
- 이 방법은 안정화 영역으로 정책을 유도하는 적응적 할인 인자를 가진 할인된 LQR 비용 함수를 도입한다.
- 시스템 모델 지식 없이도 데이터로부터 직접 계산할 수 있는, 리아푸노프 이론에 기반한 할인 인자 업데이트 규칙을 유도한다.
- 할인된 비용을 사용한 온-폴리시 롤아웃을 통해 정책 그래디언트를 계산하여 안정화된 제어기로의 내림차순을 보장한다.
- 정책이 안정화 영역에 머물러 있고 유한한 비용을 유지하는 조건을 기반으로 할인 인자를 반복적으로 업데이트한다.
- 할인 인자 값당 정책 업데이트를 단 한 번만 수행하므로 샘플 효율성이 향상된다.
- 이 방법은 순수하게 모델에 의존하지 않으며, 기울기 추정과 할인 인자 적응 모두 관측된 트레이젝터리에만 의존한다.
실험 결과
연구 질문
- RQ1시스템 식별이 필요 없이 모델에 의존하지 않는 정책 그래디언트 방법이 불확실한 선형 시스템을 안정화할 수 있는가?
- RQ2유한한 비용을 유지하면서 정책이 안정화 영역으로 유도되도록 할인 인자를 어떻게 적응적으로 조정할 수 있는가?
- RQ3목표 정확도 ε를 달성하기 위해 제안된 방법의 샘플 복잡도는 어떻게 되는가?
- RQ4이전 연구인 perdomo2021stabilizing와 비교해 본다면, 제안된 방법은 샘플 효율성 측면에서 어떻게 다른가?
- RQ5리아푸노프 이론을 활용해 데이터로부터 직접 할인 인자 업데이트 규칙을 계산할 수 있는가?
주요 결과
- 제안된 방법은 목표 정확도 ε를 달성하기 위해 O(log(1/ε))개의 샘플 트레이젝터리 내에서 수렴을 달성하며, 이는 이전 방법 대비 샘플 복잡도를 크게 감소시킨다.
- 알고리즘은 할인 인자 값당 정책 업데이트를 한 번만 수행할 수 있어 계산 효율성이 향상된다.
- 할인 인자 업데이트 규칙은 리아푸노프 이론에 기반하며, 데이터로부터 직접 계산 가능하여 정책이 안정화 영역에 머물도록 보장한다.
- 최적화 전반에 걸쳐 비용이 유한하게 유지되어 학습 중에 불안정성이 발생하지 않는다.
- 소규모 및 대규모 시스템에 대한 시뮬레이션을 통해 제안된 방법의 효율성과 강건성을 확인하였다.
- 샘플 및 시뮬레이션 효율성 측면에서 최근의 연구(perdomo2021stabilizing)를 능가한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.