Skip to main content
QUICK REVIEW

[논문 리뷰] Lyapunov-Based Reinforcement Learning State Estimator

Liang Hu, Chengwei Wu|arXiv (Cornell University)|2020. 10. 26.
Adaptive Dynamic Programming Control참고 문헌 41인용 수 11
한 줄 요약

이 논문은 비선형 이산시간 스토케스틱 시스템을 위한 라플라스 기반 딥 강화학습 상태 추정기(LRLF)를 제안한다. 깊이 있는 신경망을 사용해 시뮬레이션된 데이터로부터 필터 이득을 학습한다. 이론적으로 초기 오차나 노이즈 가정 없이 유한한 추정 오차를 보장하며, 노이즈 공분산의 변화나 측정값 누락과 같은 불확실성 하에서 전통적 필터보다 뛰어난 성능을 보인다.

ABSTRACT

In this paper, we consider the state estimation problem for nonlinear stochastic discrete-time systems. We combine Lyapunov's method in control theory and deep reinforcement learning to design the state estimator. We theoretically prove the convergence of the bounded estimate error solely using the data simulated from the model. An actor-critic reinforcement learning algorithm is proposed to learn the state estimator approximated by a deep neural network. The convergence of the algorithm is analysed. The proposed Lyapunov-based reinforcement learning state estimator is compared with a number of existing nonlinear filtering methods through Monte Carlo simulations, showing its advantage in terms of estimate convergence even under some system uncertainties such as covariance shift in system noise and randomly missing measurements. To the best of our knowledge, this is the first reinforcement learning based nonlinear state estimator with bounded estimate error performance guarantee.

연구 동기 및 목표

  • 이산시간 스토케스틱 시스템을 위한 증명 가능하게 유한한 추정 오차를 가진 비선형 상태 추정기를 설계한다.
  • EKF와 UKF에서 흔히 사용되는 작은 초기 오차나 무시할 수 있는 선형화 오차와 같은 제한적인 가정에 의존하지 않도록 한다.
  • 실시간 온라인 계산이 필요 없이 시뮬레이션된 데이터로부터 필터 이득을 학습하는 딥 강화학습 프레임워크를 개발한다.
  • 모델-프리 강화학습 환경에서 라플라스 기반 분석을 통해 추정 오차의 이론적 안정성과 수렴성을 확보한다.
  • 노이즈 공분산의 변화나 측정값 누락과 같은 시스템 불확실성 하에서도 상태 추정의 성능 보장을 제공한다.

제안 방법

  • 필터 이득은 시스템 모델에서 생성된 오직 시뮬레이션된 데이터만을 사용해 훈련된 액터-크리틱 강화학습 알고리즘을 통해 깊이 있는 신경망(DNN)으로 근사된다.
  • 라플라스의 직접 방법을 적용하여 추정 오차 동역학의 안정성을 증명함으로써, 초기 오차나 노이즈 수준에 대한 가정 없이 유한한 추정 오차를 보장한다.
  • 훈련 목표는 추정 오차가 상태이고, 액션이 필터 이득 갱신인 마르코프 결정 과정으로 설정된다.
  • 알고리즘은 가치 함수를 추정하는 크리틱 네트워크와 필터 이득을 출력하는 액터 네트워크를 사용하며, 둘 다 기대 추정 오차를 최소화하도록 훈련된다.
  • 라플라스 안정성 프레임워크 하에서 강화학습 알고리즘의 이론적 수렴성을 확립하여 추정 과정에서 오차가 유한하게 유지됨을 보장한다.
  • 몬테카를로 시뮬레이션을 사용해 오프라인으로 훈련하여, 낮은 계산 비용으로 효율적인 온라인 구현이 가능하다.

실험 결과

연구 질문

  • RQ1딥 강화학습 기반 상태 추정기는 초기 오차나 노이즈 강도에 대한 가정 없이 유한한 추정 오차를 달성할 수 있는가?
  • RQ2라플라스 안정성 이론은 모델-프리 강화학습 프레임워크에 효과적으로 통합되어 추정 오차 수렴을 보장할 수 있는가?
  • RQ3노이즈 공분산의 변화나 무작위로 누락되는 측정값과 같은 시스템 불확실성 하에서 제안된 추정기는 어떻게 성능을 발휘하는가?
  • RQ4시스템 모델이 비선형적이고 비정규분포일 경우에도 추정기는 안정성과 정확도를 유지할 수 있는가?
  • RQ5동일한 시뮬레이션 조건 하에서 제안된 방법과 기존의 EKF, UKF, PF 간의 성능 격차는 얼마인가?

주요 결과

  • 제안된 라플라스 기반 강화학습 상태 추정기(LRLF)는 초기 오차나 노이즈 강도에 대한 가정 없이도 이론적으로 유한한 추정 오차를 달성한다.
  • 진자 추적 사례에서 LRLF는 노이즈 공분산의 변화나 측정값 누락과 같은 모델 불확실성 하에서도 안정적인 수렴을 보이며, EKF, UKF, PF를 능가하는 성능을 보였다.
  • 차량 추적 사례에서는 LRLF가 위치와 속도를 최적의 칼만 필터 수준에 가까운 정확도로 추정했으며, 비선형성과 비정규성으로 인해 약간 더 높은 오차가 기대되었다.
  • 비행체 목표 추적 시나리오에서는 LRLF가 베어링 전용 측정값과 비선형 관측 모델 조건 하에서도 조작하는 지상 차량의 상태를 낮은 오차와 견고한 신뢰구간으로 성공적으로 추적했다.
  • 500회에 걸친 몬테카를로 시뮬레이션을 통해 모든 시험 케이스에서 일관된 성능을 확인했으며, LRLF는 불확실성 하에서 기존 필터보다 뛰어난 수렴성과 강인성을 보였다.
  • 저자들에 따르면, 이는 강화학습 기반 비선형 상태 추정기 중에서 이론적 성능 보장(유한한 오차)을 제공하는 최초의 방법이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.