[논문 리뷰] Deep adaptive dynamic programming for nonaffine nonlinear optimal control problem with state constraints
이 논문은 상태 제약 조건이 있는 비아핀형 비선형 최적 제어 문제를 해결하기 위해 딥 신경망을 사용하는 제약 조건이 있는 딥 어댑티브 동적 프ogramming(CDADP) 알고리즘을 제안한다. 정책 개선을 제약 조건이 있는 최적화 문제로 변환하고, 트러스트 영역과 이중 최적화를 활용함으로써, 기저 함수 없이 안정적이고 빠른 수렴을 보장하는 직접 학습을 가능하게 한다. 이는 경로 추적 차량 제어에서 효과적으로 입증되었다.
This paper presents a constrained deep adaptive dynamic programming (CDADP) algorithm to solve general nonlinear optimal control problems with known dynamics. Unlike previous ADP algorithms, it can directly deal with problems with state constraints. Both the policy and value function are approximated by deep neural networks (NNs), which directly map the system state to action and value function respectively without needing to use hand-crafted basis function. The proposed algorithm considers the state constraints by transforming the policy improvement process to a constrained optimization problem. Meanwhile, a trust region constraint is added to prevent excessive policy update. We first linearize this constrained optimization problem locally into a quadratically-constrained quadratic programming problem, and then obtain the optimal update of policy network parameters by solving its dual problem. We also propose a series of recovery rules to update the policy in case the primal problem is infeasible. In addition, parallel learners are employed to explore different state spaces and then stabilize and accelerate the learning speed. The vehicle control problem in path-tracking task is used to demonstrate the effectiveness of this proposed method.
연구 동기 및 목표
- 기존의 어댑티브 동적 프로그래밍(ADP) 방법이 직접 다룰 수 없는 일반적인 비선형 최적 제어 문제에 대한 상태 제약 조건을 해결하고자 한다.
- 정책과 가치 함수 근사에서 수작업으로 설계된 기저 함수가 필요 없도록 딥 신경망을 사용하고자 한다.
- 트러스트 영역 정규화를 통한 제약 조건 최적화 공식을 통해 정책 학습 중 제약 조건 이행을 보장하고자 한다.
- 병렬 학습자들을 활용하여 상태 공간의 다양한 영역을 탐색함으로써 학습의 안정성과 속도를 향상시키고자 한다.
- 자율 주행 차량의 경로 추적 제어 문제와 같은 실제 응용 사례에서 방법을 검증하고자 한다.
제안 방법
- 정책과 가치 함수는 시스템 상태를 직접 행동과 값으로 매핑하는 딥 신경망을 사용하여 근사하며, 기저 함수가 필요 없도록 한다.
- 상태 제약 조건은 상태 변수에 대한 부등식 제약 조건을 포함하는 제약 조건 최적화 문제로 정책 개선 단계를 재구성함으로써 구현된다.
- 제약 조건이 있는 문제의 국소 선형화를 통해 이차 제약 조건이 있는 이차 프로그래밍(QCQP) 문제로 변환된다.
- 최적의 정책 업데이트는 QCQP 문제의 이중 문제를 풀어 유도되며, 이는 효율적이고 안정적인 매개변수 업데이트를 가능하게 한다.
- 기본 최적화 문제가 비가능해지는 경우를 대비해 복구 규칙을 도입하여 안정적인 학습을 보장한다.
- 병렬 학습자들을 사용하여 상태 공간의 다양한 영역을 탐색함으로써 탐색 능력을 향상시키고 수렴 속도를 높인다.
실험 결과
연구 질문
- RQ1딥 신경망은 상태 제약 조건이 있는 비아핀형 비선형 최적 제어 문제에서 정책과 가치 함수를 효과적으로 근사할 수 있는가?
- RQ2기저 함수에 의존하지 않고 어댑티브 동적 프로그래밍의 정책 개선 과정에 상태 제약 조건을 통합하는 방법은 무엇인가?
- RQ3트러스트 영역 제약 조건과 이중 최적화는 정책 업데이트의 안정성과 수렴성에 어떤 영향을 미치는가?
- RQ4병렬 학습자는 제약 조건이 있는 비선형 제어 환경에서 더 빠르고 안정적인 학습에 어떻게 기여하는가?
- RQ5제안된 CDADP 프레임워크는 차량 경로 추적과 같은 실제 제어 과제에서 신뢰할 수 있는 성능을 달성할 수 있는가?
주요 결과
- CDADP 알고리즘은 수작업으로 설계된 기저 함수가 없이도 비아핀형 비선형 최적 제어 문제에서 상태 제약 조건을 성공적으로 처리한다.
- 트러스트 영역 제약 조건과 이중 최적화의 사용은 복잡한 제약 조건 하에서도 안정적이고 타당한 정책 업데이트를 보장한다.
- 복구 규칙은 기본 최적화 문제가 비가능해지는 경우를 효과적으로 관리하여 학습의 연속성을 유지한다.
- 병렬 학습자들은 상태 공간의 다양한 탐색을 가능하게 하여 학습 속도와 안정성을 크게 향상시킨다.
- 이 방법은 경로 추적 제어 과제에서 뛰어난 성능을 보이며, 실질적인 차량 제어 응용 분야에서의 효과성을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.