[논문 리뷰] Robust On-Line ADP-based Solution of a Class of Hierarchical Nonlinear Differential Game
이 논문은 모델 불확실성과 외란이 존재하는 상황에서 한 명의 리더와 다수의 팔로워를 포함하는 계층적 비선형 미분 게임을 해결하기 위한 새로운 온라인 적응형 동적 프ogram밍(ADP) 방법을 제안한다. 신경망을 활용해 가치 함수, 제어 정책, 외란을 추정함으로써, 신경망 사용을 약 30% 감소시키고 라플라스 기반 분석을 통해 강인 수렴성을 확보하여, 악성 외란 조건 하에서도 0-합 게임 및 비0-합 게임 성분을 효과적으로 다룰 수 있음을 입증한다.
In this paper, a hierarchical one-leader-multi-followers game for a class of continuous-time nonlinear systems with disturbance is investigated by a novel policy iteration reinforcement learning technique in which, the game model consists both of the zero-sum and nonzero-sum games, simultaneously. An adaptive dynamic programming (ADP), method is developed to achieve optimal control strategy under the worst case of disturbance. This algorithm reduces the number of neural networks which are used for estimation for about thirty percent. The proposed algorithm uses neural networks to estimate value functions, control policies and disturbances. Convergence analysis of the estimations is investigated using Lyapunov theory and exploiting properties of the Nemytskii operator. Finally, the simulation results will show effectiveness of the developed ADP method.
연구 동기 및 목표
- 모델 불확실성과 악성 외란 조건 하에서 계층적 리더-팔로워 비선형 미분 게임을 해결하는 데 도전하는 것.
- 신경망 사용을 최소화하여 계산 복잡도를 감소시키는 효율적인 온라인 ADP 기반 해법을 개발하는 것.
- 라플라스 안정성 이론을 활용해 외란에 대한 강인성과 스택엘베르크-내쉬 균형으로의 수렴을 보장하는 것.
- 통합 프레임워크 내에서 가치 함수, 제어 정책, 외란 신호를 동시에 추정하기 위해 신경망을 통합하는 것.
- 시뮬레이션을 통해 제안된 방법의 효과성을 검증하여, 동시에 0-합 및 비0-합 게임 성분을 다룰 수 있음을 보여주는 것.
제안 방법
- 실시간으로 제어 정책과 가치 함수 근사치를 반복적으로 갱신하는 정책 반복 기반 ADP 프레임워크를 활용한다.
- 신경망을 사용해 가치 함수, 제어 정책, 외란 신호를 추정함으로써, 필요한 네트워크 수를 약 30% 감소시킨다.
- 라플라스 이론과 네미츠키 연산자의 성질을 적용하여 추정 오차와 시스템 상태의 균일 최종 유계성(UUB)을 증명한다.
- 0-합 및 비0-합 게임 성분을 통합하는 수정된 비용 함수를 도입하여 동시에 최적화를 가능하게 한다.
- 기울기 하강법을 사용해 신경망의 온라인 가중치 갱신을 수행하여 실시간 적응을 보장한다.
- 행렬 부등식과 조정 파rameter $F_1^i$, $F_2^i$를 이용해 오차 동역학을 유계화함으로써 안정성에 대한 충분조건을 유도하고, 헤시안 행렬 $M$의 정정규성(positive definiteness)을 보장한다.
실험 결과
연구 질문
- RQ10-합 및 비0-합 성분을 모두 포함하는 계층적 비선형 미분 게임을 해결하기 위해 온라인 ADP 방법을 어떻게 설계할 수 있는가?
- RQ2모델 불확실성과 외란 조건 하에서 강인 제어를 달성하기 위해 필요한 최소한의 신경망 수는 얼마인가?
- RQ3라플라스 안정성 이론을 어떻게 적용하여 외란 존재 조건 하에서 ADP 기반 추정기의 수렴성을 증명할 수 있는가?
- RQ4제안된 프레임워크에서 추정 오차와 시스템 상태의 균일 최종 유계성(UUB)을 보장하기 위한 조건은 무엇인가?
- RQ5기존의 ADP 기반 동적 게임 해법과 비교했을 때, 제안된 방법의 성능 및 복잡도는 어떻게 다른가?
주요 결과
- 제안된 ADP 방법은 기존 접근 방식 대비 추정에 사용되는 신경망 수를 약 30% 감소시킨다.
- 추정 오차와 시스템 상태가 균일 최종 유계성(UUB)임이 증명되어, 악성 외란 조건 하에서도 장기적인 안정성이 보장된다.
- 라플라스 이론과 네미츠키 연산자의 성질을 활용해 알고리즘의 스택엘베르크-내쉬 균형으로의 수렴성이 분석적으로 확립된다.
- 단일 통합 프레임워크 내에서 0-합 및 비0-합 게임 성분을 효과적으로 동시에 처리하여, 불확실성 조건 하에서도 강인 제어를 가능하게 한다.
- 시뮬레이션 결과는 모델 불확실성과 외란 존재 조건 하에서도 최적 제어 전략을 달성하는 데서 알고리즘의 효과성을 확인한다.
- 조정 파rameter $F_1^i$와 $F_2^i$가 헤시안 행렬 $M$의 정정규성을 보장함으로써 안정성 영역과 수렴 속도에 결정적인 영향을 미친다는 것이 입증된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.