[논문 리뷰] Integrated and Adaptive Guidance and Control for Endoatmospheric Missiles via Reinforcement Learning
이 논문은 항공기에서 발사하는 미사일의 통합적이고 적응형 유도 및 제어를 위한 강화 학습 메타학습 프레임워크를 제안한다. 이 시스템은 항법 출력을 직접 제어 표면의 기울기로 매핑하며, 큰 비행 유효 범위 변화, 비정상적인 항공역학적 매개변수, 유연한 기체 동역학, 그리고 탐지기 유도 태도 오차 상황에서도 강건한 추적 성능을 달성한다. 시뮬레이션 결과, 기존의 3루프 자동조종장치를 갖춘 비례 유도법보다 뛰어난 성능을 보였다.
We apply a reinforcement meta-learning framework to optimize an integrated and adaptive guidance and flight control system for an air-to-air missile. The system is implemented as a policy that maps navigation system outputs directly to commanded rates of change for the missile's control surface deflections. The system induces intercept trajectories against a maneuvering target that satisfy control constraints on fin deflection angles, and path constraints on look angle and load. We test the optimized system in a six degrees-of-freedom simulator that includes a non-linear radome model and a strapdown seeker model, and demonstrate that the system adapts to both a large flight envelope and off-nominal flight conditions including perturbation of aerodynamic coefficient parameters and center of pressure locations, and flexible body dynamics. Moreover, we find that the system is robust to the parasitic attitude loop induced by radome refraction and imperfect seeker stabilization. We compare our system's performance to a longitudinal model of proportional navigation coupled with a three loop autopilot, and find that our system outperforms this benchmark by a large margin. Additional experiments investigate the impact of removing the recurrent layer from the policy and value function networks, performance with an infrared seeker, and flexible body dynamics.
연구 동기 및 목표
- 큰 비행 유효 범위 변화와 비정상적인 조건에 적응할 수 있는 공중에서 공중으로의 미사일을 위한 통합 유도 및 제어 시스템을 개발한다.
- 날개 기울기 제약, 시야각 및 하중에 대한 경로 제약, 그리고 탐지기 유도로 인한 부가적 태도 루프 문제를 해결한다.
- 기존의 유도 법칙과 자동조종장치를 대체하여 항법 출력을 직접 제어 표면 명령으로 매핑하는 학습된 정책을 도입한다.
- 항공역학 계수 변동, 중력 중심 이동, 그리고 기체의 탄성 동역학에 대한 강건성 평가를 수행한다.
- 고정밀 6자유도 시뮬레이션 환경에서 기준 기준 비례 유도법과 3루프 자동조종장치의 성능을 초월하는 것을 입증한다.
제안 방법
- 다양한 비행 조건에서 일반화할 수 있도록 메타학습 프레임워크를 사용해 딥 강화 학습 정책을 훈련시킨다.
- 정책은 실시간 항법 시스템 출력을 직접 미사일 제어 표면 기울기 변화율로 매핑한다.
- 제어 동작의 시간적 의존성을 모델링하기 위해 정책 및 가치 함수 네트워크에 순환 신경망을 통합한다.
- 비선형 레이더 도머 효과와 스트랩다운 탐지기 모델이 포함된 6자유도 시뮬레이션 환경을 구축하여 실제적인 탐지기 동역학을 시뮬레이션한다.
- 항공역학 계수, 중력 중심 위치, 기체의 탄성 동역학에 대한 편향을 포함한 훈련 환경을 구성하여 강건성 테스트를 수행한다.
- 성능 평가를 위해 3루프 자동조종장치를 갖춘 기준 縦방향 비례 유도 시스템과 비교한다.
실험 결과
연구 질문
- RQ1한 개의 강화 학습 정책이 다양한 항공역학적 및 동역학적 조건 하에서 항공기에서 발사하는 미사일의 전체 비행 유효 범위를 효과적으로 처리할 수 있는가?
- RQ2정책 및 가치 함수 네트워크에 순환층을 포함할 경우, 시스템 성능과 적응 가능성에 어떤 영향을 미치는가?
- RQ3레이더 도머 굴절과 완벽하지 않은 안정화로 인해 발생하는 탐지기 유도로 인한 부가적 태도 루프에 대해 시스템은 어느 정도 강건한가?
- RQ4기체의 탄성 동역학과 비정상적인 항공역학적 매개변수 변화 상황에서 시스템은 어떻게 성능을 발휘하는가?
- RQ5학습된 정책은 비례 유도법과 3루프 자동조종장치의 성능을 초월하여 추적 성공률과 제약 준수 측면에서 뛰어나게 작동하는가?
주요 결과
- 강화 학습 기반 시스템은 날개 기울기 제약과 시야각 및 하중 경로 제약을 모두 만족하는 추적 궤도를 성공적으로 생성한다.
- 항공역학 계수 및 중력 중심 위치의 편향이 있는 상황에서도 시스템은 강건한 성능을 보인다.
- 레이더 도머 굴절과 탐지기 안정화의 불완전성으로 인한 부가적 태도 루프가 존재하더라도 시스템은 안정적이고 효과적으로 작동한다.
- 정책 및 가치 함수 네트워크에 순환층을 포함시킴으로써 성능 향상이 크게 향상되며, 특히 시간 동적 특성 처리 및 변화하는 조건에 대한 적응성 향상에 기여한다.
- 기준 비례 유도법과 3루프 자동조종장치의 성능을 초월하여 추적 성공률과 제약 준수 측면에서 뛰어난 성능을 보였다.
- 적외선 탐지기와 기체의 탄성 동역학을 포함한 실험을 통해, 다양한 센서 및 기체 구성 조건에서도 시스템의 적응성과 강건성이 확인되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.