[논문 리뷰] Harfang3D Dog-Fight Sandbox: A Reinforcement Learning Research Platform for the Customized Control Tasks of Fighter Aircrafts
이 논문은 강화학습(RL) 연구를 위한 맞춤형이고 반현실적인 3D 비행 시뮬레이션 플랫폼인 Harfang3D Dog-Fight Sandbox를 소개한다. 이 플랫폼은 연속적인 상태 공간과 행동 공간을 사용하여 딥 강화학습 에이전트를 훈련시키며, TD3+HER를 활용하여 복잡한 공중 환경에서 인간과 유사한 행동을 보이는 내시적 범위(WVR) 전투 및 주행 작업을 성공적으로 달성한다.
The advent of deep learning (DL) gave rise to significant breakthroughs in Reinforcement Learning (RL) research. Deep Reinforcement Learning (DRL) algorithms have reached super-human level skills when applied to vision-based control problems as such in Atari 2600 games where environment states were extracted from pixel information. Unfortunately, these environments are far from being applicable to highly dynamic and complex real-world tasks as in autonomous control of a fighter aircraft since these environments only involve 2D representation of a visual world. Here, we present a semi-realistic flight simulation environment Harfang3D Dog-Fight Sandbox for fighter aircrafts. It is aimed to be a flexible toolbox for the investigation of main challenges in aviation studies using Reinforcement Learning. The program provides easy access to flight dynamics model, environment states, and aerodynamics of the plane enabling user to customize any specific task in order to build intelligent decision making (control) systems via RL. The software also allows deployment of bot aircrafts and development of multi-agent tasks. This way, multiple groups of aircrafts can be configured to be competitive or cooperative agents to perform complicated tasks including Dog Fight. During the experiments, we carried out training for two different scenarios: navigating to a designated location and within visual range (WVR) combat, shortly Dog Fight. Using Deep Reinforcement Learning techniques for both scenarios, we were able to train competent agents that exhibit human-like behaviours. Based on this results, it is confirmed that Harfang3D Dog-Fight Sandbox can be utilized as a 3D realistic RL research platform.
연구 동기 및 목표
- 복잡하고 동적인 공중 전투 시나리오에서 강화학습 에이전트를 훈련시키기 위한 현실적이고 맞춤형 3D 시뮬레이션 플랫폼의 부족을 해결하기 위해.
- 전문가 지시나 실제 세계 데이터에 의존하지 않고도 연속적인 행동 및 상태 공간을 사용하여 전투기의 저수준 제어에 대한 연구를 가능하게 하기 위해.
- 도그파이팅과 같은 고급 작업 학습을 위한 협동 및 경쟁 구성이 가능한 다중 에이전트 시나리오를 지원하기 위해.
- OpenAI Gym과 호환되며 확장 가능한 RL 실험을 위한 분산 훈련을 지원하는 유연하고 고해상도 시뮬레이션 환경을 제공하기 위해.
- 목표 지점 주행 및 내시적 범위(WVR) 전투 작업에 대해 훈련된 능력 있는 RL 에이전트를 통해 플랫폼의 효과성을 검증하기 위해.
제안 방법
- 플랫폼은 C++로 구축되었으며, OpenAI Gym과 같은 기존 RL 프레임워크와의 통합을 가능하게 하는 Python, Lua, Golang API를 지원한다.
- 렌더링이 없는 모드를 포함한 여러 런타임 모드를 지원하여 그래픽 오버헤드 없이 효율적인 훈련을 가능하게 한다.
- 위치, 올리어 각도, 속도, 가속도, 헤딩 등의 연속적인 감각 입력을 제공하여 풍부한 상태 표현을 가능하게 한다.
- 일부어론, 엘레베이터, 루더의 저수준 조작을 통해 에이전트가 직접 비행 제어를 학습할 수 있도록 한다.
- 후행 경험 재생(HER)을 통합한 쌍둥이 지연된 딥 결정적 정책 기반 강화학습(TD3) 알고리즘을 사용하여 훈련한다.
- 목표 지점까지의 거리 기반으로 정의된 희박한 보상 함수를 사용하며, 성공 시 +100, 실패 또는 충돌 시 -100의 보상을 제공하여 효율적인 학습을 촉진한다.
실험 결과
연구 질문
- RQ1반현실적인 3D 비행 시뮬레이션 환경은 복잡한 전투기 제어 작업을 위한 딥 강화학습 에이전트의 효과적인 훈련을 지원할 수 있는가?
- RQ2Harfang3D Dog-Fight Sandbox에서 훈련된 RL 에이전트는 전문가 지시 없이 인간과 유사한 주행 및 도그파이팅 행동을 얼마나 잘 학습할 수 있는가?
- RQ3TD3+HER 알고리즘은 3D 공중 전투 환경에서 고차원 연속 제어 작업을 위한 제어 정책 학습에 얼마나 효과적인가?
- RQ4플랫폼은 경쟁적 또는 협동적 작업을 위한 확장 가능한 분산 훈련과 다중 에이전트 구성 지원을 가능하게 하는가?
- RQ5렌더링이 없는 모드는 성능 저하 없이 효율적이고 장기적인 훈련을 가능하게 하는가?
주요 결과
- 에이전트는 약 1400 에피소드 만에 목표 위치로 주행하는 것을 성공적으로 학습하였으며, 1000 에피소드에 도달해 수렴함을 보였다.
- 에피소드 보상 곡선은 800 에피소드 이후 학습 속도 저하를 보이다가 안정화되고 수렴함을 나타내어 효과적인 정책 학습을 확인하였다.
- TD3+HER의 사용은 기준선 DDPG보다 뚜렷하게 우수했으며, 과대평가 문제로 인해 DDPG는 기본적인 주행 조차 학습하지 못했다.
- 플랫폼은 렌더링이 없는 모드를 통해 그래픽 오버헤드를 제거하여 서버 기반 배포 및 확장 가능한 분산 훈련을 가능하게 하였다.
- 시뮬레이션 환경은 다중 에이전트 구성 지원을 통해 도그파이팅과 같은 경쟁적 및 협동적 작업 개발을 성공적으로 지원하였다.
- 목표 지점까지의 거리 기반 보상과 희박한 종료 보상의 조합이 밀도 높은 형태의 보상 설계 없이도 에이전트가 목표로 향하도록 효과적으로 이끌었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.