Skip to main content
QUICK REVIEW

[논문 리뷰] Human Action Recognition in Drone Videos using a Few Aerial Training Examples

Waqas Sultani, Mubarak Shah|arXiv (Cornell University)|2019. 10. 22.
Human Pose and Action Recognition인용 수 4
한 줄 요약

이 논문은 실제 드론 영상에서 인간 행동 인식 성능을 햖을 때 실존하는 항공 영상 훈련 예제가 극히 적은 상황에서, 비디오 게임에서 유도한 합성 데이터와 GAN으로 생성한 항공 특징을 활용하여 분리된 다중 작업 학습 프레임워크를 제안한다. 게임 영상과 GAN으로 생성된 특징을 번갈아가며 훈련시킴으로써, YouTube-Aerial에서 최대 68.2%의 평균 정확도와 UCF-ARG에서 35.9%의 정확도를 달성하여, 합성 데이터가 항공 행동 인식에서 실존 데이터 부족을 효과적으로 보완할 수 있음을 보여준다.

ABSTRACT

Drones are enabling new forms of human actions surveillance due to their low cost and fast mobility. However, using deep neural networks for automatic aerial action recognition is difficult due to the need for a large number of training aerial human action videos. Collecting a large number of human action aerial videos is costly, time-consuming, and difficult. In this paper, we explore two alternative data sources to improve aerial action classification when only a few training aerial examples are available. As a first data source, we resort to video games. We collect plenty of aerial game action videos using two gaming engines. For the second data source, we leverage conditional Wasserstein Generative Adversarial Networks to generate aerial features from ground videos. Given that both data sources have some limitations, e.g. game videos are biased towards specific actions categories (fighting, shooting, etc.,), and it is not easy to generate good discriminative GAN-generated features for all types of actions, we need to efficiently integrate two dataset sources with few available real aerial training videos. To address this challenge of the heterogeneous nature of the data, we propose to use a disjoint multitask learning framework. We feed the network with real and game, or real and GAN-generated data in an alternating fashion to obtain an improved action classifier. We validate the proposed approach on two aerial action datasets and demonstrate that features from aerial game videos and those generated from GAN can be extremely useful for an improved action recognition in real aerial videos when only a few real aerial training examples are available.

연구 동기 및 목표

  • 드론 영상에서 인간 행동 인식을 위한 실제 항공 훈련 영상이 부족한 문제를 해결하기 위해.
  • 실존하는 항공 데이터가 부족할 경우 대체 데이터 소스로 비디오 게임과 GAN으로 생성된 특징을 탐색하기 위해.
  • 이질적인 데이터 소스(게임 영상과 GAN 특징)를 실제 항공 예제와 효과적으로 통합하는 강력한 방법을 개발하기 위해.
  • 데이터 소스 간 도메인 이동과 레이블 불일치가 존재하는 상황에서도 일반화 능력과 정확도를 향상시키기 위해.
  • 기본 데이터셋인 항공 행동 인식 데이터셋에서 제안된 프레임워크의 효과성을 검증하기 위해.

제안 방법

  • GTA와 FIFA와 같은 사진 수준의 게임 엔진을 사용하여 실제 드론 환경을 시뮬레이션하는 대규모 항공 게임 영상을 수집한다.
  • 조건부 워셔스타인 GAN을 사용하여 지상 뷰 영상에서 항공 스타일의 특징을 생성함으로써 드론 카메라 시점 효과를 시뮬레이션한다.
  • 레이블과 도메인 불일치 문제를 다루기 위해 실존 영상, 게임 영상, GAN으로 생성된 데이터를 번갈아가며 훈련하는 이산 다중 작업 학습 프레임워크를 설계한다.
  • 실제 항공 영상, 게임 영상, GAN으로 생성된 특징을 조합하여 행동 분류기를 훈련시키며, 각 소스 간에 동일한 행동 레이블이 필요로 하지 않는다.
  • 다양한 아키텍처에서의 강건성과 일반화 능력을 평가하기 위해 다수의 3D CNN 백본(MFN-3D, I3D, ResNet-3D)을 활용한다.
  • 유사 행동 간 오분류 감소를 평가하기 위해 혼동 행렬과 클래스별 정확도 분석을 수행한다.

실험 결과

연구 질문

  • RQ1비디오 게임 영상은 실제 드론 영상에서 행동 인식 성능 향상에 유의미한 합성 데이터 소스로 활용될 수 있는가?
  • RQ2실제 예제가 극히 적은 상황에서 GAN으로 생성된 항공 특징이 실존 훈련 데이터를 효과적으로 보완할 수 있는가?
  • RQ3다른 행동 레이블을 가진 이질적인 데이터 소스(게임 영상과 GAN으로 생성된 특징)를 단일 행동 인식 모델에 효과적으로 통합할 수 있는가?
  • RQ4이산 다중 작업 학습이 항공 영상 행동 인식에서 분류 정확도 향상과 유사 행동 간 오분류 감소에 기여하는가?
  • RQ5제안된 방법이 다양한 3D CNN 아키텍처와 기준 데이터셋에 대해 얼마나 잘 일반화되는가?

주요 결과

  • 이중 다중 작업 학습을 통해 게임 영상과 GAN으로 생성된 특징을 함께 사용할 경우, YouTube-Aerial 데이터셋에서 68.2%의 평균 정확도를 달성하였으며, 이는 실존 데이터만으로 훈련했을 때(51.3%)나 한 가지 합성 소스만 사용했을 때보다 유의미한 향상이다.
  • UCF-ARG 데이터셋에서는 게임 영상과 GAN 데이터를 모두 사용하여 35.92%의 평균 정확도를 기록하였으며, 지상 뷰 영상만 사용했을 때(21.33%)나 각 합성 소스를 별도로 사용했을 때보다 뛰어난 성능을 보였다.
  • 자전거 타기, 흔들기, 카약, 메기, 박수, 달리기와 같은 강한 운동 패턴을 가진 행동에 대해서는 가장 높은 성능 향상을 보였으며, 특정 클래스에서 정확도가 최대 60%까지 상승하였다.
  • 혼동 행렬 분석 결과, 유사 행동 간 오분류가 크게 감소하였으며, 이로 인해 전체 정확도는 DML 없이 훈련했을 때 51.3%에서 DML를 적용하고 두 데이터 소스를 모두 사용했을 때 64.5%로 상승하였다.
  • YouTube-Aerial의 8개 클래스 중 5개, UCF-ARG의 10개 클래스 중 6개에서 두 합성 데이터 소스를 모두 사용했을 때 베이스라인보다 뛰어난 성능을 보였으며, 이는 강력한 일반화 능력을 시사한다.
  • 명확한 운동 신호를 가진 행동에 대해서는 특히 효과적이었지만, 강한 배경 편향(예: 뛰어내리기)이나 신체 운동이 거의 없는 행동(예: 스케이트보드)에는 덜 효과적이었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.