Skip to main content
QUICK REVIEW

[논문 리뷰] RSA: Randomized Simulation as Augmentation for Robust Human Action Recognition

Yi Zhang, Xinyue Wei|arXiv (Cornell University)|2019. 12. 03.
Human Pose and Action Recognition참고 문헌 49인용 수 7
한 줄 요약

이 논문은 제어된 3차원 시뮬레이션에서 생성된 대규모 무작위 합성 영상으로 실재 영상 데이터셋을 증강함으로써 인간 행동 인식의 강건성을 향상시키는 Randomized Simulation as Augmentation (RSA) 프레임워크를 제안한다. 도메인 적응 기법인 피니튜닝 및 도메인 적대적 훈련을 활용함으로써 RSA는 NTU RGB+D 및 VIRAT 데이터셋에서 I3D 모델 성능을 크게 향상시키며, 레이블이 붙은 실재 데이터에 대한 의존도를 줄이고, 도전적인 감시 데이터에서 최대 9.09%의 정확도 향상을 달성한다.

ABSTRACT

Despite the rapid growth in datasets for video activity, stable robust activity recognition with neural networks remains challenging. This is in large part due to the explosion of possible variation in video -- including lighting changes, object variation, movement variation, and changes in surrounding context. An alternative is to make use of simulation data, where all of these factors can be artificially controlled. In this paper, we propose the Randomized Simulation as Augmentation (RSA) framework which augments real-world training data with synthetic data to improve the robustness of action recognition networks. We generate large-scale synthetic datasets with randomized nuisance factors. We show that training with such extra data, when appropriately constrained, can significantly improve the performance of the state-of-the-art I3D networks or, conversely, reduce the number of labeled real videos needed to achieve good performance. Experiments on two real-world datasets NTU RGB+D and VIRAT demonstrate the effectiveness of our method.

연구 동기 및 목표

  • 시야각, 조명, 배경 등의 혼란 인자로 인한 인간 행동 인식의 높은 내부 클래스 변동성을 해결하기 위해.
  • 실제 세계 영상 레이블링에 비용이 많이 들기 때문에 합성 데이터 생성을 활용하여 대규모 실재 영상 레이블링에 대한 의존도를 줄이기 위해.
  • 효과적인 도메인 적응 전략을 통해 합성 영상과 실재 영상 도메인 간의 현실 격차를 해소하기 위해.
  • 다양한 혼란 인자 조건 하에서 최신 I3D 네트워크의 일반화 및 강건성을 향상시키기 위해.
  • 합성 데이터 증강이 강력한 성능을 달성하기 위해 필요한 레이블이 붙은 실재 영상의 수를 크게 줄일 수 있음을 입증하기 위해.

제안 방법

  • 운동 캡처 라이브러리, RGB-D 영상 또는 단일 카메라 3D 자세 추정을 통해 획득한 3차원 인간 운동을 활용해 대규모 합성 영상 데이터를 생성한다.
  • 렌더링 중에 카메라 시야각, 배경, 연기자 외형 등의 혼란 인자를 무작위화하여 도메인 다양성을 증가시킨다.
  • 강건성을 향상시키기 위해 실재 및 합성 데이터의 조합을 사용해 3차원 컨volutional 신경망(I3D)을 훈련시킨다.
  • 두 가지 도메인 적응 전략을 적용한다: (1) 합성 데이터에서 사전 훈련한 후 실재 데이터에서 피니튜닝하고, (2) 특성 분포의 차이를 최소화하기 위한 도메인 적대적 훈련.
  • 실재 및 합성 도메인의 특성을 정렬하기 위해 도메인 적대적 훈련을 활용하여 도메인 이동을 줄인다.
  • 영상의 시간적 일관성을 활용하여 RGB 또는 RGB-D 입력에서의 3차원 자세 추정 정확도를 향상시킨다.

실험 결과

연구 질문

  • RQ1무작위 혼란 인자를 가진 합성 영상 데이터가 실세계 변동성에 대한 행동 인식 모델의 강건성을 향상시킬 수 있는가?
  • RQ2도메인 적응은 합성 영상 도메인과 실재 영상 도메인 간의 현실 격차를 완화하는 데 얼마나 효과적인가?
  • RQ3합성 데이터는 높은 성능을 달성하기 위해 필요한 레이블이 붙은 실재 영상의 수를 어느 정도 줄일 수 있는가?
  • RQ4제안된 방법은 VIRAT와 같은 도전적이고 자원이 제한된 데이터셋으로 일반화되는가?
  • RQ5피니튜닝과 도메인 적대적 훈련 중 어느 도메인 적응 전략이 교차 도메인 행동 인식에서 더 높은 성능을 낼 수 있는가?

주요 결과

  • VIRAT 데이터셋에서 도메인 적대적 훈련을 사용한 RSA는 실재 영상 전용 훈련 대비 정확도를 46.01%에서 55.10%로 향상시켜 9.09% 향상되었다.
  • NTU RGB+D에서 RSA는 실재 영상 전용 훈련 대비 I3D 성능을 향상시켜 다양한 혼란 인자 조건 하에서도 강건성을 확보했다.
  • VIRAT에서 도메인 적대적 훈련은 피니튜닝을 초월하여 성능이 뛰어났으며, 효과적인 피니튜닝을 위해 충분한 실재 데이터가 부족했기 때문일 것이다.
  • 합성 데이터만으로 훈련된 모델이 '들어가는' 및 '열기' 등의 일부 클래스에서 실재 영상 전용 훈련을 초월하여 성능을 냈으며, 현실 격차가 존재하더라도 유용한 특징 학습이 가능함을 시사한다.
  • RSA-DA를 사용할 경우 모든 행동 클래스에서 F1 점수가 향상되었으며, 특히 '들어가는' 및 '나가는'과 같이 인식이 어려운 클래스에서 가장 큰 향상을 보였다.
  • LOSО 분할 실험에서 정확도가 52.97%에서 46.01%로 6.96% 하락하여 혼란 인자 변동성이 초래하는 도전의 심각성을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.