[논문 리뷰] Exploiting Spatial-Temporal Modelling and Multi-Modal Fusion for Human Action Recognition
이 논문은 영상에서 국소적 시공간 패턴과 장거리 시간 동역학을 동시에 학습하기 위해 2D 및 3D 컨볼루션을 조합하는 공간-시간 모델링 프레임워크인 StNet을 제안한다. 또한, RGB, 광학 흐름, 오디오 모odal리티를 조기 융합 및 만기 융합 전략을 통해 융합하는 개선된 시간 Xception 네트워크인 iTXN을 도입하여, 모델 앙상블을 통해 Kinetics-600 검증 세트에서 85.0%의 top-1 정확도를 달성한다.
In this report, our approach to tackling the task of ActivityNet 2018 Kinetics-600 challenge is described in detail. Though spatial-temporal modelling methods, which adopt either such end-to-end framework as I3D \cite{i3d} or two-stage frameworks (i.e., CNN+RNN), have been proposed in existing state-of-the-arts for this task, video modelling is far from being well solved. In this challenge, we propose spatial-temporal network (StNet) for better joint spatial-temporal modelling and comprehensively video understanding. Besides, given that multi-modal information is contained in video source, we manage to integrate both early-fusion and later-fusion strategy of multi-modal information via our proposed improved temporal Xception network (iTXN) for video understanding. Our StNet RGB single model achieves 78.99\% top-1 precision in the Kinetics-600 validation set and that of our improved temporal Xception network which integrates RGB, flow and audio modalities is up to 82.35\%. After model ensemble, we achieve top-1 precision as high as 85.0\% on the validation set and rank No.1 among all submissions.
연구 동기 및 목표
- 통합적이고 엔드 투 엔드 프레임워크에서 공간 및 시간 특징을 동시에 모델링하여 영상 이해를 향상시키기 위해.
- RNN 등 전통적인 순환 아키텍처의 시간 모델링 한계를 해결하기 위해, 최적화 및 성능 향상을 위해 3D 컨볼루션으로 이를 대체하기 위해.
- RGB, 광학 흐름, 오디오 등의 다중 모달 영상 신호를 조기 및 만기 융합 전략을 통해 효과적으로 융합하여 인식 정확도를 향상시키기 위해.
- 아키텍처 혁신과 모델 앙상블을 통해 ActivityNet 2018 Kinetics-600 도전 대회에서 최고 성능을 달성하기 위해.
제안 방법
- StNet은 N개의 연속된 RGB 프레임을 채널 차원에 따라 스택하여 슈퍼 이미지를 구성함으로써, 2D 컨볼루션을 통해 국소적 시공간 패턴을 모델링할 수 있도록 한다.
- 장거리 시간 의존성은 시간 커널 크기가 3이고 공간 커널 크기가 1인 3D 컨볼루션을 사용하여 T개의 샘플된 슈퍼 이미지에 적용함으로써 캡처한다.
- 3D 컨볼루션 블록은 ResNet의 Res3 및 Res4 블록 이후에 삽입되어 계층적 특징 학습을 유지하면서도 시간 모델링을 가능하게 한다.
- iTXN은 시간 Xception 블록을 통해 RGB, TV_L1 흐름, Farneback 흐름, 오디오 특징을 개별적으로(만기 융합을 위해) 및 함께(조기 융합을 위해) 처리함으로써 다중 모달 입력을 통합한다.
- 조기 융합 특징(다양한 모달리티를 연결한 것)과 개별적으로 인코딩된 모달리티 특징을 결합하여 분류를 위한 통합 표현을 생성한다.
- 기울기 부스팅 결정 트리(GBDT)를 통한 모델 앙상블을 사용하여 단일 모달리티 및 다중 모달리티 모델의 예측을 조합함으로써 성능을 극대화한다.
실험 결과
연구 질문
- RQ1하이브리드 2D-3D 컨볼루션 아키텍처가 표준 이중 스트림 또는 RNN 기반 모델보다 엔드 투 엔드 영상 행동 인식에서 더 우수한 성능을 내는가?
- RQ2다중 모달 영상 입력에 대해 조기 융합 및 만기 융합 전략을 병행하여 사용할 경우, 단일 전략을 사용하는 것보다 성능 향상이 이루어지는가?
- RQ3완전한 3D 커널을 사용하지 않고도 파rameter 수를 줄인 3D 컨볼루션 기반 시간 모델링 방법이, 전체 3D 커널을 사용하는 3D CNN에 비해 강력한 성능을 낼 수 있는가?
- RQ4RGB 특징에 오디오 및 광학 흐름을 융합하는 것이 대규모 행동 인식 벤치마크에서 인식 정확도 향상에 얼마나 효과적인가?
- RQ5다양한 단일 및 다중 모달리티 모델을 앙상블하여 Kinetics-600에서 top-1 정확도를 얼마나 향상시킬 수 있는가?
주요 결과
- StNet-IRv2는 Kinetics-600 검증 세트에서 78.99%의 top-1 정확도를 기록하여 TSN-IRv2를 2.83%포인트 뛰어넘었다.
- 제안된 StNet 프레임워크는 전체 3D 컨볼루션을 피하고 파라미터 수가 적은 점을 감안할 때, nonlocal-Res50-I3D와 유사하거나 더 우수한 성능을 달성했다.
- RGB, 흐름, 오디오 모달리티를 조기 및 만기 융합한 iTXN은 82.35%의 top-1 정확도를 기록하여 다중 모달 융합의 효과를 입증했다.
- GBDT를 사용한 최종 모델 앙상블은 85.0%의 top-1 정확도와 96.9%의 top-5 정확도를 기록하여 ActivityNet 2018 Kinetics-600 도전 대회에서 1위를 차지했다.
- 각 모달리티의 성능는 크게 차이가 있었으며, RGB는 78.99%, Farneback 흐름은 71.3%, TV_L1 흐름은 65.1%, 오직 오디오만으로는 23%의 정확도를 기록하여 다중 모달 융합의 중요성을 강조했다.
- 절단 분석 결과, ResNet 블록 이후에 위치한 StNet의 3D 컨볼루션 블록이 표준 2D 또는 이중 스트림 베이스라인 대비 장거리 시간 모델링을 크게 향상시켰다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.