Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-Moments in Time: Learning and Interpreting Models for Multi-Action Video Understanding

Mathew Monfort, Bowen Pan|arXiv (Cornell University)|2019. 11. 01.
Human Pose and Action Recognition인용 수 8
한 줄 요약

이 논문은 100만 개의 3초 영상에 걸쳐 200만 개 이상의 액션 레이블을 포함한 대규모 다중 레이블 비디오 데이터셋인 Multi-Moments in Time (M-MiT)을 소개한다. 이는 다중 액션 비디오 이해를 위한 모델의 훈련과 평가를 가능하게 한다. 또한 장테일 학습을 위한 wLSEP 손실 함수, 다중 액션 주의를 시각화하기 위한 mCAM, 학습된 액션 개념을 해석하기 위한 Action Network Dissection와 같은 새로운 방법들을 제안하며, 최종적으로 모델의 해석 가능성과 하류 작업에서의 전이 성능 향상을 입증한다.

ABSTRACT

Videos capture events that typically contain multiple sequential, and simultaneous, actions even in the span of only a few seconds. However, most large-scale datasets built to train models for action recognition in video only provide a single label per video. Consequently, models can be incorrectly penalized for classifying actions that exist in the videos but are not explicitly labeled and do not learn the full spectrum of information present in each video in training. Towards this goal, we present the Multi-Moments in Time dataset (M-MiT) which includes over two million action labels for over one million three second videos. This multi-label dataset introduces novel challenges on how to train and analyze models for multi-action detection. Here, we present baseline results for multi-action recognition using loss functions adapted for long tail multi-label learning, provide improved methods for visualizing and interpreting models trained for multi-label action detection and show the strength of transferring models trained on M-MiT to smaller datasets.

연구 동기 및 목표

  • 비디오에서 동시에나 연속적으로 발생하는 다수의 액션을 포괄하지 못하는 단일 레이블 비디오 데이터셋의 한계를 해결하기 위해.
  • 기존의 Moments in Time와 같은 단일 레이블 데이터셋의 다양성과 규모를 유지하면서도 확장 가능한 대규모 다중 레이블 비디오 데이터셋을 개발하기 위해.
  • 비디오에서의 다중 액션 인식에 특화된 새로운 훈련 목표 함수와 해석 가능성 기법을 설계하기 위해.
  • 다중 레이블 액션 검출을 위한 시각적 주의 맵핑과 특징 분해를 통해 모델 분석을 향상시키기 위해.

제안 방법

  • Moments in Time 데이터셋을 확장하여, 100만 개의 3초 영상에 걸쳐 200만 개 이상의 액션 레이블을 포함한 다중 레이블 데이터셋인 M-MiT를 구축한다.
  • 다중 레이블 비디오 학습에서의 장테일 클래스 분포를 다루기 위해 LSEP 손실 함수의 가중치 버전인 wLSEP을 제안한다.
  • 동시 다수의 액션을 예측하는 데 기여하는 영상 프레임의 공간 영역을 식별하기 위해 mCAM (Multi-Label Class Activation Mapping)을 도입한다.
  • NetDissect 프레임워크에 단일 프레임 액션 영역 데이터셋을 통합하여, 학습된 특징을 액션 개념으로 해석할 수 있는 Action Network Dissection를 개발한다.
  • M-MiT에서 훈련된 ResNet-50 백본을 사용하여 해석 가능성 및 전이 학습 성능을 평가한다.
  • 손실 함수의 추론, 해석 가능성 향상도, 소규모 데이터셋으로의 전이 성능 등을 분석하기 위해 추론 실험(ablation studies)를 수행한다.

실험 결과

연구 질문

  • RQ1한 번의 영상에 동시에나 연속적으로 발생하는 다수의 액션을 포함하고 있으며, 레이블 분포가 장테일인 경우, 어떻게 효과적으로 딥 모델을 다중 액션 비디오 인식에 대해 훈련시킬 수 있는가?
  • RQ2클래스 불균형과 장테일 분포를 고려할 때, 다중 레이블 비디오 액션 인식에 가장 효과적인 손실 함수는 무엇인가?
  • RQ3시각적 주의 맵핑과 특징 분해를 통해 다중 액션 검출의 딥 모델에 대한 해석 가능성을 어떻게 향상시킬 수 있는가?
  • RQ4M-MiT에서 훈련된 모델이 하류의 소규모 데이터셋으로 전이 학습을 통해 얼마나 잘 일반화되는가?
  • RQ5네트워크 해석 프레임워크에 액션 전용 개념을 통합하면, 의미 있는 학습된 특징의 식별 능력이 향상되는가?

주요 결과

  • M-MiT 데이터셋은 100만 개의 3초 영상에 걸쳐 200만 개 이상의 액션 레이블을 포함하며, 기존 비디오 데이터셋의 규모와 다중 레이블 커버리지 면에서 크게 확장되었다.
  • wLSEP 손실 함수는 불균형 데이터를 보완하기 위해 클래스 가중치를 통합함으로써 장테일 다중 레이블 액션 인식에서 모델 성능을 향상시킨다.
  • mCAM은 동시에 발생하는 액션의 예측에 기여하는 다수의 공간 영역을 성공적으로 식별하여, 다중 액션 활동의 정밀한 국소화를 가능하게 한다.
  • Action Network Dissection는 Broden 개념만을 사용할 때 1,351개의 해석 가능한 특징을 제공하는 데서, Broden + 액션 영역을 통합한 경우 2,023개로 증가시키며, 이 중 211개의 해석 가능한 개념이 포함되어 있으며, 이 중 120개는 서로 다른 액션들이다.
  • Broden 데이터셋에 액션 전용 개념을 통합함으로써 해석 가능한 특징의 수가 49% 증가하였으며, 이는 액션 전용 개념이 액션 인식 특징을 해석하는 데 핵심적임을 보여준다.
  • M-MiT에서 훈련된 모델는 소규모 하류 데이터셋으로의 전이 학습에서 뛰어난 성능을 보이며, 일반화를 위한 더 rich한 지도 정보의 유용성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.