Skip to main content
QUICK REVIEW

[논문 리뷰] An Image Classifier Can Suffice For Video Understanding.

Quanfu Fan, Chun-Fu Chen|arXiv (Cornell University)|2021. 06. 26.
Human Pose and Action Recognition참고 문헌 47인용 수 6
한 줄 요약

이 논문은 비디오 행동 인식을 시간적 모델링 없이 이미지 분류 작업으로 간주함으로써 비디오 이해에 대한 새로운 접근법을 제안한다. 비디오 프레임을 '슈퍼 이미지'로 조합하고, 사전 훈련된 이미지 분류기를 적용함으로써, 3D 컨볼루션 또는 순환 네트워크와 같은 명시적 시간 모델링 없이도 Kinetics400, Something-Want-What (V2), MiT, Jester에서 우수한 성능을 달성하여 복잡한 시공간 모델링에 의존하는 최신 기법들과 견줄 만한 성능을 보인다.

ABSTRACT

We propose a new perspective on video understanding by casting the video recognition problem as an image recognition task. We show that an image classifier alone can suffice for video understanding without temporal modeling. Our approach is simple and universal. It composes input frames into a super image to train an image classifier to fulfill the task of action recognition, in exactly the same way as classifying an image. We prove the viability of such an idea by demonstrating strong and promising performance on four public datasets including Kinetics400, Something-to-something (V2), MiT and Jester, using a recently developed vision transformer. We also experiment with the prevalent ResNet image classifiers in computer vision to further validate our idea. The results on Kinetics400 are comparable to some of the best-performed CNN approaches based on spatio-temporal modeling. our code and models will be made available at this https URL.

연구 동기 및 목표

  • 비디오 이해가 명시적 시간 모델링 없이 이미지 분류기만으로 가능할 수 있는지 조사하기 위해.
  • 행동 인식을 위해 비디오 프레임을 슈퍼 이미지로 조합하는 것의 효과성을 평가하기 위해.
  • 전통적인 시공간 모델과 비교하여 비디오 데이터에 대한 이미지 분류기의 성능을 비교하기 위해.
  • Kinetics400, Something-Want-What (V2), MiT, Jester를 포함한 다양한 비디오 데이터셋에서 이 방법의 타당성을 검증하기 위해.

제안 방법

  • 입력 비디오 프레임이 공간적 및 시간적 순서를 유지하면서 하나의 복합 이미지로 조합되며, 이를 '슈퍼 이미지'라고 부른다.
  • 사전 훈련된 비전 트랜스포머 또는 ResNet 이미지 분류기가 슈퍼 이미지 표현에 대해 미세조정되어 행동 인식에 사용된다.
  • 3D 컨볼루션 또는 순환 네트워크와 같은 명시적 시간 역학 모델링을 전혀 사용하지 않는다.
  • 이 방법은 어떤 이미지 분류기 아키텍처와도 유사하게 적용 가능하며, 일반적인 방법이다.
  • 학습 및 추론 과정이 슈퍼 이미지 기반으로 종단 간(end-to-end)으로 수행되며, 비디오를 단일 이미지 입력으로 간주한다.
  • 표준 벤치마크를 사용하여 여러 공개 비디오 데이터셋에서 이 방법을 평가한다.

실험 결과

연구 질문

  • RQ1명시적 시간 모델링 없이 이미지 분류기만으로 비디오 내 행동을 인식할 수 있는가?
  • RQ2스패티오템포럴 모델링이 있는 모델과 비교해 복합 이미지 기반 이미지 분류기의 비디오 행동 인식 성능는 어떻게 다른가?
  • RQ3이러한 방법이 다양한 비디오 데이터셋(행동 복잡도 및 프레임 레이트가 상이함)에 대해 일반화되는가?
  • RQ4이미지 분류기 선택(예: 비전 트랜스포머 대비 ResNet)이 비디오 이해 작업 성능에 얼마나 큰 영향을 미치는가?

주요 결과

  • 슈퍼 이미지 접근법은 3D 컨볼루션을 사용하는 최신 기반의 CNN 기반 방법들과 유사한 성능을 Kinetics400에서 달성한다.
  • 이 방법은 Kinetics400, Something-Want-What (V2), MiT, Jester를 포함한 여러 데이터셋에서 강력한 일반화 성능를 보였다.
  • 비전 트랜스포머를 이미지 분류기로 사용할 경우 특히 뛰어난 성능를 기록하여 현대적인 자기주의 기반 아키텍처와의 호환성을 입증했다.
  • 3D 컨볼루션 또는 순환 구성 요소가 필요한 모델들에 비해 상당히 감소된 아키텍처 복잡도로도 경쟁 가능한 정확도를 달성했다.
  • 결과적으로, 시간 모델링이 반드시 필요하지 않음을 입증하였으며, 특히 이미지 프레임 조합과 강력한 이미지 분류기의 효과적인 활용이 비디오 이해에 충분함을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.