Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Spatio-Temporal Features with 3D Residual Networks for Action Recognition

Kensho Hara, Hirokatsu Kataoka|arXiv (Cornell University)|2017. 08. 25.
Human Pose and Action Recognition참고 문헌 17인용 수 79
한 줄 요약

요약: 이 논문은 ResNet을 3D 컨볼루션으로 확장하여 행동 인식을 위한 시공간 특징을 학습하고, 대규모 사전학습을 사용하여 C3D 및 RGB-I3D 베이스라인과 비교했을 때 Kinetics에서 강한 성능을 보인다.

ABSTRACT

Convolutional neural networks with spatio-temporal 3D kernels (3D CNNs) have an ability to directly extract spatio-temporal features from videos for action recognition. Although the 3D kernels tend to overfit because of a large number of their parameters, the 3D CNNs are greatly improved by using recent huge video databases. However, the architecture of 3D CNNs is relatively shallow against to the success of very deep neural networks in 2D-based CNNs, such as residual networks (ResNets). In this paper, we propose a 3D CNNs based on ResNets toward a better action representation. We describe the training procedure of our 3D ResNets in details. We experimentally evaluate the 3D ResNets on the ActivityNet and Kinetics datasets. The 3D ResNets trained on the Kinetics did not suffer from overfitting despite the large number of parameters of the model, and achieved better performance than relatively shallow networks, such as C3D. Our code and pretrained models (e.g. Kinetics and ActivityNet) are publicly available at https://github.com/kenshohara/3D-ResNets.

연구 동기 및 목표

  • 시공간 특징을 더 잘 모델하기 위해 잔차 네트워크를 3D CNN에 적용하여 행동 인식 성능을 개선하려는 동기를 제시한다.
  • 3D 커널과 아이덴티티 숏컷을 갖는 3D ResNet 아키텍처를 제안하여 심층 모델의 학습을 가능하게 한다.
  • 대규모 비디오 데이터셋(Kinetics)에서 3D ResNet을 평가하여 과적합 여부와 성능을 평가한다.
  • 재현성을 위해 사전학습된 3D ResNet 모델과 학습 세부 정보를 제공한다.

제안 방법

  • ResNet 아키텍처를 3x3x3 커널의 3D 컨볼루션과 풀링으로 확장한다.
  • 표준 ResNet-스타일 잔차 블록과 아이덴티티 숏컷을 갖고 16프레임 RGB 클립을 입력으로 사용한다.
  • Kinetics에서 SGD로 학습하며 무작위 시간 샘플링, 다중 스케일 크롭, 가로 뒤집기 등 데이터 증강을 사용한다.
  • 16프레임 클립에 대해 슬라이딩 윈도우 방식으로 평가하고 클립 간 클래스 확률을 평균한다.
  • 깊이와 사전학습 효과를 평가하기 위해 C3D(BN 여부 포함)와 RGB-I3D 베이스라인과 비교한다.

실험 결과

연구 질문

  • RQ1ResNet-스타일 잔차 블록을 3D CNN에 적용하면 대규모 데이터셋에서 행동 인식 성능이 향상되는가?
  • RQ2Kinetics에서 처음부터 학습할 때 더 깊은 3D ResNet은 C3D 및 RGB-I3D 베이스라인과 어떻게 비교되는가?
  • RQ3행동 인식에서 3D CNN의 과적합에 미치는 사전학습과 데이터셋 크기의 영향은 무엇인가?
  • RQ4깊은 3D ResNet를 효과적으로 학습시키기 위한 실용적인 학습 고려사항(배치 크기, GPU 사용량)은 무엇인가?

주요 결과

  • 3D ResNet-34는 Kinetics에서 C3D 베이스라인보다 더 높은 정확도를 달성하여 3D 커널의 깊이가 행동 인식에 이로움을 시사한다.
  • 3D ResNets는 Kinetics에서 처음부터 학습해도 과적합되지 않으며 충분한 자원을 고려하면 일부 RGB-I3D 구성과 경쟁적이거나 이를 능가한다.
  • Sports-1M에서의 사전학습은 얕은 3D CNN(C3D)에 도움이 되나, 더 깊은 3D ResNet은 Sports-1M 사전학습 없이도 대규모 데이터에서 여전히 이점을 얻는다.
  • ImageNet 사전학습 없이 RGB-I3D가 보고된 베이스라인 중 최고 성능을 달성하여 충분한 데이터와 깊은 3D 아키텍처의 가치를 강조한다.
  • 저자들은 재현성을 위해 공개적으로 접근 가능한 코드와 사전학습된 3D-ResNet 모델을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.