Skip to main content
QUICK REVIEW

[논문 리뷰] Revisiting 3D ResNets for Video Recognition

Xianzhi Du, Yeqing Li|arXiv (Cornell University)|2021. 09. 03.
Human Pose and Action Recognition참고 문헌 36인용 수 14
한 줄 요약

이 논문은 비디오 행동 인식을 위한 3D ResNet의 스케일링 및 훈련된 변종인 3D ResNet-RS(R3D-RS)를 제안한다. 이는 향상된 훈련 전략, 경량 아키텍처 수정(ResNet-D 스템, Squeeze-and-Excitation, 자기게이팅), 그리고 깊이와 시간 해상도를 동시에 조절하는 단순한 공동 스케일링 규칙을 사용한다. 모델은 라벨 없이 훈련할 경우 Kinetics-400에서 81.0%의 top-1 정확도를, Kinetics-600에서는 83.8%를 기록하며, 웹 비디오 텍스트 데이터를 사전 훈련한 경우 각각 83.5%와 84.3%의 성능을 달성한다.

ABSTRACT

A recent work from Bello shows that training and scaling strategies may be more significant than model architectures for visual recognition. This short note studies effective training and scaling strategies for video recognition models. We propose a simple scaling strategy for 3D ResNets, in combination with improved training strategies and minor architectural changes. The resulting models, termed 3D ResNet-RS, attain competitive performance of 81.0 on Kinetics-400 and 83.8 on Kinetics-600 without pre-training. When pre-trained on a large Web Video Text dataset, our best model achieves 83.5 and 84.3 on Kinetics-400 and Kinetics-600. The proposed scaling rule is further evaluated in a self-supervised setup using contrastive learning, demonstrating improved performance. Code is available at: https://github.com/tensorflow/models/tree/master/official.

연구 동기 및 목표

  • 현대적인 훈련 및 스케일링 전략이 3D ResNet의 비디오 인식 벤치마크 성능에 크게 기여하는지 조사하기 위해.
  • 경량 아키텍처 수정—ResNet-D 스템, Squeeze-and-Excitation, 자기게이팅—이 3D ResNet 정확도에 미치는 영향을 평가하기 위해.
  • 모델 깊이와 입력 프레임 수를 동시에 증가시키는 단순하고 효과적인 스케일링 규칙을 개발하고 검증하기 위해.
  • 대규모 웹 비디오 데이터셋과 자기지도 학습 대비 대비된 대비 학습이 3D ResNet-RS 성능 향상에 기여하는 정도를 평가하기 위해.

제안 방법

  • 기본 모델로 3D ResNet(R3D)을 사용하고, 첫 번째 레이어에 5×3×3 커널, 다음 두 레이어에 1×3×3 커널을 적용한 3D ResNet-D 스템을 도입하여 시간 차원에서의 특징 추출을 향상시킨다.
  • 3D 전역 평균 풀링을 사용해 채널 별 특징을 재조정하는 3D Squeeze-and-Excitation 모듈을 도입하며, 비율은 0.25로 설정한다.
  • 각 SE 블록 뒤에 자기게이팅 모듈을 통합하여 학습 가능한 어텐션을 통해 특징 표현을 더욱 정교하게 조정한다.
  • 모델 깊이(50에서 200으로)와 입력 프레임 수(32에서 48로)를 동시에 증가시키는 공동 스케일링 규칙을 적용하여 스파atiotemporal 모델링 성능을 향상시킨다.
  • 데이터 증강(RandAugment, 스케일 저자화), 레이블 스무딩(0.1), 가중치 감소(4e-5), 확률적 깊이(drop rate 초깃값 0.2), 그리고 350 에포크까지 연장된 훈련을 적용한다.
  • Kinetics-400에서 800 에포크 동안 CVRL을 사용한 자기지도 학습을 수행하고, 전이 성능 평가를 위해 선형 평가를 실시한다.

실험 결과

연구 질문

  • RQ1향상된 훈련 전략과 경량 아키텍처 수정이 3D ResNet의 비디오 인식 벤치마크 성능에 어떤 영향을 미치는가?
  • RQ2모델 깊이와 입력 시간 해상도에 대한 단순한 공동 스케일링 규칙이 3D ResNets의 표준 스케일링 방식을 능가할 수 있는가?
  • RQ3대규모 웹 비디오 데이터셋과 자기지도 대비 학습이 3D ResNet-RS 성능 향상에 어느 정도 영향을 미치는가?
  • RQ4아키텍처 및 훈련 개선의 성능 향상이 더 높은 모델 깊이에서 포화 상태에 도달하는가?

주요 결과

  • R3D-RS-50 모델은 라벨 없이 훈련했을 때 Kinetics-400에서 78.2%의 top-1 정확도를 기록하며, R3D-50 기준 +3.8% 향상된 성능을 보였다.
  • R3D-RS-200 모델은 라벨 없이 훈련했을 때 Kinetics-400에서 81.0%, Kinetics-600에서는 83.8%의 정확도를 달성하여, 라벨 없이도 뛰어난 성능을 보였다.
  • 웹 비디오 텍스트(WVT) 데이터셋에서 사전 훈련한 경우, R3D-RS-200는 Kinetics-400에서 83.5%, Kinetics-600에서는 84.3%의 정확도를 기록하여 대규모 사전 훈련의 효과를 입증했다.
  • Kinetics-400에서 자기지도 학습을 수행하면 선형 평가 정확도가 R3D-RS-50의 66.1%에서 R3D-RS-270의 67.5%로 향상되며, R3D-RS-200를 초과하면 수익 감소 현상이 나타난다.
  • 입력 프레임 수를 32에서 48로 증가시키면 정확도가 +0.3% 향상되지만, R3D-RS-200를 초과해 모델 깊이를 늘일 경우 성능 저하가 발생한다.
  • RandAugment, 레이블 스무딩 등의 향상된 훈련 전략과 SE, 자기게이팅, D-스템 등의 아키텍처 수정을 조합하면 R3D-50 기준 +1.0%의 정확도 향상을 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.