Skip to main content
QUICK REVIEW

[논문 리뷰] Temporal-attentive Covariance Pooling Networks for Video Recognition

Zilin Gao, Qilong Wang|arXiv (Cornell University)|2021. 10. 27.
Human Pose and Action Recognition인용 수 10
한 줄 요약

이 논문은 시공간 동적 구조를 시계열 주의 모듈과 시계열 공분산 풀링을 통해 모델링함으로써 영상 인식 성능을 향상시키는 새로운 글로벌 풀링 방법인 시계열 주의 공분산 풀링(TCP)을 제안한다. 이후 행렬 거듭제곱 정규화를 적용한다. TCP는 여섯 개의 벤치마크에서 글로벌 평균 풀링 및 기존의 공분산 풀링 방법들을 압도적으로 뛰어넘으며, 우수한 표현 학습 능력과 일반화 성능을 입증한다.

ABSTRACT

For video recognition task, a global representation summarizing the whole contents of the video snippets plays an important role for the final performance. However, existing video architectures usually generate it by using a simple, global average pooling (GAP) method, which has limited ability to capture complex dynamics of videos. For image recognition task, there exist evidences showing that covariance pooling has stronger representation ability than GAP. Unfortunately, such plain covariance pooling used in image recognition is an orderless representative, which cannot model spatio-temporal structure inherent in videos. Therefore, this paper proposes a Temporal-attentive Covariance Pooling(TCP), inserted at the end of deep architectures, to produce powerful video representations. Specifically, our TCP first develops a temporal attention module to adaptively calibrate spatio-temporal features for the succeeding covariance pooling, approximatively producing attentive covariance representations. Then, a temporal covariance pooling performs temporal pooling of the attentive covariance representations to characterize both intra-frame correlations and inter-frame cross-correlations of the calibrated features. As such, the proposed TCP can capture complex temporal dynamics. Finally, a fast matrix power normalization is introduced to exploit geometry of covariance representations. Note that our TCP is model-agnostic and can be flexibly integrated into any video architectures, resulting in TCPNet for effective video recognition. The extensive experiments on six benchmarks (e.g., Kinetics, Something-Something V1 and Charades) using various video architectures show our TCPNet is clearly superior to its counterparts, while having strong generalization ability. The source code is publicly available.

연구 동기 및 목표

  • 영상 인식에서 복잡한 시계열 동적 구조를 포착하지 못하는 글로벌 평균 풀링(GAP)의 한계를 해결한다.
  • 시간 순서를 忽略하고 영상 전용 시공간 구조를 모델링하지 못하는 단순한 공분산 풀링의 단점을 극복한다.
  • 기존의 깊이 영상 아키텍처를 대체 없이도 효과적으로 향상시킬 수 있는 모델 무관(global pooling) 메커니즘을 개발한다.
  • 공분산 표현의 이차 통계 및 기하학적 특성을 활용하여 영상 표현 학습을 향상시킨다.
  • 다양한 영상 인식 아키텍처와 데이터셋에서 제안된 방법의 일반화 능력과 우수성을 입증한다.

제안 방법

  • 연속된 세 프레임 간의 관계를 모델링하여 시공간 특징을 적응적으로 校정하는 시계열 주의 모듈을 도입한다.
  • 시간적으로 일관된 방식으로 프레임 내 상관관계와 프레임 간 상호상관관계를 계산하기 위해 시계열 공분산 풀링을 적용한다.
  • 공분산 행렬의 기하학적 구조를 활용하여 표현 학습을 향상시키기 위해 빠른 행렬 거듭제곱 정규화를 통합한다.
  • 모듈을 즉시 통합할 수 있도록 플러그 앤 플레이 방식으로 TCP 모듈을 설계하여 기존 영상 인식 아키텍처에 쉽게 통합할 수 있도록 한다.
  • 시계열 주의 모듈과 공분산 풀링 구성 요소를 조합하여 주의를 기반으로 하고 기하학적 인식 능력을 갖춘 영상 수준의 표현을 생성한다.
  • 딥 네트워크의 끝에서 글로벌 평균 풀링의 대체로 TCP 모듈을 사용하여 TCPNet 아키텍처를 구성한다.

실험 결과

연구 질문

  • RQ1공분산 기반의 풀링 방법이 글로벌 평균 풀링을 능가할 정도로 영상의 복잡한 시계열 동적 구조를 효과적으로 모델링할 수 있는가?
  • RQ2시계열 주의를 통합함으로써 공분산 표현의 품질은 어떻게 향상되는가?
  • RQ3공분산 행렬의 기하학적 특성이 영상 표현 학습 향상에 어느 정도 기여하는가?
  • RQ4제안된 TCP 모듈은 다양한 영상 아키텍처와 벤치마크에서 일반화 가능한가?
  • RQ5단순한 공분산 풀링에 행렬 거듭제곱 정규화를 적용한 강력한 베이스라인과 비교해 볼 때, 제안된 TCP는 어떻게 성능을 냅니다?

주요 결과

  • TCPNet은 Kinetics, Something-Something V1, Charades 등 여섯 개의 영상 인식 벤치마크에서 최신 기술 수준의 성능을 달성한다.
  • K-400 데이터셋에서 TSN+R152를 사용할 경우, TCPNet은 GAP보다 2.2% 높은 정확도를 기록했고, 단순한 공분산 풀링에 행렬 거듭제곱 정규화를 적용한 강력한 베이스라인보다도 1.1% 높은 정확도를 확보했다.
  • 시계열 공분산 풀링의 최적의 커널 크기는 8프레임 입력에서는 5, 16프레임 입력에서는 9이며, 더 큰 커널 크기는 노이즈 증가와 계산량 증가로 인해 성능 저하를 초래한다.
  • 제안된 시계열 주의 모듈(TSA)은 Non-local 블록보다 0.5% 높은 정확도를 기록했고, FLOPs는 16%에 불과했다(0.16 GFLOPs 대비 0.7 GFLOPs).
  • 시계열 주의 모듈은 SE 블록보다 정확도에서 0.5% 높은 성능을 보이며, 시간적 의존성을 모델링하는 데 효과적임을 입증한다.
  • TCPNet은 TLE 및 단순한 공분산 풀링을 포함한 모든 베이스라인보다 뛰어난 성능을 보이며, 복잡한 시계열 동적 구조와 특징의 기하학적 구조를 효과적으로 포착함을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.