Skip to main content
QUICK REVIEW

[논문 리뷰] Temporal Contrastive Graph Learning for Video Action Recognition and Retrieval

Yang Liu, Keze Wang|arXiv (Cornell University)|2021. 01. 04.
Human Pose and Action Recognition참고 문헌 65인용 수 9
한 줄 요약

이 논문은 비디오의 다중 척도 시간적 의존성을 인라인 및 인터-스니펫 시간 그래프에서 하이브리드 그래프 대비 학습 전략을 사용하여 모델링하는 자기지도 학습 방법인 시간 대비 그래프 학습(TCGL)을 제안한다. 무작위 엣지 제거 및 노드 마스킹을 통해 상관 관계가 있는 시각을 생성하고, 적응형 스니펫 순서 예측 모듈을 통합함으로써 TCGL는 다양한 3D CNN 기반 모델에서 행동 인식 및 비디오 검색 벤치마크에서 최신 기술(SOTA) 성능을 달성한다.

ABSTRACT

Attempt to fully discover the temporal diversity and chronological characteristics for self-supervised video representation learning, this work takes advantage of the temporal dependencies within videos and further proposes a novel self-supervised method named Temporal Contrastive Graph Learning (TCGL). In contrast to the existing methods that ignore modeling elaborate temporal dependencies, our TCGL roots in a hybrid graph contrastive learning strategy to jointly regard the inter-snippet and intra-snippet temporal dependencies as self-supervision signals for temporal representation learning. To model multi-scale temporal dependencies, our TCGL integrates the prior knowledge about the frame and snippet orders into graph structures, i.e., the intra-/inter- snippet temporal contrastive graphs. By randomly removing edges and masking nodes of the intra-snippet graphs or inter-snippet graphs, our TCGL can generate different correlated graph views. Then, specific contrastive learning modules are designed to maximize the agreement between nodes in different views. To adaptively learn the global context representation and recalibrate the channel-wise features, we introduce an adaptive video snippet order prediction module, which leverages the relational knowledge among video snippets to predict the actual snippet orders. Experimental results demonstrate the superiority of our TCGL over the state-of-the-art methods on large-scale action recognition and video retrieval benchmarks.

연구 동기 및 목표

  • 기존 자기지도 학습 비디오 학습 방법이 단지 단기 또는 장기 시간적 의존성만 별도로 모델링하는 데에 한계가 있음을 해결하기 위해.
  • 표현 학습 향상을 위해 내부 스니펫(단기) 및 상호 스니펫(장기) 시간적 의존성을 동시에 발견하고 활용하기 위해.
  • 자기지도 신호로 다중 척도 시간적 구조를 공동으로 활용하는 그래프 기반 대비 학습 프레임워크를 개발하기 위해.
  • 스니펫 간 상관 관계 지식을 사용하여 글로벌 컨텍스트 학습 및 채널 재조정을 향상시키기 위해 적응형 비디오 스니펫 순서 예측 모듈을 도입하기 위해.
  • 대규모 비디오 행동 인식 및 검색 벤치마크에서 TCGL의 유효성을 입증하기 위해.

제안 방법

  • 비디오를 고정 길이의 스니펫으로 샘플링하고, 각 스니펫을 프레임 집합으로 더 나누어 다중 척도 시간 역학을 캡처한다.
  • 두 종류의 그래프 구조를 구성한다: 스니펫 내 프레임 집합을 위한 인라인 스니펫 그래프와 연속적인 스니펫 순서를 위한 인터-스니펫 그래프로, 시간 순서에 대한 사전 지식을 통합한다.
  • 다양한 상관 관계가 있는 그래프 시각을 생성하기 위해 무작위 엣지 제거 및 노드 특성 마스킹을 적용한다.
  • 대비 학습 모듈은 서로 다른 시각의 노드 간 특징 일치를 최대화하여 강력한 시간적 표현 학습을 장려한다.
  • 실제 연속적인 스니펫 순서를 예측하기 위한 적응형 스니펫 순서 예측 헤드를 도입하여, 스니펫 간 상관 관계 지식을 활용해 글로벌 컨텍스트 이해를 향상시킨다.
  • 백본 네트워크(3D CNN)는 대규모 레이블이 없는 비디오 데이터에서 TCGL를 사용해 사전 학습한 후, 최종 작업에 맞게 미세 조정된다.

실험 결과

연구 질문

  • RQ1내부 및 상호 스니펫 시간적 의존성을 함께 모델링하면 자기지도 학습 비디오 표현 학습 성능이 향상되는가?
  • RQ2다중 척도 시간적 구조를 자기지도 신호로 활용하는 그래프 대비 학습 프레임워크의 효과는 어떠한가?
  • RQ3적응형 스니펫 순서 예측은 학습된 비디오 표현의 분류 능력을 향상시킬 수 있는가?
  • RQ4TCGL는 행동 인식 및 검색에서 다양한 3D CNN 백본과 벤치마크에 일반화되는가?
  • RQ5성능 및 내구성 측면에서 TCGL는 최신 기술(self-supervised methods)과 비교해 어떻게 성과를 내는가?

주요 결과

  • R3D 백본을 사용한 UCF101에서 TCGL는 72.4%의 top-1 정확도를 기록하여 이전 최신 기술(V-pace)보다 2.6%포인트 높게 달성한다.
  • R3D를 사용한 Kinetics-400에서 TCGL는 75.7%의 top-1 정확도를 기록하여 이전 최신 기술(V-pace)보다 2.8포인트 향상되었다.
  • C3D 백본을 사용한 UCF101에서의 비디오 검색에서 TCGL는 77.7%의 top-50 검색 정확도를 기록하여 이전 최신 기술(V-pace)을 2.2포인트 초월한다.
  • HMDB51에서 R(2+1)D 백본을 사용한 TCGL는 80.2%의 top-50 검색 정확도를 기록하여 이전 최신 기술을 3.1포인트 초월한다.
  • 활성화 맵의 시각화 결과는 TCGL가 비디오의 운동 패턴과 일치하는 분류 가능한 시공간 표현을 학습하고 있음을 확인한다.
  • 제거 분석 결과 내부 및 상호 스니펫 그래프 학습 구성 요소가 성능 향상에 크게 기여함을 입증하여 다중 척도 설계의 타당성을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.