Skip to main content
QUICK REVIEW

[논문 리뷰] Exploring Temporal Granularity in Self-Supervised Video Representation Learning

Rui Qian, Yeqing Li|arXiv (Cornell University)|2021. 12. 08.
Human Pose and Action Recognition인용 수 4
한 줄 요약

이 논문은 긴-짧은 클립 쌍 내의 조밀한 시간 임베딩과 그들의 전역 임베딩을 대조함으로써 세분화된 시간적 특징과 지속적인 시간적 특징을 동시에 최적화하는 자기지도 학습 비디오 표현 학습 프레임워크인 TeG을 제안한다. TeG는 8개의 비디오 벤치마크에서 최신 기술 수준의 성능을 달성하며, 작업에 맞는 시간적 해상도를 활용하여 대부분의 작업에서 지도 학습 전훈보다 뛰어난 성능을 보인다.

ABSTRACT

This work presents a self-supervised learning framework named TeG to explore Temporal Granularity in learning video representations. In TeG, we sample a long clip from a video and a short clip that lies inside the long clip. We then extract their dense temporal embeddings. The training objective consists of two parts: a fine-grained temporal learning objective to maximize the similarity between corresponding temporal embeddings in the short clip and the long clip, and a persistent temporal learning objective to pull together global embeddings of the two clips. Our study reveals the impact of temporal granularity with three major findings. 1) Different video tasks may require features of different temporal granularities. 2) Intriguingly, some tasks that are widely considered to require temporal awareness can actually be well addressed by temporally persistent features. 3) The flexibility of TeG gives rise to state-of-the-art results on 8 video benchmarks, outperforming supervised pre-training in most cases.

연구 동기 및 목표

  • 다양한 비디오 작업이 서로 다른 시간적 해상도의 특징을 요구하는지 조사하기 위해.
  • 기존 자기지도 학습 비디오 방법이 오직 시간적 지속성만을 우선시하여 세분화된 시간 작업에서 성능이 떨어지는 한계를 해결하기 위해.
  • 세분화된 특징과 지속적인 표현을 동시에 학습할 수 있는 융통성 있는 프레임워크를 개발하기 위해.
  • 이전에는 세분화된 인식이 필요하다고 여겨졌던 일부 작업에 대해 시간적 지속성이 충분할 수 있음을 입증하기 위해.
  • 작업에 맞는 시간적 해상도에 적응함으로써 다양한 비디오 벤치마크에서 최신 기술 수준의 성능을 달성하기 위해.

제안 방법

  • 비디오에서 긴 클립과 그 안에 완전히 포함된 짧은 클립을 추출한다.
  • 최종 시간 평균 풀링을 생략하여 비디오 인코더를 통해 두 클립을 모두 통과시켜 시간 해상도를 유지한다.
  • 세분화된 시간 학습을 위한 하나와 지속적인 전역 학습을 위한 다른 하나의 별도 임베딩 공간으로 인코딩된 특징을 투영한다.
  • 짧은 클립과 긴 클립의 대응하는 시간 임베딩 간의 조밀한 대비 손실을 적용하여 세분화된 판별 능력을 유도한다.
  • 두 클립의 풀링된 전역 임베딩 간의 전역 대비 손실을 적용하여 시간 지속성을 강제한다.
  • 유연성 있는 손실 가중치 α를 사용하여 두 목적을 균형 잡히게 하여, 하류 작업의 필요에 따라 어느 쪽을 우선시할지 조정할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1다양한 비디오 이해 작업은 서로 다른 시간적 해상도의 특징을 요구하는가?
  • RQ2시간적으로 지속적인 특징만으로도 이전에는 세분화된 시간 인식이 필요하다고 여겨졌던 작업에서 뛰어난 성능을 달성할 수 있는가?
  • RQ3특정 작업에 맞게 재학습 없이도 통합된 자기지도 학습 프레임워크가 세분화된 특징과 지속적인 표현을 효과적으로 학습할 수 있는가?
  • RQ4샘플링 전략과 시간 집계 설계가 학습된 특징의 품질에 어떤 영향을 미치는가?
  • RQ5다양한 하류 작업에 대해 세분화된 학습과 지속적 학습 목적 간의 최적의 트레이드오프는 무엇인가?

주요 결과

  • 다양한 비디오 작업은 서로 다른 시간적 해상도의 특징을 요구한다: 세분화된 특징은 VidSitu 이벤트 분류에서 2.8% 향상과 Kinetics-GEBD에서 2.4% 향상을 이끌었으며, 지속적인 특징은 비디오 수준의 인식과 시공간 정렬에서 우수하다.
  • 이전에는 세분화된 특징이 필요하다고 여겨졌던 작업, 예를 들어 Kinetics에서의 비디오 수준 동작 인식은 실제로 시간적 지속성 특징으로 더 뛰어난 성능을 보였으며, 이는 이전의 가정을 도전한다.
  • TeG-PS(지속성 전용)는 동일한 R3D-50 백본을 사용하여 AVA-Kinetics에서 8.9 mAP 향상으로 지도 학습 전훈을 능가했으며, 지속성 학습의 강력함을 입증한다.
  • TeG-FG(세분화 전용)는 Kinetics에서 27.7 mAP, AVA-Kinetics에서 28.7 mAP를 달성하여 이전의 비지도 학습 방법을 능가하며 세분화 학습의 효과성을 보여준다.
  • 제거 실험을 통해 손실 가중치 α는 신중하게 조정되어야 한다: α = 0.9로 설정할 경우 두 목적 간의 균형이 맞으며, α = 1.0(완전히 세분화된)일 경우 지속성 작업 성능이 저하됨을 확인했다.
  • 제안된 샘플링 전략—긴 클립과 포함된 짧은 클립—은 최고의 성능(31.1 on VidSitu)을 보였으며, 대칭적인 짧은-짧은 클립 샘플링(27.4)과 무작위 샘플링(26.9)을 능가했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.