Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Video Representations from Textual Web Supervision

Jonathan Stroud, David A. Ross|arXiv (Cornell University)|2020. 07. 29.
Human Pose and Action Recognition참고 문헌 74인용 수 16
한 줄 요약

이 논문은 수동 레이블링 없이 YouTube 메타데이터(제목, 설명, 태그, 채널 이름 등)에서 유래한 텍스트 기반 웹 감독을 활용해 비디오 표현을 사전 훈련하는 방법을 제안한다. 텍스트 기반 검색을 통해 7000만 개의 비디오-텍스트 쌍을 수집하고, 3D 컨볼루션 네트워크를 사용해 비디오 및 텍스트 임베딩을 정렬함으로써, 행동 인식 벤치마크에서 기존의 모든 자기지도 및 교차모odal 방법보다 우수한 성능을 달성한다. 특히 HMDB-51에서 8.9% 향상되고 UCF-101에서 2.1% 향상된다.

ABSTRACT

Videos on the Internet are paired with pieces of text, such as titles and descriptions. This text typically describes the most important content in the video, such as the objects in the scene and the actions being performed. Based on this observation, we propose to use text as a method for learning video representations. To accomplish this, we propose a data collection process and use it to collect 70M video clips shared publicly on the Internet, and we then train a model to pair each video with its associated text. We evaluate the model on several down-stream action recognition tasks, including Kinetics, HMDB-51, and UCF-101. We find that this approach is an effective method of pre-training video representations. Specifically, it outperforms all existing methods for self-supervised and cross-modal video representation learning.

연구 동기 및 목표

  • 완전히 감독된 비디오 표현 학습의 높은 비용과 수익 감소 문제를 해결하기 위해 공개 비디오에서 이용 가능한 무료 텍스트 메타데이터를 활용하고자 한다.
  • 유튜브에서 얻을 수 있는 비정형적이고 개방적인 텍스트(예: 제목, 설명)가 비디오 표현 학습을 위한 확장 가능하고 효과적인 감독 신호가 될 수 있는지 탐색하고자 한다.
  • 수동 레이블링이 필요 없이 웹에서 대규모 비디오-텍스트 쌍을 수확할 수 있는 확장 가능한 데이터 수집 파이프라인을 개발하고자 한다.
  • 이러한 약한 감독 기반 표현이 낮은 데이터 환경에서, 특히 클래스당 몇 개의 레이블링된 예제만 존재할 경우에도 충분히 일반화되는지 평가하고자 한다.
  • 웹 기반 감독과 완전히 감독된 사전 훈련 간의 상호보완성을 탐구하고, 둘을 조합했을 때 성능 향상이 어떻게 이루어지는지 보여주고자 한다.

제안 방법

  • 텍스트 기반 비디오 검색을 활용해 제목, 설명, 태그, 채널 이름과 함께 7000만 개의 비디오 클립을 수집하는 약한 텍스트 감독(WTS) 데이터 수집 프로세스를 제안한다.
  • 대비 학습을 통해 비디오 및 텍스트 임베딩 간의 일치를 도모하기 위해 비디오 표현을 학습하는 3D 컨volution 신경망(3D CNN) 아키텍처를 사용한다.
  • 비디오-텍스트 매칭 모델을 WTS-70M 데이터셋에서 엔드 투 엔드로 훈련하며, 일치하는 비디오-텍스트 쌍 간의 일치도를 극대화하기 위해 대비 손실을 사용한다.
  • 다운스트림 행동 인식 데이터셋(Kinetics, HMDB-51, UCF-101)에서 백본 네트워크를 미세조정하거나 동결하여 학습된 표현의 성능을 평가한다.
  • 재현 가능성과 향후 연구를 위해 7000만 개의 비디오-텍스트 쌍 전체 데이터셋과 사전 훈련된 모델을 공개한다.
  • 각각의 텍스트 모odal(예: 제목 vs. 설명)의 기여도와 그 조합이 성능에 미치는 영향을 분석하기 위해 아블레이션 스터디를 수행한다.

실험 결과

연구 질문

  • RQ1공개적으로 공유된 유튜브 비디오의 텍스트 메타데이터가 수동 레이블링 없이 비디오 표현을 사전 훈련하는 데 확장 가능하고 효과적인 감독 신호로 기능할 수 있는가?
  • RQ2웹 기반 감독 텍스트로 사전 훈련된 비디오 표현의 성능이 기존 자기지도 및 교차모달 방법과 비교해 표준 행동 인식 벤치마크에서 어떻게 되는가?
  • RQ3이러한 접근 방식이 낮은 데이터 환경(예: 클래스당 평균 6.5개의 예제)에서 얼마나 잘 일반화되는가?
  • RQ4웹 기반 감독 사전 훈련을 완전히 감독된 사전 훈련과 효과적으로 조합할 수 있는가? 그리고 이를 통해 다운스트림 성능이 어떻게 향상되는가?
  • RQ5텍스트 구성 요소(예: 제목, 설명, 태그) 중 어떤 것이 학습된 비디오 표현의 품질에 가장 크게 기여하는가?

주요 결과

  • 제안된 방법은 HMDB-51에서 기존 방법보다 8.9% 높은 정확도를 달성하며, UCF-101에서는 2.1% 향상된다.
  • Kinetics-400 및 Kinetics-600에서 동결된 특징을 사용했을 때 각각 72.7% 및 75.5%의 정확도를 기록하여 CVRL 및 기타 베이스라인을 초월한다.
  • 극도로 낮은 데이터 환경(예: Kinetics-600에서 평균 클래스당 6.5개의 예제, 레이블 분율 1%)에서도 WTS-70M 사전 훈련이 40.9%의 정확도를 달성하며, CVRL 및 라벨 없이 훈련한 경우를 모두 능가한다.
  • Kinetics-700 사전 훈련과 조합했을 때 WTS-70M는 Kinetics-700만 사용했을 때보다 HMDB-51 정확도를 8.5% 향상시키며, 완전히 감독된 학습과의 강력한 상호보완성을 입증한다.
  • 모든 기존 자기지도 및 교차모달 비디오 표현 학습 방법(음성 또는 비디오 예측을 사용한 방법 포함)을 초월한다.
  • 제목과 설명은 개별적으로 강력한 감독 신호를 제공하며, 둘을 조합하면 최고의 성능을 달성하여, 고정된 클래스 레이블보다 개방형 기술적 텍스트의 가치를 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.