Skip to main content
QUICK REVIEW

[논문 리뷰] Charades-Ego: A Large-Scale Dataset of Paired Third and First Person Videos

Gunnar A. Sigurdsson, Abhinav Gupta|arXiv (Cornell University)|2018. 04. 25.
Video Surveillance and Tracking Methods참고 문헌 8인용 수 97
한 줄 요약

Charades-Ego를 소개하는 대규모 데이터셋으로, 페어된 제3자 및 1인칭 비디오를 통해 공동적인 자가관찰 및 제3자 행동 이해를 가능하게 하며, 68,536개의 활동 인스턴스가 68.8시간에 걸쳐 수록되고 동반 주석이 제공됩니다.

ABSTRACT

In Actor and Observer we introduced a dataset linking the first and third-person video understanding domains, the Charades-Ego Dataset. In this paper we describe the egocentric aspect of the dataset and present annotations for Charades-Ego with 68,536 activity instances in 68.8 hours of first and third-person video, making it one of the largest and most diverse egocentric datasets available. Charades-Ego furthermore shares activity classes, scripts, and methodology with the Charades dataset, that consist of additional 82.3 hours of third-person video with 66,500 activity instances. Charades-Ego has temporal annotations and textual descriptions, making it suitable for egocentric video classification, localization, captioning, and new tasks utilizing the cross-modal nature of the data.

연구 동기 및 목표

  • 제3인칭 데이터의 풍부함을 활용하여 제3인칭 비디오 이해와 1인칭(자가관찰) 이해를 연결한다.
  • 쌍으로 된 뷰와 시간적/텍스트 주석을 갖춘 크고 다양한 1인칭 데이터셋을 제공한다.
  • 교차 모달 데이터를 사용하여 1인칭 비디오 분류, 로컬라이제이션, 캡셔닝 등의 태스크를 가능하게 한다.

제안 방법

  • 작업자들이 이마-mounted 및 표준 제3인칭 구성을 사용해 두 뷰에서 스크립트를 녹화하도록 하여 페어된 제1인칭 및 제3인칭 비디오를 수집한다.
  • 두 뷰를 페어로 제시하고 제3인칭 뷰를 이용해 1인칭 주석을 알리는 방식으로 시간적으로 주석이 된 교차 뷰 주석을 비디오에 부여한다.
  • 도메인 간 일관성을 확보하기 위해 Charades 데이터셋의 활동 클래스, 스크립트, 방법론을 Charades-Ego와 공유한다.
  • 데이터를 학습/테스트 세트로 분할할 때 주제자_overlap가 없도록(80/20 분할) 구분한다.
  • 제1인칭 및 제3인칭 데이터에 대해 학습된 baselines를 제공하고 교차 뷰 전이 및 제로샷 자가관찰 인식 성능을 평가한다.

실험 결과

연구 질문

  • RQ1제1인칭 및 제3인칭 비디오를 함께 학습시켜 자가관찰 이해를 개선할 수 있는가?
  • RQ2제3인칭 데이터에서 학습된 모델이 자가관찰 비디오 태스크에 얼마나 잘 전이되는가?
  • RQ3자가관찰 비디오 분류 및 로컬라이제이션에 제1인칭 주석을 도입하는 이점은 무엇인가?

주요 결과

  • Charades-Ego는 68.8시간의 페어링된 비디오(1인칭 및 제3인칭)에서 68,536개의 자가관찰 활동 인스턴스를 포함한다.
  • 추가로 Charades에서 82.3시간의 제3인칭 비디오와 66,500개의 활동 인스턴스가 Charades-Ego의 방법론과 클래스와 함께 공유된다.
  • 1인칭 라벨 데이터가 Charades-Ego 데이터로 학습할 때 자가관찰 테스트 세트의 성능을 향상시키며(예: First/Third Training이 First-Person Test에서 표 1의 28.2에 도달)
  • 제로샷 자가관찰 baselines도 경쟁력 있는 성능을 보인다(예: ResNet-152 Charades가 자가관찰 테스트에서 28.2를 달성).
  • 제3인칭으로 학습된 모델만으로는 강력한 제3인칭 모델이 존재할 때 제3인칭 정확도를 개선하지 못하는 경우가 있으며, 제1인칭 데이터를 도입하면 자가관찰 태스크에서 이득이 발생한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.