Skip to main content
QUICK REVIEW

[논문 리뷰] The EPIC-KITCHENS Dataset: Collection, Challenges and Baselines

Dima Damen, Hazel Doughty|arXiv (Cornell University)|2020. 04. 29.
Human Pose and Action Recognition참고 문헌 11인용 수 7
한 줄 요약

이 논문은 32명의 참가자가 4개국에서 자연스럽고 스크립트가 없는 주방 활동을 기록한 대규모 에고세트릭 비디오 데이터셋인 EPIC-KITCHENS을 소개한다. 총 55시간의 영상이 포함되어 있으며, 39,600개의 행동 세그먼트와 454,158개의 물체 바운딩 박스에 대한 정밀한 레이블이 부여되어 있다. 이 데이터셋은 다중모달 행동 인식 및 예측 벤치마크를 가능하게 하며, 기준 모델들은 명시적인 시간적 모델링과 청각-시각 융합이 '꼭대기 열기'와 '꼭대기 닫기'와 같은 세밀한 에고세트릭 행동 인식에서 성능을 크게 향상시킨다는 것을 보여준다.

ABSTRACT

Since its introduction in 2018, EPIC-KITCHENS has attracted attention as the largest egocentric video benchmark, offering a unique viewpoint on people's interaction with objects, their attention, and even intention. In this paper, we detail how this large-scale dataset was captured by 32 participants in their native kitchen environments, and densely annotated with actions and object interactions. Our videos depict nonscripted daily activities, as recording is started every time a participant entered their kitchen. Recording took place in 4 countries by participants belonging to 10 different nationalities, resulting in highly diverse kitchen habits and cooking styles. Our dataset features 55 hours of video consisting of 11.5M frames, which we densely labelled for a total of 39.6K action segments and 454.2K object bounding boxes. Our annotation is unique in that we had the participants narrate their own videos after recording, thus reflecting true intention, and we crowd-sourced ground-truths based on these. We describe our object, action and. anticipation challenges, and evaluate several baselines over two test splits, seen and unseen kitchens. We introduce new baselines that highlight the multimodal nature of the dataset and the importance of explicit temporal modelling to discriminate fine-grained actions e.g. 'closing a tap' from 'opening' it up.

연구 동기 및 목표

  • 자연스럽고 스크립트가 없는 일상적인 주방 활동을 다양한 문화적 및 환경적 배경에서 촬영한 대규모 실용적 에고세트릭 비디오 데이터셋을 구축하는 것.
  • 음성, 영상 및 시간적 추론을 포함한 다중모달 기반의 에고세트릭 행동 인식 및 예측을 위한 벤치마크를 개발하는 것.
  • 참가자들이 기록한 행동에 대한 정확한 의도 반영 레이블을 제공함으로써 행동 및 물체 상호작용 레이블의 현실성과 정확도를 향상시키는 것.
  • 보이는 주방과 보이지 않는 주방에 대한 테스트 세트를 포함하여, 에고세트릭 영상에서 행동 인식, 물체 검출 및 행동 예측에 대한 개방형 과제와 기준 모델을 설정하는 것.
  • 복잡한 다중 작업 환경에서의 세밀한 행동 구분 및 시간적 모델링에 대한 연구를 가능하게 하는 것.

제안 방법

  • 32명의 참가자가 10개의 국적과 4개국의 본인의 주방에서 자연스럽게 모든 주방 활동을 기록하여 데이터셋을 수집하였다.
  • 기록 후 참가자들이 자신의 행동을 묘사하였으며, 이 묘술을 활용해 커뮤니티 기반의 방식으로 참조 행동 세그먼트 레이블을 생성하였다.
  • 각 영상에 대해 39,600개의 행동 세그먼트와 454,158개의 물체 바운딩 박스에 대해 시작/종료 시간이 정밀하게 레이블링되어, 실제 상호작용의 역동성을 반영하였다.
  • RGB 영상, 옵티컬 플로우, 음성 스트림을 포함하며, 음성은 256×256 크기의 로그 스펙트로그램으로 처리되어 다중모달 모델링에 활용되었다.
  • 기준 모델은 다중모달 모델(RGB, 플로우, 음성)을 사용하여 후기 융합 방식을 적용하였으며, TSN, TRN, 2SCNN, DMR, ED 등의 아키텍처를 활용해 행동 예측을 수행하였다.
  • 시간적 모델링은 TSN(3개 세그먼트) 및 ED(16프레임 관찰)와 같은 방법을 통해 강조되었으며, DMR는 이미지 기반 예측을 위해 이중 단계 학습 절차를 사용하였다.

실험 결과

연구 질문

  • RQ1세밀한 에고세트릭 행동 인식, 예를 들어 tap을 '열기'와 '닫기'를 구분하는 데 있어서 명시적인 시간적 모델링이 성능에 어떤 영향을 미치는가?
  • RQ2RGB, 플로우, 음성 등의 다중모달 입력이 단일 모odal 접근 방식에 비해 에고세트릭 영상에서 행동 인식 및 예측에 얼마나 기여하는가?
  • RQ3EPIC-KITCHENS에서 학습한 모델은 보이지 않는 주방 환경으로 일반화되는가? 보이는 주방과 보이지 않는 주방 간의 성능 격차는 얼마나 되는가?
  • RQ4참가자가 기록한 묘술 레이블은 전통적인 수동 레이블링에 비해 더 정확하고 의도를 반영하는 행동 레이블을 제공할 수 있는가?
  • RQ5짧거나 모호한 행동에 대해 음성 모달리티가 에고세트릭 환경에서 행동 예측 및 인식에 어떤 영향을 미치는가?

주요 결과

  • EPIC-KITCHENS 데이터셋은 총 55시간의 영상, 1,150만 프레임, 39,600개의 행동 세그먼트, 454,158개의 물체 바운딩 박스를 포함하며, 다양한 실제 주방 환경에서 수집되었다.
  • 기준 모델들은 다중모달 융합—특히 RGB, 옵티컬 플로우, 음성의 조합—이 단일 모달 모델에 비해 행동 인식 정확도를 크게 향상시킨다는 것을 보여주었다.
  • TSN 및 TRN에서 적용한 명시적인 시간적 모델링은 단순한 시간 풀링보다 성능이 뛰어나며, 특히 '倒기'와 '저지르기'와 같은 세밀한 행동에 있어 유의미한 향상을 보였다.
  • 보이는 주방에서 학습한 모델은 보이지 않는 주방에서의 성능보다 높은 성능을 기록하였으며, 이는 에고세트릭 행동 인식에서 도메인 일반화의 과제를 강조한다.
  • 256×256 크기의 음성 로그 스펙트로그램 사용은 짧거나 모호한 행동의 구분에 기여하며, 특히 시각적 특징과 융합된 경우에 효과적이다.
  • DMR 및 ED 기준 모델은 더 긴 관찰 창(예: 4초)과 다중모달 특징 융합이 조기에 예측하는 상황에서 성능 향상을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.