[논문 리뷰] Scaling Egocentric Vision: The EPIC-KITCHENS Dataset
EPIC-KITCHENS는 32명의 참가자가 자택 주방에서 촬영한 대규모 1인칭 영상 벤치마크를 제공하며, 밀도 높은 액션 구간과 활성 객체 경계 박스를 포함하고, 관측된 및 관측되지 않은 주방에서의 객체 탐지, 행동 인식, 행동 예측에 대한 기준선을 제시합니다.
First-person vision is gaining interest as it offers a unique viewpoint on people's interaction with objects, their attention, and even intention. However, progress in this challenging domain has been relatively slow due to the lack of sufficiently large datasets. In this paper, we introduce EPIC-KITCHENS, a large-scale egocentric video benchmark recorded by 32 participants in their native kitchen environments. Our videos depict nonscripted daily activities: we simply asked each participant to start recording every time they entered their kitchen. Recording took place in 4 cities (in North America and Europe) by participants belonging to 10 different nationalities, resulting in highly diverse cooking styles. Our dataset features 55 hours of video consisting of 11.5M frames, which we densely labeled for a total of 39.6K action segments and 454.3K object bounding boxes. Our annotation is unique in that we had the participants narrate their own videos (after recording), thus reflecting true intention, and we crowd-sourced ground-truths based on these. We describe our object, action and anticipation challenges, and evaluate several baselines over two test splits, seen and unseen kitchens. Dataset and Project page: http://epic-kitchens.github.io
연구 동기 및 목표
- 참가자들의 자택 주방에서 녹화된 대규모 1인칭(또는 시점) 비디오 데이터셋을 도입하여 자연스러운 다중 작업 수행 및 의도를 연구합니다.
- 참가자 해설에 맞춘 액션 및 상호 작용 객체에 대한 밀도 있는 주석을 제공하여 실제 의도를 포착합니다.
- 보이는/보이지 않는 주방 분할 하에서 객체 탐지, 행동 인식, 행동 예측을 정의하고 벤치마크합니다.
- 자연주의적 1인칭 비전 연구를 촉진하기 위한 도전과제 및 기준선을 조명합니다.
제안 방법
- 북미 및 유럽의 네 도시에서 32명의 참가자로부터 55시간의 1인칭 비디오를 수집합니다.
- 촬영 후 참가자들이 행위를 서술하게 하여 실제 의도를 반영하고, 정렬 및 라벨링을 위한 기준 진실을 크라우드소싱합니다.
- 액션 구간에 걸쳐 상호 작용에 관여하는 객체 주위에 활성 객체 바운딩 박스를 주석합니다.
- 동사와 명사를 125개 동사 클래스(C_V)와 331개 명사 클래스(C_N)로 클러스터링하여 다중 클래스 작업을 가능하게 합니다.
- 보이는/보이지 않는 주방 분할에서 객체 탐지, 행동 인식, 행동 예측의 세 가지 과제에 대해 기준선을 평가합니다.
실험 결과
연구 질문
- RQ1자연 환경에서 자연스러운 다중 작업 및 의도를 반영하는 대규모 1인칭 주방 데이터셋은 어떻게 수집할 수 있을까?
- RQ2관측된/미관찰 주방에서의 1인칭 객체 탐지, 행동 인식, 예측의 과제와 기준 성능은 무엇인가?
- RQ3해설 및 다언어 주석이 정답 품질과 다운스트림 작업 성능에 어떤 영향을 미치는가?
- RQ4모델이 1인칭 시각 작업에서 보이지 않는 환경에 얼마나 일반화될 수 있는가?
주요 결과
- EPIC-KITCHENS는 55시간의 비디오, 11.5백만 프레임, 39.6천 개의 액션 구간, 그리고 454k+ 활성 객체 바운딩 박스를 포함합니다.
- 참가자가 제공한 해설은 간격이 있는 진실된 액션 구간을 산출하며, 저자들은 이를 시간 보정 및 주석 집계로 해결합니다.
- 행동 객체 및 동사/명사 클래스 클러스터링은 모든 벤치마크에 사용되는 125개 동사 클래스(C_V)와 331개 명사 클래스(C_N)를 생성합니다.
- 기준선 객체 탐지(Faster R-CNN과 ResNet-101) 및 TSN 기반 행동 인식/예측은 특히 미관찰 주방에서 큰 일반화 격차를 보이며, 탐지 성능은 특정 클래스에서 특히 낮고 저샷 상황에서도 떨어집니다.
- 행동 예측은 여전히 행동 인식보다 더 어렵고, 융합으로 다소 향상되지만 미래 행동을 예측할 때 전체 성능은 감소합니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.