Skip to main content
QUICK REVIEW

[논문 리뷰] In the Eye of the Beholder: Gaze and Actions in First Person Video

Yin Li, Miao Liu|arXiv (Cornell University)|2020. 05. 31.
Human Pose and Action Recognition참고 문헌 115인용 수 8
한 줄 요약

이 논문은 첫인성 영상에서 시선을 함께 추정하고 행동 인식을 수행하기 위해 확률적 분포를 사용해 시선을 모델링하는 딥러닝 모델을 제안한다. 이 방법은 샘플링된 시선 분포에서 주의 맵을 생성하여 특징 집합을 안내하며, 추론 시 시선 데이터가 없더라도 EGTEA Gaze+와 EPIC-Kitchens에서 최신 기준 성능(SOTA)을 달성한다.

ABSTRACT

We address the task of jointly determining what a person is doing and where they are looking based on the analysis of video captured by a headworn camera. To facilitate our research, we first introduce the EGTEA Gaze+ dataset. Our dataset comes with videos, gaze tracking data, hand masks and action annotations, thereby providing the most comprehensive benchmark for First Person Vision (FPV). Moving beyond the dataset, we propose a novel deep model for joint gaze estimation and action recognition in FPV. Our method describes the participant's gaze as a probabilistic variable and models its distribution using stochastic units in a deep network. We further sample from these stochastic units, generating an attention map to guide the aggregation of visual features for action recognition. Our method is evaluated on our EGTEA Gaze+ dataset and achieves a performance level that exceeds the state-of-the-art by a significant margin. More importantly, we demonstrate that our model can be applied to larger scale FPV dataset---EPIC-Kitchens even without using gaze, offering new state-of-the-art results on FPV action recognition.

연구 동기 및 목표

  • 시선이 행동 인식에 중요한 주의 자극을 제공하는 첫인성 영상에서 시선과 행동을 동시에 추정하는 과제를 해결한다.
  • 눈 깜빡임, 노이즈, 관련 없는 정렬 고정 등으로 인한 시선 측정의 불확실성을 확률적 잠재 분포로 모델링하여 이를 극복한다.
  • 시선 모델링과 행동 인식을 통합한 통합된 딥러닝 프레임워크를 개발하여 이고세트릭 영상 작업의 성능을 향상시킨다.
  • 첫인성 비전 연구를 위한 동기화된 영상, 시선 추적, 손 마스크, 행동 애너테이션을 포함한 종합적인 벤치마크 데이터셋인 EGTEA Gaze+를 구축한다.
  • 시선 데이터가 추론 중에 사용되지 않더라도, 대규모 데이터셋인 EPIC-Kitchens로의 일반화 능력을 입증한다. 이는 SOTA 결과를 달성한다.

제안 방법

  • 딥 네트워크 내에서 확률적 단위를 사용해 시선을 잠재 확률 분포로 모델링하여 불확실성 인식 주의 모델링을 가능하게 한다.
  • 확률적 시선 단위에서 샘플링하여 시공간 주의 맵을 생성하며, 이는 영상 내 행동 관련 영역을 강조한다.
  • 생성된 주의 맵을 사용해 행동 인식 브랜치에서 공간적 및 시간적 특징 집합을 수행하며, 관련 시각적 자극에 집중한다.
  • EGTEA Gaze+ 데이터셋을 활용해 시선 추정과 행동 인식을 동시에 최적화하는 통합 목표를 사용해 엔드 투 엔드 모델을 훈련한다.
  • 시선 감독을 균일한 사전 확률로 대체하고, IG-65M에서 미리 훈련된 강력한 CSN152 백본을 사용하여 모델을 EPIC-Kitchens에 적응시킨다.
  • 과적합을 방지하기 위해 조기 정지와 학습률 감소를 적용한다. 특히 큰 백본과 제한된 배치 크기 상황에서 유의미하다.

실험 결과

연구 질문

  • RQ1첫인성 시선 데이터의 불확실성을 효과적으로 모델링하여 행동 인식 성능을 향상시킬 수 있는가?
  • RQ2동시에 시선과 행동을 학습하는 통합 모델이 별도의 모델보다 첫인성 영상 분석에서 더 우수한 성능을 낼 수 있는가?
  • RQ3확률적 주의 사전 정보로 시선을 통합할 경우, 대규모 데이터셋에서 행동 인식 성능 향상에 어느 정도 기여하는가?
  • RQ4시선 감독을 사용해 훈련된 모델가 시선 애너테이션이 없는 데이터셋, 예를 들어 EPIC-Kitchens로 일반화될 수 있는가?
  • RQ5백본 네트워크와 훈련 전략의 선택이 통합 시선 및 행동 인식 성능에 미치는 영향은 어떠한가?

주요 결과

  • 제안된 모델은 EGTEA Gaze+ 데이터셋에서 기존 방법보다 뚜렷하게 뛰어난 성능을 달성하며, 시선 추정과 행동 인식 양 측면에서 최신 기준(SOTA) 성능을 기록한다.
  • EPIC-Kitchens에서 모델은 본 적 있는 세트에 대해 상위 1위 정확도 60.05%와 상위 5위 정확도 81.97%를 기록했으며, 본 적 없는 세트에 대해서는 각각 38.14%와 63.81%를 기록하여 이전의 단일 모델 기록을 모두 초월한다.
  • 본 적 있는 세트에서 강력한 CSN152 기준 모델 대비 상위 1위 정확도 +0.3%와 상위 5위 정확도 +1.0% 향상되었으며, 본 적 없는 세트에선 각각 +0.5%와 +0.8% 향상되었다.
  • 실제 시선 데이터 없이도 균일한 시선 사전 확률을 사용할 경우에도 경쟁 가능한 성능을 달성하여 강력한 일반화 능력을 보였다.
  • 제거 분석 결과 성능 향상의 주요 원인은 두드러진 백본(CSN152)과 미리 훈련된 가중치이며, 제안된 주의 메커니즘은 추가로 일관된 성능 향상을 제공함을 확인했다.
  • 2020년 EPIC-Kitchens 챌린지에서 본 적 없는 테스트 세트에서 2위, 본 적 있는 테스트 세트에서 4위를 기록했으며, 광학 흐름, 오디오, 물체 검출기 등을 사용한 방법들을 모두 앞섰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.