Skip to main content
QUICK REVIEW

[논문 리뷰] Following Gaze Across Views

Adrià Recasens, Carl Vondrick|arXiv (Cornell University)|2016. 12. 09.
Visual Attention and Saliency Detection참고 문헌 24인용 수 3
한 줄 요약

이 논문은 동일한 장면의 다중 시점에서 인간의 시선을 추적하기 위한 엔드 투 엔드 딥 러닝 모델을 제안한다. 시각적 주목도, 시선 자세, 시점 간 기하학적 관계를 활용하며, 시선 애너테이션만으로 훈련되어, 사람이 프레임을 벗어나 보고 있을 때도 두 번째 시점의 시선 위치를 예측할 수 있다. VideoGaze 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성하였으며, 전체 테스트 세트에서 평균 정밀도(mAP)가 0.255이다.

ABSTRACT

Following the gaze of people inside videos is an important signal for understanding people and their actions. In this paper, we present an approach for following gaze across views by predicting where a particular person is looking throughout a scene. We collect VideoGaze, a new dataset which we use as a benchmark to both train and evaluate models. Given one view with a person in it and a second view of the scene, our model estimates a density for gaze location in the second view. A key aspect of our approach is an end-to-end model that solves the following sub-problems: saliency, gaze pose, and geometric relationships between views. Although our model is supervised only with gaze, we show that the model learns to solve these subproblems automatically without supervision. Experiments suggest that our approach follows gaze better than standard baselines and produces plausible results for everyday situations.

연구 동기 및 목표

  • 자신감 없는 환경에서 시선이 원천 시점 외부로 뻗어나가는 상황에서도 다중 카메라 시점 간 인간의 시선을 추적하는 문제를 해결한다.
  • 헤드 자세나 기하학적 정보에 대한 명시적 지도 없이도, 시선 애너테이션만을 사용하여 타겟 시점의 시선 위치를 예측하는 방법을 개발한다.
  • 다중 시점 시선 추적을 위한 대규모 벤치마크 데이터셋을 구축하여, 이러한 모델의 훈련과 평가를 가능하게 한다.
  • 모델이 엔드 투 엔드 훈련을 통해 주목도 추정 및 기하학적 변환과 같은 하위 문제를 암묵적으로 학습할 수 있음을 입증한다.

제안 방법

  • 모델는 시각적 주목도 예측, 시선 방향 추정, 시점 간 기하학적 변환을 위한 별도의 경로를 가진 다중 경로 아키텍처를 사용한다.
  • 시선 예측을 위해 시선 애너테이션만을 사용하여 공동 최적화를 수행함으로써, 네트워크가 주목도 및 자세 추정을 스스로 지도하는 방식으로 학습한다.
  • 기하학적 경로는 카메라 시점 간 변환(회전 및 이동)을 추정하여, 원천 시점의 시선을 타겟 시점으로 투영할 수 있도록 한다.
  • 모델는 VideoGaze 데이터셋에서 엔드 투 엔드로 훈련되며, 이 데이터셋에는 영상 프레임에서 헤드, 눈, 시선이 애너테이션된 47,456개의 인스턴스가 포함되어 있다.
  • 다른 장면의 프레임을 사용하여 훈련된 장면 전환 감지 헤드를 추가함으로써 모델의 변종을 확장하여 장면 전환 감지를 수행한다.
  • 성능 평가에는 평균 정밀도(mAP)를 사용하며, 각 경로의 기여도를 평가하기 위해 추상화 연구(ablation study)를 실시한다.

실험 결과

연구 질문

  • RQ1딥 러닝 모델이 헤드 자세나 기하학적 정보에 대한 명시적 지도 없이도, 시선 애너테이션만으로 두 번째 시점의 시선 위치를 예측할 수 있는가?
  • RQ2엔드 투 엔드 훈련을 통해 모델이 주목도, 시선 방향, 시점 간 기하학적 관계를 어느 정도 암묵적으로 학습할 수 있는가?
  • RQ3모델은 시간적으로 떨어져 있거나 기하학적으로 다를 수 있는 시점으로 일반화하는 데 얼마나 잘 성능을 내는가?
  • RQ4모델은 시선 대상이 장면 외부에 있을 경우, 장면 전환을 나타내는지 감지할 수 있는가?

주요 결과

  • 제안된 모델은 VideoGaze 데이터셋의 전체 테스트 세트에서 평균 정밀도(mAP) 0.255를 달성하여 모든 베이스라인을 크게 앞서며 최신 기술 수준(SOTA) 성능을 보였다.
  • 원천 시점에서 1초 이상 떨어진 시간적으로 거리가 먼 프레임을 포함한 축소된 테스트 세트에서, 모델은 mAP 0.255를 기록했고, 정적 기반 모델은 0.187로 성능이 저하되었다.
  • 모델은 더 다른 시점에서 더 잘 작동하며, 이는 이러한 경우 주목도 경로가 더 중요해지기 때문이다.
  • 추상화 연구 결과, 수직축 기준의 회전과 이동만을 사용할 경우가 가장 높은 성능를 기록했으며, 이는 일반적인 카메라 움직임과 일치한다.
  • 장면 전환 감지 기능을 추가한 확장된 모델은 평균 정밀도 0.877을 기록하여 무작위 확률 0.5보다 훨씬 높은 성능를 보였다.
  • 내부 경로의 시각화 결과, 모델가 명시적 지도 없이도 기하학적 관계, 시선 방향, 주목 영역을 학습하는 것을 확인할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.