Skip to main content
QUICK REVIEW

[논문 리뷰] Connecting Gaze, Scene, and Attention: Generalized Attention Estimation via Joint Modeling of Gaze and Scene Saliency

Eunji Chong, Nataniel Ruiz|arXiv (Cornell University)|2018. 07. 27.
Gaze Tracking and Assistive Technology인용 수 7
한 줄 요약

이 논문은 다양한 자연스러운 상황에서 일반화된 시각적 주의 추정을 가능하게 하기 위해 시선 방향(3D 요와 피치)과 환경 주목도를 함께 모델링하는 다중 작업 딥 러닝 프레임워크를 제안한다. GazeFollow, EYEDIAP, SynHead 세 가지 데이터셋을 공동 학습에 활용함으로써, 시선-주목도 예측에서 최고 성능을 달성하고, MMDB 데이터셋에서 새로운 일반화된 주의 추정 작업에서 평균 정밀도 0.902를 기록하여 프레임 내외의 시선 타겟을 효과적으로 구분한다.

ABSTRACT

This paper addresses the challenging problem of estimating the general visual attention of people in images. Our proposed method is designed to work across multiple naturalistic social scenarios and provides a full picture of the subject's attention and gaze. In contrast, earlier works on gaze and attention estimation have focused on constrained problems in more specific contexts. In particular, our model explicitly represents the gaze direction and handles out-of-frame gaze targets. We leverage three different datasets using a multi-task learning approach. We evaluate our method on widely used benchmarks for single-tasks such as gaze angle estimation and attention-within-an-image, as well as on the new challenging task of generalized visual attention prediction. In addition, we have created extended annotations for the MMDB and GazeFollow datasets which are used in our experiments, which we will publicly release.

연구 동기 및 목표

  • 이미지 프레임 내외로 시선이 향할 수 있는 제약 없는 자연스러운 사회적 상호작용에서 일반화된 시각적 주의 추정 문제를 해결하기 위해.
  • 3D 시선 벡터와 고정 가능성 지apap을 함께 추정하는 통합 모델을 개발하여 다양한 시선 행동 유형에서 정확한 예측을 가능하게 하기 위해.
  • 이전 연구가 프레임 내 시선 타겟이나 스크린 기반 눈 추적과 같은 제약된 설정에만 집중한 데 비해 이를 개선하기 위해.
  • 미래의 일반화된 주의 모델링 연구를 지원하기 위해 MMDB와 GazeFollow에 대한 확장된 애너테이션을 생성하고 공개하기 위해.
  • 다양한 데이터셋과 다중 작업 학습이 다양한 시선 행동 유형 간의 강인성과 일반화 능력을 향상시키는 데 미치는 영향을 평가하기 위해.

제안 방법

  • 시나리오 경로는 주목도 추정을 위해, 얼굴 경로는 3D 시선 벡터 예측(요와 피치)을 위해 사용되는 이중 경로 신경망 아키텍처를 사용한다.
  • EYEDIAP를 사용해 시선 각도 예측, 수정된 GazeFollow를 사용해 환경 주목도 예측, SynHead를 사용해 외부 프레임 시선 탐지에 대해 다중 작업 학습을 적용한다.
  • 고정 가능성 지도는 주목도 지도와 시선 벡터를 결합하여 생성되며, 시선이 프레임 외부일 경우 활성화를 명시적으로 억제한다.
  • 자세 일반화를 향상시키기 위해 프로젝션-비교 손실을 사용하지만, 훈련 데이터에서 자세 커버리지가 제한되어 있어 그 영향은 제한적이다.
  • 시선 각도 예측에 교차 엔트로피 손실, 주목도 지도 예측에 L2 손실을 사용하여 엔드 투 엔드로 모델을 훈련시킨다.
  • 최종 출력은 프레임 내 주의와 외부 시선을 모두 반영하는 밀도 있는 고정 가능성 히트맵으로, 해석 가능한 주의 추정을 가능하게 한다.

실험 결과

연구 질문

  • RQ1통합 딥 러닝 모델이 프레임 외부 시선을 포함한 다양한 자연스러운 시선 행동에서 시각적 주의를 효과적으로 추정할 수 있는가?
  • RQ2시선 방향과 환경 주목도를 함께 모델링함으로써 단일 작업 접근법에 비해 일반화된 주의 추정 성능이 어떻게 향상되는가?
  • RQ3다양한 데이터셋과 다중 작업 학습이 시선 및 주의 추정에서 일반화와 강인성에 어떤 영향을 미치는가?
  • RQ4기존 데이터셋을 얼마나 확장하여 새로운 일반화된 주의 추정 작업을 지원할 수 있는가?
  • RQ5아키텍처 선택과 손실 함수가 외부 프레임 시선 타겟을 탐지하는 데 모델의 능력에 어떤 영향을 미치는가?

주요 결과

  • MMDB 데이터셋을 사용한 새로운 일반화된 주의 추정 작업에서 모델은 최고 성능인 평균 정밀도 0.902를 기록하여 기준 모델을 크게 앞서며 성능을 입증했다.
  • GazeFollow 벤치마크에서 모델은 AUC 0.896을 기록하여 프레임 내 시선-주목도 예측에서 뛰어난 성능을 보였다.
  • EYEDIAP 및 SynHead 데이터셋을 공동으로 학습함으로써 성능 향상이 이루어졌으며, GazeFollow와 EYEDIAP로만 학습했을 경우 평균 정밀도 0.820, 전체 다중 데이터셋 학습 시 0.902를 기록했다.
  • qualitative 결과를 통해 시선이 프레임 외부일 경우 고정 가능성 지도가 효과적으로 억제됨을 확인했으며, MMDB에서 외부 프레임 타겟에 대해 히트맵 값이 낮게 나타났다.
  • EYEDIAP 또는 SynHead 데이터셋을 제거해도 주목도 추정에 미미한 영향을 미치지만, 아키텍처 선택—특히 이중 경로를 ROI 풀링으로 대체하는 것—은 성능을 크게 떨어뜨린다(기존 AUC 0.700으로 감소).
  • 프로젝션-비교 손실은 제한적인 효과를 보였으며, 이는 SynHead 및 EYEDIAP 데이터셋의 자세 다양성이 GazeFollow에 비해 제한적이기 때문일 것이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.