Skip to main content
QUICK REVIEW

[논문 리뷰] Predicting Gaze in Egocentric Video by Learning Task-dependent Attention Transition

Yifei Huang, Minjie Cai|arXiv (Cornell University)|2018. 03. 24.
Visual Attention and Saliency Detection참고 문헌 38인용 수 9
한 줄 요약

이 논문은 순환 신경망을 통해 학습된 작업에 의존하는 주의 전이를 바탕으로 바닥에서부터 자극적인 자극과 작업에 따라 달라지는 주의 전이를 통합하는 하이브리드 딥 러닝 모델을 제안한다. 작업 맥락에 따라 시각 정지의 시간적 이동을 모델링함으로써, 공개된 에고세트릭 데이터셋에서 최신 기술 수준의 성능을 달성하며, 자극 중심 기반의 베이스라인에 비해 뚜렷하게 뛰어난 성능을 보이며 의미 있는 작업 인식 주의 전이 학습을 보여준다.

ABSTRACT

We present a new computational model for gaze prediction in egocentric videos by exploring patterns in temporal shift of gaze fixations (attention transition) that are dependent on egocentric manipulation tasks. Our assumption is that the high-level context of how a task is completed in a certain way has a strong influence on attention transition and should be modeled for gaze prediction in natural dynamic scenes. Specifically, we propose a hybrid model based on deep neural networks which integrates task-dependent attention transition with bottom-up saliency prediction. In particular, the task-dependent attention transition is learned with a recurrent neural network to exploit the temporal context of gaze fixations, e.g. looking at a cup after moving gaze away from a grasped bottle. Experiments on public egocentric activity datasets show that our model significantly outperforms state-of-the-art gaze prediction methods and is able to learn meaningful transition of human attention.

연구 동기 및 목표

  • 동적인 에고세트릭 비디오에서 주의 전이의 작업에 의존하는 패턴을 모델링하여 시각 예측 성능을 향상시키기 위해.
  • 복잡하고 작업 중심인 환경에서 고수준 맥락이 시각 행동에 영향을 주는 경우 자극 중심 모델의 한계를 해결하기 위해.
  • 시각 정지의 시간적 의존성을 순환 네트워크를 사용해 주목된 영역 간 전이를 포착함으로써 학습하기 위해.
  • 바닥에서부터 자극적인 자극과 학습된 작업 특화 주의 동역학을 융합하여 예측 정확도를 향상시키기 위해.
  • 주방 환경에서 다양한 조작 작업 간에 주의 전이 모듈의 일반화 능력을 검증하기 위해.

제안 방법

  • 이중 스트림 CNN이 에고세트릭 비디오 프레임에서 바닥에서부터 자극적인 자극 지ap을 생성한다.
  • 순환 신경망이 이전에 정지된 영역과 머리 움직임을 입력으로 사용하여 작업에 의존하는 주의 전이를 모델링한다.
  • 이전 주의 및 운동 신호를 기반으로 특정 영역에 시각 정지가 일어날 가능성을 추정하는 시각 정지 상태 예측기이다.
  • 완전 컨volution 네트워크가 자극 지도와 주의 지도를 융합하여 최종 시각 예측 히트맵을 생성한다.
  • 주의 전이 모듈은 중간 CNN 레이어(예: conv5_3)의 특징 표현을 사용하여 현재 정지 특징에서 다음 정지 영역을 예측한다.
  • 자극과 주의 모듈의 후기 융합은 그들의 상호보완적 강점을 결합하여 성능 향상을 이룬다.

실험 결과

연구 질문

  • RQ1자기 중심 비디오에서 자극 중심 모델에 비해 작업에 의존하는 주의 전이를 모델링하는 것이 정확도 향상에 기여하는가?
  • RQ2동일한 환경에서 다양한 자기 중심 조작 작업 간에 주의 전이 모듈이 얼마나 잘 일반화되는가?
  • RQ3시간적 정지 시퀀스에서 모델이 의미 있는 작업 특화 시각 전이 패턴을 얼마나 잘 학습할 수 있는가?
  • RQ4바닥에서부터 자극적인 자극과 상향식 주의 전이를 융합하면, 개별 구성 요소보다 더 나은 성능을 내는가?
  • RQ5다양한 작업으로 훈련된 후에도 주의 전이 모듈이 다음 정지 영역을 높은 정확도로 예측할 수 있는가?

주요 결과

  • 제안된 모델은 GTEA Gaze Plus 및 EGTEA Gaze+ 데이터셋 모두에서 최신 기술 수준의 성능을 달성하며, 기존의 자극 중심 및 주의 중심 방법보다 뛰어난 성능을 보였다.
  • 주의 전이(AT) 모듈은 conv5_3 레이어의 특징을 사용할 경우 다음 정지 영역 예측 정확도가 86.8%에 도달하여 무작위 기준(10.7%)보다 뚜렷하게 높았다.
  • 자극 예측(SP)과 작업에 의존하는 주의 전이(AT_d)의 후기 융합은 AT_d가 다른 작업에서 훈련된 경우에도 SP만 사용할 때보다 성능 향상을 이뤘다.
  • AT_s 변종은 동일한 작업에서 훈련 및 테스트된 경우 SP를 초월하여 성능이 뛰어나, 작업 특화 전이 패턴이 매우 예측 가능하다는 것을 보여주었다.
  • qualitative 예시에서 모델의 주의 전이 모듈은 일관되고 맥락적으로 관련된 주의 이동을 성공적으로 예측하였다.
  • 다양한 작업 간 검증 결과 AT_d는 합리적으로 잘 일반화되었으며, SP+AT_d는 SP와 AT_s 모두를 능가하는 성능로 나타나 두 구성 요소가 상호보완적임을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.