Skip to main content
QUICK REVIEW

[논문 리뷰] Supervising Neural Attention Models for Video Captioning by Human Gaze Data

Youngjae Yu, Jongwook Choi|arXiv (Cornell University)|2017. 07. 19.
Multimodal Machine Learning Applications참고 문헌 6인용 수 3
한 줄 요약

이 논문은 인간의 시선 추적 데이터를 활용하여 공간적 및 시간적 주의 메커니즘을 명시적으로 감독하는 Gaze Encoding Attention Network (GEAN)이라는 비디오 캡션 모델을 제안한다. 인코더와 디코더에 시선 예측 시각 주의 맵을 통합함으로써, GEAN은 여러 데이터셋에서 비디오 캡션 및 시선 예측 분야에서 최신 기술 수준(SOTA)의 성능을 달성하며, 자동 평가 지표와 인간 평가를 통해 검증된 바에 따라 캡션 품질이 크게 향상된다.

ABSTRACT

The attention mechanisms in deep neural networks are inspired by human's attention that sequentially focuses on the most relevant parts of the information over time to generate prediction output. The attention parameters in those models are implicitly trained in an end-to-end manner, yet there have been few trials to explicitly incorporate human gaze tracking to supervise the attention models. In this paper, we investigate whether attention models can benefit from explicit human gaze labels, especially for the task of video captioning. We collect a new dataset called VAS, consisting of movie clips, and corresponding multiple descriptive sentences along with human gaze tracking data. We propose a video captioning model named Gaze Encoding Attention Network (GEAN) that can leverage gaze tracking information to provide the spatial and temporal attention for sentence generation. Through evaluation of language similarity metrics and human assessment via Amazon mechanical Turk, we demonstrate that spatial attentions guided by human gaze data indeed improve the performance of multiple captioning methods. Moreover, we show that the proposed approach achieves the state-of-the-art performance for both gaze prediction and video captioning not only in our VAS dataset but also in standard datasets (e.g. LSMDC and Hollywood2).

연구 동기 및 목표

  • 인간의 시선 추적 데이터를 사용한 명시적 감독이 주의 기반 비디오 캡션 모델의 성능 향상에 기여하는지 조사하는 것.
  • 비디오 캡션과 인간의 시선 애너테이션을 동시에 포함하는 데이터셋의 부족을 해결하는 것.
  • 시선 예측된 공간적 주의와 시간적 언어 모델링을 효과적으로 융합하는 새로운 비디오 캡션 모델을 개발하는 것.
  • Amazon Mechanical Turk를 통한 인간 애너테이션과 자동 평가 지표를 모두 활용해 시선 감독이 캡션 품질에 미치는 영향을 평가하는 것.

제안 방법

  • 시선 예측 주의 맵을 시각적 특징 인코딩 과정에 통합하는 Gaze Encoding Attention Network (GEAN)을 제안한다.
  • 비디오 프레임에서 공간적 시선 맵을 생성하기 위해 순환적 시선 예측(RGP) 모델을 사용하며, 이를 주의 감독으로 활용한다.
  • 세 가지 특징 유형을 처리하는 다중 스트림 시각 인코더를 사용한다: GoogLeNet (C3D), 장면 인식, RGP에서 유도된 시선 맵.
  • 이중 주의 메커니즘을 적용한다: 시선 맵에 의해 유도되는 공간적 주의와 디코더에서 단어 생성을 위한 시간적 주의.
  • 캡션 생성을 위한 교차 엔트로피 손실과 시선 예측을 위한 L2 손실을 동시에 사용하여 엔드 투 엔드로 학습한다. 이는 공동 최적화를 가능하게 한다.
  • 전이 학습을 활용하여 RGP 모델을 VAS 및 Hollywood2 데이터셋에서 사전 학습한 후, LSMDC에서 미세 조정한다.

실험 결과

연구 질문

  • RQ1인간의 시선 데이터를 사용한 명시적 감독이 주의 기반 비디오 캡션 모델의 성능 향상에 기여하는가?
  • RQ2시신경 예측된 공간적 주의를 통합할 경우 더 정확하고 인간이 선호하는 캡션을 도출할 수 있는가?
  • RQ3제한된 시선 레이블이 있는 데이터에서 학습된 모델이 LSMDC와 같은 시선이 없는 데이터셋으로 일반화 가능한가?
  • RQ4시선 감독이 동시에 시선 예측 정확도와 비디오 캡션 품질에 어떤 영향을 미치는가?

주요 결과

  • GEAN은 VAS, LSMDC, Hollywood2 데이터셋에서 비디오 캡션 및 시선 예측 분야에서 모두 최신 기술 수준(SOTA)의 성능을 달성한다.
  • RGP 기반의 시선 감독을 통한 모델은 자동 평가 지표(BLEU, METEOR, CIDEr)와 AMT에서의 인간 평가 모두에서 모든 베이스라인을 압도한다.
  • 인간 선호도 연구 결과, GEAN이 생성한 캡션은 모든 베이스라인보다 통계적으로 유의미한 우월성을 보이며, 자동 평가 지표가 나타내는 것보다 더 큰 선호도 격차를 보인다.
  • VAS 및 Hollywood2에서 학습한 RGP 모델은 잘 일반화되어 있으며, 타겟 데이터셋인 LSMDC에 시선 애너테이션이 없더라도 캡션 성능을 향상시킨다.
  • 세 가지 시각적 특징 스트림(C3D, 장면, 시선 맵)을 모두 사용했을 때 최고의 성능를 기록하여, 시선 감독이 상호 보완적인 역할을 한다는 것을 확인한다.
  • 고정된 시선 패턴 중에서 균일한 시선 가중치가 가장 우수한 성능를 보이며, 이는 전체 시각 분야에 주의를 기울이는 것이 편향되거나 무작위 주의보다 더 효과적임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.