Skip to main content
QUICK REVIEW

[論文レビュー] Supervising Neural Attention Models for Video Captioning by Human Gaze Data

Youngjae Yu, Jongwook Choi|arXiv (Cornell University)|Jul 19, 2017
Multimodal Machine Learning Applications参考文献 6被引用数 3
ひとこと要約

本稿では、人間の注視追跡データを用いて空間的・時間的アテンション機構を明示的に監視する、動画字幕生成モデルであるGaze Encoding Attention Network(GEAN)を提案する。エンコーダーとデコーダーに注視予測視覚アテンションマップを統合することで、複数のデータセットにおいて動画字幕生成および注視予測の両面で最先端の性能を達成し、自動評価指標および人間評価による検証で、字幕品質が顕著に向上している。

ABSTRACT

The attention mechanisms in deep neural networks are inspired by human's attention that sequentially focuses on the most relevant parts of the information over time to generate prediction output. The attention parameters in those models are implicitly trained in an end-to-end manner, yet there have been few trials to explicitly incorporate human gaze tracking to supervise the attention models. In this paper, we investigate whether attention models can benefit from explicit human gaze labels, especially for the task of video captioning. We collect a new dataset called VAS, consisting of movie clips, and corresponding multiple descriptive sentences along with human gaze tracking data. We propose a video captioning model named Gaze Encoding Attention Network (GEAN) that can leverage gaze tracking information to provide the spatial and temporal attention for sentence generation. Through evaluation of language similarity metrics and human assessment via Amazon mechanical Turk, we demonstrate that spatial attentions guided by human gaze data indeed improve the performance of multiple captioning methods. Moreover, we show that the proposed approach achieves the state-of-the-art performance for both gaze prediction and video captioning not only in our VAS dataset but also in standard datasets (e.g. LSMDC and Hollywood2).

研究の動機と目的

  • 人間の注視追跡データを用いた明示的監視が、動画字幕生成におけるアテンション機構の性能向上に寄与するかどうかを調査すること。
  • 動画字幕と人間の注視アノテーションを併せ持つデータセットの不足を解決すること。
  • 注視予測空間的アテンションと時間的言語モデリングを効果的に統合する新しい動画字幕生成モデルを開発すること。
  • Amazon Mechanical Turkを用いた人間アノテーションおよび自動評価指標を用いて、注視監視の字幕品質への影響を評価すること。

提案手法

  • 注視予測アテンションマップを視覚特徴符号化プロセスに統合するGaze Encoding Attention Network(GEAN)を提案する。
  • 動画フレームから空間的注視マップを生成するための再帰的注視予測(RGP)モデルを採用し、これをアテンションの監視に用いる。
  • 3種類の特徴タイプ(GoogLeNet(C3D)、シーン認識、RGPからの注視マップ)を処理するマルチストリーム視覚エンコーダーを採用する。
  • 二重アテンション機構を適用:空間的アテンションは注視マップでガイドされ、デコーダーにおける時間的アテンションは語の生成に用いられる。
  • 字幕生成のための交差エントロピー損失と注視予測のためのL2損失を併用し、エンドツーエンドで訓練することで、共同最適化を実現する。
  • LSMDCでの微調整の前に、VASおよびHollywood2データセットでRGPモデルを事前学習することで、転移学習を活用する。

実験結果

リサーチクエスチョン

  • RQ1人間の注視データを用いた明示的監視が、アテンションベースの動画字幕生成モデルの性能向上に寄与するか?
  • RQ2注視予測空間的アテンションを統合することで、より正確で人間が好む字幕が生成されるか?
  • RQ3限られた注視ラベル付きデータで学習したモデルは、注視アノテーションのないゼロ注視データセット(例:LSMDC)にも一般化可能か?
  • RQ4注視監視は、同時に注視予測の正確性と動画字幕生成の品質にどのような影響を与えるか?

主な発見

  • GEANは、VAS、LSMDC、Hollywood2の各データセットにおいて、動画字幕生成および注視予測の両面で最先端の性能を達成した。
  • RGPベースの注視監視を用いたモデルは、自動評価指標(BLEU、METEOR、CIDEr)およびAMTにおける人間評価の両面で、すべてのベースラインを上回った。
  • 人間の好みの研究では、GEANが生成する字幕がベースラインを有意に上回ることが示され、自動評価指標が示すよりも高い好みの差が確認された。
  • VASおよびHollywood2で学習したRGPモデルは良好に一般化され、LSMDCにおいても注視アノテーションが存在しない状況でも字幕生成性能が向上した。
  • C3D、シーン、および注視マップの3つの視覚特徴ストリームをすべて使用した場合に最良の性能が得られ、注視監視の補完的役割が裏付けられた。
  • 固定された注視パターンの中で、均一な注視重み付けが最も優れた性能を示し、視野全体に注目することが、偏ったまたはランダムな注視よりも効果的であることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。