Skip to main content
QUICK REVIEW

[論文レビュー] Video Fill in the Blank with Merging LSTMs

Amir Mazaheri, Dong Zhang|arXiv (Cornell University)|Oct 13, 2016
Multimodal Machine Learning Applications参考文献 15被引用数 15
ひとこと要約

本稿では、空白の前後にある文の断片を別々のLSTMで符号化し、トレーニング可能なtanh層を介して統合した新しいマージングLSTMアプローチを、Video-Fill-in-the-Blank(ViFitB)タスクに提案する。視覚的特徴は空間的アテンション機構を介して統合される。本手法は、段階的学習を用いることで、LSMDC 2016 Movie Fill-in-the-Blankデータセットで34.2%の精度を達成し、テクスチャ的および視覚的モデリングを統合することで、ベースラインモデルを上回る性能を発揮する。

ABSTRACT

Given a video and its incomplete textural description with missing words, the Video-Fill-in-the-Blank (ViFitB) task is to automatically find the missing word. The contextual information of the sentences are important to infer the missing words; the visual cues are even more crucial to get a more accurate inference. In this paper, we presents a new method which intuitively takes advantage of the structure of the sentences and employs merging LSTMs (to merge two LSTMs) to tackle the problem with embedded textural and visual cues. In the experiments, we have demonstrated the superior performance of the proposed method on the challenging "Movie Fill-in-the-Blank" dataset.

研究の動機と目的

  • 空白の周囲で文構造が断片化している動画説明の欠落語を予測する課題に対処すること。
  • 言語的文脈と視覚的手がかりの両方を活用することで、Video-Fill-in-the-Blankタスクの性能を向上させること。
  • 二重LSTMとマージング機構を用いて、空白の前後の文の断片を効率的に符号化するモデルを設計すること。
  • 空間的アテンションが、テクスト表現と関連する視覚的領域を効果的に一致させ、より良い推論を実現するかを示すこと。

提案手法

  • 本手法は、空白の左右の文の断片を別々のLSTMで符号化し、両側からの文脈的意味を捉える。
  • 二つのLSTMの出力を連結し、重み行列を備えたトレーニング可能なtanh層を通過させて、統一された文の表現uを生成する。
  • 視覚的特徴は、事前学習済みのVGG-19ネットワークを用いて動画フレームから抽出され、最大プーリングを経て14×14×512の特徴テンソルが得られる。
  • アテンション機構は、テクスト表現uと視覚的特徴Fvを射影後に要素ごとの和算で統合し、統合特徴hを生成する。
  • アテンション重みPは、統合特徴hに対してソフトマックスを適用することで計算され、モデルが動画の関連する空間的領域に注目できるようにする。
  • 空白語の最終予測は、マージドされたテクスト表現と重み付き視覚的特徴の和にソフトマックス層を適用することで生成される。

実験結果

リサーチクエスチョン

  • RQ1二重LSTMは、空白の前後における断片的な文の文脈を効果的に符号化し、動画説明における語の予測精度を向上させることができるか?
  • RQ2テクスト表現と視覚的特徴をアテンションを介して統合することで、ViFitBの性能はどのように向上するか?
  • RQ3ViFitBタスクにおいて、ネットワークの段階的学習は、エンドツーエンド学習よりも優れた性能をもたらすか?
  • RQ4視覚的手がかりと空間的アテンションは、正確な空白語予測にどの程度寄与するか?
  • RQ5本稿で提案するマージングLSTMアーキテクチャは、テクストまたは視覚的特徴のみを用いるモデルと比較して、どのように異なるか?

主な発見

  • 段階的学習戦略により、Movie Fill-in-the-Blankデータセットで34.2%の精度を達成した。エンドツーエンド学習法は31.7%にとどまり、段階的学習が優れていることが示された。
  • 段階的学習を用いた本手法は、左側の文断片のみに依存するベースライン「Left Sentence」法(15.5%)を上回った。
  • 視覚的特徴のみを用いたLSTMベースラインは5.5%の低精度にとどまり、言語的文脈がなければ視覚的特徴だけでは不十分であることが示された。
  • テクストと視覚的特徴の両方を用いた完全なモデルは34.2%の精度を達成し、テキストとビジョンの共同モデリングが性能向上に顕著に寄与することが実証された。
  • 二重LSTM出力のマージング機構を用いることで、片側の文のみを用いる場合よりも性能が向上した。これは、双方向的文脈符号化の重要性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。