Skip to main content
QUICK REVIEW

[論文レビュー] Spatio-Temporal Dynamics and Semantic Attribute Enriched Visual Encoding for Video Captioning

Nayyer Aafaq, Naveed Akhtar|arXiv (Cornell University)|Feb 27, 2019
Multimodal Machine Learning Applications参考文献 58被引用数 13
ひとこと要約

本稿では、2次元および3次元畳み込みニューラルネットワーク(CNN)特徴量に階層的短時間フーリエ変換(SFT)を適用し、物体検出器を用いて空間的および意味的文脈を統合することで、時間的・空間的ダイナミクスと意味的属性を向上させる、動画キャプション生成のための新しい視覚的符号化手法を提案する。豊富な視覚的特徴量は、軽量な2層GRU言語モデルに供給され、MSVDおよびMSR-VTTベンチマークで、METEORとROUGE-Lそれぞれ2.64%および2.44%の向上を達成し、新たな最先端性能を実現した。

ABSTRACT

Automatic generation of video captions is a fundamental challenge in computer vision. Recent techniques typically employ a combination of Convolutional Neural Networks (CNNs) and Recursive Neural Networks (RNNs) for video captioning. These methods mainly focus on tailoring sequence learning through RNNs for better caption generation, whereas off-the-shelf visual features are borrowed from CNNs. We argue that careful designing of visual features for this task is equally important, and present a visual feature encoding technique to generate semantically rich captions using Gated Recurrent Units (GRUs). Our method embeds rich temporal dynamics in visual features by hierarchically applying Short Fourier Transform to CNN features of the whole video. It additionally derives high level semantics from an object detector to enrich the representation with spatial dynamics of the detected objects. The final representation is projected to a compact space and fed to a language model. By learning a relatively simple language model comprising two GRU layers, we establish new state-of-the-art on MSVD and MSR-VTT datasets for METEOR and ROUGE_L metrics.

研究の動機と目的

  • 標準的な平均プーリングによるCNN特徴量を超える視覚的特徴表現の向上を通じて、動画キャプションの性能を改善すること。
  • 2次元および3次元CNN活性化の階層的短時間フーリエ変換(SFT)を用いて、動画内の明示的な時間的・空間的ダイナミクスをモデル化すること。
  • 物体検出器と3次元CNNを用いて、物体の識別子、位置、運動といった高レベルの意味的属性を視覚的表現に統合すること。
  • 豊富な視覚的符号化と組み合わせた単純で浅いGRU言語モデルが、複雑なモデルを上回ることを示すこと。
  • METEORおよびROUGE-Lスコアを用いて、MSVDおよびMSR-VTTのベンチマークデータセットで新たな最先端性能を確立すること。

提案手法

  • 動画全体にわたって2次元(InceptionResNetV2)および3次元(C3D)CNNの活性化マップに階層的短時間フーリエ変換(SFT)を適用し、微細な時間的ダイナミクスを符号化する。
  • YOLO物体検出器を用いて、バウンディングボックスの位置、クラスラベル、物体数を含む、オブジェクトレベルの意味的特徴を抽出し、空間的ダイナミクスと複数性をモデル化する。
  • 言語モデルの辞書と語彙を一致させることで、3次元CNNと物体検出器出力の意味的埋め込みを統合する。
  • SFTで符号化されたダイナミクスと意味的属性を統合した視覚的表現を、全結合層を用いてコン pact かつ低次元空間に投影する。
  • 圧縮された視覚的コード上で2層のゲート付き再帰ユニット(GRU)言語モデルを学習し、自然言語のキャプションを生成する。
  • 時間経過に伴うニューロン単位の活性化を処理する階層的SFT戦略を採用し、動画内の時間的変化パターンを保持する。

実験結果

リサーチクエスチョン

  • RQ1より洗練された視覚的符号化機構は、標準的なCNN特徴量の平均プーリングを超えて、動画キャプションの性能を顕著に向上させることができるか?
  • RQ2CNN活性化の階層的短時間フーリエ変換は、動画系列における時間的・空間的ダイナミクスをどれほど正確に捉え、保持できるか?
  • RQ3物体の識別子、位置、運動といった高レベルの意味的属性は、より正確で詳細なキャプションを生成するためにどの程度寄与するか?
  • RQ4意味的に豊富で動的な視覚的特徴が供給された場合、相対的に単純な2層GRU言語モデルが、より複雑なモデルを上回ることができるか?
  • RQ5提案手法の視覚的符号化は、MSVDおよびMSR-VTTといった多様な動画キャプションベンチマークに一般化可能か?

主な発見

  • 提案手法はMSVDデータセットで新たな最先端性能を達成し、先行手法と比較してMETEORスコアが最大2.64%向上し、ROUGE-Lスコアも2.44%向上した。
  • MSR-VTTデータセットでは、METEORスコア28.4、ROUGE-Lスコア60.7を達成し、M3-VC、RecNet local、TDDFを含むすべての比較モデルを上回った。
  • 2次元および3次元CNN特徴量に階層的SFTを適用することで、標準的な平均プーリングを大幅に上回る性能が得られ、アブレーションスタディにより顕著な性能向上が確認された。
  • GRU層の数を2層を超えて増加させるとBLEU-4スコアが低下し、提案された視覚的符号化と組み合わせた2層GRUが最適であることが示された。
  • GRU層の状態サイズが2048の場合に最適な性能が得られ、さらに増加(例:4096)しても改善が見られなかった。
  • 定性的な分析から、生成されたキャプションが部分的なクリップに偏らず、物体の複数性、運動、全体の動画コンテキストをよりよく捉えていることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。