Skip to main content
QUICK REVIEW

[論文レビュー] Storytelling of Photo Stream with Bidirectional Multi-thread Recurrent Neural Network

Yu Liu, Jianlong Fu|arXiv (Cornell University)|Jun 2, 2016
Multimodal Machine Learning Applications参考文献 22被引用数 7
ひとこと要約

本稿では、写真シーケンスに含まれる複数のストーリー線と長距離依存関係を有するクロススキッピング構造に対処するため、新規のスキップゲート付き再帰ニューラルユニット(sGRU)を備えた双方向マルチスレッド再帰ニューラルネットワーク(BMRNN)を提案する。モデルはシーン遷移に跨るスキップ情報を保持することで物語の整合性を向上させ、NYC、ディズニーランド、SINDの各データセットでそれぞれ22.8%、15.6%、15.7%高いrecall@1を達成し、最先端性能を実現した。

ABSTRACT

Visual storytelling aims to generate human-level narrative language (i.e., a natural paragraph with multiple sentences) from a photo streams. A typical photo story consists of a global timeline with multi-thread local storylines, where each storyline occurs in one different scene. Such complex structure leads to large content gaps at scene transitions between consecutive photos. Most existing image/video captioning methods can only achieve limited performance, because the units in traditional recurrent neural networks (RNN) tend to "forget" the previous state when the visual sequence is inconsistent. In this paper, we propose a novel visual storytelling approach with Bidirectional Multi-thread Recurrent Neural Network (BMRNN). First, based on the mined local storylines, a skip gated recurrent unit (sGRU) with delay control is proposed to maintain longer range visual information. Second, by using sGRU as basic units, the BMRNN is trained to align the local storylines into the global sequential timeline. Third, a new training scheme with a storyline-constrained objective function is proposed by jointly considering both global and local matches. Experiments on three standard storytelling datasets show that the BMRNN model outperforms the state-of-the-art methods.

研究の動機と目的

  • 写真ストリームにおけるクロススキッピング構造が原因で生じる長距離依存関係とコンテンツギャップの課題に対処すること。
  • 不規則なシーン遷移に跨る長距離の視覚的情報を保持できる再帰ニューラルネットワークアーキテクチャの開発。
  • 新規の学習目的を通じて、グローバルタイムラインの整合性とローカルストーリー線の整合性を同時に最適化すること。
  • 文脈的に整合的で意味的に正確な人間水準の物語記述を生成すること。

提案手法

  • 遅延制御と保持機構を備えたスキップゲート付き再帰ユニット(sGRU)を導入し、スキップフレームに跨る長距離の視覚的情報を維持する。
  • sGRUをコアユニットとして用い、グローバルタイムラインと複数のローカルストーリー線を同時にモデリングする双方向マルチスレッドRNN(BMRNN)を設計する。
  • グローバルシーケンスのアライメントとローカルストーリー線の整合性の両方を同時に最適化するストーリー線制約付きの目的関数を実装する。
  • 入力画像の視覚的表現としてVGGNetのfc7特徴量を用い、堅牢で転送可能な特徴抽出を保証する。
  • 交差エントロピー損失とリtrievalベースの目的関数を組み合わせて、エンドツーエンドでBMRNNモデルを学習し、物語の質を向上させる。
  • 推論時にK近傍探索を適用し、候補文の生成を精緻化し、リtrieval指標を改善する。

実験結果

リサーチクエスチョン

  • RQ1再帰ニューラルネットワークは、非連続フレーム間の長距離依存関係を持つクロススキッピング構造を効果的にモデリングできるか?
  • RQ2写真ストリームにおけるシーン遷移に跨る長距離の視覚的情報を保持するためには、どのようなアーキテクチャ的変更が必要か?
  • RQ3グローバルタイムラインとローカルストーリー線の共同最適化は、視覚的物語生成における物語の整合性と生成品質を向上させられるか?
  • RQ4提案されたsGRUユニットは、標準的なGRUやLSTMユニットと比較して、スキップ構造の依存関係をどれほど効果的に捉えられるか?
  • RQ5BMRNNモデルは、自動評価と人間の好みの両面で、既存の最先端手法をどの程度上回るか?

主な発見

  • NYCデータセットでは、最先端手法と比較してBMRNNモデルがrecall@1で22.8%高い性能を達成した。
  • ディズニーランドデータセットでは、最良のベースラインと比較して、BMRNNモデルがrecall@1を15.6%向上させた。
  • SINDデータセットでは、BMRNNモデルがrecall@1で15.7%の改善を達成し、ベンチマーク全体で一貫した向上を示した。
  • ユーザースタディーでは、BMRNNが生成した物語がCRCNが生成した物語よりも68.0%のケースで好まれ、平均主観スコアは5.19(CRCNは3.77)であった。
  • SINDでは中央順位(Medr)を8に、ディズニーランドでは5に低下させ、リtrieval性能と高品質な文書生成を示した。
  • ユーザースタディーの結果、BMRNNが生成した物語は、正解に近いと判断された割合が7.0%に上昇したのに対し、CRCNは2.0%にとどまり、優れた物語品質を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。