Skip to main content
QUICK REVIEW

[論文レビュー] Movie Description

Anna Rohrbach, Atousa Torabi|arXiv (Cornell University)|May 12, 2016
Subtitles and Audiovisual Media被引用数 5
ひとこと要約

本論文は、視覚障害者向けの音声説明(ADs)と映画台本を統合した、202部の映画からなる118,114個の時間的に同期された動画クリップと説明文を含む大規模な映画説明チャレンジ(LSMDC)を紹介する。ADsは台本よりも視覚的に正確で関連性が高く、Frame-Video-Concept Fusionは正しさ、文法、関連性の観点で人間評価で最も優れており、説明品質のバランスが最も良い。

ABSTRACT

Audio Description (AD) provides linguistic descriptions of movies and allows visually impaired people to follow a movie along with their peers. Such descriptions are by design mainly visual and thus naturally form an interesting data source for computer vision and computational linguistics. In this work we propose a novel dataset which contains transcribed ADs, which are temporally aligned to full length movies. In addition we also collected and aligned movie scripts used in prior work and compare the two sources of descriptions. In total the Large Scale Movie Description Challenge (LSMDC) contains a parallel corpus of 118,114 sentences and video clips from 202 movies. First we characterize the dataset by benchmarking different approaches for generating video descriptions. Comparing ADs to scripts, we find that ADs are indeed more visual and describe precisely what is shown rather than what should happen according to the scripts created prior to movie production. Furthermore, we present and compare the results of several teams who participated in a challenge organized in the context of the workshop "Describing and Understanding Video & The Large Scale Movie Description Challenge (LSMDC)", at ICCV 2015.

研究の動機と目的

  • 視覚的および言語的分析のための大規模で時間的に同期された映画説明データセットの構築を目的とする。
  • 視覚障害者向けの音声説明(ADs)と従来の映画台本を、動画説明の出所として比較することを目的とする。
  • 自動評価と人間評価の両方の指標を用いて、自動動画説明モデルを評価・ベンチマーク化することを目的とする。
  • さまざまな深層学習アーキテクチャの、正確で文法的に正しい、関連性の高い動画説明を生成する能力における長所と短所を理解することを目的とする。

提案手法

  • 202部の長編映画から118,114組の文-動画クリップペアを含む、LSMDCと呼ばれる新規データセットを提案する。
  • 音声説明(ADs)と映画台本の両方を収集・同期化し、視覚的忠実度の比較分析を可能にする。
  • 語彙、物体、場所の分類器を別々に学習するVisual-Labelsというモデルを開発。信頼性の高い視覚スコアをLSTMに供給して文生成を実現する。
  • フレームレベルの動画特徴、時間的注意機構、動画-概念統合を用いて、説明の正確性と一貫性を向上させる。
  • 自動指標(例:BLEU、ROUGE)と人間評価を併用し、説明の正しさ、文法、関連性、視覚障害者への有用性の観点からモデル出力を順位付けする。
  • ICCV 2015でチャレンジを主催し、12種類の異なるアプローチをデータセットと評価プロトコルを用いてベンチマーク化した。

実験結果

リサーチクエスチョン

  • RQ1視覚障害者向けの音声説明(ADs)は、従来の映画台本と比較して、動画コンテンツに対する視覚的正確性と関連性においてどのように異なるか?
  • RQ2人間による評価において、最も正確で文法的に正しい、関連性の高い動画説明を生成する深層学習アーキテクチャはどれか?
  • RQ3文レベルの説明で弱いラベルが付与された動画クリップで学習したモデルは、トレーニング中に見られなかった長尾の視覚的コンセプトにうまく一般化できるか?
  • RQ4自動評価指標と人間の判断の相関関係は、視覚障害者への有用性を評価する際にどうなるか?
  • RQ5S2VT、Visual-Labels、Frame-Video-Concept Fusionといったモデルアーキテクチャの違いは、説明品質や誤りのパターンにどのような影響を与えるか?

主な発見

  • 音声説明(ADs)は、映画台本よりも顕著に正確で視覚的に関連性が高く、台本はしばしばシーンに表示されない物語的または計画的な行動を含むことがある。
  • Frame-Video-Concept Fusionは、正しさ、文法、関連性の観点で人間評価で最高得点を記録し、短く単純な文を生成するにもかかわらず、他のモデルを上回った。
  • S2VTとVisual-Labelsはより長く多様な説明を生成したが、誤り率が高く、内容的・文法的誤りのため人間評価で低い順位に終わった。
  • 人間の評価は評価項目によって顕著に異なる傾向を示した。視覚障害者への有用性で高い評価を受けたモデルが、文法的正しさや関連性で常に最高順位だったわけではない。
  • すべてのモデルが長尾の視覚的コンセプトに対して苦戦しており、大規模なトレーニングデータを用いても、新規または希少な視覚的要素は依然として根強い課題であることが示された。
  • LSMDCデータセットは、動画文埋め込み、物語理解、オープンドメイン環境下での複数文動画理解に関する新しい研究を可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。