Skip to main content
QUICK REVIEW

[論文レビュー] A Deep Ranking Model for Spatio-Temporal Highlight Detection from a 360 Video

Youngjae Yu, Sang-Ho Lee|arXiv (Cornell University)|Jan 31, 2018
Video Analysis and Summarization参考文献 26被引用数 7
ひとこと要約

本論文は、同一の360°ビデオコンテンツからプロ、一般、ランダムなNFOV(最適視野)を比較することで、視覚的構成の質を学習する深層ランクモデル、Composition View Score (CVS) を提案する。このモデルは、最適なNFOVセグメントを特定するための球面的構成スコアマップを生成し、時間的要約のための上位ランクのサブショットを選択する。本手法は、AutoCamに比べ16倍高速な推論を達成し、定量的指標およびユーザースタディーの両面で最先端の手法を上回る性能を発揮する。

ABSTRACT

We address the problem of highlight detection from a 360 degree video by summarizing it both spatially and temporally. Given a long 360 degree video, we spatially select pleasantly-looking normal field-of-view (NFOV) segments from unlimited field of views (FOV) of the 360 degree video, and temporally summarize it into a concise and informative highlight as a selected subset of subshots. We propose a novel deep ranking model named as Composition View Score (CVS) model, which produces a spherical score map of composition per video segment, and determines which view is suitable for highlight via a sliding window kernel at inference. To evaluate the proposed framework, we perform experiments on the Pano2Vid benchmark dataset and our newly collected 360 degree video highlight dataset from YouTube and Vimeo. Through evaluation using both quantitative summarization metrics and user studies via Amazon Mechanical Turk, we demonstrate that our approach outperforms several state-of-the-art highlight detection methods. We also show that our model is 16 times faster at inference than AutoCam, which is one of the first summarization algorithms of 360 degree videos

研究の動機と目的

  • 長時間の360°ビデオを空間的(最適なNFOVビューの選択)および時間的(要約されたハイライトの生成)に要約する課題に対処すること。
  • 従来の手法が空間的要約に限定されているか、重複するビュー評価による高い推論複雑性を抱えるという限界を克服すること。
  • 同じ360°ビデオコンテンツから得たプロ、一般、ランダムなNFOVビューをランク付けすることで、視覚的構成の質を学習する深層学習モデルの開発。
  • 各ビデオセグメントごとに完全な球面的スコアマップを生成することで、重複するビュー間の計算を削減し、効率的な推論を実現すること。
  • Pano2VidベンチマークおよびYouTubeとVimeoから新たに収集した360°ハイライトデータセットの両方でフレームワークの評価を行うこと。

提案手法

  • 各360°ビデオセグメントに対して、各ビューの構成品質を示す球面的スコアマップを出力する、完全畳み込み型の深層ランクネットワーク、Composition View Score (CVS) モデルを提案する。
  • プロのNFOVショット(ポジティブ)、一般のNFOVショット(ポジティブ)、ランダムに抽出されたNFOVショット(ネガティブ)を比較する三重項ランク損失を用いて訓練し、構成の忠実度に基づいてビューをランク付けする学習を実現する。
  • ガウス位置プーリングを用いて球面面上の空間的スコアを集約し、ビュー選択のための効率的なスライディングウィンドウ推論を可能にする。
  • 球面的スコアマップ上でのスライディングウィンドウカーネルを用いて、各ビデオセグメントでスコアが最も高いNFOVを選択することで空間的要約を実行する。
  • 全ビデオにわたって上位N位のランク付けされたNFOVサブショットを選択することで、時間的要約を実現する。
  • CVS-Fusionバージョンでは空間的および時間的特徴を統合することで、ダンスやキスの瞬間などの動的イベントの検出を強化する。

実験結果

リサーチクエスチョン

  • RQ1プロ、一般、ランダムなNFOVビューを比較することで、深層ランクモデルが360°ビデオにおける視覚的構成の質を効果的に学習できるか?
  • RQ2従来の手法が各ビューごとにスコアを評価するのに対し、各ビデオセグメントごとに球面的スコアマップを生成することで、推論時間が著しく短縮されるか?
  • RQ3三重項ランク損失は、ペairwiseランク損失ベースラインに比べ、ハイライト検出性能をどの程度向上させるか?
  • RQ4本手法は、YouTubeおよびVimeoから収集した実世界の360°ビデオに対して、最先端のベースラインと比較してどの程度一般化性能を発揮するか?
  • RQ5ユーザースタディーにより、本手法で検出されたハイライトが、既存手法に比べてより情報的で魅力的であると認識されるか?

主な発見

  • CVS-Fusionモデルは、新たに作成した360°ビデオハイライトデータセットで最高のmAPを達成し、RankNet、TS-DCNN、ペアワイズ損失ベースの変種を上回った。
  • 三重項ランク損失は、WeddingおよびMVデータセットにおいて、ペアワイズ損失ベースラインに比べてmAPをそれぞれ5.98点および4.73点向上させた。
  • Amazon Mechanical Turkを用いたユーザースタディーでは、72.5%のターカーがCVS-Fusionモデルが生成したハイライトをRankNetおよびTS-DCNNのものよりも好むと回答した。
  • CVSモデルは、AutoCamに比べ16倍高速な推論を達成し、重複するビュー評価に起因する計算オーバーヘッドを顕著に削減した。
  • 定性的な分析により、適切に構図が取られたメインオブジェクトや動的イベント(ダンスやキスの瞬間)が、高い構成スコアに一貫して対応していることが確認された。
  • 球面的スコアマップは、人の存在やアクションの中心といった注目すべきコンテンツを効果的に強調し、空や空っぽの背景のような情報のない領域には低スコアを割り当てていた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。