Skip to main content
QUICK REVIEW

[論文レビュー] Fast Video Shot Transition Localization with Deep Structured Models

Shitao Tang, Litong Feng|ArXiv.org|Aug 13, 2018
Video Analysis and Summarization参考文献 23被引用数 11
ひとこと要約

この論文では、特別な深層学習モデルを用いて、別々にカット遷移と段階的遷移を検出することで、高速で2段階のカスケードフレームワークを動画ショット遷移の局所化に提案している。軽量なフィルタリングモジュールに続く専用のカットおよび段階的遷移検出器を採用することで、TRECVID07およびRAIで最先端の性能を達成するとともに、30倍リアルタイムの速度を実現した。本研究では、トレーニングおよび評価のための新しい大規模データセット、ClipShotsを提供した。

ABSTRACT

Detection of video shot transition is a crucial pre-processing step in video analysis. Previous studies are restricted on detecting sudden content changes between frames through similarity measurement and multi-scale operations are widely utilized to deal with transitions of various lengths. However, localization of gradual transitions are still under-explored due to the high visual similarity between adjacent frames. Cut shot transitions are abrupt semantic breaks while gradual shot transitions contain low-level spatial-temporal patterns caused by video effects in addition to the gradual semantic breaks, e.g. dissolve. In order to address the problem, we propose a structured network which is able to detect these two shot transitions using targeted models separately. Considering speed performance trade-offs, we design a smart framework. With one TITAN GPU, the proposed method can achieve a 30\( imes\) real-time speed. Experiments on public TRECVID07 and RAI databases show that our method outperforms the state-of-the-art methods. In order to train a high-performance shot transition detector, we contribute a new database ClipShots, which contains 128636 cut transitions and 38120 gradual transitions from 4039 online videos. ClipShots intentionally collect short videos for more hard cases caused by hand-held camera vibrations, large object motions, and occlusion.

研究の動機と目的

  • 動画ストリームにおいて、急激なカット遷移と段階的遷移(例:ドライヴ)を正確に局所化する課題に対処する。
  • 高いフレーム類似度のため、段階的遷移で困難になる単一の類似度関数を用いる従来手法の限界を克服する。
  • 早期フィルタリングとターゲット特化型検出器を導入することで、精度を損なわずに検出速度を向上させる。
  • 高性能な深層学習モデルによるショット境界検出を支援するため、大規模かつ多様なトレーニングデータセットを提供する。
  • 遮蔽、動き、照明の変化を含む多様な動画条件においても、強固な性能を発揮できるようにする。

提案手法

  • 複数スケールで候補遷移領域を素早く特定できる、適応的しきい値ベースの軽量フィルタリングモジュールを第1段階に適用し、検索空間を最大50%まで削減する。
  • 連続フレーム間の画像類似度関数を学習する2次元畳み込みニューラルネットワーク(2D ConvNet)ベースのカット遷移検出器を用い、急激な意味的ブレークを検出する。
  • 動画セグメント内のマルチスケール時空間パターンを捉える新しいC3D畳み込みニューラルネットワーク(C3D ConvNet)ベースの段階的遷移検出器を設計し、段階的遷移を局所化する。
  • デフォルトボックスにインspiredされたワンショット境界検出(SSBD)戦略を実装し、段階的遷移の局所化精度を向上させる。
  • フィルタリング段階が処理を高速化し、2つの特化型検出器が高精度に予測を精緻化するカスケードアーキテクチャを統合する。
  • カメラシェイクや遮蔽などの困難な条件を含む、4,039本のオンライン動画から構成される新規のClipShotsデータセットを用いてモデルをトレーニングした。このデータセットには、128,636件のカット遷移と38,120件の段階的遷移が含まれる。

実験結果

リサーチクエスチョン

  • RQ1専用検出器を備えた2段階カスケードフレームワークは、統合モデルに比べ、カット遷移と段階的遷移の両方を検出する際に優れた性能を発揮するか?
  • RQ2軽量なフィルタリングモジュールは、両方の遷移タイプの再現率を損なわず、どの程度ショット境界検出を高速化できるか?
  • RQ3特化型のC3Dベースのモデルは、長さや視覚的パターンの変動がある状況でも、段階的遷移の局所化にどの程度有効か?
  • RQ4ClipShotsのような大規模かつ多様な動画データセットは、深層学習ベースのショット境界検出器の一般化性能と性能を向上させるか?
  • RQ5スピードと精度のトレードオフは何か?リアルタイム性能を精度を損なわず達成できるか?

主な発見

  • 提案手法は、1枚のTITAN GPU上で30倍リアルタイムの推論速度を達成し、deepSBDなどの従来手法を大きく上回った。
  • TRECVID07データセットでは、オリジナルラベルを用いた場合、カット遷移のF1スコアが0.6%向上(F1 = 0.980)、段階的遷移のF1スコアが2.9%向上(F1 = 0.810)した。
  • TRECVID07の修正済みの正例ラベルを用いることで、段階的遷移のF1スコアが6.4%向上(F1 = 0.841)し、そのロバストネスと正確性を示した。
  • RAIデータセットでは、後処理フィルタリングを用いない状態で、F1スコア0.935を達成し、deepSBD(0.934)を上回る競争力ある性能を示した。
  • 段階的遷移検出器は、IOU閾値0.75においてもF1スコア0.618を達成し、正確な境界局所化性能を維持した。
  • 128,636件のカット遷移と38,120件の段階的遷移を含むClipShotsデータセットは、ショット境界検出のための最初の大規模かつ公開可能なベンチマークであり、今後の研究を支援する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。