Skip to main content
QUICK REVIEW

[論文レビュー] Image Conditioned Keyframe-Based Video Summarization Using Object Detection

Neeraj Baghel, Suresh Chandra Raikwar|arXiv (Cornell University)|Sep 11, 2020
Video Analysis and Summarization参考文献 24被引用数 8
ひとこと要約

本稿では、物体検出とグローバルな注目度特徴を用いてユーザーの好みモデリングを向上させる、画像条件付きキーフレームベースの動画要約手法を提案する。数学的損失関数と分散に基づくしきい値処理を導入することで、冗長性を低減し、UTEデータセットで平均F1スコア57.06%を達成した(SOTA比11.01%の向上)。また、リアルタイムの7.81倍の高速処理が可能となった。

ABSTRACT

Video summarization plays an important role in selecting keyframe for understanding a video. Traditionally, it aims to find the most representative and diverse contents (or frames) in a video for short summaries. Recently, query-conditioned video summarization has been introduced, which considers user queries to learn more user-oriented summaries and its preference. However, there are obstacles in text queries for user subjectivity and finding similarity between the user query and input frames. In this work, (i) Image is introduced as a query for user preference (ii) a mathematical model is proposed to minimize redundancy based on the loss function & summary variance and (iii) the similarity score between the query image and input video to obtain the summarized video. Furthermore, the Object-based Query Image (OQI) dataset has been introduced, which contains the query images. The proposed method has been validated using UT Egocentric (UTE) dataset. The proposed model successfully resolved the issues of (i) user preference, (ii) recognize important frames and selecting that keyframe in daily life videos, with different illumination conditions. The proposed method achieved 57.06% average F1-Score for UTE dataset and outperforms the existing state-of-theart by 11.01%. The process time is 7.81 times faster than actual time of video Experiments on a recently proposed UTE dataset show the efficiency of the proposed method

研究の動機と目的

  • テキストクエリに代わる画像クエリを用いることで、動画要約におけるユーザーの主観的好みをよりよく反映する。
  • 要約の分散と類似度スコアに基づく新しい数学的モデルを用いて、選択されたキーフレーム間の冗長性を低減する。
  • 照明条件の変化にさらされる日常的な動画において、キーフレーム選択の正確性を向上させる。
  • 動画要約におけるクエリ画像選択を支援するための新規データセット、Object-based Query Image (OQI) を開発する。
  • 低レベルの視覚的特徴と適応的しきい値処理を用いて、コンsumerハードウェアでも効率的かつリアルタイムの動画要約を実現する。

提案手法

  • ユーザーの好みの信号として画像クエリを用い、局所的特徴には物体検出、グローバル特徴には注目領域を活用する。
  • クエリ画像と動画フレームとの類似度に基づいて、フレーム選択スコアを計算するための損失関数を導入する。
  • 選択されたキーフレーム間の冗長性を最小化するために、要約の分散を計算する式を適用する。
  • 標準偏差に基づく適応的しきい値処理を用いて、動的かつ柔軟にキーフレームを選択する。
  • 交差率(IOU)を用いた二部グラフマッチング手法により、正確度、再現度、F1スコアを計算する。
  • 動画処理をセグメンテーション、特徴抽出、フレームスコア計算、要約生成のパイプラインワークフローで行う。

実験結果

リサーチクエスチョン

  • RQ1動画要約において、テキストクエリに比べて画像クエリがユーザーの好みをよりよくモデル化できるか?
  • RQ2分散と類似度スコアに基づく数学的モデルを用いることで、選択されたキーフレーム間の冗長性をどの程度低減できるか?
  • RQ3物体検出(局所的)と注目度(グローバル)特徴を組み合わせることで、キーフレーム選択の正確性はどの程度向上するか?
  • RQ4類似度と分散に基づく損失関数は、実世界のエゴセントリック動画における要約性能を向上させられるか?
  • RQ5本手法は、既存の最先端手法と比較して、速度と正確性の両面で優れているか?

主な発見

  • 提案手法はUTEデータセットで平均F1スコア57.06%を達成し、既存の最先端手法を11.01%上回った。
  • 処理時間を実時間の7.81倍に短縮し、ニアリアルタイムの要約が可能となった。
  • 可視化結果から、本手法は「OR」論理を用いた画像クエリにより、関連するショット(例:人物や車)を効果的に捉えられていた。
  • 動画要約タスクにおけるクエリ画像選択を支援するため、OQIデータセットを成功裏に構築した。
  • 標準偏差に基づく適応的しきい値処理により、照明条件の変化にさらされてもキーフレーム選択のロバスト性が向上した。
  • 物体検出(局所的)と注目度(グローバル)特徴の組み合わせにより、要約品質とユーザー好みの整合性が顕著に向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。