[論文レビュー] Query-based Video Summarization with Pseudo Label Supervision
本論文は、既存のヒューマンアノテートされたフレームレベルラベルから導出されたセグメントレベルの疑似ラベルを活用することで、自己教師ありのクエリベース動画要約手法を提案する。文脈に配慮したクエリエンコーディングのためのセマンティクスブースターと、クロスモダリティ相互作用を実現する相互注意メカニズムを導入することで、TVSum、SumMe、QueryVSベンチマークで最先端の性能を達成し、それぞれF1スコア68.4、52.4、55.3を記録した。
Existing datasets for manually labelled query-based video summarization are costly and thus small, limiting the performance of supervised deep video summarization models. Self-supervision can address the data sparsity challenge by using a pretext task and defining a method to acquire extra data with pseudo labels to pre-train a supervised deep model. In this work, we introduce segment-level pseudo labels from input videos to properly model both the relationship between a pretext task and a target task, and the implicit relationship between the pseudo label and the human-defined label. The pseudo labels are generated based on existing human-defined frame-level labels. To create more accurate query-dependent video summaries, a semantics booster is proposed to generate context-aware query representations. Furthermore, we propose mutual attention to help capture the interactive information between visual and textual modalities. Three commonly-used video summarization benchmarks are used to thoroughly validate the proposed approach. Experimental results show that the proposed video summarization algorithm achieves state-of-the-art performance.
研究の動機と目的
- 高価なヒューマンアノテーションに起因するクエリベース動画要約におけるデータ不足問題に対処する。
- 既存のフレームレベルアノテーションから導出されたセグメントレベル疑似ラベルを活用することで、モデルの汎化性能を向上させる。
- 文脈に配慮したセマンティクスブースターを用いてクエリ表現学習を強化し、クエリ依存の要約性能を向上させる。
- 視覚的およびテキスト的モダリティ間のクロスモダリティ相互作用を、相互注意メカニズムで捉える。
- 完全アノテートデータにほとんど依存しない状態で、標準ベンチマークで最先端の性能を達成する。
提案手法
- 既存のヒューマンアノテートフレームレベルラベルからセグメントレベルの疑似ラベルを生成し、事前学習のためのプロキシ自己教師ありタスクの監督信号として用いる。
- これらの疑似ラベルを用いてモデルを事前学習することで、微調整の前に初期化と時系列モデリングを改善する。
- 文脈に配慮したクエリ埋め込みを生成するセマンティクスブースターを導入し、クエリの意味をよりよく捉える。
- 推論時に視覚的およびテキスト的特徴を動的に整列・統合するために、相互注意メカニズムを採用する。
- 2Dおよび3DのResNet-34バックボーンをImageNetおよびKineticsで事前学習済みのものとして用い、フレームレベルおよびセグメントレベルの視覚的特徴を抽出する。
- 一貫した入力次元を確保するため、フレーム繰り返し前処理と標準化を適用する。

実験結果
リサーチクエスチョン
- RQ1フレームレベルアノテーションから導出されたセグメントレベル疑似ラベルは、クエリベース動画要約の自己教師あり事前学習を効果的に改善できるか?
- RQ2文脈に配慮したセマンティクスブースターは、クエリ依存の動画要約におけるクエリ表現学習をどのように向上させるか?
- RQ3視覚的およびテキスト的モダリティ間の相互注意は、標準的なクロスアテンションや連結処理と比較して、モデル性能をどの程度向上させるか?
- RQ4提案手法の自己教師ありアプローチは、既存の完全教師ありおよび弱教師ありベースラインを標準ベンチマークで上回るか?
- RQ5本手法は、長さやコンテンツ分布が異なる多様な動画データセットに対しても一般化可能か?
主な発見
- 提案手法は、TVSumで68.4、SumMeで52.4、QueryVSで55.3という最先端のF1スコアを達成し、既存の完全教師ありおよび弱教師あり手法を上回った。
- アブレーションスタディの結果、疑似ラベル事前学習、セマンティクスブースター、相互注意の各コンポーネントがベースラインと比較して顕著に性能向上をもたらすことが確認された。
- フレームレベルアノテーションと整合性を持つため、人為的検証がなくても、セグメントレベル疑似ラベルが有効な時系列監督を提供することが分かった。
- セマンティクスブースターは、従来のBag-of-Words (BoW) 埋め込みよりも文脈的なクエリ意味をより効果的に捉えることができた。
- 相互注意メカニズムにより、クロスモダリティ特徴の相互作用が向上し、より正確なクエリ依存の動画クリップ選択が可能になった。
- 本モデルは、動画長やコンテンツ分布が異なるデータセットに対しても強固な性能を維持しており、ロバストネスと一般化能力を示した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。