Skip to main content
QUICK REVIEW

[論文レビュー] Progressive Localization Networks for Language-based Moment Localization

Qi Zheng, Jianfeng Dong|arXiv (Cornell University)|Feb 2, 2021
Human Pose and Action Recognition参考文献 52被引用数 12
ひとこと要約

本稿では、段階的で粗いものから細かいものへのフレームワークであるプログレッシブロケーションネットワーク(PLN)を提案する。この手法は、複数の段階で、時間的粒度が異なる動画クリップを活用して、段階的に局所化を精緻化する。条件付き特徴操作モジュールとアップサンプリング接続を統合することで、特に短いモーメントにおいても局所化精度を向上させ、3つのベンチマークデータセットで最先端の性能を達成した。

ABSTRACT

This paper targets the task of language-based video moment localization. The language-based setting of this task allows for an open set of target activities, resulting in a large variation of the temporal lengths of video moments. Most existing methods prefer to first sample sufficient candidate moments with various temporal lengths, and then match them with the given query to determine the target moment. However, candidate moments generated with a fixed temporal granularity may be suboptimal to handle the large variation in moment lengths. To this end, we propose a novel multi-stage Progressive Localization Network (PLN) which progressively localizes the target moment in a coarse-to-fine manner. Specifically, each stage of PLN has a localization branch, and focuses on candidate moments that are generated with a specific temporal granularity. The temporal granularities of candidate moments are different across the stages. Moreover, we devise a conditional feature manipulation module and an upsampling connection to bridge the multiple localization branches. In this fashion, the later stages are able to absorb the previously learned information, thus facilitating the more fine-grained localization. Extensive experiments on three public datasets demonstrate the effectiveness of our proposed PLN for language-based moment localization, especially for localizing short moments in long videos.

研究の動機と目的

  • 言語ベースのモーメントロケーションにおいて、時間的長さが著しくばらつきが激しい動画モーメントを局所化する課題に対処すること。
  • 固定された時間的粒度を持つ候補サンプリングの限界を克服し、短いモーメントや長いモーメントにおいて性能が低下することを防ぐこと。
  • 粗い粒度から細かい粒度へと段階的に局所化を精緻化するマルチステージアーキテクチャを開発すること。
  • 長時間動画における短いモーメントの性能を向上させること。これは、従来のワンステージモデルがしばしば無視する分野である。
  • マルチステージロケーションにおける階層的特徴学習とステージ間の情報フローの有効性を実証すること。

提案手法

  • 時間的粒度が段階的に細かくなる動画クリップを処理するマルチステージのプログレッシブロケーションネットワーク(PLN)を提案する。
  • PLNの各ステージには、その特定の時間的粒度に基づいて候補モーメントを生成・マッチングするロケーションブランチが含まれる。
  • 以前のステージからの特徴を適応的に精緻化するための条件付き特徴操作(CFM)モジュールを導入する。
  • 高レベル特徴を以前の(粗い)ステージから後の(細かい)ステージに伝達するアップサンプリング接続を実装し、段階的精緻化を可能にする。
  • 各ステージで言語クエリと候補モーメント間のクロスマダル類似度マッチングを用いて、局所化をガイドする。
  • 各粒度レベルでの正確な局所化を促進するマルチステージ損失を用いて、ネットワーク全体をエンドツーエンドで訓練する。

実験結果

リサーチクエスチョン

  • RQ1ワンステージ手法と比較して、粗いものから細かいものへの段階的でマルチステージのアプローチが、多様なモーメント長にわたる局所化性能を向上させることができるか?
  • RQ2時間的粒度を段階的に変化させながら段階的精緻化を実施した場合、短いモーメントおよび長いモーメントの局所化にどのような影響を与えるか?
  • RQ3条件付き特徴操作(CFM)モジュールとアップサンプリング接続(UC)が、ステージ間の特徴伝達をどのように向上させているか?
  • RQ4提案されたPLNアーキテクチャは、特に長時間動画における短いモーメントにおいて、既存の最先端モデルを上回る性能を示すか?
  • RQ5固定粒度のサンプリングと比較して、粗いものから細かいものへの設計が、冗長性を低減し最適化をどのように改善するか?

主な発見

  • PLNは、Charades-STA、TACoS、ActivityNet Captionsの3つの公開ベンチマークで最先端の性能を達成し、Rank@1, IoU=0.5のスコアはそれぞれ45.43%、31.12%、45.66%であった。
  • TACoSにおいて、PLNは最短モーメントグループにおいて2D-TANと比較して相対的に48.5%の性能向上を示し、短時間モーメントの処理能力に優れていることを裏付けた。
  • アブレーションスタディの結果、条件付き特徴操作(CFM)またはアップサンプリング接続(UC)を削除すると性能が低下し、両者の有効性が確認された。
  • 時間的粒度を段階的に変化させる粗いものから細かいものへの戦略は、全ステージで均一な粒度を使用するモデルを上回り、設計選択の妥当性を裏付けた。
  • TACoSにおいて、IoU=0.3でのmIoUは29.70%を達成し、ベースラインモデルを著しく上回った。特に低IoU領域での性能向上が顕著であった。
  • 全モーメント長グループにわたり一貫した性能向上が見られ、特にTACoSの最短モーメントグループで最大の相対的改善(48.5%)を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。