Skip to main content
QUICK REVIEW

[論文レビュー] Exploring Optical-Flow-Guided Motion and Detection-Based Appearance for Temporal Sentence Grounding

Daizong Liu, Xiang Fang|arXiv (Cornell University)|Mar 6, 2022
Human Pose and Action Recognition被引用数 4
ひとこと要約

本稿では、時間的文脈の接地のための新しい3次元的意味的推論ネットワークであるMA3SRNを提案する。このネットワークは、動きに敏感な光学フロー誘導型特徴、検出に基づく外観に敏感な特徴、3次元に敏感なオブジェクト特徴を、動き-外観関連モジュールを通じて統合する。モデルはActivityNet Caption、Charades-STA、TACoSの3つのベンチマークで最先端の性能を達成し、Charades-STAでは最大45.63%(R@1, IoU=0.7)および73.86%(R@5, IoU=0.7)の向上を達成した。

ABSTRACT

Temporal sentence grounding aims to localize a target segment in an untrimmed video semantically according to a given sentence query. Most previous works focus on learning frame-level features of each whole frame in the entire video, and directly match them with the textual information. Such frame-level feature extraction leads to the obstacles of these methods in distinguishing ambiguous video frames with complicated contents and subtle appearance differences, thus limiting their performance. In order to differentiate fine-grained appearance similarities among consecutive frames, some state-of-the-art methods additionally employ a detection model like Faster R-CNN to obtain detailed object-level features in each frame for filtering out the redundant background contents. However, these methods suffer from missing motion analysis since the object detection module in Faster R-CNN lacks temporal modeling. To alleviate the above limitations, in this paper, we propose a novel Motion- and Appearance-guided 3D Semantic Reasoning Network (MA3SRN), which incorporates optical-flow-guided motion-aware, detection-based appearance-aware, and 3D-aware object-level features to better reason the spatial-temporal object relations for accurately modelling the activity among consecutive frames. Specifically, we first develop three individual branches for motion, appearance, and 3D encoding separately to learn fine-grained motion-guided, appearance-guided, and 3D-aware object features, respectively. Then, both motion and appearance information from corresponding branches are associated to enhance the 3D-aware features for the final precise grounding. Extensive experiments on three challenging datasets (ActivityNet Caption, Charades-STA and TACoS) demonstrate that the proposed MA3SRN model achieves a new state-of-the-art.

研究の動機と目的

  • 時間的隣接する動画フレームにおける微細な視覚的差異および前景-背景コンテンツを区別する能力に欠けるフレームレベル特徴抽出の限界を解消すること。
  • Faster R-CNNに依存する検出ベース手法に見られる時間的モデリングの欠如を克服し、オブジェクトレベルでの動きの文脈を捉えること。
  • より正確なアクティビティ局所化を実現するため、動き、外観、3次元に敏感なスパatio-時間的オブジェクト関係を統合的にモデリングすること。
  • 動きと外観の手がかりを3次元に敏感な特徴と効果的に統合する統一フレームワークを構築し、接地の正確性を向上させること。

提案手法

  • 光学フロー誘導型の動きに敏感な特徴、Faster R-CNNを用いた検出ベースの外観に敏感な特徴、3次元畳み込みニューラルネットワークを用いた3次元に敏感な特徴学習のための3つの専用ブランチを設計する。
  • 特徴表現を強化するため、新しい動き-外観関連モジュールを介して、動きと外観の情報を3次元に敏感な特徴に統合する。
  • 連続するフレーム間の微細な動きダイナミクスを捉えるために光学フローを用い、類似した動作(例:'open' と 'close')の区別を向上させる。
  • 非最大抑制と信頼度のしきい値処理を適用して、1フレームあたりの検出オブジェクト数(K=20)を制御し、冗長性を低減しながら重要なインスタンスを保持する。
  • コントラスト損失と境界に敏感な回帰ヘッドを用いて、エンドツーエンドでモデルを訓練し、接地セグメントの開始時刻と終了時刻を予測する。
  • 精度と計算コストのバランスを取るために、ハイパーパramータ(正例のしきい値λ、最適は0.55)およびオブジェクト数Kを最適化する。

実験結果

リサーチクエスチョン

  • RQ1光学フロー誘導型の動き特徴を統合することで、'open' と 'close' のような意味的に類似した動作の区別が、動画フレームで向上するか?
  • RQ2曖昧な前景-背景コンテンツを有する複雑なシーンにおいて、検出ベースの外観特徴を統合することで、接地の正確性がどの程度向上するか?
  • RQ3動きと外観の情報と3次元に敏感な特徴を統合することで、スパティオ-時間的オブジェクト関係をモデル化する際の有効性はどの程度か?
  • RQ4正例のしきい値λや1フレームあたりの検出オブジェクト数Kといったハイパーパramータの最適な設定は何か?
  • RQ5提案された動き-外観関連モジュールは、特徴の直接連結に比べて、接地性能で顕著に優れているか?

主な発見

  • 提案されたMA3SRNは、Charades-STAで45.63%(R@1, IoU=0.7)および73.86%(R@5, IoU=0.7)の新記録を更新し、従来手法を上回った。
  • アブレーションスタディの結果、3次元に敏感な特徴に動きと外観の両方の情報を追加することで、ベースライン比でR@1とR@5がそれぞれ1.79%および1.81%向上した。
  • 動き-外観関連モジュールを用いることで、直接連結に比べてR@1とR@5がそれぞれ1.79%および1.81%向上し、その有効性が裏付けられた。
  • 最適な正例のしきい値λは0.55であり、この値を超えると正例候補のフィルタリングが厳しすぎることで性能が低下した。
  • 1フレームあたりK=20の検出オブジェクト数が、性能とGPUメモリコストの最良のトレードオフを提供した。K=30ではコストが著しく上昇する一方、性能向上は僅かであった。
  • 定性的な結果から、MA3SRNはオブジェクトの微細な差異(例:'door' と 'closet')や複雑な動作(例:'open' と 'hold')をよりよく捉えており、DRN や CBLN といったフレームレベルベースラインを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。