Skip to main content
QUICK REVIEW

[論文レビュー] Multi-granularity Correspondence Learning from Long-term Noisy Videos

Yijie Lin, Jie Zhang|arXiv (Cornell University)|Jan 30, 2024
Speech and Audio Processing被引用数 4
ひとこと要約

本稿では、長期間の動画理解における多粒度対応学習を統合的に扱うノイズ耐性のある最適輸送フレームワーク、Nortonを提案する。本手法は、時間的最適輸送、ソフトマックスアライメント、不正なネガティブサンプルの是正を用いて、粗粒度(クリップ-キャプション)および微粒度(フレーム-語)のずれを同時に解消する。Nortonは、最小限の計算コストで長距離時間的依存関係を効果的にモデル化することで、動画検索、動画QA、アクションセグメンテーションのベンチマークで最先端の性能を達成する。

ABSTRACT

Existing video-language studies mainly focus on learning short video clips, leaving long-term temporal dependencies rarely explored due to over-high computational cost of modeling long videos. To address this issue, one feasible solution is learning the correspondence between video clips and captions, which however inevitably encounters the multi-granularity noisy correspondence (MNC) problem. To be specific, MNC refers to the clip-caption misalignment (coarse-grained) and frame-word misalignment (fine-grained), hindering temporal learning and video understanding. In this paper, we propose NOise Robust Temporal Optimal traNsport (Norton) that addresses MNC in a unified optimal transport (OT) framework. In brief, Norton employs video-paragraph and clip-caption contrastive losses to capture long-term dependencies based on OT. To address coarse-grained misalignment in video-paragraph contrast, Norton filters out the irrelevant clips and captions through an alignable prompt bucket and realigns asynchronous clip-caption pairs based on transport distance. To address the fine-grained misalignment, Norton incorporates a soft-maximum operator to identify crucial words and key frames. Additionally, Norton exploits the potential faulty negative samples in clip-caption contrast by rectifying the alignment target with OT assignment to ensure precise temporal modeling. Extensive experiments on video retrieval, videoQA, and action segmentation verify the effectiveness of our method. Code is available at https://lin-yijie.github.io/projects/Norton.

研究の動機と目的

  • 長期間の動画理解における多粒度ノイズ対応(MNC)の課題に取り組むこと。具体的には、クリップ-キャプションおよびフレーム-語ペアの頻繁なずれを解消する。
  • 全長の長大な動画を直接モデリングすることを避けることで、長距離時間的依存関係を学習する際の計算コストを低減すること。
  • 動画-テキストアライメントにおける粗粒度(非同期的・不適切なずれ)および微粒度(部分的相関)のノイズを同時に処理することで、動画表現学習を向上させること。
  • 最適輸送に基づく再割り当てを用いて、クリップ-キャプション対照学習における潜在的に不正なネガティブサンプルを活用し、時間的モデリングの正確性を向上させること。
  • 粗粒度および微粒度のアライメントを、スケーラブルかつ耐障害性の高い動画-言語事前学習を可能にする単一の最適輸送フレームワークに統合すること。

提案手法

  • Nortonは、最適輸送(OT)に基づく動画-パラグラフ対照損失を採用し、動画クリップと自然言語パラグラフ間のシーケンスレベルの距離を測定することで、耐障害的な長期間時間的アライメントを実現する。
  • 関連付け可能なプロンプトバケツ(APB)を導入し、不適切なクリップやキャプションをフィルタリングし、輸送距離を用いて非同期ペアを再アライメントすることで、粗粒度のずれを低減する。
  • トークン単位のソフトマックス演算子を適用し、クリップ-キャプションペア内での重要な語およびキーフレームを特定することで、対数和指数近似を用いて微粒度の類似度測定を向上させる。
  • 最適輸送を用いてクリップとキャプション間のアライメントターゲットを割り当て、不正なネガティブサンプルを是正し、クリップ-キャプション対照学習における正確な時間的モデリングを保証する。
  • 統一されたOTベースの最適化において、動画-パラグラフおよびクリップ-キャプション対照損失を統合することで、多粒度対応のエンドツーエンド学習を可能にする。
  • アクションセグメンテーションのための視覚エンコーダに1層の分類ヘッドを適用し、動画検索および動画QAの標準評価プロトコルを適用する。

実験結果

リサーチクエスチョン

  • RQ1最適輸送は、長編動画-言語学習における粗粒度および微粒度のずれを同時に解消するためにどのように活用可能か?
  • RQ2関連付け可能なプロンプトバケツは、ノイズのあるクリップ-キャプション対応における動画-パラグラフ検索の耐障害性をどの程度向上させるか?
  • RQ3ソフトマックス演算子を用いることで、顕著な視覚的および言語的要素に注目することで、微粒度のフレーム-語アライメントを向上させられるか?
  • RQ4最適輸送による再割り当てを用いて不正なネガティブサンプルを活用することで、長編動画におけるクリップ-キャプション対照学習はどの程度向上するか?
  • RQ5ハイパーパrameter(例:log-sum-expにおけるα、APBにおけるp)の異なる設定が、多粒度対応学習全体の性能に与える影響は何か?

主な発見

  • Nortonは動画検索において最先端の性能を達成し、動画-パラグラフ検索でR@1が76.1%、R@5が95.0%を記録。先行手法(TempCLRやVideoCLIP)を上回る。
  • YouCookIIにおけるアクションセグメンテーションでは、75.2%のフレーム単位の正答率を達成し、最良のベースライン(VideoCLIP)を1.5ポイント上回る。
  • アブレーションスタディの結果、不正なネガティブサンプルの是正戦略を組み込むことで、ベースライン比でR@1が1.4%向上し、ノイズ環境下での有効性が裏付けられる。
  • α = 1のソフトマックス演算子を用いることで最良の性能が得られ、平均ベースライン比でR@1が0.3%向上し、微粒度アライメントにおけるその役割が検証される。
  • p = 30%(下位30%類似度閾値)の関連付け可能なプロンプトバケツが最良の性能を示し、背景を含む動画-パラグラフ検索でベースライン比でR@1が0.9%向上する。
  • 完全なNortonモデル(J)は、クリップ-キャプション検索でR@1が24.2%、R@5が51.9%を達成し、すべての評価指標で一貫した向上を示す。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。