Skip to main content
QUICK REVIEW

[論文レビュー] Embracing Uncertainty: Decoupling and De-bias for Robust Temporal Grounding

Hao Zhou, Chongyang Zhang|arXiv (Cornell University)|Mar 31, 2021
Multimodal Machine Learning Applications参考文献 48被引用数 7
ひとこと要約

本稿では、言語クエリを関係特徴(名詞/動詞に基づく)と修飾特徴(形容詞/副詞に基づく)に分離することで、クエリの不確実性に対処する、DeNetと呼ばれる新しいフレームワークを提案する。また、ラベルの不確実性下でも多様な予測を生成できるように、サンプリングとマルチチョイス学習を用いたデバイアス化機構を採用する。DeNetはCharades-STAおよびActivityNet Captionsで最先端の性能を達成し、明示的な不確実性モデリングにより、より高いロバスト性と一般化性能を示している。

ABSTRACT

Temporal grounding aims to localize temporal boundaries within untrimmed videos by language queries, but it faces the challenge of two types of inevitable human uncertainties: query uncertainty and label uncertainty. The two uncertainties stem from human subjectivity, leading to limited generalization ability of temporal grounding. In this work, we propose a novel DeNet (Decoupling and De-bias) to embrace human uncertainty: Decoupling - We explicitly disentangle each query into a relation feature and a modified feature. The relation feature, which is mainly based on skeleton-like words (including nouns and verbs), aims to extract basic and consistent information in the presence of query uncertainty. Meanwhile, modified feature assigned with style-like words (including adjectives, adverbs, etc) represents the subjective information, and thus brings personalized predictions; De-bias - We propose a de-bias mechanism to generate diverse predictions, aim to alleviate the bias caused by single-style annotations in the presence of label uncertainty. Moreover, we put forward new multi-label metrics to diversify the performance evaluation. Extensive experiments show that our approach is more effective and robust than state-of-the-arts on Charades-STA and ActivityNet Captions datasets.

研究の動機と目的

  • 時系列接地におけるクエリの不確実性とラベルの不確実性という二重の課題に対処し、モデルの一般化性能を向上させること。
  • 学習プロセスにおいて不確実性を明示的に取り入れることで、言語表現と時系列アノテーションにおける人間の主観性をモデル化すること。
  • 複数の人がアノテートした境界に一致する、多様で妥当な予測を生成し、単一のスタイルのアノテーションによるバイアスを低減すること。
  • 1つのクエリに対して複数のアノテーションが存在するデータセットに適した、新しいマルチラベル評価指標を開発すること。
  • 現実世界のオープンボキャブラリーな状況下で、時系列接地モデルのロバスト性と一般化性能を向上させること。

提案手法

  • 品詞(PoS)タギングを用いて、各言語クエリを2つの特徴に分解する:関係特徴(名詞、動詞)は一貫性があり、判別に有用な情報を提供し、修飾特徴(形容詞、副詞)は主観的で個人的な表現を表す。
  • 潜在空間において修飾特徴をガウス分布として符号化することで、確率的サンプリングが可能となり、多様なクエリ表現を生成できる。
  • マルチチョイス学習(MCL)の最小損失目的を用いたデバイアス化機構を採用し、単一のスタイルのアノテーションで学習された場合でも、多様な予測を最適化する多出力ブランチを学習する。
  • 二重ヘッド回帰ヘッドを採用:1つは開始時刻-終了時刻の境界を予測し、もう1つは中心-幅を予測する。両者に共通の時系列ブロックを用いて、長距離依存性をモデル化する。
  • 推論時にクラスタリングを適用し、複数の予測を1つの多様で妥当な予測集合に統合し、複数の人のアノテーションと一致させる。
  • 複数の正解境界がある状況での公平な評価を可能にするために、新しいマルチラベル指標(例:R@5, IoU=0.5)を導入する。

実験結果

リサーチクエスチョン

  • RQ1同じイベントに対して多様な言語表現が生じるクエリの不確実性を、どのように効果的にモデル化できるか?
  • RQ2学習データにおける単一のスタイルのアノテーションが原因となる予測バイアスを、どのように軽減できるか?
  • RQ3複数の人がアノテートした境界と一致する、多様で妥当な予測を生成することは可能か?
  • RQ4関係特徴と修飾特徴を明示的に分離することで、時系列接地におけるロバスト性はどのように向上するか?
  • RQ5新しいマルチラベル指標は、ラベルの不確実性が存在する状況で、モデルの性能をより適切に反映するのか?

主な発見

  • Charades-STAではR@1が59.70%、R@5(IoU=0.5)が64.04%を達成し、最先端手法を上回った。
  • ActivityNet CaptionsではR@1が58.12%、R@5(IoU=0.5)が61.76%を達成し、データセット間での強力な一般化性能を示した。
  • アブレーションスタディの結果、PoSに基づく分離が性能向上に顕著に寄与しており、DeNet w/o PoSに比べてR@1が1.25%向上した。
  • 修飾特徴をガウス分布として符号化したDeNetは、関係特徴を符号化したDeNet-Relationに比べ、より優れた多様性を示し、R@5(IoU=0.5)で1.92%の向上を達成した。
  • 最小損失目的を削除した(DeNet w/o min-loss)場合、R@5(IoU=0.5)が22.13%低下し、多予測学習の重要性が確認された。
  • 最適なアーキテクチャは、Charades-STAで3段の時系列ブロック、ActivityNet Captionsで4段の時系列ブロックを用いることで、モデル容量と過学習のトレードオフを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。