[論文レビュー] A Closer Look at Temporal Sentence Grounding in Videos: Datasets and Metrics
この論文は、既存のビデオ内時間的文脈埋め込み(TSGV)ベンチマークにおける欠陥を特定し、ずらされたモーメントアノテーション分布を備えた再編集されたデータセット(Charades-CD および ActivityNet-CD)と、過剰に長い予測をペナルティ化する新しい指標 dR@$n,IoU@$m を提案する。この新しい評価プロトコル下でも、最先端モデルでさえ顕著な性能低下を示す。これは、現在のモデルが真の理解ではなく、アノテーションバイアスに強く依存していることを示している。
Despite Temporal Sentence Grounding in Videos (TSGV) has realized impressive progress over the last few years, current TSGV models tend to capture the moment annotation biases and fail to take full advantage of multi-modal inputs. Miraculously, some extremely simple TSGV baselines even without training can also achieve state-of-the-art performance. In this paper, we first take a closer look at the existing evaluation protocol, and argue that both the prevailing datasets and metrics are the devils to cause the unreliable benchmarking. To this end, we propose to re-organize two widely-used TSGV datasets (Charades-STA and ActivityNet Captions), and deliberately extbf{C}hange the moment annotation extbf{D}istribution of the test split to make it different from the training split, dubbed as Charades-CD and ActivityNet-CD, respectively. Meanwhile, we further introduce a new evaluation metric dR@$n$,IoU@$m$ to calibrate the basic IoU scores by penalizing more on the over-long moment predictions and reduce the inflating performance caused by the moment annotation biases. Under this new evaluation protocol, we conduct extensive experiments and ablation studies on eight state-of-the-art TSGV models. All the results demonstrate that the re-organized datasets and new metric can better monitor the progress in TSGV, which is still far from satisfactory. The repository of this work is at \url{this https URL}.
研究の動機と目的
- データセットと指標のバイアスによる現在の TSGV 評価プロトコルの信頼性の低さを明らかにすること。
- 訓練データとテストデータの分布が一致しないように、既存のデータセット(Charades-STA および ActivityNet Captions)のテストスプリットにおけるモーメントアノテーション分布を再編集することで、Charades-CD および ActivityNet-CD を作成すること。
- 過剰に長いモーメント予測に対してペナルティを科す新しい評価指標 dR@$n,IoU@$m を提案し、アノテーションバイアスによる性能の誇張を低減すること。
- 表面的な性能向上を超えて、真の進歩を測れるより信頼性の高いベンチマークを提供すること。
提案手法
- 訓練スプリットとは異なるモーメントアノテーション分布を持つように、Charades-STA および ActivityNet Captions のテストスプリットを意図的に再編集し、Charades-CD および ActivityNet-CD を作成する。
- 過剰に長い予測に対してペナルティを科す新しい評価指標 dR@$n,IoU@$m を導入し、IoU スコアを補正する。
- 一貫した学習・評価設定のもとで、8つの最先端 TSGV モデルを新しいプロトコルで評価する。
- モデルの一般化性能とバイアスの利用状況を分析するために、広範なアブレーションスタディを実施する。
実験結果
リサーチクエスチョン
- RQ1アノテーションバイアスの影響を受けて、現在の TSGV モデルは訓練データ分布を超えてどれほど一般化できるのか?
- RQ2テストスプリットのモーメントアノテーション分布が訓練スプリットと異なる場合、SOTA TSGV モデルの性能はどの程度低下するのか?
- RQ3提案された dR@$n,IoU@$m 指標は、過剰に長い予測による性能の誇張を効果的に抑制できるか?
- RQ4複雑なモデルと比較して、学習なしの単純なベースラインは新しい評価プロトコル下でどの程度の性能を示すのか?
主な発見
- 新しいベンチマーク下でも、最高性能を発揮する TSGV モデルでさえ顕著な性能低下を示し、アノテーションバイアスに強く依存していることが明らかになった。
- 学習なしの単純なベースラインは、元のベンチマークでは最先端の性能を示すが、新しいプロトコル下では著しく性能が低下し、真の一般化能力に欠けることが明らかになった。
- 提案された dR@$n,IoU@$m 指標は、過剰に長い予測に対して効果的にペナルティを科し、誇張された IoU スコアを低減し、より公平な評価を可能にした。
- 再編集されたデータセット(Charades-CD および ActivityNet-CD)は、現在のモデルの一般化能力の低さを露呈し、TSGV分野における進歩がかつて考えられていたほど堅固ではないことを示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。