Skip to main content
QUICK REVIEW

[論文レビュー] Similarity R-C3D for Few-shot Temporal Activity Detection

Huijuan Xu, Bingyi Kang|arXiv (Cornell University)|Dec 25, 2018
Human Pose and Action Recognition参考文献 37被引用数 11
ひとこと要約

本論文では、類似度R-C3Dを提案する。これは、一時的アクティビティ検出のための新規エンドツーエンドの少ショット時間的アクティビティ検出フレームワークであり、2段階のプロポーザルネットワークと、ビデオプロポーザルと少ショット例示との間のコサイン類似度マッチングを用いて、希少なアクティビティの局所化と分類を実現する。THUMOS14、ActivityNet1.2、ActivityNet1.3の3つのベンチマークで最先端の性能を達成しており、より多くの少ショット例が与えられた場合に顕著な精度向上を示す。

ABSTRACT

Many activities of interest are rare events, with only a few labeled examples available. Therefore models for temporal activity detection which are able to learn from a few examples are desirable. In this paper, we present a conceptually simple and general yet novel framework for few-shot temporal activity detection which detects the start and end time of the few-shot input activities in an untrimmed video. Our model is end-to-end trainable and can benefit from more few-shot examples. At test time, each proposal is assigned the label of the few-shot activity class corresponding to the maximum similarity score. Our Similarity R-C3D method outperforms previous work on three large-scale benchmarks for temporal activity detection (THUMOS14, ActivityNet1.2, and ActivityNet1.3 datasets) in the few-shot setting. Our code will be made available.

研究の動機と目的

  • 未学習の希少アクティビティを、1つまたは数個のラベル付き例のみで、非トリムド動画内で検出する課題に対処すること。
  • スライディングウィンドウベースの手法が直面する高コストな計算と硬直的な境界制約の限界を克服すること。
  • 従来の手法とは異なり、より多くの少ショット例が与えられた際に性能が向上するエンドツーエンド学習を可能にすること。
  • 類似度マッチングを介して、プロポーザル生成と少ショット分類を統合的に最適化する統一フレームワークの構築。
  • THUMOS14、ActivityNet1.2、ActivityNet1.3といった複数の大規模ベンチマークにおいて、汎用性と最先端の性能を示すこと。

提案手法

  • モデルは、非トリムドテスト動画および少ショットトリムド例示動画の両方から、空間的・時間的特徴を抽出するために3次元畳み込みネットワーク(C3D)を用いる。
  • 2段階のプロポーザルネットワークが時間的アクティビティプロポーザルを生成・精錬し、2段階目ではフォアグラウンドセグメントプロポーザルを出力する。
  • 少ショット分類ブランチは、主C3Dブランチと重みを共有し、プロポーザル特徴と少ショット例示特徴の間のコサイン類似度を計算する。
  • 各プロポーザルは、最も高いコサイン類似度スコアを持つ少ショット例示のクラスラベルが割り当てられる。
  • 最終的な検出は、プロポーザルの信頼度スコア(バックグラウンドをフィルタリング)と類似度スコア(クラス割り当て)の組み合わせによって決定される。
  • 全モデルはエンドツーエンドで学習可能であり、訓練中に追加の少ショット例から利益を得る。

実験結果

リサーチクエスチョン

  • RQ1より多くの少ショット例を活用することで、統一的かつエンドツーエンドのフレームワークが少ショット時間的アクティビティ検出を改善できるか?
  • RQ2スライディングウィンドウベースのプロポーザル生成を2段階の精錬ネットワークに置き換えることで、より高い局所化精度が得られるか?
  • RQ3学習された特徴を用いた類似度ベース分類が、従来のマッチングネットワーク風アプローチを上回れるか?
  • RQ4少ショット例の数が増加するにつれて、モデルがデータ駆動的に性能向上を示すか?
  • RQ5THUMOS14、ActivityNet1.2、ActivityNet1.3といった多様なベンチマークにおいて、このアプローチはどれほど汎用性を示すか?

主な発見

  • ActivityNet1.2データセットにおいて、Similarity R-C3Dは5ショット設定でmAP@0.5が45.8%、平均mAPが28.2%を達成し、従来の最先端のスライディングウィンドウ手法(mAP@0.5が23.1%、平均mAPが10.0%)を顕著に上回った。
  • 1ショットから5ショットへの学習で顕著な向上(mAP@0.5が39.4%から45.8%に)を示し、追加の少ショット例の恩恵を実証した。
  • CDCモデルベースラインは性能が低く、mAP@0.5が8.2%にとどまり、非トリムド動画における少ショット検出の難易度を強調した。
  • アブレーションスタディの結果、プロポーザルネットワークの事前学習はわずかに性能向上をもたらすが、主な性能向上は少ショットデータを用いたエンドツーエンド学習に起因する。
  • 最適なプロポーザルスコア閾値は0.3であり、検出におけるプロポーザルの数と品質のトレードオフを示している。
  • 定性的な結果から、モデルは多様なデータセットにわたり、複雑で長時間にわたるアクティビティを正しく局所化していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。