Skip to main content
QUICK REVIEW

[論文レビュー] Revisiting Few-shot Activity Detection with Class Similarity Control

Huijuan Xu, Ximeng Sun|arXiv (Cornell University)|Mar 31, 2020
Human Pose and Action Recognition参考文献 31被引用数 9
ひとこと要約

本稿では、提案回帰とクラス類似度制御を用いて、未編集動画における検出精度を向上させる、F-PADと呼ばれる新規のエンドツーエンド少数-shot時空間行動検出フレームワークを提案する。フレームレートの不一致に対処するための分布適応損失を導入し、事前学習済みクラスと新規クラスとの重複が性能に顕著に影響することを示した。その結果、特にショット数が増加する際の最先端の性能を達成した。一方、データ漏洩を回避するため、より厳格な評価プロトコルの導入を提唱する。

ABSTRACT

Many interesting events in the real world are rare making preannotated machine learning ready videos a rarity in consequence. Thus, temporal activity detection models that are able to learn from a few examples are desirable. In this paper, we present a conceptually simple and general yet novel framework for few-shot temporal activity detection based on proposal regression which detects the start and end time of the activities in untrimmed videos. Our model is end-to-end trainable, takes into account the frame rate differences between few-shot activities and untrimmed test videos, and can benefit from additional few-shot examples. We experiment on three large scale benchmarks for temporal activity detection (ActivityNet1.2, ActivityNet1.3 and THUMOS14 datasets) in a few-shot setting. We also study the effect on performance of different amount of overlap with activities used to pretrain the video classification backbone and propose corrective measures for future works in this domain. Our code will be made available.

研究の動機と目的

  • 稀で未学習の行動に最小限の監視情報で一般化可能な、シンプルだが効果的な少数-shot時空間行動検出フレームワークの開発。
  • 少数-shot例の動画と未編集テスト動画との間のフレームレートの不一致が特徴類似度と検出性能に与える影響を是正すること。
  • 事前学習データセットと新規検出クラスとの間のクラス重複が、報告された少数-shot性能に与える影響を調査し、既存ベンチマークにおける潜在的なデータ漏洩を明らかにすること。
  • ベースクラスと新規クラスを非重複に分割することで、より公平な評価プロトコルを提唱し、モデルの頑健性評価を向上させること。
  • ショット数の増加が検出精度に与える影響を実証し、特にエンドツーエンド学習と特徴アライメント最適化が行われる場合に顕著な性能向上が得られることを示すこと。

提案手法

  • モデルは、少数-shot例動画および未編集テスト動画からの特徴抽出に3D畳み込みネットワーク(C3D)バックボーンを用いる。
  • 時間的提案ネットワークが、未編集動画ストリームから候補行動セグメント(提案)を生成する。固定フレームレート処理のため、注目領域プーリングを用いる。
  • 類似度ベースの分類ヘッドが、各提案の特徴埋め込みを少数-shot例の特徴と比較し、最も類似したアクティビティラベルを割り当てる。
  • 分布適応損失を導入し、提案と少数-shot動画の特徴分布を一致させることで、フレームレート差による性能低下を軽減する。
  • モデル全体がエンドツーエンドで学習可能であり、提案生成と類似度スコアリングの両方を同時に最適化可能である。
  • 推論および学習中に追加の例を活用することで、ワンショットおよび少数-shot学習をサポートする。

実験結果

リサーチクエスチョン

  • RQ1少数-shot例動画と未編集動画の提案との間のフレームレートの不一致が、特徴類似度と検出性能にどのように影響するか?
  • RQ2事前学習データセットと新規検出クラスとの間のクラス重複が、報告された少数-shot検出性能をどの程度誇張するか?
  • RQ3提案ベースの検出フレームワークは、スライディングウィンドウベースラインを上回り、かつより効率的であると期待できるか?
  • RQ4ショット数を1から5に増加させた場合、検出精度にどのような影響があり、異なるクラス分割においてもその向上が頑健であるか?
  • RQ5事前学習からのデータ漏洩を最小限に抑えるために、どの評価プロトコルが、少数-shot行動検出モデルの公平かつ信頼性の高い比較を可能にするか?

主な発見

  • F-PADモデルは、ActivityNet1.2で50.8%のmAP@0.5、ActivityNet1.3で51.6%のmAP@0.5を五ショット設定で達成し、同等条件での先行研究を顕著に上回った。
  • 制御された分割(31.7% mAP@0.5 on ActivityNet1.2)では、非制御分割と比較して性能が著しく低下した。これは、従来の評価がクラス重複のため過大評価されている可能性を示唆している。
  • 五ショットF-PADモデルは、ワンショットバージョンと比較して、ActivityNet1.2で9.3%の絶対的向上、ActivityNet1.3で8.2%の向上を示し、追加例による顕著な性能向上を実証した。
  • 分布適応損失により、フレームレート差に起因する特徴差が軽減され、クロスフレームレート設定において測定可能な性能向上が得られた。
  • THUMOS’14では、制御された分割において五ショット設定でmAP@0.5が10.3%にとどまり、クラス重複の影響と、より厳格な評価プロトコルの必要性が顕著に示された。
  • 本研究では、標準的な少数-shot評価プロトコルがデータ漏洩のリスクを内在していることが判明し、今後のベンチマークではベースクラスと新規クラスを非重複に分割し、標準偏差を報告することで、モデルの頑健性を確保すべきであると提言した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。