Skip to main content
QUICK REVIEW

[論文レビュー] HACS: Human Action Clips and Segments Dataset for Recognition and Temporal Localization

Hang Zhao, Antonio Torralba|arXiv (Cornell University)|Dec 26, 2017
Human Pose and Action Recognition参考文献 50被引用数 8
ひとこと要約

HACSは、150万個のクリップ動画(HACS Clips)と5万本の未加工動画にまたがる13万9千件の密なアクションセグメント(HACS Segments)を含む大規模な動画データセットを提供し、行動認識および時間的局所化のためのものである。このデータセットは、視覚的分類器の一致と不一致を活用して高品質なクリップをマイニングし、自己教師あり学習の前処理として最先端の性能を達成するとともに、短く密なセグメントのラベル付けのおかげで、細分化された行動局所化の新しいベンチマークを確立した。

ABSTRACT

This paper presents a new large-scale dataset for recognition and temporal localization of human actions collected from Web videos. We refer to it as HACS (Human Action Clips and Segments). We leverage both consensus and disagreement among visual classifiers to automatically mine candidate short clips from unlabeled videos, which are subsequently validated by human annotators. The resulting dataset is dubbed HACS Clips. Through a separate process we also collect annotations defining action segment boundaries. This resulting dataset is called HACS Segments. Overall, HACS Clips consists of 1.5M annotated clips sampled from 504K untrimmed videos, and HACS Seg-ments contains 139K action segments densely annotatedin 50K untrimmed videos spanning 200 action categories. HACS Clips contains more labeled examples than any existing video benchmark. This renders our dataset both a large scale action recognition benchmark and an excellent source for spatiotemporal feature learning. In our transferlearning experiments on three target datasets, HACS Clips outperforms Kinetics-600, Moments-In-Time and Sports1Mas a pretraining source. On HACS Segments, we evaluate state-of-the-art methods of action proposal generation and action localization, and highlight the new challenges posed by our dense temporal annotations.

研究の動機と目的

  • 行動認識および時間的局所化のための、大規模かつ密な時間的アクション局所化データセットの不足を補うために、高密度のラベル付けと細分化された時間的境界を備えたベンチマークを構築すること。
  • 分類器の一致と不一致を活用したスケーラブルで自動化されたパイプラインを開発し、人為的ラベル付けの負担を軽減する高品質な動画クリップをマイニングすること。
  • HACS Clipsを、行動認識モデルの強力な前処理ソースとして確立し、Kinetics-600 や Sports1M といった既存のベンチマークを上回ること。
  • HACS Segments において最先端のアクションプロポーザルおよび局所化手法を評価し、より短く密なアクションセグメントから生じる新たな課題を明らかにすること。
  • ActivityNet と整合性のある200クラスの分類体系を統一的に提供し、ベンチマーク間での一貫性のある評価と転移学習を可能にすること。

提案手法

  • 視覚的分類器を用いた自動クリップマイニング:複数のモデル間での一致(高い合意)と不一致(予測の相違)に基づき、多様で挑戦的な例を捉える。
  • 人間によるフィードバックを組み込んだ検証:マイニングされたクリップは人間のラベル付け者によって確認され、正確なアクションラベルが保証され、150万個の2秒間のクリップからなる HACS Clips データセットが構築された。
  • 密な時間的ラベリングパイプライン:曖昧さを低減する厳密なガイドラインに従い、アクションセグメントの境界がラベル付けされた。その結果、ActivityNet よりも1.8倍多いセグメント数を有する HACS Segments が得られた。
  • 標準化された評価指標の使用:アクションプロポーザル生成には tIoU しきい値(0.5–0.95)における AR@100 と AUC を、アクション局所化には mAP を使用。
  • 転移学習の実験:HACS Clips でモデルを事前学習し、ターゲットデータセット(Kinetics、ActivityNet など)で微調整することで、汎化性能を評価。
  • ネガティブクリップのアブレーションスタディ:人間が存在するがアクションがないようなハードなネガティブ例を評価し、アクションプロポーザル生成のための特徴学習を向上させること。

実験結果

リサーチクエスチョン

  • RQ1分類器の一致と不一致を用いた自動マイニングは、人間によるラベル付けに適した高品質で多様な動画クリップを効果的に特定できるか?
  • RQ2HACS Clips で事前学習したモデルは、Kinetics-600 や Moments-in-Time、Sports1M といった既存のベンチマークと比較して、行動認識タスクにおける転移性能で優れているか?
  • RQ3HACS Segments におけるラベル付けの密度と時間的精度は、ActivityNet と比較して、行動局所化の難易度をどの程度高めているか?
  • RQ4最先端のアクションプロポーザルおよび局所化モデルは HACS Segments でどの程度の性能を示し、どのような課題が明らかになったか?
  • RQ5HACS Clips に含まれるハードなネガティブクリップは、アクションプロポーザル生成モデルのロバスト性を向上させることができるか?

主な発見

  • HACS Clips は、50万4千本の未加工動画から抽出された150万個のラベル付きクリップを含み、Kinetics-600 よりも2.5倍規模が大きく、下流の行動認識ベンチマークでそれらを上回る前処理ソースとしての性能を示した。
  • 3つのターゲットデータセットにおいて、HACS Clips で事前学習したモデルは、Kinetics-600 や Moments-in-Time、Sports1M で事前学習したモデルよりも高い正確性を達成した。
  • HACS Segments は5万本の動画に13万9千件のアクションセグメントを含み、ActivityNet よりも4.7倍多いセグメント数と2.5倍多い動画数を有し、セグメントの持続時間は顕著に短い。
  • HACS Segments Mini(1万本の学習動画)におけるアクションプロポーザル生成では、AR@100が61.85、AUCが51.59にとどまり、ActivityNet における BSN の性能より顕著に低い結果となり、難易度の高さが示された。
  • SSN 局所化では HACS Segments Mini で mAP 15.93(ActivityNet では28.28)を達成し、HACS 全体のセグメントで学習させた場合、mAP は18.97に向上した。これは、より大きな学習データの恩恵を示している。
  • TAG は HACS Segments において BSN よりも tIoU 0.9 の高水準で AUC が高く、境界の局所化精度が優れていることを示し、細分化された時間的整合性の難しさが浮き彫りになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。