[論文レビュー] SLAC: A Sparsely Labeled Dataset for Action Classification and Localization
本稿では、520Kの未トリミング動画と200の行動クラスにわたる175万件のスパARSEなクリップアノテーションを備えた大規模な動画データセットSLACを紹介する。このデータセットは、困難で曖昧なクリップに注目することで、人的ラベル付け作業の時間を95%削減するスケーラブルなフレームワークにより構築された。SLACで事前学習を施すことで、HMDB-51では行動認識の正確性が最大35.4%向上し、THUMOS14では行動局所化のmAPが8.6%向上する。
This paper describes a procedure for the creation of large-scale video datasets for action classification and localization from unconstrained, realistic web data. The scalability of the proposed procedure is demonstrated by building a novel video benchmark, named SLAC (Sparsely Labeled ACtions), consisting of over 520K untrimmed videos and 1.75M clip annotations spanning 200 action categories. Using our proposed framework, annotating a clip takes merely 8.8 seconds on average. This represents a saving in labeling time of over 95% compared to the traditional procedure of manual trimming and localization of actions. Our approach dramatically reduces the amount of human labeling by automatically identifying hard clips, i.e., clips that contain coherent actions but lead to prediction disagreement between action classifiers. A human annotator can disambiguate whether such a clip truly contains the hypothesized action in a handful of seconds, thus generating labels for highly informative samples at little cost. We show that our large-scale dataset can be used to effectively pre-train action recognition models, significantly improving final metrics on smaller-scale benchmarks after fine-tuning. On Kinetics, UCF-101 and HMDB-51, models pre-trained on SLAC outperform baselines trained from scratch, by 2.0%, 20.1% and 35.4% in top-1 accuracy, respectively when RGB input is used. Furthermore, we introduce a simple procedure that leverages the sparse labels in SLAC to pre-train action localization models. On THUMOS14 and ActivityNet-v1.3, our localization model improves the mAP of baseline model by 8.6% and 2.5%, respectively.
研究の動機と目的
- 行動認識および局所化のための大規模な動画データセット作成における高コストとスケーラビリティの制限を解決すること。
- 予測が困難で分類が難しいクリップにのみ注目することで、人的ラベル付け作業の負荷を低減すること。
- Webスケールで制約のない動画データを活用するスケーラブルなパイプラインを構築すること。
- SLACで事前学習を施すことで、下流の行動認識および局所化ベンチマークにおける性能が顕著に向上することを示すこと。
提案手法
- 事前学習済みの行動分類器を用いて、未トリミングのWeb動画から候補となるクリップを自動抽出する。
- 複数の分類器の予測に食い違いを生じる「ハードクリップ」を識別し、人的ラベル付けの優先度を高める。
- 人的ラベラーがこれらのハードクリップのみをラベル付けし、1クリップあたり平均8.8秒のラベル付け時間にまで短縮することで、著しくラベル付けコストを削減する。
- 得られたスパARSEラベルを用いて、行動認識および行動局所化モデルの事前学習を実施する。
- スパARSEなクリップレベルラベルを弱教師あり局所化に適応させる簡単な手順を適用する。
- 標準ベンチマークで微調整を行い、転移性能を評価する。
実験結果
リサーチクエスチョン
- RQ1スケーラブルで自動化されたパイプラインは、ラベル品質を維持しつつ、大規模な動画データセット作成における人的ラベル付け作業をどれほど削減できるか?
- RQ2SLACで事前学習を施すことで、下流のベンチマークにおける行動認識性能はどの程度向上するか?
- RQ3SLACのスパARSEラベルは、行動局所化モデルの学習に効果的に利用できるか?
- RQ4ハードクリップに人的ラベル付けを集中させることで、ランダムまたは均等にサンプリングされたラベル付けと比較して、モデル性能が向上するか?
- RQ5標準ベンチマークにおけるトップ-1正確性およびmAPの観点で、SLACはどの程度の性能向上をもたらすか?
主な発見
- RGB入力を使用した場合、SLACで事前学習を施すことで、Kineticsではトップ-1正確性が2.0%向上、UCF-101では20.1%向上、HMDB-51では35.4%向上する。
- 提案されたラベル付けフレームワークにより、1クリップあたりの平均ラベル付け時間が8.8秒にまで短縮され、従来の手動トリミングおよび局所化と比較して95%以上のコスト削減が達成された。
- SLACで事前学習された行動認識モデルは、すべての評価ベンチマークで、初期から訓練したモデルを上回る性能を示した。
- SLACのスパARSEラベルに基づく弱教師あり局所化手法は、THUMOS14でmAPが8.6%向上し、ActivityNet-v1.3では2.5%向上した。
- このフレームワークは520Kを超える未トリミング動画および200の行動カテゴリにわたる175万件のクリップアノテーションへとスケーラブルに拡張可能である。
- ハードクリップの優先ラベリングにより、人的作業を最小限に抑えつつも、高いラベルの情報量を確保できた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。