[論文レビュー] WOAD: Weakly Supervised Online Action Detection in Untrimmed Videos
WOADは、動画レベルのラベルのみを用いてトレーニングする弱教師ありオンラインアクション検出フレームワークを提案する。時間的提案生成器(TPG)を共同最適化することで、擬似フレーム単位ラベルを生成し、オンラインアクション認識器(OAR)でリアルタイムのアクション検出を実現する。強教師あり手法と同等の性能を達成し、強教師あり設定でも最先端の結果を示す。
Online action detection in untrimmed videos aims to identify an action as it happens, which makes it very important for real-time applications. Previous methods rely on tedious annotations of temporal action boundaries for training, which hinders the scalability of online action detection systems. We propose WOAD, a weakly supervised framework that can be trained using only video-class labels. WOAD contains two jointly-trained modules, i.e., temporal proposal generator (TPG) and online action recognizer (OAR). Supervised by video-class labels, TPG works offline and targets at accurately mining pseudo frame-level labels for OAR. With the supervisory signals from TPG, OAR learns to conduct action detection in an online fashion. Experimental results on THUMOS'14, ActivityNet1.2 and ActivityNet1.3 show that our weakly-supervised method largely outperforms weakly-supervised baselines and achieves comparable performance to the previous strongly-supervised methods. Beyond that, WOAD is flexible to leverage strong supervision when it is available. When strongly supervised, our method obtains the state-of-the-art results in the tasks of both online per-frame action recognition and online detection of action start.
研究の動機と目的
- オンラインアクション検出におけるセグメントレベルの時間的境界の高コストなアノテーションを低減するため、フレーム単位のアノテーションを一切使わず、動画レベルのラベルでのトレーニングを可能にする。
- リアルタイムの推論能力を維持しつつ、フレーム単位のアクション認識およびアクション開始検出の高精度を実現するフレームワークを開発する。
- 強教師あり情報が利用可能になった場合に柔軟に統合できるようにし、再トレーニングなしに性能を向上させることを可能にする。
- 弱教師ありから正確なオンライン検出を学習する課題を、時間的モデリングによる擬似ラベルの活用によって克服する。
提案手法
- WOADは、2つの共同でトレーニングされるモジュールから構成される:オフラインで動作する時間的提案生成器(TPG)で、動画レベルのラベルを用いてクラスごとの時間的アクション提案を抽出する。
- TPGは、同じアクションクラスに属するフレームをグループ化することで、時間的文脈を活用してフレーム単位の擬似ラベルを生成し、局所化精度を向上させる。
- オンラインアクション認識器(OAR)は、TPGから得た擬似ラベルを用いて、リアルタイムのフレーム単位のアクション認識およびアクション開始検出を実行する。
- TPGとOARの共同トレーニングにより、共有表現学習が可能となり、両モジュールの性能が向上する。
- OARでは時間的プーリングと双方向LSTMを用いて長距離依存性を捉え、開始検出の感度を向上させる。
- 重み付き損失関数によりTPGとOARの目的関数を統合し、ハイパーパrameter λ で両者の寄与度を調整する。
実験結果
リサーチクエスチョン
- RQ1セグメントレベルのアノテーションを一切使わず、動画レベルのラベルのみでオンラインアクション検出を効果的にトレーニングできるか?
- RQ2弱教師ありの動画レベルラベルから、オンライン学習を支える信頼性の高いフレーム単位の擬似ラベルをどのように生成できるか?
- RQ3共同でトレーニングされたTPG-OARフレームワークは、既存の弱教師ありオンラインアクション検出手法を上回る性能を達成できるか?
- RQ4強教師あり情報が利用可能になった場合、WOADの性能はどのようにスケーリングするか?
主な発見
- THUMOS’14、ActivityNet1.2、ActivityNet1.3の各データセットにおいて、弱教師あり設定下でWOADは平均F-AP 54.4%、55.0%、54.6%を達成し、既存の弱教師ありベースラインを上回った。
- 強教師あり設定では、同じデータセットで平均F-AP 67.1%、66.3%、66.6%を達成し、先行する強教師あり手法を上回った。
- 1台のTesla V100 GPU上での1フレームあたりの推論時間は0.40 msであり、TRNより6倍速く、パラメータ数もTRN(314M)の約1/3(110M)にまで削減された。
- アブレーションスタディの結果、時間的プーリングやRNN層を除去すると性能が著しく低下し、正確な開始検出にこれらのモジュールが重要であることが確認された。
- デフォルトのTPGに代えてより正確なTPG(BaS-Net)を採用した場合、BaS-Netベースライン比で平均F-APが6.8%向上した。これはWOADフレームワークの頑健性を示している。
- 20本の長時間動画のみで構成される挑戦的なTVSeriesデータセットにおいて、弱教師あり設定下で59.1%の平均cAPを達成した。これは低データ量・長時間動画環境下での限界を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。