[論文レビュー] Learning to Localize Actions from Moments
本稿では、Action Herald Networks (AherNet) を提案する。AherNet は、大規模なカテゴリ群(例:Kinetics-600)からのトリムド行動モーメントと、小規模なクラス群(例:ActivityNet v1.3)からの時間的アノテーションのみを用いて大規模行動局所化を実現するワンステージの行動局所化フレームワークである。共有重み転送関数と敵対的文脈生成を活用することで、完全教師あり手法を上回る最先端の性能を達成し、0.5 IoU閾値下でKinetics-600上でmAP 24.43%を達成した。
With the knowledge of action moments (i.e., trimmed video clips that each contains an action instance), humans could routinely localize an action temporally in an untrimmed video. Nevertheless, most practical methods still require all training videos to be labeled with temporal annotations (action category and temporal boundary) and develop the models in a fully-supervised manner, despite expensive labeling efforts and inapplicable to new categories. In this paper, we introduce a new design of transfer learning type to learn action localization for a large set of action categories, but only on action moments from the categories of interest and temporal annotations of untrimmed videos from a small set of action classes. Specifically, we present Action Herald Networks (AherNet) that integrate such design into an one-stage action localization framework. Technically, a weight transfer function is uniquely devised to build the transformation between classification of action moments or foreground video segments and action localization in synthetic contextual moments or untrimmed videos. The context of each moment is learnt through the adversarial mechanism to differentiate the generated features from those of background in untrimmed videos. Extensive experiments are conducted on the learning both across the splits of ActivityNet v1.3 and from THUMOS14 to ActivityNet v1.3. Our AherNet demonstrates the superiority even comparing to most fully-supervised action localization methods. More remarkably, we train AherNet to localize actions from 600 categories on the leverage of action moments in Kinetics-600 and temporal annotations from 200 classes in ActivityNet v1.3. Source code and data are available at \url{https://github.com/FuchenUSTC/AherNet}.
研究の動機と目的
- すべてのカテゴリに対して完全な時間的アノテーションを必要とせずに、数千のカテゴリに対する行動局所化を可能にすること。
- トリムドモーメントにおける行動認識と、アントリムド動画における行動局所化の間のギャップを、転移学習の枠組みで埋めること。
- 訓練中に、行動モーメントのための現実的な背景文脈をシミュレートする課題に対処すること。
- アノテーションコストを低減しながら高い局所化精度を維持するスケーラブルな部分教師ありフレームワークを開発すること。
- 少数のアノテート済みクラスからの最小限の監視情報のみを用いて、1つのモデルで大規模な行動局所化を学習可能であることを実証すること。
提案手法
- AherNet は、分類タスクと局所化タスク間の重み転送を統合したワンステージの行動局所化フレームワークを採用している。
- 共有重み転送関数により、前景セグメント分類のネットワークパラメータを、アントリムド動画における時間的行動分類にマッピングする。
- 敵対的学習を用いて、行動モーメントのための現実的な背景特徴を生成し、それらを本物のアントリムド動画の背景と区別する。
- 提案損失、分類損失、敵対的損失を用いてエンドツーエンドに訓練することで、局所化性能と文脈の現実性を最適化する。
- 行動モーメントを合成的文脈として扱うことで、完全な時間的アノテーションがなくても局所化モデリングが可能になる。
- フレームワークは、ActivityNet v1.3 のスプリットおよび、THUMOS14 から ActivityNet v1.3 への適用が行われ、600クラスの Kinetics-600 への拡張も含む。
実験結果
リサーチクエスチョン
- RQ1大規模なカテゴリ群からのトリムド行動モーメントと、小規模なクラス群からの時間的アノテーションのみを用いて、行動局所化を効果的に学習できるか?
- RQ2重み転送関数は、行動モーメントにおける分類と、アントリムド動画における局所化を効果的に橋渡しできるか?
- RQ3敵対的学習は、行動モーメントの訓練に適した、本物のアントリムド動画背景に類似した背景特徴を生成できるか?
- RQ4部分教師ありモデルは、完全な監視が得られない大規模な行動カテゴリにどの程度一般化できるか?
- RQ5提案手法は、ゼロショットまたはフェイントショットの局所化設定において、完全教師ありおよび弱教師ありベースラインを上回るか?
主な発見
- AherNet は、0.5 IoU閾値下で Kinetics-600 で mAP 24.43% を達成し、14.18% のベースラインから顕著な向上を示した。
- IoU 閾値 0.5 および 0.75 の下で、最近の弱教師あり手法をそれぞれ 3.9% および 5.8% 上回った。
- すべてのカテゴリに完全な時間的アノテーションを必要とする複数の完全教師ありモデルをも凌駆した。
- 敵対的文脈生成モジュールは、ANet-AM および ANet-FG の両セットにおいて、本物の背景特徴と区別がつかない背景特徴を生成した。
- AherNet ∗(完全教師ありバージョン)は、時間的アノテーションの50%以上を用いる場合にのみ AherNet を上回る性能を示し、部分教師あり設計の有効性を裏付けた。
- Kinetics-600 における定性的な結果は、正確な時間的境界予測と、行動ダイナミクスの効果的なモデリングを示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。