[論文レビュー] Self-Supervised Learning via multi-Transformation Classification for Action Recognition
本論文は、回転、フレーム置換、カラー切り替えなど7種類の多様な動画変換を分類するように3D CNNを訓練する自己教師あり動画表現学習手法を提案する。これにより、強力な空間時間特徴の学習が可能となる。本手法は、C3Dおよび3D ResNet-18バックボーンを用いてUCF101(62.8%)およびHMDB51(35.9%)で最先端の精度を達成し、Kineticsのような大規模データセットに依存せずに、先行する自己教師あり手法を上回っている。
Self-supervised tasks have been utilized to build useful representations that can be used in downstream tasks when the annotation is unavailable. In this paper, we introduce a self-supervised video representation learning method based on the multi-transformation classification to efficiently classify human actions. Self-supervised learning on various transformations not only provides richer contextual information but also enables the visual representation more robust to the transforms. The spatio-temporal representation of the video is learned in a self-supervised manner by classifying seven different transformations i.e. rotation, clip inversion, permutation, split, join transformation, color switch, frame replacement, noise addition. First, seven different video transformations are applied to video clips. Then the 3D convolutional neural networks are utilized to extract features for clips and these features are processed to classify the pseudo-labels. We use the learned models in pretext tasks as the pre-trained models and fine-tune them to recognize human actions in the downstream task. We have conducted the experiments on UCF101 and HMDB51 datasets together with C3D and 3D Resnet-18 as backbone networks. The experimental results have shown that our proposed framework is outperformed other SOTA self-supervised action recognition approaches. The code will be made publicly available.
研究の動機と目的
- 行動認識にかかる高コストな人為的アノテーションへの依存を低減する自己教師あり動画表現学習手法の開発。
- 事前学習段階で動画クリップに複数の変換を適用することで、空間時間特徴の学習を向上させる。
- マルチ変換分類が単一変換アプローチを上回ることを、下流の行動認識タスクで示す。
- 標準ベンチマーク(UCF101およびHMDB51)において、異なるバックボーンネットワーク(C3Dおよび3D ResNet-18)を用いて本手法の有効性を検証する。
- 多様な変換を用いたシンプルだが強力なデータ拡張戦略を確立し、モデルの汎化性能を向上させる。
提案手法
- 入力動画クリップに、回転、クリップ反転、並べ替え、分割・結合、カラー切り替え、フレーム置換、ノイズ追加の7種類の異なる動画変換を適用し、偽ラベルを生成する。
- 3次元畳み込みニューラルネットワーク(3D CNN)を、各クリップに適用された変換の種別を分類するように訓練する。変換タイプを事前学習タスクとして用いる。
- 自己教師あり学習を用いて、これらの変換分類タスクで事前学習を行い、人為的ラベルなしで豊かな空間時間表現を学習する。
- 事前学習後、標準的な教師あり学習を用いて、下流の行動認識タスクで学習済み3D CNN特徴をファインチューニングする。
- 本手法は空間的および時間的ドメインの両方の変換を活用しており、モデルが強固で汎化性の高い表現を学習できる。
- 本フレームワークは、UCF101およびHMDB51データセットにおいて、C3Dおよび3D ResNet-18をバックボーンネットワークとして用いて評価されている。
実験結果
リサーチクエスチョン
- RQ1自己教師あり学習におけるマルチ変換分類は、動画行動認識のための空間時間表現学習を向上させることができるか?
- RQ2下流の行動認識精度という観点から、マルチ変換分類の性能は単一変換ベースラインと比べてどう異なるか?
- RQ3本手法は、異なるバックボーンアーキテクチャ(例:C3Dおよび3D ResNet-18)およびデータセット(UCF101およびHMDB51)に一般化可能か?
- RQ4Kineticsのような大規模データセットに依存せずに、最先端の性能を達成できるか?
- RQ5各個々の変換が全体の性能にどの程度寄与しているか、そしてそれらを組み合わせることでモデルのロバスト性がどのように向上するか?
主な発見
- 3D ResNet-18を用いた場合、UCF101で62.8%のトップ1精度、HMDB51で35.9%の精度を達成し、両データセットで先行するすべての自己教師あり手法を上回っている。
- スクラッチからファインチューニングした場合、C3Dおよび3D ResNet-18はそれぞれUCF101で16.7%、HMDB51で14.5%高い精度を達成し、自己教師あり事前学習の価値を示している。
- マルチ変換分類は、単一変換ベースラインと比較して行動認識精度を最低10.6%以上向上させており、最も良い単一変換(フレーム回転)でもUCF101では52.2%にとどまる。
- マルチ変換設定では、個々の変換と比較して、検証損失がより早くかつ一貫して安定化しており、より良い学習収束性と一般化性能を示している。
- 同じC3Dバックボーンを用いても、本手法はVideo JigsawおよびMotion & Appearance手法を2.0%上回り、Kineticsデータセットを事前学習に用いていないにもかかわらず、UCF101で最先端性能を達成している。
- アブレーションスタディにより、複数の変換を組み合わせることで特徴学習が顕著に向上することが確認されており、各変換が独自の空間時間的インダクティブバイアスを導入している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。