[論文レビュー] Pose from Action: Unsupervised Learning of Pose Features based on Motion
本稿では、動きを教師信号として用いることで、人間の行動動画から教師なしでポーズに敏感な視覚特徴を学習する手法を提案する。共有された外見と動きのストリームを持つ三重項ネットワークを用い、2つのフレーム間の動き遷移を予測することで、CNNがポーズ特徴を符号化するように訓練する。ポーズ推定および行動認識タスクにおいて人間によるアノテーションなしに微調整した場合、最先端の性能を達成する。
Human actions are comprised of a sequence of poses. This makes videos of humans a rich and dense source of human poses. We propose an unsupervised method to learn pose features from videos that exploits a signal which is complementary to appearance and can be used as supervision: motion. The key idea is that humans go through poses in a predictable manner while performing actions. Hence, given two poses, it should be possible to model the motion that caused the change between them. We represent each of the poses as a feature in a CNN (Appearance ConvNet) and generate a motion encoding from optical flow maps using a separate CNN (Motion ConvNet). The data for this task is automatically generated allowing us to train without human supervision. We demonstrate the strength of the learned representation by finetuning the trained model for Pose Estimation on the FLIC dataset, for static image action recognition on PASCAL and for action recognition in videos on UCF101 and HMDB51.
研究の動機と目的
- 視覚表現学習における手動アノテーションのボトルネックを解消するため、動画内の動きを自己教師信号として活用すること。
- ポーズ間の予測可能な動きのパターンをモデル化することで、人間によるラベルなしにポーズに敏感な視覚特徴を学習すること。
- 動きに基づく教師信号が、ポーズ推定や行動認識などの下流タスクに適した高い汎化性を持つ外見表現をもたらすことを示すこと。
- 特に人間の行動に適した、ポーズ符号化特徴を動画データから学習する汎用フレームワークを提供すること。
提案手法
- 外見ストリームと動きストリームに共有重みを持つ三重項シアンプスネットワークを用い、2つのストリームが最初のフレームとn番目のフレームを処理し、3番目のストリームがそれらの間の光流を処理する。
- 外見特徴はRGBフレームに適用されたCNN(外見ConvNet)によって抽出され、動き特徴は別個のCNN(動きConvNet)によって光流マップから抽出される。
- 2つのフレーム間の動きが外見の変化と整合しているかどうかを分類するようにネットワークを訓練し、類似したポーズが類似した動きパターンを持つようにする三重項損失を用いる。
- 動きの教師信号は動画シーケンスから自動的に得られるため、人間によるポーズや行動ラベルの必要がなくなる。
- 大規模な行動動画で事前学習を行い、ポーズ推定や行動認識などの下流タスクで微調整する。
- 2ストリームアーキテクチャを用い、外見と動きの表現を同時に学習する。これは、行動認識における2ストリームネットワークの成功にインspiredされている。
実験結果
リサーチクエスチョン
- RQ1動画内の動きのパターンは、ポーズに敏感な視覚表現を学習する強力な自己教師信号として機能するか?
- RQ2フレーム間の動き遷移に基づく教師なし学習アプローチは、ランダム初期化よりも汎用性の高い外見特徴をもたらすか?
- RQ3動きに基づく教師信号は、人間によるラベルなしでポーズ推定や行動認識タスクの性能を向上させるか?
- RQ4動きに基づく事前学習は、標準ベンチマークにおいて他の自己教師型動画ベース手法と比較してどうなるか?
主な発見
- 微調整時に、UCF101で55.4%、HMDB51で23.6%の精度を達成。ランダム初期化で学習した場合(それぞれ42.5%および15.1%)に比べ顕著に優れている。
- PASCAL VOCの静止画像行動分類タスク(訓練画像50枚のみ)で22.7%の精度を達成し、先行研究の最良手法より2.5%高い。
- 最後の2つの全結合層のみを微調整した場合、HMDB51で19.1%、UCF101で41.4%の精度を達成し、学習済み特徴の強力な汎用性を示している。
- [11]を含む他の動画ベースの教師なし手法と比較して、すべての評価ベンチマークで優れた性能を示しており、動きが教師信号として有効であることを裏付けている。
- 結果から、ポーズ間の動きのパターンは、教師なしでポーズ符号化視覚特徴を学習するための信頼性が高く強力な信号であることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。