[論文レビュー] Adversarial Motion Modelling helps Semi-supervised Hand Pose Estimation
本稿では、ラベルなし動画シーケンスを活用することで、低ラベル設定下でも一般化性能を向上させる、敵対的モーショングモデリングフレームワークを提案する。ポーズ予測器を、時間的に整合的かつ現実的なハンドモーションシーケンスを生成するように訓練し(判別器が本物のモーションシーケンスと生成されたシーケンスを区別するように指導)、一般化性能が著しく向上し、ラベルが少ない状況下で平均関節誤差(MPJPE)が40%絶対的に低減された。
Hand pose estimation is difficult due to different environmental conditions, object- and self-occlusion as well as diversity in hand shape and appearance. Exhaustively covering this wide range of factors in fully annotated datasets has remained impractical, posing significant challenges for generalization of supervised methods. Embracing this challenge, we propose to combine ideas from adversarial training and motion modelling to tap into unlabeled videos. To this end we propose what to the best of our knowledge is the first motion model for hands and show that an adversarial formulation leads to better generalization properties of the hand pose estimator via semi-supervised training on unlabeled video sequences. In this setting, the pose predictor must produce a valid sequence of hand poses, as determined by a discriminative adversary. This adversary reasons both on the structural as well as temporal domain, effectively exploiting the spatio-temporal structure in the task. The main advantage of our approach is that we can make use of unpaired videos and joint sequence data both of which are much easier to attain than paired training data. We perform extensive evaluation, investigating essential components needed for the proposed framework and empirically demonstrate in two challenging settings that the proposed approach leads to significant improvements in pose estimation accuracy. In the lowest label setting, we attain an improvement of $40\%$ in absolute mean joint error.
研究の動機と目的
- 高コストなラベル付けと現実世界の条件下での一般化性能の低さにより、3次元ハンドポーズデータが限られるという課題に対処する。
- 多様な環境、遮蔽、ハンドのバリエーションに対応できない完全教師あり手法の限界を克服する。
- ラベルなし動画データに内在する空間時間的構造を活用し、対応するラベル付きシーケンスを必要とせずにポーズ推定を向上させる。
- 既存の全身モーションモデルとは異なり、ハンドポーズに特化した新たなモーションモデリングアプローチを開発する。
- 完全にラベル付けされていない動画とポーズシーケンスを別々に用いることで、完全にアノテートされたデータよりも容易に入手可能な半教師あり学習を可能にする。
提案手法
- ラベルなし動画から3次元ハンドポーズシーケンスを生成するジェネレータ(ハンドポーズ推定器)を備えた、ハンドポーズ向けの新規敵対的モーションモデルを提案する。
- 本物のハンドモーションシーケンス(ラベル付きデータから得る)と生成されたシーケンス(ポーズ推定器から得る)を区別できるように、判別器を訓練し、時間的・構造的整合性を強制する。
- ポーズ予測器を最適化するためのミニマックス敵対的訓練目的関数を用い、その予測結果が本物のモーションシーケンスと区別不能になるようにする。
- 標準的なフレームごとのポーズ推定損失と敵対的損失を統合し、ラベルなし動画上でエンドツーエンドの学習を可能にするとともに、フレームレベルの精度を維持する。
- データが同期済みまたはペア化されていなくてもよいように、未ペアな設計とした。
- 一般化性と耐障害性を向上させるために、2.5次元キーポイント表現を入力として採用する。特に現実世界の困難な状況下で有効である。
実験結果
リサーチクエスチョン
- RQ1ラベルなし動画シーケンスを用いた敵対的訓練は、低教師信号環境下における3次元ハンドポーズ推定器の一般化性能を向上させることができるか?
- RQ2既存の全身モーションモデルとは異なり、ハンドポーズに特化して設計されたモーションモデルは、ハンドポーズ推定の文脈で、それらと比較してどれほど効果的か?
- RQ3ラベルなしの動画とポーズシーケンスをペアでなくても利用できる状況で、真のラベルが不要な半教師ありハンドポーズ推定をどれほど向上させられるか?
- RQ4敵対的モーショングモデリングによる時間的整合性の強制は、標準的なフレームごとのベースラインと比較して予測誤差を低減するか?
- RQ5本手法は、さまざまなラベル設定や、分布外の設定下でも、どのように性能を発揮するか?
主な発見
- 最低ラベル設定(10%ラベルデータ)下で、平均関節誤差(MPJPE)が40%絶対的に低減され、優れた一般化性能が示された。
- 10%のラベルデータを用いた場合、FPHABプロトコル2では27.60 mmのMPJPEを達成し、20%ラベルデータを用いたベースラインモデル(28.30 mm MPJPE)を上回った。
- HO-3Dデータセットでは、半教師あり設定下でMPJPEを24.5 mmにまで低減し、先行研究([22]:31.8 mm、[51]:30.4 mm)を著しく上回った。
- アブレーションスタディの結果、敵対的モーションモデルそのものでMPJPEが4.95 mm低減(28.47 mm → 23.52 mm)されたことから、その貢献度が顕著に示された。
- 絶対誤差とルート相対誤差の両方の改善が確認され、カメラやオブジェクトのポーズ変化に対してより高い耐性を示した。
- 2.5次元キーポイント表現の採用により誤差が3.1 mm低減し、モーションモデルの設計選択により0.94 mmの低減が得られた。これにより、各モジュールの有効性が裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。