[論文レビュー] Learning Temporal Pose Estimation from Sparsely-Labeled Videos
この論文では、PoseWarperと呼ばれるコン act なディープラーニングモデルを提案する。このモデルは、わずかkフレームおきのスパARSEなアノテーションのみを用いて、動画からの密な時間的ポーズ推定を可能にする。可変畳み込みを活用してフレーム間の非剛体ポーズワープを学習することで、ポーズ伝搬および時間的集約において最先端の性能を達成し、光学的フローに基づく手法(88.7% mAP 対 83.8%)を上回るが、パラメータ数は600万にとどまる。
Modern approaches for multi-person pose estimation in video require large amounts of dense annotations. However, labeling every frame in a video is costly and labor intensive. To reduce the need for dense annotations, we propose a PoseWarper network that leverages training videos with sparse annotations (every k frames) to learn to perform dense temporal pose propagation and estimation. Given a pair of video frames---a labeled Frame A and an unlabeled Frame B---we train our model to predict human pose in Frame A using the features from Frame B by means of deformable convolutions to implicitly learn the pose warping between A and B. We demonstrate that we can leverage our trained PoseWarper for several applications. First, at inference time we can reverse the application direction of our network in order to propagate pose information from manually annotated frames to unlabeled frames. This makes it possible to generate pose annotations for the entire video given only a few manually-labeled frames. Compared to modern label propagation methods based on optical flow, our warping mechanism is much more compact (6M vs 39M parameters), and also more accurate (88.7% mAP vs 83.8% mAP). We also show that we can improve the accuracy of a pose estimator by training it on an augmented dataset obtained by adding our propagated poses to the original manual labels. Lastly, we can use our PoseWarper to aggregate temporal pose information from neighboring frames during inference. This allows our system to achieve state-of-the-art pose detection results on the PoseTrack2017 and PoseTrack2018 datasets. Code has been made available at: https://github.com/facebookresearch/PoseWarper.
研究の動機と目的
- 密な動画ポーズデータセットの高コストなアノテーションを軽減するため、スパARSEラベル付き動画からの有効な学習を可能にする。
- 動きのぼやけや隠蔽、時間的不一致といった課題に直面した動画におけるポーズ推定を、時間的モデリングによって解決する。
- 光学的フローに依存せずに、フレーム間のポーズ知識を転送可能な、軽量でパラメータ効率の良いワープメカニズムを開発する。
- ポーズ伝搬、モデル事前学習のための疑似ラベル生成、推論時の時間的集約といった実用的応用を可能にする。
- 訓練データが密にアノテートされていなくても、学習されたワープによる時間的モデリングが性能向上をもたらすことを示す。
提案手法
- ラベル付きフレーム(フレームA)の人体キーポイントポーズを、時間的に離れたラベルなしフレーム(フレームB)の特徴量を用いて予測するPoseWarperネットワークを訓練する。
- 学習可能なオフセットを備えた3次元可変畳み込みを用い、フレームBの特徴量を空間的・時間的にサンプリングすることで、非剛体な人体運動をモデル化する。
- フレームBの特徴量を用いてフレームAのポーズ推定損失を最小化することで、自己教師付きの方法でネットワークを訓練する。
- 推論時においてネットワークの方向を逆転させ、スパARSEフレームからの手動アノテーションをラベルなしフレームに伝搬させ、全動画のポーズラベル付けを実現する。
- トレーニングデータを拡張するために、PoseWarperが予測したポーズを疑似ラベルとして挿入し、ベースのポーズ推定器の性能を向上させる。
- 推論パイプラインにPoseWarperを統合し、隣接フレームからの時間的コンテキストを集約することで、隠蔽やぼやけに対する耐性を高める。
実験結果
リサーチクエスチョン
- RQ1光学的フローに依存せずに、スパARSEフレーム間で正確な時間的ポーズワープを学習できるか?
- RQ2コンパクトなワープメカニズムは、大規模な光学的フローネットワークをどれほど上回れるか?
- RQ3PoseWarperは、より良いポーズ推定器のトレーニングに高品質な疑似ラベルを生成するのにどれほど効果的か?
- RQ4学習されたワープによる時間的集約は、ベンチマーク動画ポーズデータセットにおける推論時性能を向上させるか?
- RQ5学習されたオフセットマップがエンコードする動きのパターンはどのようなものか?また、一般の光学的フローではなく、人間の動きと整合性があるか?
主な発見
- PoseWarperはポーズ伝搬タスクで88.7% mAPを達成し、光学的フローに基づく手法(83.8% mAP)を大きく上回り、パラメータ数は3900万対600万と大幅に少ない。
- PoseTrack2017の検証セットでは81.2% mAP、テストセットでは77.9% mAPを達成し、単一フレームベースラインを上回った。
- PoseTrack2018データセットでは、検証セットで79.7% mAP、テストセットで78.0% mAPを達成し、時間的集約タスクで新たな最先端性能を樹立した。
- 学習されたオフセットマップは、異なる身体部位に特徴的な動きパターンをエンコードしており、大きさが顕著な人体の動きを強調し、真値の関節移動量とよく一致している。
- 疑似ラベルとして使用された場合、PoseWarperが生成するアノテーションは、拡張されたデータセットで微調整されたベースポーズ推定器の精度を向上させる。
- モデルの時間的集約メカニズムは、動きのぼやけや隠蔽に対する耐性を高め、困難な動画シーケンスにおいて一貫した性能向上をもたらした。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。