[論文レビュー] Effective Whole-body Pose Estimation with Two-stages Distillation
本稿では、有効かつ効率的な全身人体ポーズ推定のための2段階知識蒸留フレームワーク、DWPoseを提案する。最初の段階では、教師モデル(RTMPose-x)の途中特徴量と完全なキーポイントログティスを活用し、2番目の段階では、わずか20%の学習時間で軽量でヘッドに配慮した自己蒸留を適用することで、RTMPose-lのCOCO-WholeBody APを64.8%から66.5%まで向上させ、教師モデルをも上回った。
Whole-body pose estimation localizes the human body, hand, face, and foot keypoints in an image. This task is challenging due to multi-scale body parts, fine-grained localization for low-resolution regions, and data scarcity. Meanwhile, applying a highly efficient and accurate pose estimator to widely human-centric understanding and generation tasks is urgent. In this work, we present a two-stage pose extbf{D}istillation for extbf{W}hole-body extbf{P}ose estimators, named extbf{DWPose}, to improve their effectiveness and efficiency. The first-stage distillation designs a weight-decay strategy while utilizing a teacher's intermediate feature and final logits with both visible and invisible keypoints to supervise the student from scratch. The second stage distills the student model itself to further improve performance. Different from the previous self-knowledge distillation, this stage finetunes the student's head with only 20% training time as a plug-and-play training strategy. For data limitations, we explore the UBody dataset that contains diverse facial expressions and hand gestures for real-life applications. Comprehensive experiments show the superiority of our proposed simple yet effective methods. We achieve new state-of-the-art performance on COCO-WholeBody, significantly boosting the whole-body AP of RTMPose-l from 64.8% to 66.5%, even surpassing RTMPose-x teacher with 65.3% AP. We release a series of models with different sizes, from tiny to large, for satisfying various downstream tasks. Our codes and models are available at https://github.com/IDEA-Research/DWPose.
研究の動機と目的
- 実世界のヒューマンセントリックなアプリケーションにおける全身ポーズ推定の精度と効率を向上させること。
- UBodyのようなクリーニング済みデータセットを用いて、手や顔など細分化された身体部位におけるデータ不足を解決すること。
- 推論コストを著しく増加させない軽量モデルの強化を可能にする、プラグアンドプレイな蒸留戦略を開発すること。
- 制御可能な画像生成などの後続タスクにおける高品質なポーズ推定を可能にすること。
- 既存のモデルを上回るパフォーマンスを維持しながら、リアルタイムの推論速度を保つこと。
提案手法
- 最初の段階の蒸留では、教師モデルの最終ログティスと途中特徴量を用い、可視および不可視キーポイントの両方の監督を実施し、訓練の安定性を高めるために徐々に減少する蒸留重みを採用する。
- 教師モデルの影響を段階的に弱める新しい重み減少戦略を提案し、訓練の安定性と一般化性能を向上させる。
- 2番目の段階では、学生モデルのバックボーンを固定し、2番目の学生モデルを教師として用い、学生のヘッド部分のみをファインチューニングする軽量でヘッドに配慮した自己知識蒸留を実施し、学習時間の20%で実現する。
- ターゲットマスクを用いないロジットベースの蒸留を採用し、不可視キーポイントにおける教師の知識を保持することで、実験的に性能が向上した。
- 本手法はプラグアンドプレイであり、任意の密度予測ヘッドと互換性があり、広範な適用性を有する。
- 多様な表情や手の動きに対応するため、UBodyデータセットを統合し、実生活における一般化性能を向上させた。
実験結果
リサーチクエスチョン
- RQ12段階の蒸留フレームワークは、推論コストを増加させずに、軽量な全身ポーズ推定器の精度を著しく向上させることができるか?
- RQ2教師モデルの可視および不可視キーポイントの両方の監督を学生モデルに与えることで、全身ポーズ推定における学生モデルの性能にどのような影響を与えるか?
- RQ3軽量でヘッドに配慮した自己蒸留戦略は、最小限の追加学習時間でモデルの精度をどの程度向上させられるか?
- RQ4UBodyのような多様な実世界データを統合することで、細分化された身体部位におけるポーズ推定器のロバスト性と一般化性能はどの程度向上するか?
- RQ5より高精度なポーズ推定器は、生成モデルの再トレーニングなしに、制御可能な画像生成の品質を向上させることができるか?
主な発見
- DWPoseはCOCO-WholeBodyで66.5%という新たなSOTAの全身APを達成し、RTMPose-lの64.8%を著しく上回った。
- RTMPose-x教師モデル(65.3% AP)をも上回り、蒸留パイプラインの有効性を実証した。
- 2段階目の自己蒸留は、学習時間の20%で性能を向上させ、非常に効率的なプラグアンドプレイ戦略であることが示された。
- ロジットベースの蒸留でターゲットマスクを削除すると1.1%の性能低下が生じ、全キーポイント(可視および不可視を含む)の監督が知識伝達に不可欠であることを裏付けた。
- DWPoseは1枚あたりの推論時間を0.068秒に短縮(OpenPoseの5.78秒と比較)し、複数人の人物に対してもスケーリングが良く、スケールが大きくなっても低遅延を維持した。
- 画像生成タスクでは、ControlNetと組み合わせた際、DWPoseがOpenPoseよりもより高精度なスケルトン監督を提供し、より高品質な結果を得られた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。