[論文レビュー] RTMO: Towards High-Performance One-Stage Real-Time Multi-Person Pose Estimation
RTMO は、YOLOアーキテクチャに二重1次元ヒートマップベースの座標分類を統合し、動的座標分類器(DCC)と新しい最尤推定(MLE)ベースの損失関数を用いることで、精度と効率を向上させた1段階型のリアルタイム多人数ポーズ推定フレームワークを提案する。COCO val2017で74.8%のAPを達成し、1台のV100 GPUで141 FPSを実現し、速度と精度の両面で先行する1段階型手法を上回る性能を発揮した。
Real-time multi-person pose estimation presents significant challenges in balancing speed and precision. While two-stage top-down methods slow down as the number of people in the image increases, existing one-stage methods often fail to simultaneously deliver high accuracy and real-time performance. This paper introduces RTMO, a one-stage pose estimation framework that seamlessly integrates coordinate classification by representing keypoints using dual 1-D heatmaps within the YOLO architecture, achieving accuracy comparable to top-down methods while maintaining high speed. We propose a dynamic coordinate classifier and a tailored loss function for heatmap learning, specifically designed to address the incompatibilities between coordinate classification and dense prediction models. RTMO outperforms state-of-the-art one-stage pose estimators, achieving 1.1% higher AP on COCO while operating about 9 times faster with the same backbone. Our largest model, RTMO-l, attains 74.8% AP on COCO val2017 and 141 FPS on a single V100 GPU, demonstrating its efficiency and accuracy. The code and models are available at https://github.com/open-mmlab/mmpose/tree/main/projects/rtmo.
研究の動機と目的
- 1段階検出と高精度な座標分類の統合により、リアルタイム多人数ポーズ推定における速度-精度トレードオフを解消すること。
- 1段階モデルにおける直接キーポイント回帰の限界を克服すること。これは、空間的不確実性のモデリングが不足しているため、性能が劣る。
- インスタンス固有の空間的文脈に適応する動的バイン分配とエンコーディング機構を設計し、ヒートマップ学習を向上させること。
- 硬いサンプルと易しいサンプルの両方をバランスよく最適化できる、学習可能でサンプルに敏感な損失関数を開発すること。
- 1段階多人数ポーズ推定において、速度と精度の両面で最先端の性能を達成すること。
提案手法
- YOLOベースの1段階検出器内に二重1次元ヒートマップを統合し、キーポイントの局所化を実現。直接回帰の代わりに座標分類を採用。
- バウンディングボックス内でのバインを動的に割り当て、学習可能なバイン表現を用いることで局所化精度を向上させる動的座標分類器(DCC)を提案。
- 各サンプルの不確実性を学習可能な分散でモデリングする最尤推定(MLE)ベースの損失関数を導入。これにより、異なるインスタンスの難易度に応じた最適化が可能になる。
- バインの利用効率を向上させるとともに、滑らかで空間的に一貫性のあるヒートマップ出力を保証するため、動的バイン割り当て(DBA)と動的バインエンコーディング(DBE)を適用。
- 特徴マップピラミッドの使用を最適化し、P3を削除してP4とP5のみを保持することで、精度の低下を最小限に抑えながら推論速度を向上。
- CPUおよびGPUプラットフォームで効率的な推論を実現するため、ONNXRuntimeを用いてモデルのトレーニングとデプロイを実施。

実験結果
リサーチクエスチョン
- RQ11段階多人数ポーズ推定のような密度予測タスクに、速度を犠牲にせずに座標分類を効果的に適応できるか?
- RQ21段階モデルにおけるインスタンス固有の空間的文脈に適合するように、バインの割り当てと表現を動的にできるか?
- RQ3学習可能で不確実性を考慮した損失関数は、標準的なカルバック・ライブラー距離(KLD)を上回る性能を発揮するか?
- RQ4YOLOベースのモデルに座標分類を統合することで、標準ベンチマークで高精度かつリアルタイム推論を達成できるか?
- RQ51段階多人数ポーズ推定において、速度と精度のバランスを最適化するための特徴マップピラミッドの最適な構成は何か?
主な発見
- RTMO-l は COCO val2017 で 74.8% の平均精度(AP)を達成し、1段階型手法として新たな最先端水準を樹立した。
- RTMO-l は 1台の NVIDIA V100 GPU で 141 FPS を達成し、同じバックボーンを用いた先行1段階型手法と比較して約9倍の高速化を実現した。
- CrowdPose ベンチマークでは、RTMO-l が 73.2% の AP を達成し、1段階型手法として再び最先端水準を樹立した。
- MLEベース損失は COCO で KLD よりも 2.1% の AP を上回り、各サンプルの不確実性をモデリングすることの利点を示した。
- 特徴マップピラミッドから P3 を削除することで、ヘッド部の FLOPs を 78.5% 減少させたが、精度の低下はたった 0.3% にとどまり、P4 と P5 の組み合わせで高い性能が達成可能であることを証明した。
- 動的バインエンコーディング(DBE)は、ヒートマップの滑らかさと性能を顕著に向上させ、静的または不適切なエンコーディングによる問題を解消した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。