Skip to main content
QUICK REVIEW

[論文レビュー] AutoPose: Searching Multi-Scale Branch Aggregation for Pose Estimation

Xinyu Gong, Wuyang Chen|arXiv (Cornell University)|Aug 16, 2020
Human Pose and Action Recognition参考文献 47被引用数 14
ひとこと要約

AutoPoseは、2次元ヒューマンポーズ推定のための、セルレベルのマイクロ構造、マルチスケールブランチ選択、クロススケールアグリゲーションを統合的に最適化する新しいニューラルアーキテクチャ探索(NAS)フレームワークを提案する。セルアーキテクチャの勾配ベース探索と、ネットワークレベルのブランチ選択およびアグリゲーションの強化学習を組み合わせることで、73.6 APを達成する高精度でマルチブランチかつ高解像度のアーキテクチャを発見した。これは、探索空間の柔軟性と精度において、既存のNAS手法を上回る。

ABSTRACT

We present AutoPose, a novel neural architecture search(NAS) framework that is capable of automatically discovering multiple parallel branches of cross-scale connections towards accurate and high-resolution 2D human pose estimation. Recently, high-performance hand-crafted convolutional networks for pose estimation show growing demands on multi-scale fusion and high-resolution representations. However, current NAS works exhibit limited flexibility on scale searching, they dominantly adopt simplified search spaces of single-branch architectures. Such simplification limits the fusion of information at different scales and fails to maintain high-resolution representations. The presentedAutoPose framework is able to search for multi-branch scales and network depth, in addition to the cell-level microstructure. Motivated by the search space, a novel bi-level optimization method is presented, where the network-level architecture is searched via reinforcement learning, and the cell-level search is conducted by the gradient-based method. Within 2.5 GPU days, AutoPose is able to find very competitive architectures on the MS COCO dataset, that are also transferable to the MPII dataset. Our code is available at https://github.com/VITA-Group/AutoPose.

研究の動機と目的

  • 既存のNAS手法が2次元ヒューマンポーズ推定のための複雑でマルチブランチ・マルチスケールアーキテクチャを十分に探索できないという制限に対処すること。
  • 微細な空間的詳細を保持する高解像度のクロススケール特徴融合メカニズムを自動で発見できること。
  • セルレベル、スケールレベル、ネットワークレベルの意思決定を統合した巨大な探索空間におけるスケーラビリティと最適化の課題を克服すること。
  • 異なるレベルのアーキテクチャ探索に適した勾配ベースと強化学習を組み合わせた二段階最適化戦略を構築すること。
  • 提案された探索空間と最適化手法がMS COCOおよびMPIIの両データセットで有効であることを検証し、汎用性と最先端の性能を示すこと。

提案手法

  • セルレベルのマイクロアーキテクチャ、スケール選択、ネットワークレベルのブランチ選択とアグリゲーションを同時に探索可能な階層的マルチスケール探索空間を導入する。
  • 二段階最適化を採用:セルレベルアーキテクチャには勾配ベース探索、ネットワークレベルの意思決定(ブランチ選択、スケール、アグリゲーション)には強化学習を適用する。
  • 単純な連結や加算ではなく、密で構造的なクロススケール特徴統合を可能にする新しいアグリゲーションセルを設計する。
  • 共有重みを有するスーパーネットを用いて、探索中に候補アーキテクチャを効率的に評価し、学習コストを低減する。
  • 複数の異なるスケールの並列ブランチを維持することで、ネットワーク全体でフル解像度の表現を保持する。
  • 検索時にフル解像度の入力($256\times192$)を用いることで、検索と学習の間で分布シフトが生じにくくなり、最終的な性能が向上する。

実験結果

リサーチクエスチョン

  • RQ1NASフレームワークが2次元ポーズ推定のため、セルレベルアーキテクチャ、マルチスケールブランチ、クロススケールアグリゲーションを同時に最適化できるか?
  • RQ2単一パスまたは固定ブランチ構造に最適化する手法と比較して、マルチブランチ・マルチスケールアーキテクチャを探索するNAS手法の性能はどのように異なるか?
  • RQ3ポーズ推定のような密度予測タスクにおいて、NAS検索時にフル解像度の画像を使用することが、最終的なモデル性能に与える影響は何か?
  • RQ4勾配ベースと強化学習を組み合わせた二段階最適化が、巨大で多段階の探索空間を効果的に探索できるか?
  • RQ5提案されたアグリゲーションセルとマルチブランチ設計は、単純な連結や単一ブランチバックボーンと比較して、性能向上にどのように寄与するか?

主な発見

  • AutoPoseはMS COCOバリデーションセットで73.6 APを達成し、既存のNAS手法やHRNet-W32のような手作業で設計されたモデルを上回る。
  • 各ステージで1つのスケールのみを許容すると、性能は急激に低下し63.9 APにまで下がる。これはマルチスケール並列ブランチの重要性を示している。
  • 提案されたアグリゲーションセルを単純な連結に置き換えると、高IOU閾値(AP@75は80.1%から77.6%に低下)で性能が低下する。これは構造的なクロススケール統合の重要性を裏付けている。
  • すべての4つのブランチを手動で固定し、セルレベルアーキテクチャのみを探索すると71.8 APにとどまるが、これはAutoPoseの73.6 APより低い。これは、ネットワークレベルとセルレベルの共同探索の利点を示している。
  • 検索時に画像サイズを縮小($128\times96$)すると、APが3.5%低下(70.1% vs. 73.6%)する。これは、密度予測タスクにおいてフル解像度での検索が不可欠であることを確認している。
  • 二段階最適化は安定して収束し、セルレベルおよびネットワークレベルの意思決定におけるエントロピーが減少し、検証APとコントローラー報酬が時間経過とともに増加する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。