Skip to main content
QUICK REVIEW

[論文レビュー] Deep Deformation Network for Object Landmark Localization

Xiang Yu, Feng Zhou|arXiv (Cornell University)|May 3, 2016
Face recognition and analysis被引用数 9
ひとこと要約

本稿では、非剛性物体のランドマーク検出のための2段階のカスケード型CNNフレームワークであるDeep Deformation Network (DDN)を提案する。この手法は、形状ベースネットワーク(SBN)によるグローバルな初期化と、局所的なテイラー・プレートスプライン変形を扱うポイントトランスフォーマーネットワーク(PTN)を介して幾何的制約を統合する。エンド・トゥ・エンドの学習と手作業で設計された特徴量やパーツ接続性の仮定なしに、顔、人体、鳥のランドマーク検出タスクにおいて最先端の性能を達成する。

ABSTRACT

We propose a novel cascaded framework, namely deep deformation network (DDN), for localizing landmarks in non-rigid objects. The hallmarks of DDN are its incorporation of geometric constraints within a convolutional neural network (CNN) framework, ease and efficiency of training, as well as generality of application. A novel shape basis network (SBN) forms the first stage of the cascade, whereby landmarks are initialized by combining the benefits of CNN features and a learned shape basis to reduce the complexity of the highly nonlinear pose manifold. In the second stage, a point transformer network (PTN) estimates local deformation parameterized as thin-plate spline transformation for a finer refinement. Our framework does not incorporate either handcrafted features or part connectivity, which enables an end-to-end shape prediction pipeline during both training and testing. In contrast to prior cascaded networks for landmark localization that learn a mapping from feature space to landmark locations, we demonstrate that the regularization induced through geometric priors in the DDN makes it easier to train, yet produces superior results. The efficacy and generality of the architecture is demonstrated through state-of-the-art performances on several benchmarks for multiple tasks such as facial landmark localization, human body pose estimation and bird part localization.

研究の動機と目的

  • 多様なオブジェクトクラスにわたる非剛性形状の変形、外観の変化、隠蔽の課題に対処すること。
  • 複雑な初期化や複数のサブネットワーク、手作業で設計された特徴量に依存する従来のカスケード型CNNの限界を克服すること。
  • 幾何的事前知識をCNNアーキテクチャに直接埋め込むことで、正則化と精度の向上を図る汎用的なフレームワークを導入すること。
  • パーツ接続性モデルや事前に定義されたグラフィカル構造を必要としないエンド・トゥ・エンドの学習と推論を可能にすること。
  • 顔のランドマーク、人体ポーズ、鳥の部位検出という複数のベンチマークで優れた性能を示すこと。

提案手法

  • 2段階のカスケードアーキテクチャを提案:まず、CNN特徴量を低ランクの形状多様体に射影することでグローバルなランドマーク初期化を生成する形状ベースネットワーク(SBN)を用いる。
  • 学習された形状ベースを用いてポーズ空間を正則化することで、非剛性形状の複雑さを低減し、一般化性能を向上させる。
  • 2段階目では、初期ランドマークからのテイラー・プレートスプライン(TPS)変形を用いて局所的変形を予測するポイントトランスフォーマーネットワーク(PTN)を採用する。
  • SBNとPTNを介して幾何的事前知識をネットワークに直接統合し、外部のグラフィカルモデルや手作業で設計されたパーツ接続に依存しない。
  • SBNとPTNの両方に逆誤差伝搬を可能にすることでエンド・トゥ・エンドの学習を実現し、形状ベースと変形パラメータを同時に最適化可能にする。
  • 入力としてVGGベースのCNN特徴量を用い、中間の密度特徴量の監視なしに直接スパースランドマーク座標へ回帰する。

実験結果

リサーチクエスチョン

  • RQ1CNNフレームワーク内に幾何的制約を効果的に統合することで、手作業で設計された特徴量なしにランドマーク検出を向上させることができるか?
  • RQ2低ランクの形状ベースを事前知識として組み込むことで、非剛性ランドマーク検出における初期化と一般化性能が向上するか?
  • RQ3テイラー・プレートスプラインでモデル化された局所的非剛性変形は、CNN特徴量からの直接回帰に比べ、精度と頑健性で優れているか?
  • RQ4顔、人体、鳥など外観と形状の変動が著しい多様なオブジェクトカテゴリに一般化可能なフレームワークか?
  • RQ5幾何的インダクティブバイアスを内蔵したエンド・トゥ・エンドで学習可能なアーキテクチャは、複雑な初期化や複数のサブネットワークを必要とする従来のカスケード型手法を上回る性能を示せるか?

主な発見

  • 300W顔ランドマークデータセットにおいて、DDNは94.0%のPCK@0.10スコアを達成し、[60]が報告した93.8%を上回り、最先端の性能を達成した。
  • 人体ポーズ推定のためのLSPデータセットでは、DDNがPCK@0.10スコア88.3%を達成し、同ベンチマークにおける従来の最先端手法を上回った。
  • CUB200-2011鳥部位検出データセットでは、DDNがPCK@0.10スコア93.3%を達成し、同じ閾値で93.4%を報告したベースライン[60]を上回った。
  • 本手法は隠蔽や大きな変形に対しても頑健であり、質的結果から困難なポーズでも正確なランドマーク検出が可能であることが示された。
  • 完全に畳み込み型のベースラインと比較して、密度マスクの予測ではなくスパースランドマークへの直接回帰により、計算コストを低減した。
  • アブレーション実験では、SBNによる幾何的正則化とTPS変形が、直接回帰やグラフィカルモデルベースのアプローチに比べ、収束が速く一般化性能に優れていることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。