Skip to main content
QUICK REVIEW

[論文レビュー] Learning deep representation from coarse to fine for face alignment

Zhiwen Shao, Shouhong Ding|ArXiv.org|Jul 31, 2016
Face recognition and analysis参考文献 16被引用数 12
ひとこと要約

本稿では、顔のアライメントにおける深層畳み込みネットワークの粗いから細かい学習戦略を提案し、特徴点を主な(例:目、鼻、口)と詳細なサブセットに分割する。主な特徴点から徐々に詳細な特徴点へ学習の焦点を移すことで、最適化が滑らかになり、耐性が向上し、COFWデータセットにおいて従来の最先端手法よりも平均誤差を21.37%低減した。

ABSTRACT

In this paper, we propose a novel face alignment method that trains deep convolutional network from coarse to fine. It divides given landmarks into principal subset and elaborate subset. We firstly keep a large weight for principal subset to make our network primarily predict their locations while slightly take elaborate subset into account. Next the weight of principal subset is gradually decreased until two subsets have equivalent weights. This process contributes to learn a good initial model and search the optimal model smoothly to avoid missing fairly good intermediate models in subsequent procedures. On the challenging COFW dataset [1], our method achieves 6.33% mean error with a reduction of 21.37% compared with the best previous result [2].

研究の動機と目的

  • 重度の遮蔽およびポーズ変動下でも頑健な顔の特徴点検出を実現すること。
  • 最適化中に良好な中間モデルを逃す可能性がある直接的なエンドツーエンド学習の限界を克服すること。
  • 初期段階で顔の主要特徴点を優先することで、モデルの汎化性能と収束性を向上させること。
  • 事前学習や補助属性ラベルの付与に依存せずに、最適なモデルの滑らかな探索を可能にすること。
  • 特に遮蔽などの困難な条件下でも、ベンチマークデータセットで最先端の性能を達成すること。

提案手法

  • 顔の特徴点を主なサブセット(12個のキーポイント:眉/目の端、鼻先、口の端、あご先)と詳細なサブセットに分割する。
  • 主なサブセットの損失に初期値が高く(λ ≈ 1)徐々に0.5に減少する動的損失重み付け方式を導入する。
  • λを複数段階にわたり線形に初期値から0.5に減少させる学習スケジュールを採用し、粗い学習から細かい学習への滑らかな移行を実現する。
  • 最終層だけでなく、4つのマックスプーリング層に段階的な監視信号を追加することで、特徴量学習を向上させる。
  • 限られた学習データによる過学習を軽減するため、データ拡張を実施する。
  • 初期化や事前学習を一切行わず、入力として生の顔画像のみを用いて、1つの深層畳み込みネットワークをエンドツーエンドで学習する。

実験結果

リサーチクエスチョン

  • RQ1粗いから細かい学習戦略は、遮蔽下における深層顔アライメントの頑健性と精度を向上させることができるか?
  • RQ2主な特徴点から詳細な特徴点へ段階的に学習の焦点を移すことで、より良い収束が達成され、局所最適解を回避できるか?
  • RQ3補助属性ラベルの付与なしに、1つの深層ネットワークがマルチステージや事前学習モデルを上回る性能を発揮できるか?
  • RQ4固定重み付けや標準的な学習と比較して、動的損失重み付けは最終的なアライメント精度において優れているか?
  • RQ5段階的な監視は、顔アライメントネットワークにおける特徴表現の向上にどの程度寄与するか?

主な発見

  • 提案手法の粗いから細かい学習(CFT)は、COFWデータセットにおいて従来の最先端手法(TCDCN)と比較して平均誤差を21.37%低減した。
  • CFTはCOFWで直接学習(DT)より6.22%、300-Wで6.55%、Helenで8.65%の性能向上を示し、ベンチマーク全体で一貫した向上を確認した。
  • 遮蔽を伴う挑戦的なCOFWサブセットでは、事前学習と属性監視を用いるTCDCNを著しく上回り、優れた頑健性を示した。
  • CFTは、重度の遮蔽およびポーズ変動下でも、顔間距離で正規化した平均誤差6.33%を達成した。
  • 可視化結果から、CFTはRCPRなどのベースラインと比較して、部分的遮蔽や極端な表情変化のような複雑なケースをより正確に処理できた。
  • CPU上での1枚あたりの処理時間は65msであり、TCDCN(18ms)より遅いが、性能の向上が複雑さの妥当なトレードオフを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。