Skip to main content
QUICK REVIEW

[論文レビュー] Human and Sheep Facial Landmarks Localisation by Triplet Interpolated Features

Heng Yang, Renqiao Zhang|arXiv (Cornell University)|Sep 16, 2015
Face recognition and analysis参考文献 38被引用数 4
ひとこと要約

本論文は、顔の大きな姿勢変動と希少なランドマークアノテーション下での人間およびヒツジの顔ランドマーク局所化に耐性を持つ、三重項補間特徴(TIF)手法を提案する。三つのアンカーランドマークを用いた特徴抽出の強化と、負に相関するデータ拡張方式の導入により、300W(人間)および600枚の画像からなる新しいヒツジ顔データセットにおいて、最先端の性能を達成し、困難なポーズでの成功確率を顕著に向上させた。

ABSTRACT

In this paper we present a method for localisation of facial landmarks on human and sheep. We introduce a new feature extraction scheme called triplet-interpolated feature used at each iteration of the cascaded shape regression framework. It is able to extract features from similar semantic location given an estimated shape, even when head pose variations are large and the facial landmarks are very sparsely distributed. Furthermore, we study the impact of training data imbalance on model performance and propose a training sample augmentation scheme that produces more initialisations for training samples from the minority. More specifically, the augmentation number for a training sample is made to be negatively correlated to the value of the fitted probability density function at the sample's position. We evaluate the proposed scheme on both human and sheep facial landmarks localisation. On the benchmark 300w human face dataset, we demonstrate the benefits of our proposed methods and show very competitive performance when comparing to other methods. On a newly created sheep face dataset, we get very good performance despite the fact that we only have a limited number of training samples and a set of sparse landmarks are annotated.

研究の動機と目的

  • 希少なランドマークと顕著な顔の姿勢変動を伴う現実世界の状況における顔ランドマーク局所化の課題に対処すること。
  • 人間およびヒツジの顔に対して、段階的形状回帰の耐性を向上させること。
  • 限られたデータ設定における不均衡なトレーニングデータ分布による性能低下を克服すること。
  • 動物福祉の応用を想定し、新しい小規模なヒツジ顔データセットにおいて正確なランドマーク検出を可能にすること。
  • ランドマークが希少に分布している場合でも効果を発揮する特徴抽出手法を開発すること。

提案手法

  • 三つのランドマークアンカーを用いて形状インデックス特徴を計算する三重項補間特徴(TIF)方式を提案し、ポーズ変動や形状変形に対して耐性を高める。
  • TIFを段階的形状回帰フレームワーク内に適用し、反復的にランドマーク予測を精緻化する。
  • 少数派のトレーニングサンプルがトレーニング分布における密度に応じてより多くのランダム初期化を受ける、負に相関する拡張(NCA)戦略を設計する。
  • 確率密度関数を用いて拡張頻度を決定し、密度が低いサンプルほど多くの拡張を受けるようにする。
  • 現実世界の制約を模倣するため、密な(68点)および疎な(14点)ランドマーク設定の両方でモデルをトレーニングおよび評価する。
  • 境界ボックス生成のため、dlib顔検出器を用い、手動による検証を実施し、現実的な評価条件を確保する。

実験結果

リサーチクエスチョン

  • RQ1三重項補間特徴は、顕著な顔のポーズ変動と希少なランドマークアノテーション下でも、ランドマーク局所化の正確性を向上させることができるか?
  • RQ2小規模なトレーニングデータセットにおけるデータの不均衡は、ランドマーク局所化の性能にどのような影響を及ぼし、効果的に是正可能か?
  • RQ3提案された負に相関する拡張方式は、レアまたは局所化が難しい顔のポーズにおける一般化性能を向上させるか?
  • RQ4TIF手法は、最小限のランドマークアノテーションで、人間およびヒツジの顔データセットの両方で競争力のある性能を達成できるか?
  • RQ5TIF手法は、困難な現実世界の条件下で、既存の最先端手法をどれほど上回るか?

主な発見

  • 300Wベンチマークにおいて、提案されたTIF + NCA手法は比較手法の中で最高の性能を達成した。特に、希少なランドマーク設定下で顕著であった。
  • TIF手法は、希少なランドマーク局所化において、ベースラインのRCPRおよびESRモデルを顕著に改善し、低ランドマーク環境下での有効性を示した。
  • NCA拡張方式により、高ポーズ変動ケースにおいて、689枚のテスト画像のうち30点以上(30以上)の成功局所化率の向上が確認され、強い耐性の向上が示された。
  • わずか600枚の画像からなる新しいヒツジ顔データセットにおいても、限られたデータと希少なランドマークアノテーションの下で、強力な性能を達成した。
  • 特に困難なポーズにおいて、平均局所化誤差と成功確率の両面で、既存の最先端手法を上回った。
  • TIFとNCAの組み合わせにより、極端な顔のポーズにおける失敗率が低下し、標準的なデータ拡張およびベースライン特徴手法に比べて顕著な優位性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。