Skip to main content
QUICK REVIEW

[論文レビュー] Aggregation via Separation: Boosting Facial Landmark Detector with Semi-Supervised Style Translation

Shengju Qian, Keqiang Sun|arXiv (Cornell University)|Aug 18, 2019
Face recognition and analysis被引用数 6
ひとこと要約

本論文は、条件付き変分オートエンコーダを用いて顔画像をスタイル空間と構造空間に分離する半教師あり顔ランドマーク検出フレームワークを提案する。その後、スタイル変換によりスタイル拡張された合成画像を生成することで検出性能を向上させる。本手法は、WFLW、300W、COFW、AFLWで最先端の結果を達成し、特にデータが少ない状況下でも、完全に教師ありのベースラインを最大で10%の学習データで94.94%の相対的改善で上回る。

ABSTRACT

Facial landmark detection, or face alignment, is a fundamental task that has been extensively studied. In this paper, we investigate a new perspective of facial landmark detection and demonstrate it leads to further notable improvement. Given that any face images can be factored into space of style that captures lighting, texture and image environment, and a style-invariant structure space, our key idea is to leverage disentangled style and shape space of each individual to augment existing structures via style translation. With these augmented synthetic samples, our semi-supervised model surprisingly outperforms the fully-supervised one by a large margin. Extensive experiments verify the effectiveness of our idea with state-of-the-art results on WFLW, 300W, COFW, and AFLW datasets. Our proposed structure is general and could be assembled into any face alignment frameworks. The code is made publicly available at https://github.com/thesouthfrog/stylealign.

研究の動機と目的

  • 照明、遮蔽、画像品質などの制約のない環境要因による顔ランドマーク検出器の性能低下を是正すること。
  • 追加のアノテーションやデータに依存せずに、ランドマーク検出器の汎化性と耐性を向上させること。
  • 少データ状況下での顔アラインメントにおける、分離表現を用いた半教師あり学習の可能性を調査すること。
  • 既存の顔アラインメントアーキテクチャに統合可能な汎用的なフレームワークを開発すること。

提案手法

  • KL正則化項とスキップ接続を備えた条件付き変分オートエンコーダを用いて、顔画像を分離されたスタイル空間と構造空間に分解する。
  • 学習済みのスタイル空間からサンプリングした多様なスタイルと、与えられた顔の構造を再結合することでスタイル変換を実行する。
  • 顔の幾何学的形状を保持したまま、実際の顔画像を新しいスタイルに変換することで合成学習データを生成する。
  • 一貫性正則化を活用して一般化性能を向上させるために、実データと合成データの両方で半教師ありランドマーク検出器を訓練する。
  • より強いベースライン(SAN)とResNet-18を用いて、異なるデータ比とスタイル拡張要因における性能を評価する。
  • 合成データの量とスタイル多様性がモデルの収束と性能に与える影響を分析することで、ドメインシフトの影響を制御する。

実験結果

リサーチクエスチョン

  • RQ1顔画像のスタイルと構造を分離することで、環境要因の変化に対して顔ランドマーク検出の耐性が向上するか?
  • RQ2限られたデータ状況下で、スタイル拡張された合成データを用いた半教師あり学習は、顔アラインメントにおいてどの程度有効か?
  • RQ3過学習を避けるために、性能を最大化するのに最適な1枚あたりのスタイル拡張数は何か?
  • RQ4提案手法は多様なベンチマークで汎用性を示し、既存の顔アラインメントフレームワークに統合可能か?
  • RQ5分離の品質が、生成されたスタイル拡張画像の現実性と実用性にどのように影響するか?

主な発見

  • 300Wデータセットにおいて、学習データの10%で、ベースライン比で94.94%の相対的改善を達成し、高いデータ効率を示した。
  • 学習データの50%で、ベースラインモデル(SAN)は最先端性能に達し、本手法によりWFLWでさらに15.38%の向上を達成した。
  • 1枚あたりのスタイル拡張数が8を超えると性能向上の効果が薄れ、k=32では合成データへの過学習が顕在し、性能低下が観察された。
  • より多くの学習データで分離品質が向上し、遮蔽やテクスチャ劣化といった複雑なスタイル要因を段階的に捉えるようになった。
  • 本手法は良好に汎用性を示し、WFLW、300W、COFW、AFLWのベンチマークで、先行する最先端モデルを上回った。
  • 本フレームワークは多様な顔アラインメントアーキテクチャと互換性があり、ベースモデルが強固であっても顕著な性能向上を実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。