Skip to main content
QUICK REVIEW

[論文レビュー] Teacher Supervises Students How to Learn From Partially Labeled Images for Facial Landmark Detection

Xuanyi Dong, Yi Yang|arXiv (Cornell University)|Aug 6, 2019
Face recognition and analysis参考文献 47被引用数 7
ひとこと要約

本論文では、2つの学生検出器が生成する高品質な疑似ラベルを教師がフィルタリングすることで、半教師付き顔ランドマーク検出を向上させるTS³という教師-学生フレームワークを提案する。学生はラベルなしデータ上で予測を段階的に改善するが、教師は動的に予測の信頼性と一貫性に基づいて信頼できる疑似ラベルを選別する。300-WおよびAFLWベンチマークで、ラベル付きデータをたった30%に抑えた状態で最先端の性能を達成した。

ABSTRACT

Facial landmark detection aims to localize the anatomically defined points of human faces. In this paper, we study facial landmark detection from partially labeled facial images. A typical approach is to (1) train a detector on the labeled images; (2) generate new training samples using this detector's prediction as pseudo labels of unlabeled images; (3) retrain the detector on the labeled samples and partial pseudo labeled samples. In this way, the detector can learn from both labeled and unlabeled data to become robust. In this paper, we propose an interaction mechanism between a teacher and two students to generate more reliable pseudo labels for unlabeled data, which are beneficial to semi-supervised facial landmark detection. Specifically, the two students are instantiated as dual detectors. The teacher learns to judge the quality of the pseudo labels generated by the students and filter out unqualified samples before the retraining stage. In this way, the student detectors get feedback from their teacher and are retrained by premium data generated by itself. Since the two students are trained by different samples, a combination of their predictions will be more robust as the final prediction compared to either prediction. Extensive experiments on 300-W and AFLW benchmarks show that the interactions between teacher and students contribute to better utilization of the unlabeled data and achieves state-of-the-art performance.

研究の動機と目的

  • 顔ランドマーク検出の高コストなラベル付けを、半教師付きの枠組みでラベルなしデータを活用することで軽減すること。
  • 自己学習フレームワークにおける低品質な疑似ラベルによる誤差の蓄積を低減すること。
  • 膨大なハイパーパrameterチューニングを必要とせずに、顔ランドマーク検出のロバスト性と一般化性能を向上させること。
  • 相互正則化とアンサンブル予測を通じて、複数の学生検出器間の効果的な協調を可能にすること。

提案手法

  • CPMとHourglassの2つの学生検出器が、反復的な自己学習ループの中でラベルなし顔画像に対して疑似ラベルを生成する。
  • 教師ネットワークは、予測の一貫性と信頼度に基づく学習された基準を用いて、学生が生成する疑似ラベルの品質を評価する。
  • 教師は低品質な疑似ラベルをフィルタリングし、信頼性の高い一貫性のある予測のみを再訓練に使用する。
  • 学生は、実際のラベル付きデータとフィルタリングされた疑似ラベル付きデータの組み合わせを用いて再訓練され、両方の学生の予測をアンサンブルすることで最終出力を向上させる。
  • 教師は、改善された学生の予測を用いてトレーニング中に適応的に更新され、時間経過とともに動的フィードバックとより良い選別が可能になる。
  • 検証セットを活用することで、過学習を回避し、高品質な疑似ラベルの選択を支援する。

実験結果

リサーチクエスチョン

  • RQ1教師ネットワークは、半教師付き顔ランドマーク検出における学生検出器が生成する低品質な疑似ラベルを効果的にフィルタリングできるか?
  • RQ2複数の学生間の相互作用は、単一モデルの自己学習と比較して性能をどのように向上させるか?
  • RQ3提案された教師-学生相互作用メカニズムは、最小限のハイパーパrameterチューニングで最先端の性能を達成できるか?
  • RQ4トレーニングデータの30%しかラベルが与えられていない場合、モデルの一般化性能はどの程度向上するか?

主な発見

  • 300-Wベンチマークでは、TS³はラベル付きデータをたった10%に抑えた状態で平均誤差5.64 NMEを達成し、単一モデルベースライン(CPM: 8.28 NME、HG: 6.25 NME)を上回った。
  • 20%のラベル付きデータを使用した場合、TS³は300-WでNMEを5.03まで低下させ、SPLやSPaCoと比較して収束が早く、一般化性能に優れた。
  • AFLWベンチマークでは、TS³は半教師付き設定で最先端の性能を達成し、ラベル付きデータを30%に抑えた状態ですでに完全教師ありモデルを上回った。
  • アブレーションスタディの結果、2人の学生の相互作用により、CPMと比較して30%、HGと比較して9%の性能向上が確認され、アンサンブルと相互正則化の有効性が示された。
  • 教師の品質フィルタリング機構により、SPLのように4ラウンド目以降に劣化するような局所最適解に陥るのを防いだ。
  • 本フレームワークはデータの不均衡に対してもロバストであり、標準的なトレーニングを超えて追加のハイパーパrameterチューニングを必要としない。一方、モデル数の増加に伴い2乗的にスケーリングするco-training戦略とは異なり、そのような問題を回避した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。