[논문 리뷰] Teacher Supervises Students How to Learn From Partially Labeled Images for Facial Landmark Detection
이 논문은 두 명의 학생 검출기로부터 생성된 고품질의 가짜 레이블을 선별하기 위해 교사 네트워크를 사용하는 TS³라는 교사-학생 프레임워크를 제안한다. 학생들은 반복적으로 미라벨 데이터에 대한 예측을 개선하고, 교사는 동적으로 예측의 일관성과 신뢰도를 기반으로 신뢰할 수 있는 가짜 레이블을 평가하고 선택함으로써, 300-W 및 AFLW 벤치마크에서 라벨 데이터의 30%만으로도 최신 기술 수준의 성능을 달성한다.
Facial landmark detection aims to localize the anatomically defined points of human faces. In this paper, we study facial landmark detection from partially labeled facial images. A typical approach is to (1) train a detector on the labeled images; (2) generate new training samples using this detector's prediction as pseudo labels of unlabeled images; (3) retrain the detector on the labeled samples and partial pseudo labeled samples. In this way, the detector can learn from both labeled and unlabeled data to become robust. In this paper, we propose an interaction mechanism between a teacher and two students to generate more reliable pseudo labels for unlabeled data, which are beneficial to semi-supervised facial landmark detection. Specifically, the two students are instantiated as dual detectors. The teacher learns to judge the quality of the pseudo labels generated by the students and filter out unqualified samples before the retraining stage. In this way, the student detectors get feedback from their teacher and are retrained by premium data generated by itself. Since the two students are trained by different samples, a combination of their predictions will be more robust as the final prediction compared to either prediction. Extensive experiments on 300-W and AFLW benchmarks show that the interactions between teacher and students contribute to better utilization of the unlabeled data and achieves state-of-the-art performance.
연구 동기 및 목표
- 얼굴 랜드마크 검출의 높은 레이블링 비용 문제를 반감성 학습 방식으로 라벨이 없는 데이터를 활용하여 해결하고자 한다.
- 자기학습 프레임워크에서 저품질의 가짜 레이블로 인한 오차 누적 문제를 줄이고자 한다.
- 광범위한 초모수 조정 없이도 랜드마크 검출의 강건성과 일반화 능력을 향상시키고자 한다.
- 서로 다른 다수의 학생 검출기 간의 효과적인 협업을 위해 상호 정규화 및 앙상블 예측을 통한 협력 메커니즘을 제공하고자 한다.
제안 방법
- CPM 및 아워글라스와 같은 두 명의 학생 검출기가 반복적인 자기학습 루프를 통해 미라벨 얼굴 이미지에 대한 가짜 레이블을 생성한다.
- 교사 네트워크는 예측 일관성과 신뢰도를 기반으로 학습된 기준을 사용하여 학생들이 생성한 가짜 레이블의 품질을 평가한다.
- 교사는 저품질의 가짜 레이블을 걸러내고, 높은 신뢰도와 일관성을 보이는 예측만을 유지하여 학생들을 재학습시킨다.
- 학생들은 실제 라벨 데이터와 걸러낸 가짜 레이블 데이터의 조합을 사용하여 재학습되며, 두 학생의 예측을 앙상블하여 최종 출력을 향상시킨다.
- 교사는 학생의 예측 향상에 따라 동적으로 업데이트되어 시간이 지남에 따라 선택 성능이 향상되는 동적 피드백 메커니즘을 제공한다.
- 검증 세트를 활용하여 과적합을 방지하고, 고품질의 가짜 레이블 선택을 이끌어내는 데에 사용된다.
실험 결과
연구 질문
- RQ1반감성 얼굴 랜드마크 검출에서, 교사 네트워크가 학생 검출기로부터 생성된 저품질의 가짜 레이블을 효과적으로 걸러낼 수 있는가?
- RQ2다중 학생 간의 상호작용은 단일 모델 자기학습보다 성능 향상에 어떻게 기여하는가?
- RQ3제안된 교사-학생 상호작용 메커니즘은 최소한의 초모수 조정으로 최신 기술 수준의 성능을 달성할 수 있는가?
- RQ4라벨 데이터의 30%만을 사용할 경우, 모델의 일반화 능력은 어느 정도까지 유지되는가?
주요 결과
- 300-W 벤치마크에서 TS³는 라벨 데이터의 10%만을 사용하여 평균 오차 5.64 NME를 기록했으며, 단일 모델 기반 베이스라인(CPM: 8.28 NME, HG: 6.25 NME)을 모두 초월했다.
- 라벨 데이터의 20%를 사용했을 때, TS³는 300-W에서 NME를 5.03으로 낮추었으며, SPL 및 SPaCo보다 더 빠른 수렴과 더 나은 일반화 능력을 보였다.
- AFLW 벤치마크에서 TS³는 반감성 설정에서도 최신 기술 수준의 성능을 달성했으며, 라벨 데이터의 30%만 사용했을 때도 완전히 라벨링된 모델를 초월하는 성능을 보였다.
- 제거 분석 결과, 두 학생 간의 상호작용은 CPM 기반 기준 대비 30% 향상, HG 기반 기준 대비 9% 향상된 성능을 기록하여 앙상블 및 상호 정규화의 유용성을 입증했다.
- 교사의 품질 필터링 메커니즘은 SPL과 같이 라운드 4 이후 성능이 저하되는 국소 최적점에 갇히는 것을 방지함을 확인했다.
- 이 프레임워크는 데이터 불균형에 강건하며, 표준 학습 외에 추가적인 초모수 조정이 필요로 하지 않으며, 모델 수에 따라 제곱적으로 증가하는 공동 학습 전략과는 달리, 초모수 조정이 적은 편이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.