Skip to main content
QUICK REVIEW

[논문 리뷰] Cross-database non-frontal facial expression recognition based on transductive deep transfer learning

Keyu Yan, Wenming Zheng|arXiv (Cornell University)|2018. 11. 30.
Face and Expression Recognition참고 문헌 22인용 수 6
한 줄 요약

이 논문은 VGGface16-Net을 사용하여 교차 데이터베이스 비정방향 얼굴 표정 인식 문제를 다루기 위해 전이 학습 기반의 전이적 딥 러닝 프레임워크를 제안한다. 이는 레이블이 없는 타겟 샘플에 대한 표정보다도 분류 특징을 동시에 학습한다. 제안된 방법은 Multi-PIE에서 66.85%의 최고 성능을 기록했고, BU-3DEF에서는 66.05%를 기록하여 기존의 전이 학습 기법들을 능가한다.

ABSTRACT

Cross-database non-frontal expression recognition is a very meaningful but rather difficult subject in the fields of computer vision and affect computing. In this paper, we proposed a novel transductive deep transfer learning architecture based on widely used VGGface16-Net for this problem. In this framework, the VGGface16-Net is used to jointly learn an common optimal nonlinear discriminative features from the non-frontal facial expression samples between the source and target databases and then we design a novel transductive transfer layer to deal with the cross-database non-frontal facial expression classification task. In order to validate the performance of the proposed transductive deep transfer learning networks, we present extensive crossdatabase experiments on two famous available facial expression databases, namely the BU-3DEF and the Multi-PIE database. The final experimental results show that our transductive deep transfer network outperforms the state-of-the-art cross-database facial expression recognition methods.

연구 동기 및 목표

  • 학습 데이터와 테스트 데이터가 서로 다른 데이터베이스에서 오는 분포 이탈이 발생하는 교차 데이터베이스 비정방향 얼굴 표정 인식 문제에 도전한다.
  • 기존의 FER 방법들이 학습 및 테스트 세트 간에 동일한 데이터 분포를 가정하는 데서 비롯되는 한계를 극복한다.
  • 레이블이 없는 타겟 샘플에 대해 특징 학습과 레이블 예측을 동시에 최적화하는 딥 전이 학습 프레임워크를 개발한다.
  • 표준 FER 데이터셋에서 미흡하게 표현되는 비정방향 얼굴 표정에 대한 인식 성능을 향상시킨다.
  • 복잡한 다중 시점 얼굴 표정 인식 작업에서 수작업으로 만든 특징(SIFT, LBP)보다 딥 러닝 특징(VGG)이 유의미하게 뛰어나다는 것을 입증한다.

제안 방법

  • 원천 학습된 VGGface16-Net을 공통 특징 추출기로 활용하여 소스 및 타겟 도메인의 비정방향 얼굴 표정 데이터로부터 비선형적 분류 특징을 학습한다.
  • 레이블이 있는 소스 샘플과 레이블이 없는 타겟 샘플 양쪽에 대한 손실 함수를 동시에 최적화하는 새로운 전이 레이어를 설계한다.
  • 레이블이 있는 소스 데이터에 대한 분류 손실을 최소화하면서 동시에 레이블이 없는 타겟 샘플의 레이블을 예측하고 개선하는 통합 최적화 전략을 사용한다.
  • 레이블이 없는 타겟 샘플까지 포함하여 전체 소스 및 타겟 데이터셋을 학습 과정에 활용함으로써 도메인 적응 및 특징 일반화를 향상시킨다.
  • 분류 정확도와 타겟 데이터에 대한 레이블 예측 신뢰도를 균형 잡는 병합 손실 함수를 사용하여 모델을 엔드 투 엔드로 훈련한다.
  • 공개된 두 데이터베이스인 BU-3DEF(소스 또는 타겟)와 Multi-PIE(타겟 또는 소스)에 프레임워크를 적용하여 교차 데이터베이스 평가를 가능하게 한다.

실험 결과

연구 질문

  • RQ1전이적 딥 러닝 전이 학습 프레임워크는 기존 최고 성능 기법들을 뛰어넘어 교차 데이터베이스 비정방향 얼굴 표정 인식을 향상시킬 수 있는가?
  • RQ2다른 촬영 조건과 비정방향 자세를 가진 BU-3DEF와 Multi-PIE 데이터베이스 간 전이 시 제안된 방법의 성능는 어떠한가?
  • RQ3비정방향 표정 인식에서 딥 러닝 특징(VGGface16-Net)이 전통적인 수작업 특징(SIFT, LBP)보다 유의미하게 뛰어나게 성능을 높이는가?
  • RQ4학습 과정에 레이블이 없는 타겟 샘플을 포함시키는 것이 모델의 일반화 능력과 정확도 향상에 어느 정도 기여하는가?
  • RQ5왜 제안된 프레임워크에서 NE(중립) 표정은 특히 인식하기 어려운가?

주요 결과

  • TDTL 모델은 Multi-PIE를 타겟 데이터베이스로, BU-3DEF를 소스 데이터베이스로 사용할 경우 66.85%의 인식 정확도를 기록하여 비교된 모든 최고 성능 기법들을 능가한다.
  • BU-3DEF를 타겟으로, Multi-PIE를 소스로 사용할 경우 66.05%의 인식 정확도를 기록하여 양방향 데이터베이스 전이에 대한 강건성을 입증한다.
  • TDTL 방법의 F1-score는 타겟으로 Multi-PIE를 사용할 경우 0.6547, 타겟으로 BU-3DEF를 사용할 경우 0.5309를 기록하여 모든 표정 유형에서 뛰어난 성능를 보였다.
  • VGG 기반 특징은 정확도와 F1-score 모두에서 SIFT 및 LBP 특징을 뛰어넘었으며, 이는 복잡한 비정방향 얼굴 패턴을 포괄하는 데서 딥 러닝 특징의 우수성을 입증한다.
  • NE(중립) 표정은 특히 BU-3DEF 타겟 설정에서 다른 표정들과 분포상 유사성 때문에 가장 인식하기 어려운 것으로 보인다.
  • TDTL 프레임워크는 소스 데이터와 레이블이 없는 타겟 데이터를 동시에 최적화하는 전이 학습 기법이 도메인 적응 및 인식 강건성을 향상시킨다는 점을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.