Skip to main content
QUICK REVIEW

[논문 리뷰] Probabilistic Attribute Tree in Convolutional Neural Networks for Facial Expression Recognition

Jie Cai, Zibo Meng|arXiv (Cornell University)|2018. 12. 17.
Face and Expression Recognition참고 문헌 52인용 수 20
한 줄 요약

이 논문은 얼굴 표정 인식에서 반복 클래스 변동성을 줄이기 위해 신원과 관련된 속성(예: 성별, 인종, 연령)을 계층적 트리 구조를 사용해 명시적으로 모델링하는 새로운 딥러닝 프레임워크인 확률적 속성 트리-CNN(PAT-CNN)을 제안한다. 샘플을 트리 노드에 확률적으로 할당하고, 유사도 기반으로 클러스터 중심을 업데이트하며, 반감성 학습 전략을 통해 잎 노드에서 표정 분류기를 훈련시킴으로써 PAT-CNN은 단일 모델로도 SFEW와 같은 제한 없는 데이터셋에서 최신 기술 수준의 성능을 달성하였으며, 수백 개의 네트워크로 구성된 앙상블 방법을 능가한다.

ABSTRACT

In this paper, we proposed a novel Probabilistic Attribute Tree-CNN (PAT-CNN) to explicitly deal with the large intra-class variations caused by identity-related attributes, e.g., age, race, and gender. Specifically, a novel PAT module with an associated PAT loss was proposed to learn features in a hierarchical tree structure organized according to attributes, where the final features are less affected by the attributes. Then, expression-related features are extracted from leaf nodes. Samples are probabilistically assigned to tree nodes at different levels such that expression-related features can be learned from all samples weighted by probabilities. We further proposed a semi-supervised strategy to learn the PAT-CNN from limited attribute-annotated samples to make the best use of available data. Experimental results on five facial expression datasets have demonstrated that the proposed PAT-CNN outperforms the baseline models by explicitly modeling attributes. More impressively, the PAT-CNN using a single model achieves the best performance for faces in the wild on the SFEW dataset, compared with the state-of-the-art methods using an ensemble of hundreds of CNNs.

연구 동기 및 목표

  • 연령, 인종, 성별과 같은 신원 관련 속성으로 인해 발생하는 얼굴 표정 인식의 큰 반복 클래스 변동성을 해결하기 위해.
  • 표정 관련 특징을 학습하면서 이러한 속성의 영향을 최소화하기 위해 계층적 클러스터링을 통한 딥러닝 프레임워크를 개발하기 위해.
  • 신원 속성 레이블이 부족한 데이터에서, 표정 레이블과 속성 레이블이 모두 있는 샘플을 활용하는 반감성 학습 전략을 통해 효과적인 훈련을 가능하게 하기 위해.
  • 기존 CNN 모델이 높은 주체 변동성으로 인해 어려움을 겪는 제한 없는 실생활 얼굴 표정 데이터셋에서의 성능 향상을 위해.

제안 방법

  • CNN의 최종 풀링 레이어 뒤에 새로운 확률적 속성 트리(PAT) 모듈을 삽입하여, 신원 속성 기반으로 특징을 계층적 트리로 정렬한다.
  • 트리의 각 노드는 부모 노드의 특징을 특정 속성(예: 성별 또는 인종)을 기반으로 클러스터링하며, 클러스터 중심은 새로운 PAT 손실 함수를 통해 업데이트된다.
  • 샘플은 특징 유사도에 기반해 트리의 모든 노드에 확률적으로 할당되며, 이로 인해 다양한 속성 상태에 걸쳐 가중치가 부여된 특징 학습이 가능해진다.
  • 표정 관련 특징은 트리의 잎 노드에서 추출되며, 이 특징들에 대해 훈련된 분류기들의 가중치 합으로 최종 분류기가 형성된다.
  • 반감성 학습 전략을 적용: PAT 손실은 속성 레이블이 있는 샘플만을 사용해 클러스터 중심을 개선하고, 표정 손실은 모든 표정 레이블이 있는 샘플을 사용해 최종 분류기를 훈련한다.
  • 백프로파게이션 동안 특징과 할당된 클러스터 중심 간의 거리를 최소화함으로써, 의미적으로 유의미한 클러스터 형성이 보장되는 PAT 손실 함수를 설계하였다.

실험 결과

연구 질문

  • RQ1계층적이고 속성 기반의 클러스터링 메커니즘이 CNN에서 신원 관련 변동성이 얼굴 표정 인식에 미치는 영향을 줄일 수 있는가?
  • RQ2신원 속성 레이블이 부족한 데이터 세트에서, 단지 일부 샘플만이 레이블이 있는 경우, 딥러닝 모델이 어떻게 효과적으로 표정 관련 특징을 학습할 수 있는가?
  • RQ3속성 노드에 샘플을 확률적으로 할당하는 전략이 제한 없는 얼굴 표정 데이터셋에서 일반화 능력과 성능을 향상시킬 수 있는가?
  • RQ4단일 모델 기반의 PAT-CNN이 SFEW와 같은 실생활 얼굴 표정 벤치마크에서 앙상블 기반 최신 기술 수준의 방법을 능가할 수 있는가?

주요 결과

  • SFEW 데이터셋에서 성별과 인종 속성을 가진 PAT-VGG는 테스트 세트에서 62.90%의 정확도를 기록하여, 최고의 앙상블 기반 방법(61.6%)과 모든 단일 모델 기반 백본을 능가하였다.
  • 동일한 속성을 가진 PAT-ResNet는 테스트 정확도 62.10%를 기록하여, 베이스라인 ResNet(56.72%) 및 기타 단일 모델 방법을 모두 능가하였다.
  • PAT-CNN는 단일 모델로만 SFEW 데이터셋에서 최신 기술 수준의 성능을 달성하였으며, 다음으로 우수한 성능를 기록한 방법들은 수백 개의 네트워크로 구성된 앙상블가 필요로 하였다.
  • RAF-DB 및 BU-3DFE 데이터셋에서도 PAT-CNN는 베이스라인 VGG 및 ResNet 모델을 능가하였으며, 다양한 포즈 기반 및 자발적 표정 데이터셋에서 일관된 성능 향상을 보였다.
  • 반감성 학습 전략을 통해 속성 레이블이 제한된 데이터를 효과적으로 활용할 수 있었으며, 모든 샘플에 대해 완전한 속성 레이블이 필요로 하지 않음에도 불구하고 성능 향상이 이루어졌다.
  • PAT 손실 함수는 의미적으로 유의미한 클러스터 형성에 성공적으로 기여하였으며, 이는 향상된 특징 분리 및 인식 정확도로 입증되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.