[논문 리뷰] Deep Covariance Descriptors for Facial Expression Recognition
이 논문은 VGG-face와 ExpNet에서 추출한 특징을 대칭 양의 정부호(SPD) 행렬로 표현하여 리만 다양체 상에서 깊이 있는 공분산 서술자를 사용하여 얼굴 표정 인식을 수행한다. SPD 다양체 상에서 가우시안 RBF 커널을 적용함으로써 Oulu-CASIA 및 SFEW 데이터셋에서 기존의 완전히 연결된 계층을 사용한 표준 소프트맥스 분류보다 최신 기술 수준의 성능을 달성한다.
In this paper, covariance matrices are exploited to encode the deep convolutional neural networks (DCNN) features for facial expression recognition. The space geometry of the covariance matrices is that of Symmetric Positive Definite (SPD) matrices. By performing the classification of the facial expressions using Gaussian kernel on SPD manifold, we show that the covariance descriptors computed on DCNN features are more efficient than the standard classification with fully connected layers and softmax. By implementing our approach using the VGG-face and ExpNet architectures with extensive experiments on the Oulu-CASIA and SFEW datasets, we show that the proposed approach achieves performance at the state of the art for facial expression recognition.
연구 동기 및 목표
- 공간적 관계를 포괄하는 압축되고 분류에 유용한 표현으로 깊이 학습된 CNN 특징을 인코딩함으로써 얼굴 표정 인식 성능을 향상시키기 위해.
- 얼굴 영역 내의 공간적 의존성을 모델링하는 데에 표준 DCNN의 한계를 극복하기 위해.
- 더 나은 분류 성능를 위해 대칭 양의 정부호(SPD) 다양체 상의 공분산 행렬의 기하학적 구조를 탐색하기 위해.
- 기준 데이터셋에서 제안된 방법을 평가하고 최신 기술 수준의 접근법과 비교하기 위해.
- 전역 및 국소 공분산 서술자가 표현 특이 패턴을 효과적으로 포착하는지 조사하기 위해.
제안 방법
- 사진에서 사전 훈련된 VGG-face 및 ExpNet 모델로부터 깊이 학습된 컨volutional 특징을 추출한다.
- 512개의 특징 맵을 통합하여 각 이미지당 하나의 SPD 행렬로 전역 공분산 서술자를 계산한다.
- 좌표점 기반으로 국소 얼굴 영역을 탐지하고, 영역별 특징 맵을 추출하여 국소 공분산 서술자를 얻는다.
- 각 국소 영역의 특징을 국소 공분산 행렬로 표현하여 SPD 행렬의 집합을 형성한다.
- SVM 기반 분류를 가능하게 하기 위해 SPD 다양체 상에 유효한 양의 정부호 가우시안 RBF 커널을 적용한다.
- SPD 행렬의 리만 기하학을 활용하여 다양체의 내재된 구조를 고려해 분류기를 훈련하고 평가한다.
실험 결과
연구 질문
- RQ1기존의 표준 소프트맥스 분류에 비해 깊이 학습된 CNN 특징의 공분산 서술자가 얼굴 표정 인식 성능 향상에 기여하는가?
- RQ2SPD 다양체의 기하학적 구조가 얼굴 표정 데이터의 분류 성능 향상에 어떻게 기여하는가?
- RQ3전역 및 국소 공분산 서술자를 조합하면 단독으로 사용할 경우보다 더 높은 성능을 얻을 수 있는가?
- RQ4Oulu-CASIA 및 SFEW와 같은 표준 벤치마크에서 제안된 방법은 최신 기술 수준의 접근법과 어떻게 비교되는가?
- RQ5특히 SFEW와 같은 도전적인 데이터셋에서, 얼굴 좌표점 탐지의 신뢰성 저하가 국소 공분산 서술자 품질에 어떤 영향을 미치는가?
주요 결과
- 제안된 방법은 동일한 평가 프rotocol를 사용한 이전 방법들보다 Oulu-CASIA 데이터셋에서 최신 기술 수준의 성능을 달성했다.
- SFEW 데이터셋에서는 두 번째로 높은 정확도를 기록했으며, 다수의 최신 기술 수준 접근법을 크게 앞서며 성능 향상을 보였다.
- SPD 다양체 상에서 가우시안 RBF 커널을 사용한 결과, 완전히 연결된 계층을 사용한 표준 소프트맥스 분류보다 더 나은 분류 성능을 달성했다.
- 시각화 결과 유사한 표정(예: 기쁨은粉/ purpule, 놀람은 blue)에 대해 일관된 색상 패턴이 나타나, 분류에 효과적인 특징 학습이 이루어졌음을 시사했다.
- 국소 공분산 서술자는 각 얼굴 영역에서 독특한 패턴을 포착하여 효과적인 공간 모델링이 이루어졌음을 시사했다.
- SFEW 이미지의 약 30%에서 얼굴 좌표점 탐지 실패로 인해 국소 및 전역 서술자를 조합하는 데서 유의미한 이점이 제한되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.