[논문 리뷰] Facial Expression Recognition Using Human to Animated-Character Expression Translation
이 논문은 인간의 얼굴 표정을 고정된 애니메이션 캐릭터 정체성으로 변환하는 조건부 GAN인 HA-GAN을 제안한다. 이는 개인 간 변동성을 줄이고 순수하며 스타일리시한 표정을 생성한다. FERGDB 데이터셋으로 훈련함으로써, 모델은 정적 이미지에서 FER 정확도를 향상시켜 시간 정보를 사용하지 않고도 최신 기술 수준의 성능을 달성한다.
Facial expression recognition is a challenging task due to two major problems: the presence of inter-subject variations in facial expression recognition dataset and impure expressions posed by human subjects. In this paper we present a novel Human-to-Animation conditional Generative Adversarial Network (HA-GAN) to overcome these two problems by using many (human faces) to one (animated face) mapping. Specifically, for any given input human expression image, our HA-GAN transfers the expression information from the input image to a fixed animated identity. Stylized animated characters from the Facial Expression Research Group-Database (FERGDB) are used for the generation of fixed identity. By learning this many-to-one identity mapping function using our proposed HA-GAN, the effect of inter-subject variations can be reduced in Facial Expression Recognition(FER). We also argue that the expressions in the generated animated images are pure expressions and since FER is performed on these generated images, the performance of facial expression recognition is improved. Our initial experimental results on the state-of-the-art datasets show that facial expression recognition carried out on the generated animated images using our HA-GAN framework outperforms the baseline deep neural network and produces comparable or even better results than the state-of-the-art methods for facial expression recognition.
연구 동기 및 목표
- 미리보지 않은 개인에 대해 일반화 능력이 떨어지는 얼굴 표정 인식(FER) 데이터셋에서 개인 간 변동성을 해결하기 위해.
- 포즈 촬영 데이터셋에서 순수하지 않고 균일하지 않은 얼굴 표정이 존재하는 문제를 완화하기 위해.
- 훈련을 위해 현실적인 애니메이션 이미지를 생성함으로써 순수하고 전문가가 설계한 표정을 갖춘 이미지를 제공함으로써 FER 성능을 향상시키기 위해.
- 다양한 인간 얼굴에서 단일 애니메이션 정체성으로의 다대일 매핑을 통해 정체성에 의존하지 않는 FER를 가능하게 하기 위해.
- 3D 라이브러리 데이터나 영상 시퀀스가 필요 없는 데이터 증강 프레임워크를 제공하기 위해.
제안 방법
- 다양한 인간 얼굴 표정 이미지를 고정된 애니메이션 캐릭터 정체성으로 매핑하는 다대일 매핑을 학습하기 위해 조건부 GAN 프레임워크인 HA-GAN을 훈련한다.
- 생성자 네트워크는 FERGDB 데이터셋을 사용하여 입력된 인간 이미지의 표정 세부 정보를 사전에 정의된 애니메이션 얼굴로 전달한다. 이 데이터셋은 정교하게 제작된 순수 표정 애니메이션을 포함한다.
- 판별자는 실제 애니메이션 이미지와 생성된 이미지를 구분하도록 훈련되어, 사진 수준의 사실성과 표정의 정확성을 보장한다.
- 모델은 적대적 손실과 인지적 손실을 사용하여 엔드 투 엔드로 훈련되며, 이는 얼굴의 구조와 표정 세부 정보를 유지하는 데 기여한다.
- 생성된 애니메이션 이미지에서 FER를 수행하고, 이를 딥 컨볼루션 네트워크 분류기의 미세조정을 위한 훈련 데이터로 사용한다.
- 미리보지 않은 개인에 대한 일반화 능력을 평가하기 위해 정체성에 의존하지 않는 분할을 사용한 교차 검증을 적용한다.
실험 결과
연구 질문
- RQ1다양한 인간 얼굴에서 단일 고정 애니메이션 정체성으로의 다대일 매핑이 FER에서 개인 간 변동성의 영향을 줄일 수 있는가?
- RQ2애니메이션에서 순수하고 예술가가 설계한 표정을 생성하면 실제 인간 이미지보다 FER 정확도가 향상되는가?
- RQ3GAN 기반 번역 프레임워크가 인간 입력의 표정 의미를 유지하면서도 현실적인 애니메이션 표정을 생성할 수 있는가?
- RQ4생성된 애니메이션 이미지에서의 FER 성능은 정적 이미지 벤치마크에서 최신 기술 수준의 방법과 비교해 어떻게 되는가?
- RQ5이 방법은 영상 시퀀스나 시간 정보를 사용하지 않고도 높은 정확도를 달성할 수 있는가?
주요 결과
- CK+ 데이터셋에서 HA-GAN은 6가지 표정 분류 작업에서 96.14%의 정확도를 기록했으며, CNN 기준선(92.45%)을 뛰어넘고 최신 기술 수준의 방법들과 맞먹거나 초월한다.
- MMI 데이터셋에서 HA-GAN은 71.87%의 정확도를 기록했으며, 기준선 CNN(58.46%)보다 뚜렷이 높고, DeRL과 같은 고급 정적 방법(73.23%)과 유사한 성능을 보였다.
- Oulu-CASIA 데이터셋에서 HA-GAN은 88.26%의 정확도를 기록했으며, 기준선 CNN(73.14%)를 뛰어넘고 시간 정보를 사용하지 않은 동적 방법들인 LBP-TOP와 HOG 3D를 초월했다.
- 결과는 생성된 애니메이션 이미지에서의 FER 성능가 실제 인간 이미지에서의 성능보다 높음을 보여주며, 순수한 표정이 인식을 향상시킨다는 가설을 지지한다.
- 이 방법은 영상 데이터나 복잡한 시간 모델링을 사용하지 않고도 정적 이미지 벤치마크에서 최신 기술 수준의 성능을 달성한다.
- HA-GAN의 성공은 합성된 스타일리시한 표정이 특히 데이터가 적거나 정체성 변동성이 큰 상황에서 FER에 효과적인 데이터 증강 수단이 될 수 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.