[논문 리뷰] All-In-One: Facial Expression Transfer, Editing and Recognition Using A Single Network
이 논문은 단일 아키텍처를 사용하여 얼굴 표정 전이, 편집, 인식을 통합적으로 수행하는 TER-GAN이라는 유일한 생성적 적대적 네트워크를 제안한다. 소스 이미지와 타겟 이미지에서 각각 표현과 정체성 특징을 분리하기 위해 전용 인코더 두 개를 사용하고, 이를 디코더에서 조합하여 사진처럼 현실적인 합성 이미지를 생성함으로써, 체르모이드나 액션 유닛과 같은 보조 감독 없이도 세 가지 작업에서 최신 기술 수준(SOTA)의 성능을 달성한다.
In this paper, we present a unified architecture known as Transfer-Editing and Recognition Generative Adversarial Network (TER-GAN) which can be used: 1. to transfer facial expressions from one identity to another identity, known as Facial Expression Transfer (FET), 2. to transform the expression of a given image to a target expression, while preserving the identity of the image, known as Facial Expression Editing (FEE), and 3. to recognize the facial expression of a face image, known as Facial Expression Recognition (FER). In TER-GAN, we combine the capabilities of generative models to generate synthetic images, while learning important information about the input images during the reconstruction process. More specifically, two encoders are used in TER-GAN to encode identity and expression information from two input images, and a synthetic expression image is generated by the decoder part of TER-GAN. To improve the feature disentanglement and extraction process, we also introduce a novel expression consistency loss and an identity consistency loss which exploit extra expression and identity information from generated images. Experimental results show that the proposed method can be used for efficient facial expression transfer, facial expression editing and facial expression recognition. In order to evaluate the proposed technique and to compare our results with state-of-the-art methods, we have used the Oulu-CASIA dataset for our experiments.
연구 동기 및 목표
- 표현과 정체성 특징이 제대로 분리되지 않아 발생하는 정체성 泄漏 문제를 해결하기 위해.
- 표현 합성에서 얼굴 랜드마크, 액션 유닛, 또는 one-hot 코드와 같은 보조 감독이 필요 없도록 하기 위해.
- 한 개의 모델이 세 가지 관련 작업을 수행할 수 있도록 하기 위해: 표정 전이, 표정 편집, 얼굴 표정 인식.
- 훈련 중에 합성 이미지를 활용하는 새로운 일치성 손실을 통해 특징 분리 성능을 향상시키기 위해.
- 분리된 표정 표현이 미리 보지 않은 정체성에 대해 강건한 얼굴 표정 인식에 직접적으로 사용될 수 있음을 보여주기 위해.
제안 방법
- 모델은 두 개의 별도 인코더를 사용한다: 소스 이미지에서 표현 특징을 추출하기 위한 $G_{es}$와 타겟 이미지에서 정체성 특징을 추출하기 위한 $G_{et}$.
- 인코딩된 표현 및 정체성 특징을 연결하여 디코더 $G_{de}$에 전달하여 소스의 표현과 타겟의 정체성을 가진 합성 이미지를 생성한다.
- 각 인코더의 출력에서 적대적 일치성 손실을 도입한다: 표현 일치성 손실과 정체성 일치성 손실이며, 특징 품질 향상을 위해 합성 이미지를 활용한다.
- 생성자 모델은 GAN 프레임워크를 기반으로 엔드 투 엔드로 훈련되며, 판별자는 생성된 이미지의 현실성 확보를 담당한다.
- 얼굴 표정 인식을 위해 $G_{es}$ 인코더를 분리하고 Oulu-CASIA 데이터셋에서 얕은 분류기로 미세조정한다.
- t-SNE 시각화를 통해 정체성 표현에서 분리된 표현 특징의 타당성을 정성적으로 검증한다.
실험 결과
연구 질문
- RQ1보조 감독 없이도 단일 딥러닝 아키텍처가 얼굴 표정 전이, 편집, 인식을 효과적으로 수행할 수 있는가?
- RQ2one-hot 코드나 액션 유닛에 의존하지 않고도 통합 모델이 정체성과 표현 특징을 얼마나 잘 분리할 수 있는가?
- RQ3적대적 일치성 손실을 사용함으로써 추출된 표현 및 정체성 표현의 품질과 분리 정도가 향상되는가?
- RQ4인코더에서 추출한 분리된 표현 표현이 새로운 정체성에 대해 얼굴 표정 인식에 효과적으로 사용될 수 있는가?
- RQ5시각적 현실성과 인식 정확도 측면에서 최신 기술 수준의 방법들과 비교해 볼 때 모델의 성능은 어떠한가?
주요 결과
- TER-GAN은 Oulu-CASIA 데이터셋에서 얼굴 표정 인식 성능이 최신 기술 수준(SOTA)을 달성하여 GAN 기반 및 CNN 기반 SOTA 방법들을 모두 능가한다.
- 표현 특징의 t-SNE 시각화 결과는 기본 얼굴 표정에 해당하는 여섯 개의 명확한 클러스터를 보여주며, 정체성 정보로부터 효과적인 분리가 이루어졌음을 확인한다.
- 기존 방법들과 비교해 표정 전이 및 편집 과정에서 타겟 이미지의 정체성을 효과적으로 유지하며, 정체성 泄漏가 최소화되었다.
- 인코더 $G_{es}$에서 추출한 분리된 표현 표현은 조건부로 시간 영상 정보를 사용하는 방법들을 뛰어넘는 높은 정확도로 얼굴 표정 인식에 효과적으로 활용된다.
- 합성 이미지와 일치성 손실의 사용은 더 나은 클러스터링과 복원 정밀도를 통해 향상된 특징 품질을 입증한다.
- 변동성 정규화 기법을 피하므로 계산 복잡도를 줄였지만, 여전히 고품질의 아티팩트 없는 합성 이미지를 생성한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.