[논문 리뷰] Interactive Generative Adversarial Networks for Facial Expression Generation in Dyadic Interactions
이 논문은 파트너의 정서 상태를 조건으로 하여 가상 에이전트의 시계적 순서가 유지되고 표현력 있는 얼굴 행동(예: 얼굴 표정 및 머리 자세)을 생성하는 이단계 조건부 GAN 프레임워크를 제안한다. 얼굴 형태 파라미터를 모델링하기 위해 조건부 LSTM 또는 정서-형태 사전을 사용하고, 고해상도 이미지 합성을 위해 스케치-이미지 GAN을 활용함으로써, 정서적 역동성과 사회적 모방을 반영하는 현실적이고 다양한 실시간 호환 얼굴 반응을 생성한다.
A social interaction is a social exchange between two or more individuals,where individuals modify and adjust their behaviors in response to their interaction partners. Our social interactions are one of most fundamental aspects of our lives and can profoundly affect our mood, both positively and negatively. With growing interest in virtual reality and avatar-mediated interactions,it is desirable to make these interactions natural and human like to promote positive effect in the interactions and applications such as intelligent tutoring systems, automated interview systems and e-learning. In this paper, we propose a method to generate facial behaviors for an agent. These behaviors include facial expressions and head pose and they are generated considering the users affective state. Our models learn semantically meaningful representations of the face and generate appropriate and temporally smooth facial behaviors in dyadic interactions.
연구 동기 및 목표
- 이중 상호작용 중 파트너의 정서 상태에 대응하여 가상 에이전트가 자연스럽고 비어미성 얼굴 행동(예: 얼굴 표정 및 머리 자세)을 생성할 수 있도록 하기.
- 정서 상태와 그 강도에 기반하여 얼굴 랜드마크 및 머리 자세의 동적이고 시간적으로 일관된 변화를 모델링하기.
- 실시간 구동이 가능한 표현력 있는 얼굴 생성 시스템을 개발하여 가상 에이전트의 사회적 모방 및 정서적 반응성을 지원하기.
- 이중 단계 GAN 아키텍처를 통해 스케치 생성과 이미지 합성을 분리함으로써 생성된 얼굴 이미지의 품질과 현실성을 향상시키기.
제안 방법
- 이중 단계 생성 프레임워크를 활용: 먼저 정서 상태와 잠재 벡터 z를 조건으로 하여 얼굴 스케치를 생성하고, 그 스케치에서 고해상도 얼굴 이미지를 생성한다.
- 한 상호작용 파트너의 정서 상태(예: 기쁨, 분노, 공포 등)를 나타내는 조건부 벡터를 사용한 조건부 GAN(CGAN)을 적용하여 얼굴 행동 생성를 유도한다.
- 학습된 정서-형태 사전 또는 조건부 LSTM을 사용하여 얼굴 형태 파라미터를 모델링함으로써 시간적 동적 변화를 인코딩하고 프레임 간 부드러운 전환을 보장한다.
- 고정된 정규분포에서 유도된 잠재 벡터 z를, 정규화된 정형 및 비정형 얼굴 형태 파라미터의 학습된 분포에서 샘플링하여 의미 있는 다양성을 확보한다.
- 이중 단계 훈련 전략을 적용: 디스 criminator 업데이트마다 생성자 업데이트를 두 번 수행하여 훈련 안정성 확보 및 모드 붕괴 방지.
- 생성자 및 디스 criminator 네트워크 모두에 잔차 U-Net 유사 아키텍처를 사용하고, 컨볼루션-BatchNorm-ReLU 블록을 반복 적용하여 특징 학습 및 훈련 안정성 향상.
실험 결과
연구 질문
- RQ1파트너의 정서 상태에 대응하여 얼굴 표정 및 머리 자세를 시간적으로 부드럽고 의미적으로 유의미한 방식으로 어떻게 생성할 수 있는가?
- RQ2정서-형태 사전과 조건부 LSTM 중 어느 것이 얼굴 형태 파라미터의 시간적 동적 변화를 더 잘 모델링하는가?
- RQ3이중 단계 GAN(스케치-이미지)이 잠재 공간에서 이미지로 직접 매핑하는 단일 단계 GAN보다 더 높은 품질의 얼굴 이미지를 생성할 수 있는가?
- RQ4LSTM을 통한 이전 정보 기반의 역사적 맥락 포함 여부가 비역사적 접근 대비 얼굴 표정 생성의 정확성과 부드러움에 어떤 영향을 미치는가?
- RQ5생성된 얼굴 행동이 이중 상호작용에서 사회적 모방과 정서적 반응성을 얼마나 잘 반영하는가?
주요 결과
- 정서-형태 사전 접근법은 조건부 LSTM보다 더 부드러운 얼굴 표정 시퀀스를 생성했으며, 장기간의 역사 평균화로 인해 프레임 간 갑작스러운 전환이 발생하는 조건부 LSTM의 문제점을 보완했다.
- 100프레임의 역사 오버랩을 가진 조건부 LSTM은 역사 없이 구동된 경우보다 더 낮은 평균 제곱오차(MSE = 0.101)를 기록하여 맥락 기억이 있는 경우 더 높은 예측 정확도를 확보했다(MSE = 0.183).
- 이중 단계 스케치-이미지 GAN은 단일 단계 GAN보다 유의미하게 높은 품질의 얼굴 이미지를 생성했으며, 정체성과 표현을 분리하는 데 중간 스케치 표현이 유리함을 입증했다.
- 정서-형태 사전 방법은 이전 프레임의 역사가 필요로 하지 않아 실시간 인퍼런스에 적합하며, 상호작용 애플리케이션에 유용하다.
- 조건부 LSTM 방법은 부드러움이 다소 떨어지지만, 고정된 역사에서 결정론적으로 생성되기 때문에 평가 및 재현이 더 용이하다.
- 프레임워크는 정서 상태의 의미적 변동성과 강도 변화를 반영하는 다양한 표현력 있고 시간적으로 일관된 얼굴 행동을 성공적으로 생성했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.