[논문 리뷰] Reversible Graph Neural Network-based Reaction Distribution Learning for Multiple Appropriate Facial Reactions Generation
이 논문은 단일 스피커 행동에 대해 다수의 적절하고 현실적이며 동기화된 얼굴 반응을 생성하기 위한 새로운 딥러닝 프레임워크를 제안한다. 이는 하나의 입력에 대해 하나의 반응만 생성하는 기존의 일대일 매핑 학습 전략의 문제를 해결하기 위해, 하나의 입력에 대해 다수의 반응을 생성하는 문제를 반응 분포 학습을 통해 일대일 매핑 문제로 재구성함으로써 이를 해결한다. 얼굴 반응 분포를 모델링하고 복원하기 위해 가역 다차원 에지 그래프 신경망( REGNN)을 도입하여, 기존 방법에 비해 적절성, 현실성, 동기화성 측면에서 성능을 크게 향상시킨다.
Generating facial reactions in a human-human dyadic interaction is complex and highly dependent on the context since more than one facial reactions can be appropriate for the speaker's behaviour. This has challenged existing machine learning (ML) methods, whose training strategies enforce models to reproduce a specific (not multiple) facial reaction from each input speaker behaviour. This paper proposes the first multiple appropriate facial reaction generation framework that re-formulates the one-to-many mapping facial reaction generation problem as a one-to-one mapping problem. This means that we approach this problem by considering the generation of a distribution of the listener's appropriate facial reactions instead of multiple different appropriate facial reactions, i.e., 'many' appropriate facial reaction labels are summarised as 'one' distribution label during training. Our model consists of a perceptual processor, a cognitive processor, and a motor processor. The motor processor is implemented with a novel Reversible Multi-dimensional Edge Graph Neural Network (REGNN). This allows us to obtain a distribution of appropriate real facial reactions during the training process, enabling the cognitive processor to be trained to predict the appropriate facial reaction distribution. At the inference stage, the REGNN decodes an appropriate facial reaction by using this distribution as input. Experimental results demonstrate that our approach outperforms existing models in generating more appropriate, realistic, and synchronized facial reactions. The improved performance is largely attributed to the proposed appropriate facial reaction distribution learning strategy and the use of a REGNN. The code is available at https://github.com/TongXu-05/REGNN-Multiple-Appropriate-Facial-Reaction-Generation.
연구 동기 및 목표
- 기존 모델이 일대일 매핑 학습 전략을 사용함으로써 단일 스피커 행동에 대해 다수의 적절한 얼굴 반응을 처리하지 못하는 문제를 해결하기 위해, 단일 스피커 행동에 대해 다수의 적절한 얼굴 반응을 생성하는 데 도전한다.
- 개별 반응을 학습하는 대신 적절한 반응의 분포를 학습하여, 얼굴 반응 생성의 일대다 매핑 문제를 일대일 매핑 문제로 재구성한다.
- 예측된 분포에서 다양한 현실적인 얼굴 반응을 엔드 투 엔드로 학습하고 복원할 수 있도록, 새로운 가역 그래프 신경망(REGNN)을 설계한다.
- 인지 프로세서가 반응 분포를 예측하고, 운동 프로세서가 이를 복원하는 방식으로, 생성된 얼굴 반응의 현실성, 동기화성, 적절성을 향상시킨다.
- 기본 데이터셋에서 제안된 프레임워크의 효과성을 검증하여, 주요 평가 지표에서 기존 베이스라인 모델보다 뛰어난 성능을 보여준다.
제안 방법
- 프레임워크는 세 가지 모듈로 구성된다: 스피커의 오디오 및 얼굴 신호를 인코딩하는 지각 프로세서, 적절한 얼굴 반응의 분포를 예측하는 인지 프로세서, 가역 다차원 에지 그래프 신경망(REGNN) 기반의 운동 프로세서이다.
- 운동 프로세서는 예측된 분포에서 단일 얼굴 반응을 복원할 수 있도록 학습하는 새로운 가역 GNN(REGNN)을 사용하며, 이는 그래프 구조의 얼굴 데이터를 미분 가능하고 역행 가능한 방식으로 처리할 수 있도록 한다.
- 얼굴 반응 분포는 다차원 에지 특징 상에서 가우시안 믹스처 분포(GMD)로 모델링되며, 얼굴 특성 간의 임무 특화된 관계를 포괄한다.
- 인지 프로세서가 분포를 예측하고 REGNN이 이를 기반으로 반응을 복원하도록, L1 손실, 프리셰트 반응 거리(FRD), 그리고 지각 유사도를 조합한 다중 과제 손실을 사용하여 모델을 학습한다.
- REGNN은 다차원 에지 특징을 활용하여 얼굴 랜드마크 간의 복잡한 관계를 인코딩함으로써, 표현력 있고 맥락 인식 가능한 반응 생성을 가능하게 한다.
- 얼굴 특성 간 관계를 종합적으로 표현하기 위해, 다차원 에지 특징 학습(MEFL) 모듈을 신규로 도입하여 모델링 성능을 향상시킨다.

실험 결과
연구 질문
- RQ1딥러닝 프레임워크는 단일 스피커 행동에 대해 유일한 반응을 강제하는 대신, 다양한 반응을 생성할 수 있는가?
- RQ2분포 학습을 활용하여 얼굴 반응 생성의 일대다 매핑 문제를 어떻게 일대일 매핑 문제로 재구성할 수 있는가?
- RQ3가역 그래프 신경망(REGNN)은 기존의 표준 GNN에 비해 생성된 얼굴 반응의 품질과 다양성에 얼마나 기여하는가?
- RQ4에지 차원, REGNN 레이어 수, 분포 분산과 같은 다양한 하이퍼파라미터가 얼굴 반응 생성 모델의 성능에 어떤 영향을 미치는가?
- RQ5오디오 및 얼굴 신호가 적절한 얼굴 반응 분포를 예측하는 데 기여하는 정도는 어떠한가?
주요 결과
- 제안된 프레임워크는 모든 주요 평가 지표에서 네 가지 베이스라인 모델을 초월하여, 적절성(FRDvs: 0.72), 현실성(0.78), 동기화성(0.75)에서 최고 점수를 기록하며 기존 방법에 비해 뚜렷한 성능 향상을 보였다.
- 분포 분산(σ)이 0.1 이하로 설정될 경우, 적절성, 현실성, 동기화성 성능이 안정적이고 유망하게 유지되며, 최적 성능는 약 σ ≈ 0.6에서 관찰되었다.
- 에지 특징 차원 D = 6에서 모델은 최고 성능을 기록하였으며, 이 경우 FRDvs, 현실성, 동기화성 지표가 최대화되고 변동 폭이 최소화되었다.
- REGNN 레이어 수는 성능에 거의 영향을 주지 않았다: 4~10개 레이어 범위에서 CCC와 PCC의 변화가 0.02 이내였고, FRDvs와 FRDiv의 변화는 0.01 이내였으며, 이는 매우 높은 강건성을 보여준다.
- 여섯 개의 REGNN 레이어를 사용할 경우 다섯 가지 평가 지표에서 최고 성능를 기록하였고, FRDvs와 현실성에서는 두 번째로 높은 성능를 기록하여 최적의 설정임을 확인하였다.
- MEFL 모듈은 성능에 핵심적인 역할을 하며, 다차원 에지 특징을 통해 얼굴 특성 간 관계를 종합적으로 모델링함으로써 반응 품질을 크게 향상시킨다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.