[논문 리뷰] Optimal Transport-based Identity Matching for Identity-invariant Facial Expression Recognition
이 논문은 최적화 운반을 사용하여 서로 다른 신원 간 유사한 표정을 매칭함으로써 신원 이동에 강인한 표현 인식 프레임워크인 ELIM을 제안한다. 이를 통해 모델은 신원 이동에 강인한 표현을 학습할 수 있다. 상호 신원 간 표정 유사도를 운반 비용으로 설정하고 Sinkhorn-Knopp 반복을 통해 이를 해결함으로써, 최첨단 방법에 비해 야생 데이터셋에서 PCC/CCC 성능을 최대 10% 향상시킨다.
Identity-invariant facial expression recognition (FER) has been one of the challenging computer vision tasks. Since conventional FER schemes do not explicitly address the inter-identity variation of facial expressions, their neural network models still operate depending on facial identity. This paper proposes to quantify the inter-identity variation by utilizing pairs of similar expressions explored through a specific matching process. We formulate the identity matching process as an Optimal Transport (OT) problem. Specifically, to find pairs of similar expressions from different identities, we define the inter-feature similarity as a transportation cost. Then, optimal identity matching to find the optimal flow with minimum transportation cost is performed by Sinkhorn-Knopp iteration. The proposed matching method is not only easy to plug in to other models, but also requires only acceptable computational overhead. Extensive simulations prove that the proposed FER method improves the PCC/CCC performance by up to 10\% or more compared to the runner-up on wild datasets. The source code and software demo are available at https://github.com/kdhht2334/ELIM_FER.
연구 동기 및 목표
- 표현 스타일의 상호 신원 간 변동으로 인한 신원 의존적 성능 저하 문제를 해결하기 위해.
- 신원 이동을 명시적으로 모델링하고 보완함으로써, 미리 보지 않은 신원으로의 일반화를 향상시키기 위해.
- 최적화 운반 기반 매칭을 통해 신원 간 상대적 표현 차이를 학습함으로써 신원에 강인한 FER를 가능하게 하기 위해.
- 불일치하는 표현 레이블 쌍이 존재하는 경우에도 VA(Valence-Arousal) FER 성능을 향상시키기 위해.
제안 방법
- 상호 신원 간 유사도를 운반 비용으로 간주하는 최적화 운반(OT) 문제로 신원 매칭을 공식화한다.
- 최소 비용을 갖는 최적의 운반 계획을 도출하기 위해 Sinkhorn-Knopp 반복을 사용하여 서로 다른 신원 간 유사한 표현 쌍을 식별한다.
- 매칭된 신원 쌍에서 ID 이동 벡터를 계산하여 신원별로 표현 변동을 정량화하고 모델링한다.
- 최적 운반 흐름에서 유도된 관련성 가중치를 손실 함수에 통합하여 학습 중 위험 최소화를 이끌어내는 데 활용한다.
- 주 FER 손실, PCC/CCC 손실, VA 회귀 손실을 조합한 다중 작업 학습 목표를 도입하여 일반화 성능을 향상시킨다.
- 이미 존재하는 FER 모델과 즉각 통합 가능한 플러그 앤 플레이 아키텍처로 구현되며, 중간 정도의 계산 오버헤드만 수반한다.
실험 결과
연구 질문
- RQ1최적화 운반을 사용하여 서로 다른 신원 간 유사한 표정 쌍을 효과적으로 식별함으로써 신원에 강인한 FER 성능을 향상시킬 수 있는가?
- RQ2최적화 운반을 통해 상호 신원 간 표현 이동을 모델링할 경우, 야생의, 분포가 다른 데이터셋에서의 성능 향상 정도는 어떠한가?
- RQ3미리 보지 않은 신원에서 테스트할 경우, 성능 저하가 어느 정도 감소하는가?
- RQ4학습에 사용된 신원 수가 신원 매칭 메커니즘의 성능에 어떤 영향을 미치는가?
주요 결과
- ELIM은 야생 데이터셋에서 런업 메서드에 비해 PCC 및 CCC 성능을 최대 10% 향상시켜 최첨단 성능을 입증한다.
- 불일치하는 표현-레이블 쌍이 존재하는 샘플에서도 높은 정확도를 유지하여 표현 스타일의 변동성에 강건함을 보여준다.
- 학습에 사용된 신원 수가 증가할수록 성능이 점진적으로 향상되며, 효과적인 매칭을 위해 충분한 신원 다양성이 중요함을 확인한다.
- t-SNE를 활용한 시각화 결과, ID 이동 벡터가 상호 신원 간 표현 차이를 효과적으로 포착함을 확인하여 메서드의 핵심 가정을 검증한다.
- 제거 실험 결과, VA 손실을 제거할 경우 성능 저하가 발생함을 확인하여 표현 연속성에 대한 공동 최적화의 중요성을 입증한다.
- 모든 신원 간 표현 밸런스 기호가 서로 반대인 희귀 케이스에도 불구하고 반복적 학습이 이러한 극단 케이스를 완화함으로써 메서드의 강건성을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.