[논문 리뷰] AOT: Appearance Optimal Transport Based Identity Swapping for Forgery Detection
이 논문은 잠재공간과 픽셀 공간에서의 최적 운반 문제로 표현 맵핑을 공식화함으로써, 극한의 외형 차이를 가진 현실적인 딥페이크를 생성할 수 있는 새로운 신원 교환 방법인 Appearance Optimal Transport(AOT)을 제안한다. 특징 공간과 픽셀 공간에서 워셔스타인 거리의 최소화를 위해 리라이팅 생성기와 세그멘테이션 게임을 활용함으로써, AOT는 기존 최첨단 방법들에 비해 뛰어난 현실성과 강건성을 확보하며, 다양한 외형 조건에서 위조 탐지의 일반화 성능을 크게 향상시킨다.
Recent studies have shown that the performance of forgery detection can be improved with diverse and challenging Deepfakes datasets. However, due to the lack of Deepfakes datasets with large variance in appearance, which can be hardly produced by recent identity swapping methods, the detection algorithm may fail in this situation. In this work, we provide a new identity swapping algorithm with large differences in appearance for face forgery detection. The appearance gaps mainly arise from the large discrepancies in illuminations and skin colors that widely exist in real-world scenarios. However, due to the difficulties of modeling the complex appearance mapping, it is challenging to transfer fine-grained appearances adaptively while preserving identity traits. This paper formulates appearance mapping as an optimal transport problem and proposes an Appearance Optimal Transport model (AOT) to formulate it in both latent and pixel space. Specifically, a relighting generator is designed to simulate the optimal transport plan. It is solved via minimizing the Wasserstein distance of the learned features in the latent space, enabling better performance and less computation than conventional optimization. To further refine the solution of the optimal transport plan, we develop a segmentation game to minimize the Wasserstein distance in the pixel space. A discriminator is introduced to distinguish the fake parts from a mix of real and fake image patches. Extensive experiments reveal that the superiority of our method when compared with state-of-the-art methods and the ability of our generated data to improve the performance of face forgery detection.
연구 동기 및 목표
- 어려운 조명 조건과 피부 색상의 불일치가 동반된, 높은 외형 변동성을 가지는 딥페이크 데이터셋의 부족을 해결하기 위해.
- 극단적인 외형 차이를 가진 다양한 현실적인 딥페이크를 생성함으로써, 얼굴 위조 탐지 모델의 강건성을 향상시키기 위해.
- 기존 최적 운반 기법이 신원 교환에 있어 가지는 한계, 즉 비연속적 합성, 높은 계산 비용, 낮은 기하학적 보존 능력을 극복하기 위해.
- 세부적인 외형 전달을 위한 최적 운반과 딥 생성 모델링을 통합하는 확장 가능하고 미분 가능한 프레임워크를 개발하기 위해.
- 기존 신원 교환 파이프라인과 호환되는 플러그인 솔루션을 제공하여, 복잡한 외형 조건 하에서도 성능을 향상시키기 위해.
제안 방법
- 복잡한 외형 변환을 모델링하기 위해, 잠재공간과 픽셀 공간에서 모두 표현 맵핑을 최적 운반 문제로 공식화한다.
- 신원 유지 특징 학습을 안내하기 위해 3차원 얼굴 기하학 및 조명 정보를 포함한 이중 경로 인식기 인코더를 도입한다.
- 잠재공간에서 워셔스타인 거리의 최소화를 통해 효율적이고 연속적인 합성을 가능하게 하는 신경 최적 운반 계획 추정(NOTPE)을 제안한다.
- 특징를 픽셀 공간으로 디코딩하고, 세그멘테이션 게임을 통해 표현 전달을 정밀하게 보정하기 위해 리라이팅 생성기를 활용한다.
- 실제와 위조 이미지 패치를 구분할 수 있도록 세그멘테이션 게임에 디스criminator를 통합하여, 생성기가 더 현실적인 출력을 내도록 유도한다.
- 실제와 위조 이미지 패치의 혼합을 사용하여 디스criminator를 훈련시켜, 생성기가 목표 외형과 일치하는 사진 수준의 현실성 있는 결과를 생성하도록 유도한다.
실험 결과
연구 질문
- RQ1피부 톤과 조명 조건의 다양성과 같은 극단적인 외형 차이가 있는 신원 교환에 최적 운반을 효과적으로 적용할 수 있는가?
- RQ2기존 최적 운반의 계산 부담을 줄이면서도 신원과 구조적 무결성을 유지할 수 있는가?
- RQ3잠재공간과 픽셀 공간에서의 동시 최적화는 단일 공간 기반 접근법에 비해 생성된 딥페이크의 현실성과 연속성에 있어 향상되는가?
- RQ4제안된 방법이 예상치 못한 외형 변동에 대해 얼굴 위조 탐지 모델의 일반화 성능을 어느 정도 향상시키는가?
- RQ5AOT 프레임워크는 기존 신원 교환 파이프라인에 원활하게 통합되어 성능을 향상시킬 수 있는가?
주요 결과
- AOT는 피부 톤 불일치 및 조명 조건의 극단적인 차이가 있는 상황에서도 최첨단 신원 교환 방법들에 비해 뛰어난 성능을 보이며 현실적인 얼굴 교환을 생성한다.
- 딥페이드랩 및 기존 최적 운반 기법에 비해 더 낮은 잡음과 더 일관된 피부 톤을 보이며, 더 높은 시각적 품질을 달성한다.
- 잠재공간과 픽셀 공간에서 워셔스타인 거리 최소화를 통해 더 부드럽고 연속적인 표현 전달이 가능해졌으며, 계산 비용도 감소했다.
- 적대적 훈련을 통한 세그멘테이션 게임은 픽셀 수준의 현실성을 효과적으로 향상시켜, 생성된 이미지를 실제 이미지와 구분하기 어려운 수준으로 만들었다.
- 생성된 딥페이크 데이터는 후속 얼굴 위조 탐지 모델의 강건성을 향상시키며, 특히 예측 불가능한 외형 분포에 대해서도 효과적이다.
- AOT는 기존 신원 교환 프레임워크와 호환되며, 복잡한 외형 조건 하에서도 성능을 향상시킬 수 있는 플러그인 솔루션으로 활용 가능하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.