[논문 리뷰] Reference-guided Face Component Editing
이 논문은 쌍방향이 아닌 참조 이미지를 사용하여 고수준 얼굴 구성 요소(예: 눈, 코, 입)를 다양하고 제어 가능하며 기하학적으로 정확하게 편집할 수 있는 참조 기반 얼굴 구성 요소 편집 프레임워크 r-FACE를 제안한다. 이미지 복원 백본과 예시 유도 주의 모듈을 활용하여 대상 구성 요소에 집중함으로써, 수동 마스크나 스케치가 필요 없이도 최신 기술 수준의 성능을 달성하며 얼굴 편집 품질과 형태 일관성을 확보한다.
Face portrait editing has achieved great progress in recent years. However, previous methods either 1) operate on pre-defined face attributes, lacking the flexibility of controlling shapes of high-level semantic facial components (e.g., eyes, nose, mouth), or 2) take manually edited mask or sketch as an intermediate representation for observable changes, but such additional input usually requires extra efforts to obtain. To break the limitations (e.g. shape, mask or sketch) of the existing methods, we propose a novel framework termed r-FACE (Reference-guided FAce Component Editing) for diverse and controllable face component editing with geometric changes. Specifically, r-FACE takes an image inpainting model as the backbone, utilizing reference images as conditions for controlling the shape of face components. In order to encourage the framework to concentrate on the target face components, an example-guided attention module is designed to fuse attention features and the target face component features extracted from the reference image. Through extensive experimental validation and comparisons, we verify the effectiveness of the proposed framework.
연구 동기 및 목표
- 사전 정의된 속성이나 수동으로 생성된 마스크 및 스케치에 의존하는 기존 얼굴 편집 방법의 한계를 해결하기 위해.
- 눈, 코, 입과 같은 고수준 얼굴 구성 요소에 대해 민첩하고 형태 제어가 가능한 편집을 가능하게 하기 위해.
- 쌍방향이 아닌 참조 이미지를 형태 가이드로 사용하여 정밀한 중간 표현(예: 마스크, 스케치)이 필요 없도록 하기 위해.
- 구성 요소 이동 중 신원 일관성, 자세, 피부 톤, 위상적 구조를 유지하기 위해.
- 데이터 증강 및 얼굴 교체와 같은 다양한 편집 응용 프로그램을 지원하는 프레임워크를 개발하기 위해.
제안 방법
- 프레임워크는 이미지 복원 모델을 백본으로 사용하며, 부분적으로 손상된 소스 이미지와 마스크를 입력으로 사용한다.
- 참조 이미지는 형태 조건으로 사용되며, 전용 임bedding 네트워크 $\mathcal{E}_r$를 통해 특징이 추출된다.
- 예시 유도 주의 모듈은 복원 네트워크와 참조 이미지의 특징를 융합하여 특히 대상 얼굴 구성 요소에 집중한다.
- 모델은 세 가지 손실 함수로 훈련된다: 문맥 손실(형태 유사성 제약), 스타일 손실(피부 톤 유지), 인지 손실(구조 일관성 유지).
- 주의 모듈은 참조 이미지에서 관련 있는 얼굴 구성 요소 영역에만 중점을 두어 특징 정렬을 향상시킨다.
- 쌍방향 이미지가 필요 없이, 다른 신원의 어떤 참조 이미지도 사용하여 편집이 가능하다.
실험 결과
연구 질문
- RQ1정밀한 마스크나 스케치를 중간 가이드로 요구하지 않고도 얼굴 구성 요소 편집을 달성할 수 있는가?
- RQ2딥 러닝 모델은 참조 이미지에서 소스 이미지로 얼굴 구성 요소의 기하학적 형태를 효과적으로 전달할 수 있는가?
- RQ3주목적 메커니즘이 이미지 생성 중 특정 얼굴 구성 요소에 집중하는 데 얼마나 기여하는가?
- RQ4얼굴 구성 요소의 큰 기하학적 변화를 가능하게 하면서도 신원 일관성을 유지하는 데 가장 효과적인 손실 함수는 무엇인가?
- RQ5자신의 자세와 표정이 다양한 신원 간에 일반화가 가능한가?
주요 결과
- 제안된 r-FACE 프레임워크는 CelebA-HQ 데이터셋에서 최신 기술 수준의 성능을 달성하였으며, Fréchet Inception Distance (FID)는 8.49, MS-SSIM는 0.89를 기록하였다.
- 제거 실험 결과, 예시 유도 주의 모듈이 성능 향상에 크게 기여하며, 이는 FID와 MS-SSIM 모두에서 기본 모델보다 뛰어난 성능을 보였다.
- 문맥 손실을 제거할 경우 성능이 가장 열 劣해졌으며, 이는 참조 이미지와의 형태 일관성을 강제하는 데 핵심적인 역할을 함을 시사한다.
- 스타일 손실과 인지 손실은 피부 색상과 구조적 세부 사항을 유지하는 데 필수적이며, 이들의 부재는 색상 왜곡과 가시성 없는 잔상 아티팩트를 유발한다.
- 시각적 비교 결과 r-FACE는 참조 이미지에서 복잡한 형태(예: 눈과 코 윤곽)를 성공적으로 전달하면서도 현실적인 외관과 신원 일관성을 유지함을 보였다.
- 단지 참조 이미지를 변경하기만 하여도 다양한 편집 결과를 도출할 수 있어, 쌍방향 데이터나 수동 애너테이션 없이도 높은 제어성과 유연성을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.