[논문 리뷰] Face Aging via Diffusion-based Editing
이 논문은 대규모 언어-이미지 확산 모델을 활용하여 현실적인 연령 변환을 생성하는, 얼굴 노화에 대한 확산 기반 방법인 FADING을 제안한다. 사전 훈련된 확산 모델을 연령 인식 테이닝을 통해 특화하고, 입력 이미지를 잠재 노이즈로 역행성 변환하며, 이중 프롬프트를 사용한 텍스트 유도 주의 제어를 적용함으로써, 다양한 연령 범위와 도전적인 조건에서 뛰어난 연령 정확도, 특성 유지 능력, 이미지 품질을 달성한다.
In this paper, we address the problem of face aging: generating past or future facial images by incorporating age-related changes to the given face. Previous aging methods rely solely on human facial image datasets and are thus constrained by their inherent scale and bias. This restricts their application to a limited generatable age range and the inability to handle large age gaps. We propose FADING, a novel approach to address Face Aging via DIffusion-based editiNG. We go beyond existing methods by leveraging the rich prior of large-scale language-image diffusion models. First, we specialize a pre-trained diffusion model for the task of face age editing by using an age-aware fine-tuning scheme. Next, we invert the input image to latent noise and obtain optimized null text embeddings. Finally, we perform text-guided local age editing via attention control. The quantitative and qualitative analyses demonstrate that our method outperforms existing approaches with respect to aging accuracy, attribute preservation, and aging quality.
연구 동기 및 목표
- 기존의 제한된 얼굴 데이터셋에 의존하는 얼굴 노화 방법의 한계를 해결하기 위해.
- 더 강력하고 일반화 가능한 얼굴 노화를 위해 대규모 텍스트-이미지 확산 모델의 풍부한 의미적 및 시각적 사전 지식을 활용하기 위해.
- 크고 도전적인 조건(예: 가림, 극단적인 자세)에서도 정확한 연령 변화를 가능하게 하기 위해.
- 성별, 표정과 같은 신원 유지 특성과 연령 관련 특성을 분리하기 위해.
- 최신 기술인 GAN 기반 접근법보다 노화 품질, 현실성, 특성 충실도 측면에서 뛰어난 성능을 내는 방법을 개발하기 위해.
제안 방법
- 성별, 신원 등 연령과 무관한 특성과의 분리를 위해 사전 훈련된 확산 모델을 연령 인식 테이닝을 통해 특화한다.
- 구조적 세부 정보를 유지하기 위해 잘 선택된 역행성 기법을 사용해 입력 얼굴 이미지를 잠재 노이즈로 변환한다.
- 편집을 안내하기 위해 역행성 잠재 표현에서 최적화된 빈도 없는 텍스트 임베딩을 생성한다.
- 이중 프롬프트 기반의 주의 제어를 통해 국소적 노화 편집을 수행한다: 하나는 원본 연령을, 다른 하나는 목표 연령을 지정한다.
- 예: '여성', '웃는'과 같은 의미적 특성 포함된 향상된 프롬프트를 사용해 주의 타겟팅과 특성 유지 능력을 향상시킨다.
- 모델의 이탈을 방지하고 의미 있는 연령 진행을 보장하기 위해 편집 프롬프트에 초기 연령 추정치를 가이드로 사용한다.

실험 결과
연구 질문
- RQ1대규모 텍스트-이미지 확산 모델은 일반적인 이미지 편집을 넘어서 얼굴 노화 작업에 효과적으로 특화될 수 있는가?
- RQ2연령 인식 테이닝은 성별, 표정과 같은 신원과 무관한 특성과의 분리에 어떻게 기여하는가?
- RQ3주의 제어를 갖춘 이중 프롬프트 편집 기법은 노화 정확도와 구조적 충실도에 어느 정도 향상시키는가?
- RQ4의미적 특성을 포함한 향상된 프롬프트는 특성 유지 능력과 노화의 현실성 향상에 기여하는가?
- RQ5편집 프롬프트에 초깃값 연령 정보를 포함시키면 모델이 의미 있는 연령 변화를 생성하는 데 어떤 영향을 미치는가?
주요 결과
- 비교 방법들 중에서 가장 낮은 프레셰 인셉션 거리(FID) 및 KID 점수(0.660 × 100)를 기록하여 뛰어난 이미지 품질과 분포 유사도를 입증한다.
- 연령 예측 오차(MAE)를 9.162년으로 줄여, 훈련이 없는 기반 모델(9.830)과 단일 프롬프트 변종(8.781)을 모두 초월하여 노화 정확도 향상을 입증한다.
- 특성 유지 능력이 크게 향상되었으며, 성별 일관성은 84.10%에 도달하여 훈련이 없는 기반 모델(79.90%)과 단일 프롬프트 변종(81.95%)을 뛰어넘었다.
- 이중 프롬프트 기법은 블러를 줄이고 구조적 일치도 향상시켰으며, 두 프롬프트를 모두 사용할 경우 KID 점수가 0.707에서 0.660으로 감소했다.
- 제거 실험 결과, 향상된 프롬프트와 초깃값 연령 가이드가 핵심임을 확인: 이들을 제거하면 MAE는 4.543 증가하고 KID는 0.504 증가하여 성능 저하가 발생했다.
- 정성적 결과에서 잡음과 아티팩트가 최소화되었으며, 특히 입술과 얼굴 윤곽 등 도전적인 영역에서 현실감이 향상되었고, 큰 연령 격차 조건에서도 유사하게 유지되었다.
![Figure 2 : Qualitative comparison with state-of-the-art methods on CelebA-HQ. Images for the other approaches are extracted from [ Gomez-Trenado et al.(2022)Gomez-Trenado, Lathuilière, Mesejo, and Cordón ] .](https://ar5iv.labs.arxiv.org/html/2309.11321/assets/images/celebA_all.png)
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.