Skip to main content
QUICK REVIEW

[논문 리뷰] ChatFace: Chat-Guided Real Face Editing via Diffusion Latent Space Manipulation

Dongxu Yue, Qin Guo|arXiv (Cornell University)|2023. 05. 24.
Face recognition and analysis인용 수 4
한 줄 요약

ChatFace는 확산 모델의 의미 잠재 공간을 활용하여 대화형으로 고품질의 제로샷 편집을 가능하게 하는 새로운 시스템을 소개한다. 이는 대규모 언어 모델(Large Language Models, LLMs)과 안정적 편집 전략(Stable Manipulation Strategy, SMS)에 의해 유도되며, 정밀하고 신원을 유지하는 편집을 보장한다. 다양한 얼굴 특성에서 정량적 지표와 인간 평가 모두에서 이전 방법들을 능가한다.

ABSTRACT

Editing real facial images is a crucial task in computer vision with significant demand in various real-world applications. While GAN-based methods have showed potential in manipulating images especially when combined with CLIP, these methods are limited in their ability to reconstruct real images due to challenging GAN inversion capability. Despite the successful image reconstruction achieved by diffusion-based methods, there are still challenges in effectively manipulating fine-gained facial attributes with textual instructions.To address these issues and facilitate convenient manipulation of real facial images, we propose a novel approach that conduct text-driven image editing in the semantic latent space of diffusion model. By aligning the temporal feature of the diffusion model with the semantic condition at generative process, we introduce a stable manipulation strategy, which perform precise zero-shot manipulation effectively. Furthermore, we develop an interactive system named ChatFace, which combines the zero-shot reasoning ability of large language models to perform efficient manipulations in diffusion semantic latent space. This system enables users to perform complex multi-attribute manipulations through dialogue, opening up new possibilities for interactive image editing. Extensive experiments confirmed that our approach outperforms previous methods and enables precise editing of real facial images, making it a promising candidate for real-world applications. Project page: https://dongxuyue.github.io/chatface/

연구 동기 및 목표

  • GAN 기반 방법이 GAN 역전환의 불안정성으로 인해 실사 얼굴 이미지의 재구성과 편집에 한계를 가진다는 점을 해결하기 위해.
  • 확산 기반 방법에서 사전 정의된 편집 방향에 국한되는 제약을 극복하기 위해, 임의의 텍스트 기반 얼굴 특성 조작을 가능하게 하기 위해.
  • 자연어 질의를 해석하고 실사 얼굴에 대해 복잡한 다중 특성 편집을 수행할 수 있는 대화형이고 사용자 친화적인 시스템을 개발하기 위해.
  • 생성 과정에서 시간적 특징을 의미 조건과 정렬시켜 안정적이고 의미적으로 일관된 편집을 보장하기 위해.
  • 세분화된 실세계 얼굴 편집을 위해 LLM과 확산 모델의 의미론을 융합한 가능성을 입증하고 우수성을 입증하기 위해.

제안 방법

  • 고품질 재구성을 가능하게 하기 위해 실사 얼굴 이미지를 의미 잠재 코드로 변환하기 위해 사전 학습된 확산 오토인코더(Diffusion Autoencoder, DAE)를 사용한다.
  • 텍스트 프롬프트를 확산 모델의 의미 공간 내 목표 잠재 코드로 변환하기 위해 학습된 매핑 네트워크를 활용한다.
  • 각 노이즈 제거 단계에서 확산 모델의 시간적 특징을 의미 조건과 정렬함으로써 안정적이고 일관된 편집을 보장하는 안정적 편집 전략(Stable Manipulation Strategy, SMS)을 도입한다.
  • 복잡한 자연어 편집 질의를 해석하고 사용자 의도를 추출하기 위해 대규모 언어 모델(Large Language Model, LLM)을 활용하여 편집 방향의 동적 활성화를 수행한다.
  • 원본 코드와 목표 코드 사이의 의미 잠재 공간에서 선형 보간을 수행하여 신원 이탈을 최소화한 편집 이미지를 생성한다.
  • CLIP 기반 지표(S_dir, SC, ID)와 인간 평가를 활용하여 편집의 안정성과 현실감을 최적화하고 검증한다.

실험 결과

연구 질문

  • RQ1LLM 유도 텍스트 프롬프트가 GAN 역전환에 의존하지 않고도 실사 얼굴 이미지의 정밀한 제로샷 편집을 가능하게 할 수 있는가?
  • RQ2확산 모델의 의미 잠재 공간을 어떻게 안정적으로 조작하여 특정 얼굴 특성을 변경하면서도 신원을 유지할 수 있는가?
  • RQ3LLM과 확산 모델을 융합한 다중 모odal 시스템이 기존 방법에 비해 복잡한 다중 특성 얼굴 편집에서 뛰어난 성능을 달성할 수 있는가?
  • RQ4안정적 편집 전략(SMS)이 저수준 의미적 세부 정보를 유지하고 과도한 편집 또는 신원 붕괴를 방지하는 데 미치는 영향은 무엇인가?
  • RQ5다양한 사용자 질의에 대응하는 실세계 대화형 편집 시나리오에서 시스템의 성능은 어떠한가?

주요 결과

  • ChatFace는 CelebA-HQ에서 방향성 CLIP 유사도(S_dir) 0.21을 기록하여, StyleCLIP(0.13), Stylegan-NADA(0.16), DiffusionCLIP(0.18)를 포함한 모든 베이스라인을 능가한다.
  • 이 방법은 89.7%의 세그멘테이션 일관성(SC)과 0.84의 얼굴 신원 유사도(ID)를 기록하여 의미 구조와 신원 유지 능력이 뛰어나다는 것을 시사한다.
  • 인간 평가에서 ChatFace는 미소(90.3%), 굵은 머리카락(82.7%), 메이크업(90.4%), 안경(94.2%) 각각 높은 점수를 기록하였으며, 모든 특성에서 다른 방법들보다 뚜렷하게 뛰어난 성능을 보였다.
  • 제거 실험을 통해 SMS가 필수적임을 확인: SMS 없이 편집 시, 립스틱이 입을 초과해 분홍색으로 번지거나 저수준 이미지 세부 정보가 뚜렷하게 손상되는 현상이 발생했다.
  • 시스템은 지속적인 편집 기능을 보이며, 자연어 대화를 통해 순차적이고 복잡한 편집을 수행할 수 있다.
  • LLM 통합을 통해 사용자 의도 이해와 편집 방향의 동적 활성화가 효과적으로 이루어져 사용성과 유연성이 향상되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.