Skip to main content
QUICK REVIEW

[논문 리뷰] DreamIdentity: Improved Editability for Efficient Face-identity Preserved Image Generation

Zhuowei Chen, Shancheng Fang|arXiv (Cornell University)|2023. 07. 01.
Generative Adversarial Networks and Image Synthesis인용 수 4
한 줄 요약

DreamIdentity는 다중 척도, 얼굴 전용 특징과 다중 단어 임베딩을 사용하여 신원 표현을 향상시키는 M² ID 인코더를 도입함으로써 최적화 없이도 효율적인 얼굴 신원 유지 이미지 생성을 위한 방법을 제안한다. 또한 T2I 모델을 활용해 쌍체의 편집 데이터를 자가 증강하여 편집 가능성을 향상시키며, 테스트 시 최적화 없이도 고도로 신원을 유지하고 유연한 텍스트 유도 편집이 가능한 성능을 달성한다.

ABSTRACT

While large-scale pre-trained text-to-image models can synthesize diverse and high-quality human-centric images, an intractable problem is how to preserve the face identity for conditioned face images. Existing methods either require time-consuming optimization for each face-identity or learning an efficient encoder at the cost of harming the editability of models. In this work, we present an optimization-free method for each face identity, meanwhile keeping the editability for text-to-image models. Specifically, we propose a novel face-identity encoder to learn an accurate representation of human faces, which applies multi-scale face features followed by a multi-embedding projector to directly generate the pseudo words in the text embedding space. Besides, we propose self-augmented editability learning to enhance the editability of models, which is achieved by constructing paired generated face and edited face images using celebrity names, aiming at transferring mature ability of off-the-shelf text-to-image models in celebrity faces to unseen faces. Extensive experiments show that our methods can generate identity-preserved images under different scenes at a much faster speed.

연구 동기 및 목표

  • 개별 신원 최적화가 필요 없이 텍스트에서 이미지 생성 시 얼굴 신원을 유지하는 데 도전한다.
  • 기존 최적화 없이도 신원 유지와 모델의 편집 가능성 사이의 상충 관계를 극복한다.
  • 일반적인 인코더(예: CLIP)를 대체하여 얼굴 전용의 다중 척도 특징 인코더를 도입함으로써 신원 표현을 향상시킨다.
  • 학습과 추론 목표를 일치시켜 편집 작업을 학습 단계에 통합함으로써 편집 가능성을 유지한다.
  • 단일 입력 얼굴 이미지로 다양한 장면에서 일관된 신원 유지가 가능한 다양한 이미지를 실시간으로 효율적으로 생성할 수 있도록 한다.

제안 방법

  • 비전 트랜스포머 기반의 M² ID 인코더를 제안하여 얼굴 이미지에서 다중 척도 특징을 처리하고, 이를 텍스트 임베딩 공간 내 다중 단어 임베딩으로 투영한다.
  • 다중 임베딩 프로젝터를 사용하여 단일 임베딩보다 더 나은 신원 특징을 포착하는 다수의 가짜 단어를 생성한다.
  • 사전 학습된 T2I 모델을 활용해 쌍체의 이미지를 생성함으로써 자가 증강된 편집 가능성 학습을 도입한다: 원본 유명인 얼굴 이미지와 자연어 프롬프트를 사용해 편집된 버전(예: '경찰로')을 생성한다.
  • 실제 얼굴 복원 데이터(FFHQ에서 취득)와 자가 증강된 편집 쌍 데이터를 결합한 데이터셋으로 M² ID 인코더를 훈련시켜 신원 유지성과 편집 가능성 양쪽을 향상시킨다.
  • 각 신원에 대한 최적화를 방지함으로써 추론 효율성을 유지하며, 입력 얼굴 이미지당 한 번의 전방 전파만으로도 처리한다.
  • ControlNet과 통합하여 공간적 제어를 가능하게 하며, 시선 유도 레이아웃 제어를 통해 신원 유지 장면 전환을 가능하게 한다.

실험 결과

연구 질문

  • RQ1경량이며 최적화가 없는 인코더가 CLIP 기반 기준보다 뛰어난 신원 유지 성능을 달성할 수 있는가?
  • RQ2자기 증강된 편집 가능성 학습이 다양한 텍스트 프롬프트를 따르는 능력과 함께 신원 유지 능력을 향상시키는가?
  • RQ3다중 척도 특징 추출과 다중 단어 임베딩 투영이 신원 표현 정확도에 어떤 영향을 미치는가?
  • RQ4신원 유지와 텍스트 정렬의 균형을 고려할 때 최적의 단어 임베딩 수는 얼마인가?
  • RQ5모델이 미세조정 없이도 새로운 신원과 복잡한 편집 시나리오에 일반화 가능한가?

주요 결과

  • M² ID 인코더는 다중 척도, 얼굴 인식 특징을 활용함으로써 신원 유지 성능을 CLIP 기준 0.266에서 0.412로 향상시켰다.
  • 두 개의 단어 임베딩을 사용할 경우 단일 임베딩 대비 얼굴 유사도가 12% 향상되었고, 텍스트 정렬도 0.4% 감소에 그쳐, 더 많은 임베딩은 편집 가능성을 떨어뜨린다.
  • 자기 증강된 편집 가능성 학습은 편집 능력을 크게 향상시켰다: 이 학습 없이 훈련된 모델은 '경찰로'와 같은 정확한 편집을 생성하지 못했다.
  • 실제 복원 데이터(FFHQ)와 자기 증강된 편집 데이터를 결합하면, 각각을 별도로 사용하는 것보다 더 높은 얼굴 유사도와 프롬프트 준수도 달성한다.
  • 이 방법은 테스트 시 최적화 없이도 단일 전방 전파로 고품질의 신원 유지 이미지 생성이 가능하다.
  • 정성적 결과에서는 의복, 자세, 배경의 변화가 있는 다양한 장면과 편집 프롬프트에서도 일관된 신원 유지가 관찰되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.