Skip to main content
QUICK REVIEW

[논문 리뷰] Generate Anything Anywhere in Any Scene

Yuheng Li, Haotian Liu|arXiv (Cornell University)|2023. 06. 29.
Generative Adversarial Networks and Image Synthesis인용 수 4
한 줄 요약

PACGen은 개인화된 객체 생성의 고해상도 재현성과 정밀한 위치 제어를 동시에 달성하기 위해 미세조정 중 데이터 증강을 통해 객체 정체성과 공간적 특성을 분리하는 새로운 텍스트-이미지 확산 모델을 소개한다. 추론 시 GLIGEN의 어댑터 레이어를 통합하고 지역 기반 샘플링 전략을 활용함으로써, 기존 방법에 비해 훨씬 뛰어난 이미지 품질과 제어 가능성으로 다양한 시나리오에서 원하는 위치와 크기로 개인화된 객체를 생성할 수 있다.

ABSTRACT

Text-to-image diffusion models have attracted considerable interest due to their wide applicability across diverse fields. However, challenges persist in creating controllable models for personalized object generation. In this paper, we first identify the entanglement issues in existing personalized generative models, and then propose a straightforward and efficient data augmentation training strategy that guides the diffusion model to focus solely on object identity. By inserting the plug-and-play adapter layers from a pre-trained controllable diffusion model, our model obtains the ability to control the location and size of each generated personalized object. During inference, we propose a regionally-guided sampling technique to maintain the quality and fidelity of the generated images. Our method achieves comparable or superior fidelity for personalized objects, yielding a robust, versatile, and controllable text-to-image diffusion model that is capable of generating realistic and personalized images. Our approach demonstrates significant potential for various applications, such as those in art, entertainment, and advertising design.

연구 동기 및 목표

  • 개인화된 텍스트-이미지 확산 모델에서 객체 정체성이 위치와 크기와 뒤섞이는 문제를 해결하기 위해.
  • 생성된 시나리오에서 개인화된 객체의 위치와 크기에 대해 세밀한 제어를 가능하게 하기 위해.
  • 개인화와 위치 제어의 가능성을 유지하면서도 높은 이미지 품질을 유지도하기 위해.
  • 개인화 후 위치 제어를 위해 추가적인 미세조정이 필요하지 않은 방법을 개발하기 위해.
  • 학습 중 데이터 증강으로 인해 발생하는 잡음 효과(예: 콜라주 효과)를 완화하기 위해.

제안 방법

  • DreamBooth 방식의 미세조정 중 사용자가 제공한 이미지에 대해 임의의 크기 조정과 재배치를 적용하여 객체 정체성과 공간적 특성을 분리한다.
  • 추론 시 사전 학습된 GLIGEN 어댑터 레이어를 미세조정된 확산 모델에 통합하여 위치와 크기 제어를 가능하게 한다.
  • 부정적 프롬프트, 다양성 프롬프트, 억제 프롬프트의 세 가지 전용 프롬프트를 사용하는 지역 기반 샘플링 전략을 적용한다.
  • 이미지 품질과 레이아웃 정확도의 균형을 위해 스케일 5의 분류기 기반 가이던싱과 스케줄링 샘플링(τ = 0.3)을 활용한다.
  • CLIP 특징를 사용해 콜라주 분류기를 학습하여 데이터 증강으로 인한 잡음 유발 정도를 정량적으로 평가하고 아블레이션 분석을 수행한다.
  • 배치 크기 2로 Stable Diffusion v1.4를 1000 반복 동안 미세조정하며, 임의의 크기 조정 스케일 s = 0.3을 사용한다.

실험 결과

연구 질문

  • RQ1미세조정 중 데이터 증강이 개인화된 확산 모델에서 객체 정체성과 공간적 특성을 효과적으로 분리하는 데 기여하는가?
  • RQ2GLIGEN 어댑터 통합으로 재학습 없이도 위치 제어가 가능한가?
  • RQ3지역 기반 샘플링 전략은 이미지 품질 향상과 콜라주 효과 같은 잡음 감소에 어떤 영향을 미치는가?
  • RQ4다중 개념 개인화가 특성 일관성과 생성 품질에 어떤 영향을 미치는가?
  • RQ5지역 기반 샘플링 프롬프트의 개별 구성 요소가 전체 성능에 기여하는 정도는 어떠한가?

주요 결과

  • 제안된 데이터 증강 전략은 생성된 이미지 간 LPIPS 거리(0.6583 → 0.5489)를 감소시켜 정체성 분리로 인한 일관성 향상과 다양성 감소를 나타낸다.
  • 아블레이션 연구 결과, 세 가지 지역 기반 프롬프트 중 어느 하나라도 제거할 경우 심각한 잡음이 발생한다: 부정적 프롬프트가 없을 경우 특히 작은 객체에서 콜라주 효과가 나타난다.
  • 억제 프롬프트가 없을 경우 모델은 잘못된 위치에 불필요한 중복 인스턴스를 생성하여 레이아웃 품질 유지 기능을 확인할 수 있다.
  • 정성적 결과에서는 PACGen이 복잡한 시나리오에서도 고해상도로 개인화된 객체를 임의의 위치에 정확히 배치하는 데 성공했다.
  • 모델은 다중 객체 조합, 예술 스타일 전이, 특성 편집 등 다양한 응용 분야를 지원하면서도 위치 제어 기능을 유지한다.
  • 추론 시간은 A6000 GPU에서 이미지당 5초에서 8초로 증가하지만, 이는 모델의 강건성과 제어 가능성으로 상쇄된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.