[논문 리뷰] SingleInsert: Inserting New Concepts from a Single Image into Text-to-Image Models for Flexible Editing
SingleInsert는 고도로 정밀한 시각적 충실도와 영구적인 편집 유연성을 갖춘 단일 이미지에서 새로운 개념을 텍스트-이미지 확산 모델에 삽입하기 위한 이중 단계 방법을 제안한다. 전경 인식 역전환, 배경 분리, 언어 이탈을 방지하기 위한 의미론적 손실을 통해, 공동 학습 없이도 정확한 개념 편집, 새로운 시점 합성, 다중 개념 조합이 가능하다.
Recent progress in text-to-image (T2I) models enables high-quality image generation with flexible textual control. To utilize the abundant visual priors in the off-the-shelf T2I models, a series of methods try to invert an image to proper embedding that aligns with the semantic space of the T2I model. However, these image-to-text (I2T) inversion methods typically need multiple source images containing the same concept or struggle with the imbalance between editing flexibility and visual fidelity. In this work, we point out that the critical problem lies in the foreground-background entanglement when learning an intended concept, and propose a simple and effective baseline for single-image I2T inversion, named SingleInsert. SingleInsert adopts a two-stage scheme. In the first stage, we regulate the learned embedding to concentrate on the foreground area without being associated with the irrelevant background. In the second stage, we finetune the T2I model for better visual resemblance and devise a semantic loss to prevent the language drift problem. With the proposed techniques, SingleInsert excels in single concept generation with high visual fidelity while allowing flexible editing. Additionally, SingleInsert can perform single-image novel view synthesis and multiple concepts composition without requiring joint training. To facilitate evaluation, we design an editing prompt list and introduce a metric named Editing Success Rate (ESR) for quantitative assessment of editing flexibility. Our project page is: https://jarrentwu1031.github.io/SingleInsert-web/
연구 동기 및 목표
- 사전 훈련된 텍스트-이미지 모델에 단일 이미지에서 새로운 개념을 삽입할 때 발생하는 과적합과 낮은 편집 가능성 문제를 해결한다.
- 학습된 임베딩에서 전경과 배경이 얽히는 문제를 해결하여 편집의 유연성과 시각적 충실도를 향상시킨다.
- 세분화 훈련 중 언어 이탈을 방지하여 클래스 임베딩이 원본 이미지 쪽으로 이동하는 것을 막고 일반화 능력을 유지한다.
- 공동 학습 없이도 독립적으로 학습된 임베딩을 기반으로 새로운 시점 합성과 다중 개념 조합을 가능하게 한다.
- 편집 가능성 평가를 위한 정량적 평가 프레임워크를 제공하며, 편집 프롬프트 목록과 새로운 지표인 편집 성공률(ESR)을 활용한다.
제안 방법
- 사전 훈련된 모델(GroundingDINO 및 SAM)을 통해 확보한 전경 마스크 내에서만 최적화하여 단일 소스 이미지를 텍스트 임베딩으로 역전환하기 위해 이미지 인코더를 사용한다.
- 전경 손실을 도입하여 최적화를 전경 영역으로 제한함으로써, 임베딩이 의도한 개념만 정확히 캡처하도록 보장한다.
- 배경 손실을 적용하여 학습된 임베딩이 배경 복원 과정에 미치는 영향을 최소화함으로써 개념과 배경을 분리한다.
- 세분화 훈련 중 의미론적 손실을 구현하여 원래 클래스 임베딩이 복원 과정에 미치는 영향을 유지함으로써 언어 이탈을 방지한다.
- 이중 단계 훈련 체계를 채택한다: 첫 번째 단계에서는 전경 및 배경 손실을 사용해 이미지를 역전환하고, 두 번째 단계에서는 의미론적 손실을 활용해 T2I 모델을 세분화 훈련하여 시각적 충실도를 향상시킨다.
- T2I 모델 내의 사전 훈련된 시각적 사전 지식을 활용하여 재학습 없이도 타당한 새로운 시점 합성과 다중 개념 조합을 생성한다.
실험 결과
연구 질문
- RQ1단일 이미지 개념 삽입 방법은 어떻게 고도로 정밀한 시각적 충실도를 유지하면서도 영구적인 편집 능력을 확보할 수 있는가?
- RQ2임베딩 학습에서 전경과 배경이 얽히는 원인은 무엇이며, 이를 어떻게 완화할 수 있는가?
- RQ3세분화 훈련 중 언어 이탈을 어떻게 방지하여 클래스 사전 지식과 편집 가능성의 유지가 가능한가?
- RQ4공동 학습 없이도 단일로 학습된 개념을 활용해 새로운 시점 합성과 다중 개념 조합을 수행할 수 있는가?
- RQ5편집 가능성 평가에 효과적인 정량적 지표는 무엇인가?
주요 결과
- 전용 배경 손실을 통해 학습된 개념을 배경으로부터 분리함으로써 SingleInsert는 높은 시각적 충실도와 강력한 편집 가능성 유연성을 달성한다.
- 의미론적 손실은 언어 이탈을 효과적으로 방지하여 원래 클래스 임베딩의 영향력을 유지하고 세분화 훈련 중에도 편집 가능성의 유지에 기여한다.
- 제안된 방법을 통해 단일 이미지에서 새로운 시점 합성이 가능해졌으며, T2I 모델 내부의 사전 지식을 활용해 타당한 새로운 시점 이미지를 생성할 수 있었다.
- 여러 개념(예: 얼굴, 머리카락, 옷)을 공동 학습 없이도 독립적으로 학습된 임베딩 간에 조합할 수 있었으며, 독립된 임베딩 간의 구성 일반화 능력을 입증했다.
- 제안된 편집 성공률(ESR) 지표와 함께 정제된 편집 프롬프트 목록을 활용하면 편집 가능성 평가에 신뢰할 수 있는 정량적 평가가 가능하다.
- 제거 실험 결과, 전경 손실, 배경 손실, 의미론적 손실 모두가 충실도와 편집 가능성의 최적 균형을 이루기 위해 필수적임을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.