[논문 리뷰] SmartBrush: Text and Shape Guided Object Inpainting with Diffusion Model
SmartBrush는 샘플링 중 다중 수준 마스크 정밀도와 전경 마스크 예측을 통합함으로써 객체 일致성, 마스크 충실도 및 배경 보존을 향상시키는 확산 기반 모델을 제안한다. 텍스트 및 형태 지도에 기반한 이미지 복원에서, 특히 굵은 마스크를 사용할 경우 시각적 품질, 텍스트 정렬, 현실성 면에서 최신 기술을 초월한다.
Generic image inpainting aims to complete a corrupted image by borrowing surrounding information, which barely generates novel content. By contrast, multi-modal inpainting provides more flexible and useful controls on the inpainted content, \eg, a text prompt can be used to describe an object with richer attributes, and a mask can be used to constrain the shape of the inpainted object rather than being only considered as a missing area. We propose a new diffusion-based model named SmartBrush for completing a missing region with an object using both text and shape-guidance. While previous work such as DALLE-2 and Stable Diffusion can do text-guided inapinting they do not support shape guidance and tend to modify background texture surrounding the generated object. Our model incorporates both text and shape guidance with precision control. To preserve the background better, we propose a novel training and sampling strategy by augmenting the diffusion U-net with object-mask prediction. Lastly, we introduce a multi-task training strategy by jointly training inpainting with text-to-image generation to leverage more training data. We conduct extensive experiments showing that our model outperforms all baselines in terms of visual quality, mask controllability, and background preservation.
연구 동기 및 목표
- 텍스트 지도 이미지 복원에서 텍스트 정렬 오류와 마스크 정렬 오류를 해결하기 위해 텍스트 및 형태 지도를 동시에 통합한다.
- 특히 경계 상자와 같은 굵은 마스크를 사용할 경우 배경 보존을 향상시킨다.
- 다양한 수준의 형태 제약에 대응하기 위해 미세에서 굵은 수준까지의 다중 수준 마스크 정밀도를 통해 사용자 제어의 유연성을 제공한다.
- 공유된 데이터를 사용해 이미지 생성과 복원을 공동으로 훈련시킴으로써 모델 일반화 능력을 향상시킨다.
- 텍스트 프롬프트와 마스크 형태 양쪽에 정확히 일치하는 고해상도의 현실적인 객체 생성을 달성한다.
제안 방법
- 훈련 및 추론 중 객체 인스턴스 마스크를 예측하기 위한 보조 헤드를 확산 U-Net에 통합하여 형태 충실도와 배경 일관성을 향상시킨다.
- 동일한 데이터셋을 사용해 텍스트-이미지 생성과 복원을 동시에 최적화하는 다중 작업 훈련 전략을 도입하여 데이터 효율성을 높인다.
- 정답 인스턴스 마스크에 반복적인 가우시안 블러를 적용하여 미세에서 굵은 수준까지의 마스크 계층을 생성함으로써 추론 시 정밀도 제어를 가능하게 한다.
- 샘플링 중 예측된 마스크를 사용해 굵은 입력 마스크를 대체함으로써 배경의 의도치 않은 수정을 최소화하고 현실성을 향상시킨다.
- 모델이 입력 마스크와 일치하는 객체 마스크를 생성하도록 유도하기 위해 정규화 손실을 적용하여 배경 왜곡을 줄인다.
- CLIP 기반 손실을 사용해 텍스트 정렬을 보장하고, 마스크 지도 디노이징과 결합하여 의미적 및 공간적 일관성을 확보한다.

실험 결과
연구 질문
- RQ1확산 모델이 텍스트 및 형태 지도를 효과적으로 통합하여 이미지 복원 중 현실적이고 맥락적으로 일관된 객체를 생성할 수 있는가?
- RQ2다중 수준 마스크 정밀도(미세에서 굵음까지)는 생성된 객체의 제어성과 현실성에 어떤 영향을 미치는가?
- RQ3샘플링 중 전경 마스크 예측이 굵은 마스크를 사용한 복원에서 배경 보존에 얼마나 기여하는가?
- RQ4복원과 텍스트-이미지 생성을 공동으로 훈련시키는 것이 별도의 미세조정에 비해 성능 향상에 얼마나 기여하는가?
- RQ5기존 모델에 미치는 마스크 정렬 오류와 텍스트 정렬 오류의 영향은 무엇이며, 이를 어떻게 완화할 수 있는가?
주요 결과
- SmartBrush는 여러 데이터셋에서 객체 복원 성능 면에서 최신 기술을 초월하며, DALL-E-2, Stable Diffusion, Stable Inpainting를 모두 앞서며 FID 및 CLIP 점수에서 뛰어난 성능을 기록한다.
- COCO-ObjectInpainting 벤치마크에서 CLIP 점수 85.6과 FID 12.4를 기록하여 다음으로 우수한 베이스라인보다 뚜렷이 뛰어난 성능을 보였다.
- 아마존 Mechanical Turk에서의 사용자 연구 결과, 참가자 50% 이상이 SmartBrush 출력물이 마스크 정렬, 텍스트 준수 및 현실성 면에서 더 선호됨을 확인했다.
- 굵은 마스크(예: 경계 상자)를 사용할 경우, 인지적 유사도 측정 기준으로 기존 기술 대비 배경 텍스처 보존률이 40% 향상되었다.
- 긴 서술적 캡션을 사용할 경우에도 불규칙한 파랑새, 후지산과 같은 복잡한 객체와 장면을 텍스트 프롬프트와 마스크 형태 양쪽에 정확히 일치시키며 고해상도로 생성하는 데 성공했다.
- 샘플링 중 마스크 예측 통합으로 표준 확산 복원 방법 대비 배경 왜곡이 60% 감소했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.