Skip to main content
QUICK REVIEW

[논문 리뷰] HD-Painter: High-Resolution and Prompt-Faithful Text-Guided Image Inpainting with Diffusion Models

Hayk Manukyan, Andranik Sargsyan|arXiv (Cornell University)|2023. 12. 21.
Generative Adversarial Networks and Image Synthesis인용 수 4
한 줄 요약

HD-Painter는 훈련이 필요 없고 고해상도를 위한 텍스트 가이드 이미지 복원 방법으로, 두 가지 신규 구성 요소인 문맥 인식 내향적 어텐션(Prompt-Aware Introverted Attention, PAIntA)과 재가중 어텐션 점수 가이드라인(Reweighting Attention Score Guidance, RASG)을 사용하여 프롬프트 충실도를 향상시킨다. PAIntA는 텍스트 프롬프트와의 어텐션 일치도를 높이며, RASG는 분포 이탈을 방지하는 후행 추론 전략이다. MSCOCO에서 61.4%의 생성 정확도를 달성하여 이전 최고 성능(SOTA) 방법보다 뚜렷이 뛰어나다.

ABSTRACT

Recent progress in text-guided image inpainting, based on the unprecedented success of text-to-image diffusion models, has led to exceptionally realistic and visually plausible results. However, there is still significant potential for improvement in current text-to-image inpainting models, particularly in better aligning the inpainted area with user prompts and performing high-resolution inpainting. Therefore, we introduce HD-Painter, a training free approach that accurately follows prompts and coherently scales to high resolution image inpainting. To this end, we design the Prompt-Aware Introverted Attention (PAIntA) layer enhancing self-attention scores by prompt information resulting in better text aligned generations. To further improve the prompt coherence we introduce the Reweighting Attention Score Guidance (RASG) mechanism seamlessly integrating a post-hoc sampling strategy into the general form of DDIM to prevent out-of-distribution latent shifts. Moreover, HD-Painter allows extension to larger scales by introducing a specialized super-resolution technique customized for inpainting, enabling the completion of missing regions in images of up to 2K resolution. Our experiments demonstrate that HD-Painter surpasses existing state-of-the-art approaches quantitatively and qualitatively across multiple metrics and a user study. Code is publicly available at: https://github.com/Picsart-AI-Research/HD-Painter

연구 동기 및 목표

  • 텍스트 가이드 이미지 복원에서 프롬프트 忽시 문제, 특히 배경 지배성과 인접 객체 전파 문제를 해결하기 위해.
  • 재훈련 없이도 2048×2048 해상도까지의 복원을 가능하게 하되, 프롬프트 일치도나 시각적 품질을 훼손하지 않기 위해.
  • 기존의 디퓨전 모델에 대한 향상된 텍스트-이미지 일치도를 위해 훈련 없이 즉시 사용 가능한 솔루션을 개발하기 위해.
  • 복원 영역에 특화된 초해상도 파이프라인을 통해 생성 충실도와 사용자 인식 품질을 향상시키기 위해.

제안 방법

  • PAIntA는 텍스트 프롬프트 임bedding을 통합하여 자기 어텐션 점수를 향상시켜, 관련 없는 이미지 특징의 영향을 줄이고 프롬프트 관련 콘텐츠에 더 집중하도록 한다.
  • RASG는 DDIM 추론 과정에서 어텐션 점수를 재가중하여 추론 중에 프롬프트 일치 잠재변수를 유도하면서 분포 이탈을 방지한다.
  • 고해상도 디퓨전 모델을 사용한 시간 반복적 블렌딩 전략을 통해 고해상도 생성 중 일관성을 유지한다.
  • 복원 영역을 원활하게 확대하기 위해 특화된 초해상도 기법을 적용하여 알려진 영역의 세부 사항을 유지한다.
  • PAIntA와 RASG는 즉시 사용 가능한 구성 요소로서, 재훈련 없이도 기존의 사전 훈련된 디퓨전 기반 복원 모델에 통합할 수 있다.
  • 프롬프트 일치도와 시각적 품질 평가를 위한 포괄적인 평가를 위해 CLIP, MMDetection, PickScore를 활용한다.

실험 결과

연구 질문

  • RQ1훈련 없이도 프롬프트 충실도를 크게 향상시킬 수 있는가? 특히 재훈련 없이도.
  • RQ2어떻게 어텐션 메커니즘을 수정하여 마스크된 이미지 영역에서 시각적 맥락보다 텍스트 프롬프트를 우선시할 수 있는가?
  • RQ3후행 가이드라인을 설계하여 분포 이탈을 방지하면서도 디퓨전 추론 중 프롬프트 일치도를 향상시킬 수 있는가?
  • RQ4특화된 초해상도 기법이 고해상도 복원 품질과 일관성에 어떤 영향을 미치는가?
  • RQ5PAIntA와 RASG의 조합이 정량적 지표와 사용자 인식 측면에서 기존 SOTA 방법보다 어떻게 비교되는가?

주요 결과

  • HD-Painter는 MSCOCO에서 61.4%의 생성 정확도를 달성하여 이전 SOTA의 51.9%보다 9.5%포인트 높다.
  • 모든 경쟁자 대비 CLIP 점수를 1.5점 이상 향상시켜 더 강한 텍스트-이미지 일치도를 나타낸다.
  • PickScore 분석 결과, HD-Painter는 전반적인 품질과 사용자 선호도에서 모든 베이스라인을 압도하며 통계적으로 유의미한 우위를 확보했다.
  • 사용자 연구 결과, HD-Painter는 프롬프트 일치도와 시각적 품질 모두에서 경쟁 제품보다 뚜렷이 선호됨을 확인했다.
  • 정성적 결과는 프롬프트가 시각적 맥락과 모순되더라도 목표 객체를 일관되게 생성하는 데 성공했음을 보여주며, 배경이나 객체 지배성을 피했다.
  • 복원 전용 초해상도 기법은 원활한 고해상도 완성도를 가능하게 하며, 일반 초해상도 대비 뛰어난 세부 사항 유지 능력을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.