Skip to main content
QUICK REVIEW

[논문 리뷰] Realistic Image Generation using Region-phrase Attention

Wanming Huang, Yida Xu|arXiv (Cornell University)|2019. 02. 04.
Generative Adversarial Networks and Image Synthesis참고 문헌 19인용 수 9
한 줄 요약

이 논문은 텍스트-이미지 GAN에서 기존의 단어 수준의 어텐션을 다중어절 어휘 표현(예: '빨간 셔츠')과 실제 그리드 객체 영역 간의 정렬을 통해 더 현실적인 이미지를 생성하기 위해 영역-어휘 어텐션 메커니즘을 제안한다. 보조 경계 상자와 품사 분석에서 유도된 어휘 수준의 임베딩을 사용함으로써, 모델은 더 정확하고 다양한, 맥락적으로 일관된 이미지를 생성하며, MSCOCO에서 AttnGAN보다 더 높은 R-정밀도와 더 나은 객체 수 정확도를 달성한다.

ABSTRACT

The Generative Adversarial Network (GAN) has recently been applied to generate synthetic images from text. Despite significant advances, most current state-of-the-art algorithms are regular-grid region based; when attention is used, it is mainly applied between individual regular-grid regions and a word. These approaches are sufficient to generate images that contain a single object in its foreground, such as a "bird" or "flower". However, natural languages often involve complex foreground objects and the background may also constitute a variable portion of the generated image. Therefore, the regular-grid based image attention weights may not necessarily concentrate on the intended foreground region(s), which in turn, results in an unnatural looking image. Additionally, individual words such as "a", "blue" and "shirt" do not necessarily provide a full visual context unless they are applied together. For this reason, in our paper, we proposed a novel method in which we introduced an additional set of attentions between true-grid regions and word phrases. The true-grid region is derived using a set of auxiliary bounding boxes. These auxiliary bounding boxes serve as superior location indicators to where the alignment and attention should be drawn with the word phrases. Word phrases are derived from analysing Part-of-Speech (POS) results. We perform experiments on this novel network architecture using the Microsoft Common Objects in Context (MSCOCO) dataset and the model generates $256 imes 256$ conditioned on a short sentence description. Our proposed approach is capable of generating more realistic images compared with the current state-of-the-art algorithms.

연구 동기 및 목표

  • 기존 GAN이 복잡한 전경-배경 상호작용을 가진 다중 객체 이미지를 현실적으로 생성하는 데에 한계를 보이고 있는 문제를 해결하기 위해.
  • 단어 수준의 어텐션을 어휘 수준의 어텐션으로 대체하여 텍스트와 이미지 영역 간의 어텐션 정렬을 향상시키기 위해.
  • 보조 경계 상자로 정의된 진짜 그리드 영역을 통합함으로써 이미지 생성의 정밀도를 향상시키기 위해.
  • 예: '녹색 사과'와 같이 어휘의 전체 시각적 맥락을 고립된 단어가 아닌 전체로 모델링하기 위해.
  • 단일 키워드에 대한 생성 편향을 줄이고 의미적으로 유사한 문장들 간의 일관성을 향상시키기 위해.

제안 방법

  • 보조 경계 상자로 정의된 진짜 그리드 이미지 영역과 품사 분석에서 유도된 다중어절 어휘 간의 어텐션을 계산하는 새로운 어텐션 메커니즘을 제안한다.
  • 연속된 단어 시퀀스에서 유도된 어휘 임베딩을 도입하여 개별 단어를 초월한 의미적 맥락을 포착한다.
  • DAMSM 손실 함수를 수정하여 경계 상자 내부의 어휘 수준의 임베딩과 진짜 그리드 특징을 모두 통합함으로써 이미지-문장 정렬을 향상시킨다.
  • 단일층 신경망을 사용하여 경계 상자 및 객체 수 예측을 수행하였으며, 깊은 아키텍처보다 뛰어난 성능을 보였다.
  • StackGAN과 유사한 이중 단계 GAN 프레임워크를 활용하며, 어휘와 이미지 영역 간의 특징 수준에서 어텐션을 적용한다.
  • 전역 문장-이미지 일관성과 국소 영역-어휘 정렬을 동시에 장려하는 수정된 손실 함수를 사용하여 MSCOCO 데이터셋에서 모델을 훈련시킨다.

실험 결과

연구 질문

  • RQ1이미지 영역과 다중어절 어휘 간의 어휘 수준 어텐션은 텍스트-이미지 생성의 현실성과 정확도를 향상시키는가?
  • RQ2보조 경계 상자에서 유도된 진짜 그리드 영역을 사용할 경우, 일반적인 그리드 영역보다 더 나은 공간 어텐션 정렬을 달성하는가?
  • RQ3어휘 수준의 임베딩은 복잡한 시각적 맥락을 포착하는 데 있어 단어 수준의 임베딩보다 더 우수한가?
  • RQ4문장에서 명시적으로 기술된 경우, 모델은 정확한 객체 수와 공간 관계를 가진 이미지를 생성할 수 있는가?
  • RQ5제안된 방법은 의미적으로 다를 수 있지만 유사한 문장들(예: '서핑' vs. '서핑 중')에서 유사한 이미지를 생성하는 것을 줄이는가?

주요 결과

  • 제안된 방법은 R-정밀도(100) 86.44%와 R-정밀도(30K) 9.5%를 기록하여 AttnGAN의 85.47%와 6.7%를 각각 초월한다.
  • 예를 들어 '세只 양'이나 '성인과 두 아이'와 같이 명시적으로 기술된 경우, 100%의 경우에서 정확한 객체 수를 갖는 이미지를 생성한다.
  • 의미적으로 다를 수 있지만 유사한 문장들(예: '서핑' vs. '서핑 중')에 대해 AttnGAN와 달리 동일하거나 유사한 이미지를 생성하지 않는다.
  • 예를 들어 '큰 browm 양'이나 '가로등이 있는 정지 표지판'의 경우, 더 정확한 객체 형태와 더 나은 시각적 일관성을 보인다.
  • 더 높은 품질의 BW 이미지를 생성하여 질감과 구성의 정밀도 향상을 보여준다.
  • Inception 점수 23.74±0.36는 AttnGAN의 25.89±0.47에 가깝게 유지되며, 낮은 점수에도 불구하고 강력한 이미지 다양성과 품질을 나타낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.