Skip to main content
QUICK REVIEW

[논문 리뷰] Using Scene Graph Context to Improve Image Generation

Subarna Tripathi, Anahita Bhiwandiwalla|arXiv (Cornell University)|2019. 01. 11.
Multimodal Machine Learning Applications참고 문헌 23인용 수 20
한 줄 요약

이 논문은 장면 그래프에서의 이미지 생성을 향상시키기 위해 풀링된 그래프 특징을 생성자 및 판별자 네트워크에 주입하는 장면 그래프 컨텍스트 네트워크를 제안한다. 이는 의미적 및 비공간적 관계에 대한 준수를 향상시킨다. 이 방법은 Visual Genome 및 COCO-stuff에서 최신 기술 성능을 달성하며, 이전 작업의 0.64와 비교해 평균 관계 점수(MORS)가 0.74로 향상되어 생성된 이미지에서 장면 그래프 관계에 대한 우월한 일치를 보여준다.

ABSTRACT

Generating realistic images from scene graphs asks neural networks to be able to reason about object relationships and compositionality. As a relatively new task, how to properly ensure the generated images comply with scene graphs or how to measure task performance remains an open question. In this paper, we propose to harness scene graph context to improve image generation from scene graphs. We introduce a scene graph context network that pools features generated by a graph convolutional neural network that are then provided to both the image generation network and the adversarial loss. With the context network, our model is trained to not only generate realistic looking images, but also to better preserve non-spatial object relationships. We also define two novel evaluation metrics, the relation score and the mean opinion relation score, for this task that directly evaluate scene graph compliance. We use both quantitative and qualitative studies to demonstrate that our pro-posed model outperforms the state-of-the-art on this challenging task.

연구 동기 및 목표

  • 객체 관계, 특히 비공간적 관계에 대한 준수를 향상시켜 장면 그래프에서의 이미지 생성을 개선한다.
  • 장면 그래프 준수를 위한 과업 특화 평가 지표의 부족을 해결한다.
  • 생성자 및 판별자에 장면 그래프 의미를 통합하여 더 나은 일치를 이룰 수 있는 컨텍스트 인식 학습 프레임워크를 개발한다.
  • 장면 그래프 컨텍스트를 통합할 경우 더 현실적이고 구조적으로 정확한 이미지가 생성됨을 입증한다.

제안 방법

  • 장면 그래프 컨텍스트 네트워크는 그래프 컬러네이션 네트워크(GCN)에서 특징을 풀링하여 생성자 및 판별자에 대한 컨텍스트 임베딩을 생성한다.
  • 이 컨텍스트 임베딩은 생성자 및 판별자에 주입되어 장면 그래프 관계를 존중하는 이미지 생성을 유도한다.
  • 컨텍스트 인식 적대적 손실이 적용되며, 두 네트워크가 풀링된 장면 그래프 컨텍스트에 조건화되어 현실성과 구조적 정밀도를 향상시킨다.
  • 모델는 예측된 객체 레이아웃과 장면 컨텍스트에서 고해상도 이미지를 생성하기 위해 캐스케이드 정밀화 네트워크를 사용한다.
  • 레이아웃 및 이미지 생성 단계에서 준수 정도를 측정하기 위해 관계 점수와 평균 관계 점수(MORS)라는 새로운 평가 지표가 도입된다.
  • 프레임워크는 Visual Genome 및 COCO-stuff 데이터셋에서 학습 및 평가되며, 사용자 연구를 통해 MORS의 타당성이 검증된다.

실험 결과

연구 질문

  • RQ1생성자 및 판별자 양쪽에 장면 그래프 컨텍스트를 주입함으로써 이미지 생성의 정밀도와 관계 준수를 향상시킬 수 있는가?
  • RQ2비공간적 관계, 예를 들어 의미적 관계나 소유 관계를 유지하는 데 있어 제안된 방법이 이전 작업보다 어떻게 우월한가?
  • RQ3관계 점수와 MORS라는 새로운 지표가 기존의 픽셀 기반 지표보다 장면 그래프 준수를 얼마나 더 잘 캡처하는가?
  • RQ4장면 컨텍스트 네트워크는 복잡하거나 혼잡한 장면에서 레이아웃 예측 정확도와 최종 이미지의 현실성 향상에 기여하는가?
  • RQ5제안된 평가 프레임워크는 사용자 연구를 통해 그래프 조건 기반 이미지 생성의 품질을 신뢰성 있게 측정할 수 있는가?

주요 결과

  • 제안된 모델은 Visual Genome 테스트 세트에서 평균 관계 점수(MORS) 0.74를 기록하여 Johnson 등 [9]의 0.64 점수보다 유의미하게 뛰어나다.
  • 의미적 관계의 경우, 모델은 기준 모델의 0.60과 비교해 관계 점수 0.78을 기록하여 준수 정도의 상당한 향상을 보였다.
  • 소유 관계의 경우, 기준 모델의 0.62와 비교해 관계 점수 0.80을 기록하여 복잡한 관계 개념에서 강력한 성능을 보였다.
  • 모델는 기준 모델의 0.223과 비교해 0.234로 더 높은 교차 오버랩(IoU)을 기록하여 레이아웃 예측 정확도 향상을 보였다.
  • 정성적 결과는 장면 컨텍스트가 다양한 관계 유형, 특히 비공간적 관계를 여러 테스트 세트에서 잘 유지함을 보여주었다.
  • 사용자 연구 결과, 생성된 이미지가 장면 그래프와 더 일치하며, 특히 의미적 및 소유 관계에서 효과가 검증되었으며, MORS가 인지적 지표로서의 타당성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.