Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Neurosymbolic Generative Models via Program Synthesis

Halley Young, Osbert Bastani|arXiv (Cornell University)|2019. 01. 24.
Generative Adversarial Networks and Image Synthesis참고 문헌 25인용 수 5
한 줄 요약

이 논문은 신경기호 프로그램—스케치와 감각적 구성요소를 포함하는 것—을 통합하여 이미지의 전반적인 구조적 패턴(예: 반복적인 창 배치)을 포착하는 프로그램 합성 유도 생성 모델(PS-GM)을 제안한다. 학습 데이터로부터 프로그램을 합성하고 이를 딥 생성 모델을 지도하는 방식으로, PS-GM는 특히 복잡한 공간적 구조를 가진 데이터에서 최신 기준 모델들보다 이미지 생성 및 복구 성능을 크게 향상시킨다.

ABSTRACT

Significant strides have been made toward designing better generative models in recent years. Despite this progress, however, state-of-the-art approaches are still largely unable to capture complex global structure in data. For example, images of buildings typically contain spatial patterns such as windows repeating at regular intervals; state-of-the-art generative methods can't easily reproduce these structures. We propose to address this problem by incorporating programs representing global structure into the generative model---e.g., a 2D for-loop may represent a configuration of windows. Furthermore, we propose a framework for learning these models by leveraging program synthesis to generate training data. On both synthetic and real-world data, we demonstrate that our approach is substantially better than the state-of-the-art at both generating and completing images that contain global structure.

연구 동기 및 목표

  • 딥 생성 모델이 이미지 내 반복 패턴과 같은 복잡한 전반적 구조를 포착하는 데에 한계가 있음을 해결하기 위해.
  • 프로그램 합성과 딥 생성 모델을 융합하여 감각 데이터의 고수준 구조적 사전 지식을 모델링하는 방법을 개발하기 위해.
  • 합성된 프로그램을 구조적 사전 지식으로 활용하여 이미지 생성(초기 생성)과 이미지 복구를 모두 가능하게 하기 위해.
  • 학습 데이터에 진정한 전반적 구조가 부재하는 문제를 극복하기 위해 도메인 특화 프로그램 합성 기법을 사용해 지도 신호를 생성하기 위해.
  • 프로그램 기반의 구조를 통합할 경우, 특히 데이터가 적은 환경에서 더 정확하고 구조적으로 이미지를 생성 및 복구할 수 있음을 입증하기 위해.

제안 방법

  • 전반적 구조를 구멍이 있는 스케치(s)와 감각적 구성요소(c)로 분해하여 신경기호 프로그램 P = (s, c)를 구성한다.
  • 학습 이미지에서 2차원 반복 패턴을 나타내는 중첩된 for-루프를 도메인 특화 프로그램 합성 알고리즘을 사용해 추출한다.
  • 입력 데이터의 감각적 구성요소에 기반해 합성된 프로그램 P를 실행하여 구조 렌더링 x_struct를 생성한다.
  • 구조적 사전 지식을 생성을 이끄는 데 사용하여, 딥 생성 모델(예: VAE, GAN, 또는 VED)을 훈련시켜 x_struct를 완전한 이미지로 복원한다.
  • 이미지 복구 과정에서는 부분적으로 주어진 이미지에서 프로그램을 합성하고, 이를 기반으로 전체 구조를 외삽한 후, 사전 훈련된 모델을 통해 이 구조를 기반으로 복구를 이끈다.
  • 강화 학습이나 약한 지도 학습을 피하기 위해, 합성된 프로그램에서 파생된 지도 신호를 사용하여 엔드 투 엔드 시스템을 훈련시킨다.

실험 결과

연구 질문

  • RQ1신경기호 프로그램은 이미지 내 복잡한 전반적 구조, 예를 들어 2차원 반복 패턴을 효과적으로 포착할 수 있는가?
  • RQ2프로그램 합성 기반의 프로그램 기반 구조를 통합할 경우, 딥 생성 모델의 이미지 생성 및 복구 성능이 향상되는가?
  • RQ3PS-GM 프레임워크는 GLCIC, CycleGAN, VAE와 같은 최신 기준 모델들과 비교해 구조적 정밀도와 정량적 지표에서 어떻게 성능을 내는가?
  • RQ4기본 모델이 실패하는 데이터가 제한된 실세계 데이터셋(예: facades 데이터셋)에 대해 이 방법이 일반화 가능한가?
  • RQ5합성된 프로그램을 구조적 사전 지식으로 사용할 경우, 데이터가 적은 환경에서 일반화 능력과 샘플 품질이 얼마나 향상되는가?

주요 결과

  • 합성 데이터에서 PS-GM는 CycleGAN 기반으로 FID 91.8, GLCIC 기반으로 106.8을 기록했으며, 각각 기준 모델의 218.7과 163.66보다 유의미하게 높은 성능을 보였다.
  • facades 데이터셋에서 PS-GM는 FID를 CycleGAN 기반으로 124.4, GLCIC 기반으로 141.8로 낮추었으며, 기준 모델의 251.4와 195.9보다 낮아 데이터 부족 상황에서도 강건함을 입증했다.
  • VED 기반 복구 과정에서 PS-GM는 facades 데이터셋에서 음의 로그우도(NLL) 8755.4를 기록했으며, 기준 모델의 8636.3보다 略적으로 열등했지만, 모두 구조 학습이 부족해 어려움을 겪었다.
  • 이미지 생성 과정에서 VED 기반 PS-GM는 기준 VAE보다 더 일관되고 구조적인 패턴을 가진 이미지를 생성했으며, 정성적 비교를 통해 이를 확인했다.
  • 복잡한 공간적 구조를 가진 이미지(예: 반복적인 창 패턴이 있는 건물)에서 PS-GM는 기존 모델이 전반적 레이아웃을 복원하지 못하는 상황에서도 복구 품질을 크게 향상시켰다.
  • 지표적인 전반적 구조가 없는 환경에서 프로그램 합성 기반으로 의미 있는 지도 신호를 생성할 수 있음을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.