Skip to main content
QUICK REVIEW

[논문 리뷰] Locally Masked Convolution for Autoregressive Models

Ajay N. Jain, Pieter Abbeel|ArXiv.org|2020. 06. 22.
Generative Adversarial Networks and Image Synthesis참고 문헌 45인용 수 7
한 줄 요약

이 논문은 2D 컨볼루션에 대한 단순하면서도 효과적인 수정인 로컬 마스크 컨볼루션(LMConv)을 소개한다. 이 방법은 특징 맵에 위치 기반 마스크를 적용함으로써 단일 딥 네ural 네트워크가 임의의 순차적 생성 순서를 지원할 수 있도록 한다. 여러 순서에 걸쳐 가중치를 공유함으로써, LMConv는 조건 없는 이미지 생성(비디오당 2.89비트)과 전역적으로 일관된 이미지 보완에서 최신 기술 수준의 성능을 달성한다. 이는 작업별 특화 학습 없이도 가능하다.

ABSTRACT

High-dimensional generative models have many applications including image compression, multimedia generation, anomaly detection and data completion. State-of-the-art estimators for natural images are autoregressive, decomposing the joint distribution over pixels into a product of conditionals parameterized by a deep neural network, e.g. a convolutional neural network such as the PixelCNN. However, PixelCNNs only model a single decomposition of the joint, and only a single generation order is efficient. For tasks such as image completion, these models are unable to use much of the observed context. To generate data in arbitrary orders, we introduce LMConv: a simple modification to the standard 2D convolution that allows arbitrary masks to be applied to the weights at each location in the image. Using LMConv, we learn an ensemble of distribution estimators that share parameters but differ in generation order, achieving improved performance on whole-image density estimation (2.89 bpd on unconditional CIFAR10), as well as globally coherent image completions. Our code is available at https://ajayjain.github.io/lmconv.

연구 동기 및 목표

  • 래스터 스캔과 같은 고정된 생성 순서에 제한된 순차적 모델의 한계를 해결하기 위해, 이미지 보완과 같은 작업에서 효과적인 컨텍스트 활용이 어려운 문제를 해결한다.
  • 개별 파rameter화나 계산 오버헤드 없이도 단일 컨volutional 신경망이 여러 순차적 생성 순서를 지원하도록 한다.
  • 공유된 가중치를 통해 여러 순서에 걸친 베이지안 모델 평균화를 가능하게 하여 가능성을 향상시키고 생성 품질을 향상시킨다.
  • 관측된 컨텍스트에 기반해 추론 시 최적의 생성 순서를 동적으로 선택함으로써 전역적으로 일관된 이미지 보완을 달성한다.
  • 기존 컨볼루션 아키텍처에 효율적이고 확장 가능하며 모듈화된 확장 기능을 제공하며, 인덕티브 바이어스를 유지하면서도 유연한 순서 제어를 가능하게 한다.

제안 방법

  • 로컬 마스크 컨볼루션(LMConv)을 도입하여, 각 공간 위치에서 공간적으로 변화하는 가중치를 가진 학습 가능한 마스크를 특징 맵에 적용함으로써 임의의 순차적 생성 순서를 가능하게 한다.
  • 입력이나 가중치가 아닌 특징 수준에서 마스킹을 적용함으로써, 동일한 네트워크 파rameters를 다양한 생성 순서에 공유할 수 있다.
  • 표준 컨볼루션 연산의 im2col 및 col2im 변환에 마스킹을 통합함으로써 행렬 곱셈 기반의 효율적 구현을 실현한다.
  • 마스크된 특징 맵을 이용해 인과성을 강제함으로써, 여러 순서에 걸쳐 조건부 확률을 동시에 계산하는 단일 순방향 전파를 통해 모델을 엔드 투 엔드로 학습시킨다.
  • 동일한 네트워크 가중치 세트를 사용해 서로 다른 순차적 분해에 해당하는 다수의 그래픽 모델을 추정한다.
  • 관측된 컨텍스트에 기반해 추론 시 순서 선택 기능을 제공함으로써, 예를 들어 이미지 보완 작업에서 가시 컨텍스트를 최대화하는 순서를 선택할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1단일 컨볼루션 신경망이 별도의 파arameter화 없이 여러 순차적 생성 순서를 지원할 수 있는가?
  • RQ2계산 효율성을 유지하면서도 컨볼루션 아키텍처에 임의의 생성 순서를 효율적으로 구현할 수 있는 방법은 무엇인가?
  • RQ3공유된 가중치를 통해 여러 순서를 지원함으로써 이미지 모델링에서 가능성을 향상시키고 생성 품질을 향상시킬 수 있는가?
  • RQ4로컬 마스크 컨볼루션은 인painting 작업에 대한 별도의 훈련 없이도 전역적으로 일관된 이미지 보완을 가능하게 하는가?
  • RQ5LMConv를 통한 순서에 민감하지 않은 훈련 방식이 CIFAR-10과 같은 표준 벤치마크에서 성능 향상에 얼마나 기여하는가?

주요 결과

  • 제안된 로컬 마스크 컨볼루션(LMConv)은 특징 맵에 위치 기반 마스크를 적용함으로써 단일 네트워크가 임의의 순차적 생성 순서를 지원할 수 있도록 한다.
  • LMConv는 조건 없는 CIFAR-10 데이터셋에서 테스트 세트 가능도를 2.89비트 per dimension로 달성하여 PixelCNN++을 능가한다.
  • 관측된 컨텍스트에 기반해 추론 시 최적의 생성 순서를 동적으로 선택함으로써 전역적으로 일관된 이미지 보완을 실현한다.
  • 단일 순방향 전파를 통해 여러 순서에 걸쳐 병렬 밀도 추정을 수행함으로써 계산 효율성을 유지한다. 이는 행렬 곱셈 기반의 구현 덕분이다.
  • 이미지 보완 결과는, 보완 마스크에 대한 별도의 훈련 없이도 컨텍스트 인식 기반 순서 선택을 통해 일관된 출력을 생성할 수 있음을 보여준다.
  • 이 방법은 MADE를 컨볼루션 아키텍처로 일반화하면서도 국소적 수신 필드의 인덕티브 바이어스를 유지함으로써 장거리 의존성 모델링을 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.