Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Restricted Boltzmann Networks

Hengyuan Hu, Lisheng Gao|arXiv (Cornell University)|2016. 11. 15.
Generative Adversarial Networks and Image Synthesis참고 문헌 14인용 수 11
한 줄 요약

이 논문은 계층적 전이 학습 없이도 복수의 RBM을 통합하여 종단 간 훈련이 가능한 새로운 딥 생성 모델인 딥 제한 볼츠만 망(Deep Restricted Boltzmann Networks, DRBNs)을 제안한다. 모든 계층을 동시에 훈련시키고 컨볼루션 RBM을 통합함으로써, MNIST 및 Weizmann Horses 데이터셋에서 표준 RBM보다 우수한 이미지 생성 품질과 특징 표현 능력을 달성하며, 전이 학습이 필요한 모델들과 비교해도 열등하지 않다.

ABSTRACT

Building a good generative model for image has long been an important topic in computer vision and machine learning. Restricted Boltzmann machine (RBM) is one of such models that is simple but powerful. However, its restricted form also has placed heavy constraints on the models representation power and scalability. Many extensions have been invented based on RBM in order to produce deeper architectures with greater power. The most famous ones among them are deep belief network, which stacks multiple layer-wise pretrained RBMs to form a hybrid model, and deep Boltzmann machine, which allows connections between hidden units to form a multi-layer structure. In this paper, we present a new method to compose RBMs to form a multi-layer network style architecture and a training method that trains all layers jointly. We call the resulted structure deep restricted Boltzmann network. We further explore the combination of convolutional RBM with the normal fully connected RBM, which is made trivial under our composition framework. Experiments show that our model can generate descent images and outperform the normal RBM significantly in terms of image quality and feature quality, without losing much efficiency for training.

연구 동기 및 목표

  • 단일 계층 RBM의 표현 한계를 극복하는 딥 비방향 생성 모델을 개발하는 것.
  • DBN에서 사용하는 탐욕적 계층별 전이 학습이 아닌, 모든 RBM 계층을 동시에 학습할 수 있도록 하는 것.
  • 이미지 데이터에서의 확장성과 특징 학습 향상을 위해 컨볼루션 RBM을 딥 아키텍처에 통합하는 것.
  • 비지도 이미지 생성 및 후속 분류 작업에서의 성능 평가를 수행하는 것.
  • 제한된 레이블 데이터가 있는 경우에도 고품질의 특징을 추출할 수 있으며, 보정( fine-tuning )의 필요성을 줄일 수 있음을 입증하는 것.

제안 방법

  • 모든 계층이 상호 연결이 없는 표준 RBM으로 구성된 복수의 RBM을 계층적으로 스택한 딥 비방향 아키텍처를 제안한다.
  • 보기 데이터의 로그우도에 대한 기울기 상승을 이용해 모든 RBM 파라미터를 동시에 최적화하는 통합 학습 알고리즘을 도입한다.
  • RBM의 조건부 독립성 특성을 활용하여 자유 에너지와 효율적인 블록 기반 기브스 샘플링을 사용해 근사 추론 및 학습을 수행한다.
  • 로컬 공간 패턴을 더 잘 포착하기 위해 첫 번째 계층에 컨볼루션 RBM을 통합하여 확장함으로써 확장성과 특징 품질 향상을 도모한다.
  • 완전 연결형과 컨볼루션형 RBM을 융합한 하이브리드 아키텍처를 사용하며, 컨볼루션 계층은 국소적 특징을 추출하고, 더 깊은 계층은 전반적인 구조를 모델링한다.
  • 기브스 샘플링을 통해 이미지 생성을 수행하고, 특징 추출 후 분류 작업에서 성능을 평가한다.

실험 결과

연구 질문

  • RQ1스택된 RBM으로 구성된 딥 비방향 모델이 단일 계층 RBM보다 더 나은 이미지 생성과 특징 학습을 달성할 수 있는가?
  • RQ2모든 RBM 계층을 동시에 학습시키는 방식이 탐욕적 계층별 전이 학습 방식보다 모델 품질과 효율성 측면에서 뛰어난가?
  • RQ3컨볼루션 RBM을 딥 RBM 아키텍처에 통합하면 이미지 데이터에서 확장성과 특징 표현 능력이 향상되는가?
  • RQ4제한된 레이블 데이터를 가진 데이터셋에 대해 DRBN은 얼마나 잘 일반화되는가? 그리고 보조 분류 작업에서 보정의 필요성을 줄일 수 있는가?
  • RQ5DBM이나 ShapeBM과 달리, 전이 학습 없이도 제안된 아키텍처가 다양하고 현실적인 이미지 샘플을 생성할 수 있는가?

주요 결과

  • 3층 DRBN은 레이블이 6,000개 뿐인 MNIST에서 테스트 오차 3.29%를 기록하여 표준 RBM보다 뚜렷이 뛰어난 성능을 보였다.
  • 컨볼루션 DRBN은 레이블이 6,000개인 MNIST에서 테스트 오차 2.92%를 기록하여 완전 연결형 대비 성능 향상을 입증했다.
  • Weizmann Horses 데이터셋에서 DRBN은 다양하고 현실적인 말 이미지를 생성했으며, 컨볼루션 변형은 자세와 다리 부분의 다양성이 더 뛰어났다.
  • 완전 연결형 DRBN은 더 선명하고 매끄러운 이미지를 생성했지만 모드 붕괴 현상이 더 심했고, 컨볼루션 DRBN은 더 많은 노이즈를 포함했지만 더 뛰어난 구조적 다양성을 보였다.
  • ShapeBM 및 DBM과 달리 DRBN은 의미 있는 샘플을 생성하기 위해 계층별 전이 학습이 필요 없으며, 직접 종단 간 훈련이 가능하다.
  • DRBN에서 추출한 특징을 사용한 분류 작업에서 추가 보정이 거의 향상시키지 못했으며, 이는 제한된 레이블 데이터로도 거의 최적의 특징을 추출할 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.