Skip to main content
QUICK REVIEW

[논문 리뷰] Large-scale Artificial Neural Network: MapReduce-based Deep Learning

Kairan Sun, Wei Xu|arXiv (Cornell University)|2015. 10. 09.
Handwritten Text Recognition Techniques참고 문헌 13인용 수 7
한 줄 요약

이 논문은 클라우드 클러스터를 통해 역전파를 분산시켜 대규모 인공 신경망 학습을 가속화하는 MapReduce 기반의 딥러닝 프레임워크를 제안한다. 딥러닝을 Hadoop의 MapReduce와 통합함으로써 선형 확장성과 효율성이 향상되어 아마존 웹 서비스(AWS)에서 수작업 숫자 인식 작업을 통해 높은 속도 향상과 정확한 분류를 입증한다.

ABSTRACT

Faced with continuously increasing scale of data, original back-propagation neural network based machine learning algorithm presents two non-trivial challenges: huge amount of data makes it difficult to maintain both efficiency and accuracy; redundant data aggravates the system workload. This project is mainly focused on the solution to the issues above, combining deep learning algorithm with cloud computing platform to deal with large-scale data. A MapReduce-based handwriting character recognizer will be designed in this project to verify the efficiency improvement this mechanism will achieve on training and practical large-scale data. Careful discussion and experiment will be developed to illustrate how deep learning algorithm works to train handwritten digits data, how MapReduce is implemented on deep learning neural network, and why this combination accelerates computation. Besides performance, the scalability and robustness will be mentioned in this report as well. Our system comes with two demonstration software that visually illustrates our handwritten digit recognition/encoding application.

연구 동기 및 목표

  • 거대한 데이터셋에서 전통적인 역전파 신경망의 비효율성과 확장성 한계를 해결한다.
  • 빅데이터 워크로드를 효과적으로 처리하기 위해 딥러닝을 클라우드 컴퓨팅과 통합한다.
  • 병렬 계산을 위해 MapReduce를 사용하는 분산형 확장 가능한 신경망 프레임워크를 설계하고 구현한다.
  • 감독 학습 및 비감독 학습 모드를 모두 포함한 수작업 문자 인식 응용 프로그램을 통해 시스템 성능을 입증한다.
  • 클라우드 기반 클러스터를 사용하여 실제 데이터에서의 확장성, 내구성, 정확도를 평가한다.

제안 방법

  • 스태킹된 오토에코더 방식을 사용하여 딥 신경망을 구현하고, 각 층을 사전 학습하기 위해 제한된 볼츠만 기계(RBM)로 처리한 후 역전파로 최적화한다.
  • 클러스터의 여러 노드에서 가중치 갱신을 병렬화하여 신경망 학습 과정을 MapReduce 패러다임에 매핑한다.
  • 분산 데이터 처리를 위한 Hadoop 기반 MapReduce 프레임워크를 호스팅하기 위해 아마존 웹 서비스(AWS)를 클라우드 인프라로 사용한다.
  • 감독 학습용 숫자 인식용, 비감독 학습용 오토에코딩 및 재구성용 두 가지 데모 애플리케이션을 설계한다.
  • 28×28 픽셀 이미지를 30차원의 코드로 압축하여 효율적인 저장 및 재구성 가능성을 확보한다.
  • 반복적인 MapReduce 작업을 통해 클러스터 전반에 걸쳐 전방 및 역방향 전파 단계를 분산 처리하여 데이터 전송을 최소화하고 병렬성을 극대화한다.

실험 결과

연구 질문

  • RQ1딥 신경망의 계산적으로 부담스러운 역전파 과정을 효과적으로 병렬화하기 위해 MapReduce를 사용할 수 있는가?
  • RQ2딥러닝을 MapReduce와 통합할 경우 대규모 데이터에서 학습 효율성과 확장성에 어떤 영향을 미치는가?
  • RQ3클라우드 클러스터에 분산된 상태에서도 수작업 숫자 인식에서 정확도를 어느 정도 유지할 수 있는가?
  • RQ4차원 축소를 활용한 비감독 학습 및 오토에코딩 작업에서 시스템 성능은 어떠한가?
  • RQ5클러스터 노드 수를 늘릴 경우 시스템의 실행 시간과 성능에 어떤 영향을 미치는가?

주요 결과

  • 시스템은 거의 선형 확장성을 달성하여 노드 수가 증가할수록 처리 시간이 비례하여 감소함을 입증하며, 효과적인 병렬 처리를 보였다.
  • 노드 수가 많아질수록 학습 시간이 크게 감소하여 MapReduce 기반 접근이 딥러닝의 계산 부담을 효과적으로 분산시킴을 보여주었다.
  • 감독 학습 모델은 비공식적이거나 스타일러디한 수작업 필기체에서도 높은 정확도로 숫자를 인식하였다.
  • 비감독 오토에코딩 모델은 30차원의 코드에서 28×28 픽셀의 숫자 이미지를 대부분의 경우 높은 정밀도로 재구성하였다.
  • 시스템은 숫자 재구성에 있어 내구성이 있었지만, 비숫자 기호는 재구성하지 못하여 모델이 훈련 데이터 분포에 의존함을 확인하였다.
  • 이론적 확장성과 관측된 확장성 사이의 약간의 성능 격차는 노드 수가 많아질수록 발생하는 시스템 수준의 오버헤드 때문으로 분석되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.