Skip to main content
QUICK REVIEW

[논문 리뷰] Adapting Resilient Propagation for Deep Learning

Alan Mosca, George D. Magoulas|arXiv (Cornell University)|2015. 09. 15.
Domain Adaptation and Few-Shot Learning참고 문헌 10인용 수 13
한 줄 요약

이 논문은 딥 네ural 네트워크에서의 제로 기울기 문제를 극복하기 위해 드롭아웃 인식 기능을 통합한 수정된 Rprop 알고리즘을 제안한다. 이는 훈련 속도와 정확도를 크게 향상시키며, 단지 35 에포크 만에 MNIST에서 2.57%의 검증 오차를 달성한다. 이는 표준 SGD와 수정되지 않은 Rprop보다 빠르며, 일반 하드웨어에서도 딥 네ural 네트워크 앙상블의 효율적 훈련을 가능하게 한다.

ABSTRACT

The Resilient Propagation (Rprop) algorithm has been very popular for backpropagation training of multilayer feed-forward neural networks in various applications. The standard Rprop however encounters difficulties in the context of deep neural networks as typically happens with gradient-based learning algorithms. In this paper, we propose a modification of the Rprop that combines standard Rprop steps with a special drop out technique. We apply the method for training Deep Neural Networks as standalone components and in ensemble formulations. Results on the MNIST dataset show that the proposed modification alleviates standard Rprop's problems demonstrating improved learning speed and accuracy.

연구 동기 및 목표

  • 표준 Rprop와 드롭아웃 간의 상호 호환성 문제를 해결하기 위해, 드롭아웃에 의해 유도된 제로 기울기가 Rprop의 학습 동역학을 방해하는 문제를 해결한다.
  • Rprop의 수렴 속도와 최종 정확도를 향상시키기 위해, 진짜 기울기 부호 변화와 드롭아웃에 의한 제로 기울기 간의 구분이 가능한 방식으로 Rprop를 수정한다.
  • 수정된 Rprop 알고리즘의 향상된 수렴 특성을 활용하여 딥 네럴 네트워크 앙상블의 빠른 훈련을 가능하게 한다.
  • 수정된 Rprop가 MNIST 벤치마크에서 표준 SGD와 수정되지 않은 Rprop보다 속도와 정확도 면에서 뛰어나다는 것을 입증한다.

제안 방법

  • 수정된 Rprop 알고리즘은 제로 기울기가 드롭아웃에 의해 발생했는지, 아니면 기울기 부호 변화를 나타내는지 구분하기 위해 드롭아웃 마스크 $Dm$ 를 추적한다.
  • 드롭아웃으로 인해 제로 기울기가 발생할 경우, 표준 Rprop가 모든 제로 기울기를 동일하게 취급하는 것과 달리, 이 알고리즘은 가중치와 학습률 업데이트를 건너뛰지 않는다.
  • 알고리즘은 기울기 부호 일관성에 기반한 다항 계수 $\eta_+$ 와 $\eta_-$ 를 사용하여 단계 크기 조정을 적응적으로 유지하는 Rprop의 핵심 메커니즘을 유지한다.
  • 수정된 Rprop는 개별 딥 네럴 네트워크를 훈련시키는 데 적용되며, 백킹 및 스태킹을 이용한 앙상블 프레임워크에 통합된다.
  • 앙상블 훈련은 수정된 Rprop를 사용해 기초 DNN을 신속히 훈련한 후, 예측을 조합하기 위한 두 번째 공간 분류기(다른 DNN)를 사용한다.
  • 이 방법은 업데이트를 건너뛸지 결정하기 전에 드롭아웃 마스크를 확인하는 수정된 가중치 업데이트 규칙을 사용하여, 드롭아웃 단계 동안의 학습 진전을 유지한다.

실험 결과

연구 질문

  • RQ1드롭아웃 정규화와 함께 사용할 경우, Rprop는 딥 네럴 네트워크 훈련에 효과적으로 적응시킬 수 있는가?
  • RQ2드롭아웃에 의해 발생하는 제로 기울기로 인해 표준 Rprop의 수렴이 방해되는가? 만약 그렇다면, 이를 어떻게 완화할 수 있는가?
  • RQ3수정된 Rprop 알고리즘이 딥 러닝 작업에서 표준 SGD와 수정되지 않은 Rprop보다 더 빠른 수렴과 더 나은 일반화 성능을 달성할 수 있는가?
  • RQ4수정된 Rprop의 향상된 훈련 속도 덕분에 일반 데스크톱 하드웨어에서도 실용적인 딥 네럴 네트워크 앙상블 훈련이 가능해지는가?

주요 결과

  • 수정된 Rprop는 MNIST 데이터셋에서 최소 검증 오차 2.57%를 달성하여, 표준 SGD(2.85%)와 수정되지 않은 Rprop(3.03%)를 모두 앞서나갔다.
  • 수정된 Rprop는 단지 35 에포크 만에 최고 성능에 도달했으며, 수정되지 않은 Rprop는 105, SGD는 1763에포크가 소요되었다.
  • 수정된 Rprop는 단일 GPU 시스템에서 훈련 시간을 10분으로 줄였으며, Rprop는 25분, SGD는 320분이 소요되었다.
  • 이 방법은 일반 데스크톱 시스템에서 12시간 이내에 딥 네럴 네트워크 앙상블을 훈련시켰으며, 10명의 스태킹 앙상블은 테스트 오차 2.19%를 달성했다.
  • 윌코크슨 부호 순위 검정을 통해 10명의 앙상블이 3명의 앙상블보다 유의미하게 높은 성능을 보였으며, 98% 신뢰 수준에서 통계적으로 유의미했다.
  • 수정된 Rprop는 전체 훈련 과정 동안 더 빠른 수렴과 낮은 오차를 유지했으며, 수정되지 않은 Rprop에서 관찰되는 과적합과 조기 포화 현상은 피했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.