Skip to main content
QUICK REVIEW

[논문 리뷰] Feed Forward and Backward Run in Deep Convolution Neural Network

P. P. Murugan|arXiv (Cornell University)|2017. 11. 09.
Neural Networks and Applications참고 문헌 7인용 수 13
한 줄 요약

이 논문은 깊이 있는 합성곱 신경망(CNN)에서 전방전파와 오차역전파의 종합적인 수학적 설명을 제공한다. 아키텍처, 활성화 함수(ReLU, 시그모이드), 손실 함수(교차 엔트로피), 기반 경사 하강법을 통한 파라미터 업데이트를 중심으로 다룬다. 합성곱, 풀링, 완전 연결층을 거쳐 전방전파를 수행한 후, 확률적 경사 하강법을 사용해 가중치와 편향 업데이트를 위한 기울기를 계산하는 오차역전파 과정을 상세히 기술하며, 단순화된 Grayscale 이미지 환경에서 CNN 메커니즘을 이해하기 위한 기초 가이드를 제공한다.

ABSTRACT

Convolution Neural Networks (CNN), known as ConvNets are widely used in many visual imagery application, object classification, speech recognition. After the implementation and demonstration of the deep convolution neural network in Imagenet classification in 2012 by krizhevsky, the architecture of deep Convolution Neural Network is attracted many researchers. This has led to the major development in Deep learning frameworks such as Tensorflow, caffe, keras, theno. Though the implementation of deep learning is quite possible by employing deep learning frameworks, mathematical theory and concepts are harder to understand for new learners and practitioners. This article is intended to provide an overview of ConvNets architecture and to explain the mathematical theory behind it including activation function, loss function, feedforward and backward propagation. In this article, grey scale image is taken as input information image, ReLU and Sigmoid activation function are considered for developing the architecture and cross-entropy loss function are used for computing the difference between predicted value and actual value. The architecture is developed in such a way that it can contain one convolution layer, one pooling layer, and multiple dense layers

연구 동기 및 목표

  • 초보자와 실무자들을 대상으로 깊이 있는 합성곱 신경망(CNN)에서 전방전파와 오차역전파 과정을 명확하고 수학적으로 기반한 설명을 제공하는 것.
  • 합성곱층, 풀링층, 완전 연결층의 핵심 구성 요소를 단계별로 수학적 연산을 유도함으로써 그 본질을 밝혀내는 것.
  • 단순화된 Grayscale 이미지 입력을 사용해 활성화 함수(ReLU, 시그모이드)와 손실 함수(교차 엔트로피)가 CNN 학습 과정에서 수행하는 역할을 설명하는 것.
  • 사슬법칙과 오차역전파를 활용해 합성곱층과 완전 연결층의 가중치 및 편향에 대한 기울기 계산을 유도하고 설명하는 것.
  • 학습률 α를 사용해 기울기 하강법을 통해 파라미터 업데이트를 명시적으로 기술한, 전방전파와 오차역전파의 완전한 엔드 투 엔드 워크플로우를 제시하는 것.

제안 방법

  • 네트워크 아키텍처는 하나의 합성곱층, 하나의 풀링층, 그리고 다수의 완전 연결층으로 구성되며, 입력은 Grayscale 이미지이다.
  • 전방전파에서는 선형 변환(z = Wx + b)을 통해 활성화를 계산한 후, ReLU 또는 시그모이드 함수를 통해 비선형 활성화를 적용한다.
  • 손실 함수는 예측값과 진짜 레이블 간의 교차 엔트로피로 정의되며, 모델 성능 평가에 사용된다.
  • 오차역전파에서는 최종 층에서 시작해 네트워크를 거꾸로 에러를 전파하며 기울기를 계산한다.
  • 가중치 및 편향에 대한 기울기는 편미분을 통해 유도되며, ∂L/∂W 및 ∂L/∂b로 표현되며, ReLU 및 시그모이드 활성화 함수에 특화된 표현식이 포함된다.
  • 파라미터 업데이트는 학습률 α를 사용한 표준 확률적 경사 하강법(SGD)을 통해 수행되며, W = W - α·∂L/∂W 및 b = b - α·∂L/∂b 식으로 가중치와 편향을 업데이트한다.

실험 결과

연구 질문

  • RQ1CNN에서 전방전파가 합성곱층, 풀링층, 완전 연결층을 거쳐 신호를 어떻게 전파하는가?
  • RQ2CNN에서 손실 함수의 수학적 유도 및 네트워크 파라미터에 대한 손실 함수의 기울기 계산은 어떻게 이루어지는가?
  • RQ3오차역전파를 통해 합성곱층의 가중치 및 편향에 대한 손실 함수의 기울기는 어떻게 계산되는가?
  • RQ4ReLU 및 시그모이드와 같은 활성화 함수가 CNN에서 출력과 기울기 흐름에 어떤 역할을 하는가?
  • RQ5오차 신호는 네트워크를 거꾸로 어떻게 전파되며, 합성곱층의 커널 가중치 및 편향에 대한 기울기는 어떻게 계산되는가?

주요 결과

  • 전방전파는 선형 조합(z = Wx + b)을 통해 계층별 활성화를 계산한 후, 비선형 활성화(ReLU 또는 시그모이드)를 적용하여 특징 맵과 최종 예측을 생성한다.
  • 교차 엔트로피 손실 함수는 예측값과 진짜 레이블 간의 차이를 측정하며, 출력 층에 대한 손실 함수의 도함수를 사용해 기울기를 계산한다.
  • 최종 완전 연결층에서 편향에 대한 기울기는 ∂L/∂b^L+1_i = z^{L-1}_i - y_i로 유도되며, 이는 ReLU 활성화를 가정한다.
  • 합성곱층의 커널 가중치에 대한 기울기는 ∂L/∂k^{p,q}_{u,v} = Σ_{m,n} (P^{p,q}_{m,n}) · I_{m-u,n-v}로 계산되며, 여기서 P^{p,q}_{m,n}는 상游 기울기이다.
  • 합성곱층의 편향에 대한 기울기는 상위 기울기의 합으로 표현되며, ∂L/∂b^{p,q} = Σ_{m,n} ∂L/∂C^{p,q}_{m,n}이다.
  • 파라미터 업데이트는 표준 SGD를 통해 수행되며, 학습률 α와 계산된 기울기를 사용해 가중치와 편향을 업데이트한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.