Skip to main content
QUICK REVIEW

[논문 리뷰] Frequency Principle in Deep Learning with General Loss Functions and Its Potential Application

Zhi‐Qin John Xu|arXiv (Cornell University)|2018. 11. 26.
Model Reduction and Neural Networks참고 문헌 14인용 수 14
한 줄 요약

이 논문은 깊이 있는 신경망(DNN)이 저주파 성분을 고주파 성분보다 먼저 학습하는 주파수 원리(F-Principle)가 평균 제곱오차와 교차엔트로피를 포함한 일반적인 손실 함수에도 적용된다는 것을 보여준다. 저자들은 이론적 분석과 실험을 통해 DNN이 미분방정식을 푸는 데 있어 저주파 수렴를 가속화할 수 있음을 입증하고, DNN을 이용해 저주파 성분을 포착하고 고전적 해법을 통해 고주파 성분을 정밀화하는 하이브리드 DNN-자코비 방법을 제안한다.

ABSTRACT

Previous studies have shown that deep neural networks (DNNs) with common settings often capture target functions from low to high frequency, which is called Frequency Principle (F-Principle). It has also been shown that F-Principle can provide an understanding to the often observed good generalization ability of DNNs. However, previous studies focused on the loss function of mean square error, while various loss functions are used in practice. In this work, we show that the F-Principle holds for a general loss function (e.g., mean square error, cross entropy, etc.). In addition, DNN's F-Principle may be applied to develop numerical schemes for solving various problems which would benefit from a fast converging of low frequency. As an example of the potential usage of F-Principle, we apply DNN in solving differential equations, in which conventional methods (e.g., Jacobi method) is usually slow in solving problems due to the convergence from high to low frequency.

연구 동기 및 목표

  • 주어진 손실 함수가 평균 제곱오차 외에도 교차엔트로피와 같은 일반적인 손실 함수일 때 주파수 원리(F-Principle)가 성립함을 입증하는 것.
  • 고전적 반복 해법에서 저주파 성분 수렴이 느린 미분방정식의 수치적 해법 향상에 F-Principle를 활용할 수 있는지 조사하는 것.
  • DNN의 내재된 저주파 우선 학습 특성을 활용해 DNN과 고전적 반복 해법(예: 자코비)을 조합한 하이브리드 수치적 방법을 제안하고 검증하는 것.
  • 일반적인 손실 함수를 사용한 DNN 학습 동역학이 여전히 저주파에서 고주파로의 순차적 주파수 성분 학습을 보임을 이론적 및 경험적 증거로 제시하는 것.

제안 방법

  • 일반적인 손실 함수를 사용한 DNN 학습에서의 경량 흐름 이론적 분석을 통해, 활성화 함수의 스펙트럼 감쇠로 인해 손실 기울기의 주파수 응답이 저주파 성분을 우선시함을 보여주는 분석.
  • 직교 기저 분해(예: 푸리에 기저)를 사용해 DNN 출력을 표현하고 학습 동안 주파수 계수의 변화를 추적하는 방법.
  • 교차엔트로피 손실을 사용한 1차원 분류 작업을 통해 실험적으로 저주파 성분이 고주파 성분보다 먼저 학습됨을 입증.
  • 디리클레 원리에 기반해 1차원 포아송 방정식을 DNN으로 푸는 응용: 주파수 도메인에서 DNN 학습 동역학을 고전적 자코비 및 가우스-세이델 방법과 비교.
  • 하이브리드 D-자코비 방법 설계: DNN을 먼저 학습시켜 저주파 성분을 포착한 후, DNN 출력을 고전적 반복 해법의 초기 추정치로 사용해 고주파 성분을 정밀화.
  • 손실의 평탄함과 변동성에 기반해 DNN에서 고전적 해법으로의 전환 타이밍을 적응적으로 설정하여 조기 또는 지연 전환을 방지하는 방법.

실험 결과

연구 질문

  • RQ1일반적인 손실 함수(예: 교차엔트로피)를 사용할 때도 평균 제곱오차 외에 F-Principle가 유지되는가?
  • RQ2DNN의 F-Principle를 활용해 고전적 반복 방법에서 저주파 수렴이 느린 미분방정식의 해법을 가속화할 수 있는가?
  • RQ3DNN의 내재된 주파수 편향을 고전적 해법과 어떻게 조합하여 전체 수렴 속도와 정확도를 향상시킬 수 있는가?
  • RQ4하이브리드 수치적 방법에서 DNN 학습에서 고전적 반복 해법으로의 전환 타이밍을 최적화하는 방법은 무엇인가?
  • RQ5DNN의 주파수 편향이 자코비나 가우스-세이델과 같은 고전적 해법의 수렴 행동과 얼마나 일치하는가?

주요 결과

  • 이론적 분석과 실험을 통해 F-Principle가 교차엔트로피와 평균 제곱오차를 포함한 일반적인 손실 함수에서도 성립함을 확인.
  • 교차엔트로피 손실을 사용한 1차원 분류 작업에서 DNN이 여전히 저주파 성분을 고주파 성분보다 먼저 학습함을 입증해 F-Principle의 일반성 확인.
  • 포아송 방정식을 풀이할 때 DNN은 자코비 방법보다 저주파 성분에서 더 빠르게 수렴함. 자코비 방법은 저주파 성분에서 수렴이 느림.
  • 손실 평탄도 시점에 DNN에서 고전적 해법으로 전환할 경우, D-Jacobi 하이브리드 방법은 DNN 또는 자코비 방법만 사용할 때보다 더 빠른 수렴을 달성함.
  • 최적 전환 시점에서 DNN 출력은 장기간 학습 후 DNN 단독 결과보다 무한노름 오차가 더 낮게 나타나 효율성 향상을 입증.
  • 주파수 도메인 분석 결과, DNN은 학습 초반에 고주파 성분을 억제하여 다항식 피팅에서 관찰되는 진동 현상(예: 룬게 현상)을 방지함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.