Skip to main content
QUICK REVIEW

[논문 리뷰] A Unifying View on Implicit Bias in Training Linear Neural Networks

Chulhee Yun, Shankar Krishnan|arXiv (Cornell University)|2020. 10. 06.
Neural Networks and Applications참고 문헌 35인용 수 12
한 줄 요약

이 논문은 완전히 연결된, 대각선 및 컨볼루션 아키텍처를 모두 포함하는 선형 신경망을 위한 통합 텐서 공식을 제안하며, 기울기 흐름이 변환된 입력 공간에서 특정 노름으로의 암묵적 편향을 갖는 해로 수렴함을 보여준다. 직교 분해 가능한 네트워크의 경우, 이전 연구보다 훨씬 더 약한 가정 하에 분류 문제에서 $\ell_{2/L}$ 최대 마진 해와 회귀 문제에서 최소 노름 해로 수렴함을 증명한다.

ABSTRACT

We study the implicit bias of gradient flow (i.e., gradient descent with infinitesimal step size) on linear neural network training. We propose a tensor formulation of neural networks that includes fully-connected, diagonal, and convolutional networks as special cases, and investigate the linear version of the formulation called linear tensor networks. With this formulation, we can characterize the convergence direction of the network parameters as singular vectors of a tensor defined by the network. For $L$-layer linear tensor networks that are orthogonally decomposable, we show that gradient flow on separable classification finds a stationary point of the $\ell_{2/L}$ max-margin problem in a "transformed" input space defined by the network. For underdetermined regression, we prove that gradient flow finds a global minimum which minimizes a norm-like function that interpolates between weighted $\ell_1$ and $\ell_2$ norms in the transformed input space. Our theorems subsume existing results in the literature while removing standard convergence assumptions. We also provide experiments that corroborate our analysis.

연구 동기 및 목표

  • 다양한 선형 네트워크 아키텍처(완전히 연결된, 대각선, 컨볼루션 네트워크 등)에 걸쳐 암묵적 편향 분석을 통합하기 위해.
  • 텐서 특이벡터를 사용하여 선형 텐서 네트워크에서 기울기 흐름의 수렴 방향을 특성화하기 위해.
  • 이전 암묵적 편향 분석에서 흔히 사용되던 강력한 수렴 가정(예: 전역 손실 수렴 또는 방향 수렴)에 의존하지 않도록 하기 위해.
  • 기존 선형 네트워크 및 행렬 분해 결과를 더 넓은 범위의 직교 분해 가능한 아키텍처로 확장하기 위해.
  • 다양한 네트워크 유형에서 기울기 흐름의 한계점에 대한 이론적 예측을 경험적으로 검증하기 위해.

제안 방법

  • 아키텍처 간 분석을 통합하기 위해 일반적인 텐서 공식화를 제안하며, 선형 버전인 선형 텐서 네트워크를 도입한다.
  • 네트워크 구조에서 유도된 텐서를 정의하고, 그 특이벡터를 사용해 기울기 흐름의 수렴 방향을 특성화한다.
  • 한계점의 정밀한 특성화를 가능하게 하기 위해 직교 분해 가능한 네트워크(가정 1)의 개념을 도입한다.
  • 기울기 흐름 역학과 특이값 분석을 통해 초기화 스케일 $\alpha \to 0$ 일 때 각 레이어 간 특이벡터가 정렬됨을 보여준다.
  • 행렬 섭동 이론과 노름 경계를 적용해, 작은 초기화 조건 하에서 특이값이 0에서 멀리 떨어져 있음을 증명한다.
  • 초기화 스케일 $\alpha \to 0$ 일 때 네트워크 출력 파라미터 $\bm{\beta}_{\rm fc}$ 의 극한을 분석하여, $\bm{X}$ 의 행공간 안에서 최소 $\ell_2$ 노름 해로 수렴함을 보여준다.

실험 결과

연구 질문

  • RQ1어떻게 통합 프레임워크가 다양한 선형 네트워크 아키텍처 간의 암묵적 편향을 기술할 수 있는가?
  • RQ2선형 텐서 네트워크에서 기울기 흐름의 수렴 방향은 무엇이며, 이는 텐서 특이벡터와 어떻게 관련이 있는가?
  • RQ3직교 분해 가능한 네트워크에서 기울기 흐름이 분류 문제에서 $\ell_{2/L}$ 최대 마진 해로 수렴하는 조건은 무엇인가?
  • RQ4손실 또는 파라미터의 수렴을 가정하지 않고도 과소정의 선형 회귀에서의 암묵적 편향을 특성화할 수 있는가?
  • RQ5초기화 스케일 $\alpha$ 는 기울기 흐름이 최소 노름 해로 수렴하는 데 어떤 영향을 미치는가?

주요 결과

  • 선형 완전히 연결된 네트워크의 경우, 기울기 흐름은 $\ell_2$ 최대 마진 해로 수렴하며, 이는 이전 결과를 회복하지만 더 적은 가정을 필요로 한다.
  • 직교 분해 가능한 네트워크의 경우, 기울기 흐름은 변환된 입력 공간에서 $\ell_{2/\text{depth}}$ 최대 마진 해로 수렴하며, 이는 이전의 컨볼루션 및 대각선 네트워크 결과를 일반화한다.
  • 과소정의 회귀 문제에서, 기울기 흐름은 손실 또는 파라미터 수렴 가정 없이도 변환된 공간에서 가중 $\ell_1$ 과 $\ell_2$ 노름 사이를 interpolating 하는 노름을 최소화하는 전역 최소값으로 수렴한다.
  • 깊은 선형 완전히 연결된 네트워크의 경우, 초기화 스케일 $\alpha \to 0$ 일 때 기울기 흐름은 최소 $\ell_2$ 노름 해로 수렴하며, 이는 더 약한 조건 하에서도 알려진 행동을 확인한다.
  • 네트워크 출력 파라미터 $\bm{\beta}_{\rm fc}$ 의 극한은 $\bm{X}$ 의 행공간에 속하며, 유일한 최소 $\ell_2$ 노름 해인 $\bm{X}^T(\bm{X}\bm{X}^T)^{-1}\bm{y}$ 로 수렴한다.
  • 실험 결과는 기울기 하강 경로가 다양한 초기화 스케일 하에서 완전히 연결된, 대각선 및 컨볼루션 네트워크에서 예측된 한계점과 일치함을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.