Skip to main content
QUICK REVIEW

[논문 리뷰] Invariance Learning in Deep Neural Networks with Differentiable Laplace Approximations

Alexander Immer, Tycho F. A. van der Ouderaa|arXiv (Cornell University)|2022. 02. 22.
Gaussian Processes and Bayesian Inference인용 수 11
한 줄 요약

이 논문은 깊이 신경망에서 데이터 증강 불변성의 엔드 투 엔드 학습을 위한 미분 가능한 베이지안 방법을 제안한다. 이는 마진 분포의 크로네커 분해 라플라스 근사법을 사용한다. 검증 데이터 없이 경사 하강법을 통해 불변성 파라미터를 최적화함으로써 일반화 성능과 데이터 효율성을 향상시키며, 기존 증강 기법 대비 이미지 벤치마크에서 최대 10%p 높은 정확도와 10배 높은 데이터 효율성을 달성한다.

ABSTRACT

Data augmentation is commonly applied to improve performance of deep learning by enforcing the knowledge that certain transformations on the input preserve the output. Currently, the data augmentation parameters are chosen by human effort and costly cross-validation, which makes it cumbersome to apply to new datasets. We develop a convenient gradient-based method for selecting the data augmentation without validation data during training of a deep neural network. Our approach relies on phrasing data augmentation as an invariance in the prior distribution on the functions of a neural network, which allows us to learn it using Bayesian model selection. This has been shown to work in Gaussian processes, but not yet for deep neural networks. We propose a differentiable Kronecker-factored Laplace approximation to the marginal likelihood as our objective, which can be optimised without human supervision or validation data. We show that our method can successfully recover invariances present in the data, and that this improves generalisation and data efficiency on image datasets.

연구 동기 및 목표

  • 딥 신경망에서 데이터 증강 변환의 자동 선택을 가능하게 하여 수동 튜닝과 교차 검증에 의존하지 않도록 하는 것.
  • 검증 데이터가 필요 없이 학습 중에 불변성 파라미터(예: 회전, 스케일링)에 대한 기울기 기반 최적화를 가능하게 하는 것.
  • 깊이 신경망에 대해 마진 분포를 미분 가능하고 확장 가능한 방식으로 근사함으로써 베이지안 모델 선택을 확장하는 것.
  • 데이터로부터 직접 작업별 불변성을 학습함으로써 일반화 성능과 데이터 효율성을 향상시키는 것.

제안 방법

  • 데이터 증강을 입력 편향에 대한 사전으로 정의하여, 변환된 입력의 평균을 취해 기능적 불변성을 강제한다.
  • 불변성 사전이 있는 베이지안 신경망을 위한 마진 분포에 대한 미분 가능한 크로네커 분해 라플라스 근사를 제안한다.
  • 재생성 기법을 사용하여 불변성 파라미터에 대한 확률적 기울기를 유도함으로써 엔드 투 엔드 최적화를 가능하게 한다.
  • 가중치와 불변성 초모수를 함께 최적화함으로써 불변성 파라미터 학습을 표준 신경망 학습과 통합한다.
  • 확장 가능한 라플라스 근사를 활용해 마진 분포를 추정함으로써, 깊이 신경망에서 기울기 기반의 베이지안 모델 선택을 가능하게 한다.

실험 결과

연구 질문

  • RQ1딥 신경망에서 기울기 기반 최적화를 통해 데이터로부터 불변성 파라미터(예: 회전, 스케일링)를 자동으로 학습시킬 수 있는가?
  • RQ2마진 분포 근사를 통한 미분 가능한 베이지안 모델 선택이 수작업으로 만든 증강 기법에 비해 일반화 성능과 데이터 효율성을 향상시키는가?
  • RQ3검증 데이터나 인간이 지정한 초모수 없이도 제안된 방법이 의미 있는 불변성을 학습할 수 있는가?
  • RQ4이러한 학습된 불변성 방법의 성능은 이미지 분류 작업에서 표준 데이터 증강 기반선과 비교해 어떻게 되는가?

주요 결과

  • 기존의 MNIST, Fashion-MNIST, CIFAR-10 데이터셋에서 표준 데이터 증강 기법 대비 최대 8–10%p 높은 테스트 정확도를 달성했다.
  • 이미지 데이터셋의 무작위 부분집합에서, 기존 고정 증강 기반선 대비 최대 10배 높은 데이터 효율성을 확보했다.
  • 시각화 및 궤적 분석을 통해 학습된 불변성 분포가 회전 및 애핀 변형과 같은 의미 있는 변환을 복원하는 것으로 확인되었다.
  • 검증 데이터나 초모수 튜닝 없이도 기울기 기반으로 불변성 파라미터를 엔드 투 엔드로 최적화하는 데 성공했다.
  • 크로네커 분해 라플라스 근사는 효율적이고 미분 가능한 마진 분포 추정을 가능하게 하여, 깊이 신경망에서의 베이지안 모델 선택을 실현 가능하게 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.