Skip to main content
QUICK REVIEW

[논문 리뷰] Data augmentation in Bayesian neural networks and the cold posterior effect

Seth Nabarro, Stoil Ganev|arXiv (Cornell University)|2021. 06. 10.
Gaussian Processes and Bayesian Inference인용 수 6
한 줄 요약

이 논문은 유한 궤도 설정에서 정확한 우도 계산과 전체 궤도 설정에서 날카운 다중 샘플 경계를 도입하여 데이터 증강을 통한 원칙적인 베이지안 신경망(BNN) 학습을 제안한다. 이는 이러한 잘 정의된 우도가 존재하는 상황에서도 콜드 포스터리어 효과가 지속됨을 보여주며, 이는 잘못된 데이터 증강 처리의 산물이 아니며 오히려 데이터 쿠리에이션 또는 사전 분포의 잘못 설정에서 기인할 가능성이 있음을 시사한다.

ABSTRACT

Bayesian neural networks that incorporate data augmentation implicitly use a ``randomly perturbed log-likelihood [which] does not have a clean interpretation as a valid likelihood function'' (Izmailov et al. 2021). Here, we provide several approaches to developing principled Bayesian neural networks incorporating data augmentation. We introduce a ``finite orbit'' setting which allows likelihoods to be computed exactly, and give tight multi-sample bounds in the more usual ``full orbit'' setting. These models cast light on the origin of the cold posterior effect. In particular, we find that the cold posterior effect persists even in these principled models incorporating data augmentation. This suggests that the cold posterior effect cannot be dismissed as an artifact of data augmentation using incorrect likelihoods.

연구 동기 및 목표

  • 표준 방법이 유효한 확률적 해석 없이 '임의로 변형된 로그우도'를 생성하는, 베이지안 신경망에서의 부적절한 데이터 증강이라는 오랫동안 지속된 문제를 해결하기 위해.
  • 유한 궤도 설정을 통해 정확한 우도 계산을 가능하게 하고 일반적인 경우에 대해 다중 샘플 경계를 도입하여 데이터 증강을 BNN에 원칙적으로 통합하는 프레임워크를 개발하기 위해.
  • 콜드 포스터리어 효과(CPE)가 잘못된 데이터 증강 처리로 인한 결과물인지, 특히 타당하지 않은 우도로 인한 것인지 조사하기 위해.
  • 잘 정의된 우도를 갖는 모델에서 CPE를 평가하여, 경쟁 가능한 가설들 중에서 그 진정한 근본 원인을 분리해내기 위해.
  • 부적절한 우도가 데이터 증강에서 유래하는 혼동 요인을 제거함으로써, 데이터 쿠리에이션과 사전 분포의 잘못 설정이 CPE에 어떤 역할을 하는지 명확히 하기 위해.

제안 방법

  • 작고 이산적인 증강 집합을 갖는 '유한 궤도' 설정을 도입하여 베이지안 신경망에서 로그우도를 정확히 계산할 수 있도록 한다.
  • 전체 궤도 설정에서 계산이 불가능한 로그우도에 대해 날카운 하한 경계를 제공하는 다중 샘플 추정기법을 제안하며, 이는 네트워크의 로짓 또는 확률을 평균화하여 구성된다.
  • 다양한 증강 샘플들 사이에서 로짓 또는 확률을 평균화하는 기반으로 한 학습 목표를 도출하며, 이는 단일 샘플 추정기법보다 유효하고 더 날카운 경계를 제공한다.
  • 분류 및 회귀 작업 모두에 이 방법을 적용하여 표준 분류 설정을 초월하는 일반화를 이루었다.
  • 스토하스틱 그레디언트 랭글레인 다이내믹스(SGLD) 및 기타 베이지안 추론 방법을 사용하여 원칙적인 데이터 증강을 갖춘 BNN을 학습하고 평가하였다.
  • 콜드 포스터리어 효과를 연구하기 위해 사후 분포에서 온도 스케일링(T)을 적용하였으며, T=1과 T<1에서의 성능과 우도를 비교하였다.

실험 결과

연구 질문

  • RQ1원칙적이고 잘 정의된 우도를 갖는 데이터 증강이 베이지안 신경망에 통합된 상황에서 콜드 포스터리어 효과가 지속되는가?
  • RQ2데이터 증강 BNN에 대해 정확하거나 날카운 다중 샘플 경계를 로그우도에 대해 유도할 수 있으며, 이는 모델의 캘리브레이션과 성능을 향상시키는가?
  • RQ3콜드 포스터리어 효과는 단순한 데이터 증강에 의한 잘못된 우도에서 기인한 결과물인가, 아니면 모델 사양의 더 깊은 문제를 반영하는가?
  • RQ4데이터 증강이 있는 모델과 없는 모델에서 콜드 포스터리어 효과의 유무가 그 효과의 진정한 근본 원인을 밝히는 데 어떻게 기여하는가?
  • RQ5오늘날 잘못된 우도라는 혼동 요인이 제거된 상황에서, 데이터 쿠리에이션과 사전 분포의 잘못 설정이 콜드 포스터리어 효과를 얼마나 설명하는가?

주요 결과

  • 유한 궤도 설정에서 정확한 우도와 전체 궤도 설정에서 날카운 다중 샘플 경계를 갖는 BNN에서도 콜드 포스터리어 효과가 지속되며, 이는 데이터 증강에서 기인한 잘못된 우도의 산물이 아니라는 것을 시사한다.
  • 이전 연구에서 사용된 표준 단일 샘플 학습 목표(예: Wenzel 등, 2020)는 진짜 로그우도에 대해 느슨한 경계를 제공하며, 이는 CPE에 대한 오해의 해소에 기여했을 수 있다.
  • 로짓 또는 확률의 평균을 기반으로 한 다중 샘플 추정기법은 단일 샘플 방법보다 더 날카운 경계를 제공하며, 이는 이전 방법이 가우시안 또는 Pólya-Gamma 근사에 국한된 것과 달리 광범위한 유형의 우도 함수에 적용 가능하다.
  • 유한 궤도 설정은 로그우도의 정확한 계산을 가능하게 하여 원칙적인 데이터 증강 BNN 평가를 위한 명확한 기준이 된다.
  • 데이터 증강이 없는 경우 콜드 포스터리어 효과가 없고, 원칙적인 데이터 증강이 있는 경우에만 지속되는 것으로 나타나, 비증강 모델에서 CPE가 없는 것은 모델의 잘못된 사용 때문일 수 있으며, 정확성을 뜻하는 것은 아님을 시사한다.
  • 결과는 콜드 포스터리어 효과가 데이터 쿠리에이션(예: 여러 평가자가 이미지를 레이블링하는 것) 또는 사전 분포의 잘못 설정 때문일 가능성이 더 크며, BNN에서 잘못된 데이터 증강 때문이 아니라는 가설을 지지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.