Skip to main content
QUICK REVIEW

[논문 리뷰] Assessing Generalization of SGD via Disagreement

Yiding Jiang, Vaishnavh Nagarajan|arXiv (Cornell University)|2021. 06. 25.
Domain Adaptation and Few-Shot Learning참고 문헌 53인용 수 19
한 줄 요약

이 논문은 동일한 데이터로 훈련된 두 개의 딥 네ural 네트워크 간의 이견 비율을 사용하여 테스트 오차를 직접적으로, 레이블이 없는 데이터만으로 추정하는 방법을 제안한다. 이는 다양한 아키텍처와 데이터셋에서 일반화 오차와 매우 밀접하게 일치하며, 확률적 경사 하강법(SGD)으로 훈련된 모델 앙상블이 잘 校정되어 있을 경우 이 등식이 성립함을 이론적으로 증명함으로써 일반화와 校정성 사이에 새로운 연결 고리를 설정한다.

ABSTRACT

We empirically show that the test error of deep networks can be estimated by simply training the same architecture on the same training set but with a different run of Stochastic Gradient Descent (SGD), and measuring the disagreement rate between the two networks on unlabeled test data. This builds on -- and is a stronger version of -- the observation in Nakkiran & Bansal '20, which requires the second run to be on an altogether fresh training set. We further theoretically show that this peculiar phenomenon arises from the \emph{well-calibrated} nature of \emph{ensembles} of SGD-trained models. This finding not only provides a simple empirical measure to directly predict the test error using unlabeled test data, but also establishes a new conceptual connection between generalization and calibration.

연구 동기 및 목표

  • 레이블이 없는 테스트 데이터가 필요 없이 레이블이 없는 데이터에서의 모델 이견이 일반화 오차를 예측할 수 있는지 조사한다.
  • 이전 연구에서 관찰된 바와 같이, 두 모델이 서로 다른 랜덤 시드로 동일한 데이터셋에서 훈련될 경우, 이견이 테스트 오차와 상관관계를 유지하는지 확인한다.
  • 관찰된 이견 비율과 테스트 오차 간의 일치성에 대한 이론적 기반을 구축한다.
  • 이견이 모델 일반화를 측정하는 데 있어 블랙박스이자 개인정보 보호에 유리한 방법으로 실용적으로 유용한지 탐색한다.

제안 방법

  • 동일한 훈련 데이터셋에서 동일한 아키텍처와 초모수를 사용하지만 다른 랜덤 시드(예: 다른 가중치 초기화 및 데이터 셔플링 순서)로 두 개의 딥 네럴 네트워크를 훈련한다.
  • 레이블이 없는 검증 세트에서 두 모델 간의 이견 비율을 계산하기 위해, 서로 다른 레이블을 예측하는 샘플의 비율을 측정한다.
  • 동일한 레이블이 없는 검증 세트에서 각 모델의 일반화 오차(테스트 오차)를 측정하여 이견 비율과 비교한다.
  • 확률적 최적화로 훈련된 모델 앙상블이 잘 校정되어 있을 경우, 기대 이견 비율이 기대 테스트 오차와 동일하다는 것을 이론적으로 증명한다.
  • 교정 플롯과 신뢰도 히스토GRAM을 사용하여 SGD로 훈련된 앙상블의 잘 校정되어 있는 성질을 경험적으로 검증한다.
  • 다양한 데이터 분할, 모델 아키텍처, 초모수(예: 넓이, 깊이, 배치 크기)에 대한 분석을 통해 이견-일반화 관계의 강건성을 평가한다.

실험 결과

연구 질문

  • RQ1두 모델이 서로 다른 랜덤 시드로 동일한 데이터셋에서 훈련될 경우, 레이블이 없는 데이터에서의 이견이 여전히 테스트 오차와 상관관계를 가지는가? 이는 이전 연구에서 두 모델이 별도의 데이터셋에서 훈련된 경우에 관찰된 바와 같다.
  • RQ2레이블이 없는 테스트 데이터나 모델 내부 정보 없이도 이견 비율이 일반화 오차의 신뢰할 수 있는 직접 추정치로 사용될 수 있는가?
  • RQ3실제로 이견 비율이 테스트 오차와 약간씩 일치하는 이유는 무엇이며, 이 현상을 설명하는 SGD로 훈련된 모델의 기본적인 성질은 무엇인가?
  • RQ4이견-일반화 등식이 성립하는 조건은 무엇인가? 특히 분포 외 데이터에 대해서는 어떻게 되는가?
  • RQ5이견과 테스트 오차 간의 관계는 넓이, 깊이, 배치 크기와 같은 모델 초모수의 변화에 대해 강건한가?

주요 결과

  • 서로 다른 랜덤 시드로 동일한 데이터셋에서 훈련된 두 모델 간의 이견 비율은 테스트 오차와 매우 유사하며, 모든 모델 쌍에 대해 R² = 0.986, Kendall’s tau = 0.858을 기록한다.
  • 이론적으로 잘 校정되어 있는 SGD로 훈련된 앙상블의 특성 덕분에, 이견-일반화 등식은 초모수의 작은 변화(예: 넓이, 깊이, 배치 크기)에도 불구하고 유지되며, 이는 모델 구성 변경에 대한 강건성을 시사한다.
  • 현상은 SGD로 훈련된 앙상블이 잘 校정되어 있다는 이론적 설명으로 설명된다: 앙상블이 잘 校정되어 있을 경우, 기대 이견 비율은 기대 테스트 오차와 동일하다.
  • PACS 데이터셋의 일부 도메인에서는 분포 외 데이터에 대해서도 관계가 유지되지만, 항상 그렇지는 않으며, 도메인 이동에 민감함을 시사한다.
  • 이견 측정법은 레이블이 없는 데이터만 필요로 하고 모델 가중치나 기울기 접근이 불필요하므로, 블랙박스이자 개인정보 보호에 유리한 일반화 추정 방법으로 효과적이다.
  • 여러 모델 쌍을 사용할 경우 추정 정확도가 향상되며, 네 쌍을 사용할 경우 평균 편차가 대각선(테스트 오차 = 이견)에서 0.034로 감소하는 반면, 단일 쌍을 사용할 경우 0.112로 유지된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.