Skip to main content
QUICK REVIEW

[논문 리뷰] Let's Agree to Agree: Neural Networks Share Classification Order on Real Datasets

Guy Hacohen, Leshem Choshen|arXiv (Cornell University)|2019. 05. 26.
Machine Learning and Data Classification인용 수 6
한 줄 요약

이 논문은 CIFAR-100과 ImageNet과 같은 실제 데이터셋에서 다양한 아키텍처와 학습 런에 대해 동일한 순서로 예제를 지속적으로 학습하는 딥 네ural 네트워크를 보여준다. 이는 다른 옵티마이저나 무작위 초기화를 사용해도 마찬가지다. 핵심 발견은 이 공통된 학습 순서가 학습 동역학이 아니라 데이터셋의 구조에 의해 유도된다는 것이다. 합성 데이터셋이나 레이블을 뒤섞은 데이터셋에서는 이 패턴이 깨지며, AdaBoost와 같은 비신경망 모델은 다른 순서로 학습한다.

ABSTRACT

We report a series of robust empirical observations, demonstrating that deep Neural Networks learn the examples in both the training and test sets in a similar order. This phenomenon is observed in all the commonly used benchmarks we evaluated, including many image classification benchmarks, and one text classification benchmark. While this phenomenon is strongest for models of the same architecture, it also crosses architectural boundaries -- models of different architectures start by learning the same examples, after which the more powerful model may continue to learn additional examples. We further show that this pattern of results reflects the interplay between the way neural networks learn benchmark datasets. Thus, when fixing the architecture, we show synthetic datasets where this pattern ceases to exist. When fixing the dataset, we show that other learning paradigms may learn the data in a different order. We hypothesize that our results reflect how neural networks discover structure in natural datasets.

연구 동기 및 목표

  • 다양한 모델과 학습 런 간에 신경망이 예제를 일관된 순서로 학습하는지 조사하기.
  • 이 일관된 학습 순서가 최적화 동역학(예: SGD) 때문인지, 본질적인 데이터셋 구조 때문인지 판단하기.
  • 이 순서가 신경망 전용인지 비신경망 학습 철학과 비교하여 테스트하기.
  • 학습 순서가 데이터 복잡도와 일반화 행동과 관련이 있는지 평가하기.

제안 방법

  • CIFAR-100, MNIST, ImageNet과 같은 표준 벤치마크에서 훈련된 동일하거나 다른 아키텍처의 여러 신경망 모델 간의 분류 순서를 경험적으로 비교하기.
  • '분류 순서'를 모델이 각 테스트 예제를 처음으로 올바르게 분류하는 에포크로 정의하기.
  • 모델 간 및 신경망과 비신경망 모델 간의 학습 순서를 비교하기 위해 상관 분석(Pearson 상관 계수)을 사용하기.
  • 학습 하이퍼파rameter에 대한 학습 순서의 강건성을 테스트하기 위해 다른 옵티마이저, 학습률, 무작위 시드로 모델을 훈련하기.
  • 내재된 구조가 없는 합성 데이터셋을 제작하여 학습 순서가 유지되는지 테스트하기.
  • 선형 약한 학습기로 훈련된 AdaBoost를 원시 픽셀과 사전 훈련된 Inception-V3 모델의 특징에서 훈련하여 신경망과의 학습 순서를 비교하기.

실험 결과

연구 질문

  • RQ1동일한 벤치마크 데이터셋에서 훈련된 서로 다른 신경망 모델이 아키텍처나 학습 하이퍼파rameter에 관계없이 동일한 순서로 예제를 학습하는가?
  • RQ2관찰된 학습 순서는 확률적 최적화(SGD 등)의 결과인가, 아니면 데이터셋의 본질적 구조의 성질인가?
  • RQ3일반화 신호가 없는 합성 또는 레이블을 뒤섞은 데이터셋에서 학습할 경우 이 학습 순서가 유지되는가?
  • RQ4AdaBoost와 같은 비신경망 학습 모델은 신경망과 동일한 예제를 동일한 순서로 학습하는가?
  • RQ5학습 순서가 데이터 복잡도와 관련이 있는가? 즉, 더 쉬운 예제들이 모든 모델에서 일찍 학습되는가?

주요 결과

  • 동일한 아키텍처의 모델들은 매우 높은 상관성을 보이며 학습 순서가 유사하며, 여러 벤치마크에서 피어슨 상관 계수는 0.9 이상이다.
  • 다른 아키텍처의 모델들 역시 처음에는 동일한 순서로 예제를 학습하며, 더 강력한 모델은 약한 모델이 공통 집합을 학습한 후에 추가 예제를 학습한다.
  • 자연스러운 구조가 없는 합성 데이터셋에서는 공통된 학습 순서가 깨지며, 이는 SGD나 최적화의 산물이 아니라는 것을 시사한다.
  • 일반화가 불가능한 레이블을 뒤섞은 데이터셋에서는 모델들이 서로 다른 순서로 예제를 암기하므로, 이 패턴은 실제 데이터셋의 구조에 의존한다는 것을 보여준다.
  • 선형 분류기를 사용한 AdaBoost는 신경망과는 유의미하게 다른 순서로 예제를 학습하며, 사전 훈련된 네트워크의 특징을 사용해도 상관 계수는 낮게(r = 0.35) 유지된다.
  • 모델들이 동일한 데이터 분포에서 샘플링된 서로 다른 훈련 세트를 사용해도 학습 순서는 일관되게 유지된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.