[논문 리뷰] No One Representation to Rule Them All: Overlapping Features of Training Methods
이 논문은 지도 학습과 대비 학습 전훈과 같은 다각적인 학습 방법론이 상호보완적인 오차와 전문화된 특징 표현을 생성함으로써 매우 효과적인 앙상블을 가능하게 한다고 보여준다. 다른 목표와 데이터로 학습된 모델을 조합함으로써, 낮은 정확도를 보이는 모델들조차도 앙상블 성능을 향상시킬 수 있으며, 이는 고정확도 모델과 조합할 경우 Pascal VOC에서 86.7%의 정확도를 달성한다.
Despite being able to capture a range of features of the data, high accuracy models trained with supervision tend to make similar predictions. This seemingly implies that high-performing models share similar biases regardless of training methodology, which would limit ensembling benefits and render low-accuracy models as having little practical use. Against this backdrop, recent work has developed quite different training techniques, such as large-scale contrastive learning, yielding competitively high accuracy on generalization and robustness benchmarks. This motivates us to revisit the assumption that models necessarily learn similar functions. We conduct a large-scale empirical study of models across hyper-parameters, architectures, frameworks, and datasets. We find that model pairs that diverge more in training methodology display categorically different generalization behavior, producing increasingly uncorrelated errors. We show these models specialize in subdomains of the data, leading to higher ensemble performance: with just 2 models (each with ImageNet accuracy ~76.5%), we can create ensembles with 83.4% (+7% boost). Surprisingly, we find that even significantly low-accuracy models can be used to improve high-accuracy models. Finally, we show diverging training methodology yield representations that capture overlapping (but not supersetting) feature sets which, when combined, lead to increased downstream performance.
연구 동기 및 목표
- 다양한 방법론으로 훈련된 고성능 모델들이 유사한 편향을 공유하는지 또는 행동의 다양성을 보이는지 조사하기.
- 다른 방법론으로 훈련된 낮은 정확도의 모델들이 여전히 앙상블 성능에 기여할 수 있는지 확인하기.
- 다른 학습 방법론에서 유도된 표현이 겹치는 특징를 갖지만 상위집합이 아닌 특징를 학습하여 최종 작업 성능을 향상시키는지 검토하기.
- 학습 방법론이 모델 간 일반화 행동과 오차 상관관계에 어떻게 영향을 미치는지 평가하기.
- 전이 학습과 앙상블 효율성에서 특징 다양성의 역할 탐색하기.
제안 방법
- 저자들은 CLIP, ALIGN, SimCLR, BiT, ViT-G/14, MPL과 같은 최첨단 모델을 포함해 다양한 초모수, 아키텍처, 학습 목표, 프레임워크, 데이터셋에서 82개의 모델을 훈련하거나 수집하였다.
- 모델 쌍은 재초기화에서 데이터셋까지 다양하게 변동하는 학습 방법론의 차이에 기반하여 평가되었으며, ImageNet에서의 오차 상관관계가 측정되었다.
- 앙상블 성능는 모델 쌍의 예측 평균화를 통해 평가되었으며, ImageNet과 Pascal VOC에서의 정확도가 측정되었다.
- 스태킹 일반화는 두 모델의 특징 임bedding을 연결하고, 최종 작업에서 선형 헤드를 미세조정함으로써 적용되었다.
- 예측 다양성은 Pascal VOC에서의 11점 mAP 측정과 ImageNet 정확도와 비교함으로써 분석되었다.
- 서브도메인 전문화는 자연 이미지와 인공 이미지 하위집합에서의 모델 성능 분석을 통해 평가되었으며, 서로 다른 데이터 서브도메인에서의 고유한 강점을 드러냈다.
실험 결과
연구 질문
- RQ1유의미하게 다른 방법론으로 훈련된 모델들이, 개별 정확도가 유사하더라도 상호보완적인 오차를 보이는가?
- RQ2다른 방법론으로 훈련된 낮은 정확도의 모델들이 높은 정확도 모델과 조합될 경우 여전히 앙상블 성능을 향상시킬 수 있는가?
- RQ3다른 목표로 훈련된 모델들이 겹치는 특징를 학습하지만 상위집합이 아닌 특징를 학습하며, 이들이 조합될 경우 최종 작업 성능을 향상시키는가?
- RQ4학습 목표와 데이터 분포의 선택이 데이터 서브도메인 간 모델 전문화에 어떻게 영향을 미치는가?
- RQ5개별 모델 정확도보다 예측 다양성이 최종 작업 성능을 더 잘 예측하는가?
주요 결과
- 학습 방법론에서의 더 큰 차이—특히 목표와 데이터에서의 차이—는 점점 더 상호보완적인 오차를 유도하며, 이는 더 높은 앙상블 정확도로 이어진다.
- 표준 ResNet-50(76.5% ImageNet 정확도)과 가장 다각적인 방법론으로 훈련된 모델인 ALIGN-ZS(75.5% 정확도)를 조합하여 83.4%의 정확도를 달성했으며, 이는 +7% 향상이다.
- 대비 학습된 모델들인 CLIP-S는 인공 이미지에서 특화되어 있는 반면, ResNet-50는 자연 이미지에서 뛰어난 성능을 보이며, 서브도메인 전문화를 보여준다.
- 고정확도 모델(BiT-1k, 82.9% 정확도)과 낮은 정확도 모델들(최대 77.4%)을 조합하여 Pascal VOC에서 앙상블 성능가 86.7%에 도달했다.
- 다양하게 훈련된 모델들 간의 임베딩을 쌍으로 연결한 결과, Pascal VOC에서 91.4%의 정확도를 기록했으며, 이는 최고의 단일 모델(90.7% 정확도)을 초월했다.
- 최종 작업에서 가장 뛰어난 성능을 보인 모델 조합에는 ImageNet에서 가장 높은 정확도를 기록한 모델(MPL)이 포함되지 않았으며, 이는 다양성이 앙상블 성능에서 순수 정확도를 압도할 수 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.