[논문 리뷰] On The Consistency Training for Open-Set Semi-Supervised Learning.
이 논문은 분포 밖(out-of-distribution, OOD) 샘플을 제거하는 대신 활용함으로써 개방형 준지도 학습(open-set semi-supervised learning)을 위한 새로운 일致성 훈련 일致성 훈련 방법을 제안한다. 레이블이 부여된 데이터와 레이블이 미부여된 데이터 간의 클래스별 분포 간극을 메우면서 모델의 일반화 성능을 향상시키고, 특히 OOD 샘플이 존재하는 현실적인 데이터 이동 조건에서 최신 기술 수준(SOTA) 성능을 달성한다.
Conventional semi-supervised learning (SSL) methods, e.g., MixMatch, achieve great performance when both labeled and unlabeled dataset are drawn from the same distribution. However, these methods often suffer severe performance degradation in a more realistic setting, where unlabeled dataset contains out-of-distribution (OOD) samples. Recent approaches mitigate the negative influence of OOD samples by filtering them out from the unlabeled data. Our studies show that it is not necessary to get rid of OOD samples during training. On the contrary, the network can benefit from them if OOD samples are properly utilized. We thoroughly study how OOD samples affect DNN training in both low- and high-dimensional spaces, where two fundamental SSL methods are considered: Pseudo Labeling (PL) and Data Augmentation based Consistency Training (DACT). Conclusion is twofold: (1) unlike PL that suffers performance degradation, DACT brings improvement to model performance; (2) the improvement is closely related to class-wise distribution gap between the labeled and the unlabeled dataset. Motivated by this observation, we further improve the model performance by bridging the gap between the labeled and the unlabeled datasets (containing OOD samples). Compared to previous algorithms paying much attention to distinguishing between ID and OOD samples, our method makes better use of OOD samples and achieves state-of-the-art results.
연구 동기 및 목표
- 레이블이 부여된 데이터에 포함된 분포 밖(out-of-distribution, OOD) 샘플이 존재할 경우 기존 준지도 학습(SSL) 방법의 성능 저하 문제를 해결하기 위해.
- 낮은 차원과 높은 차원 공간에서 OOD 샘플이 딥 네URAL 네트워크 훈련에 미치는 영향을 조사하기 위해.
- OOD 샘플을 명시적으로 탐지하거나 제거하는 대신, 이를 유의미하게 활용하는 방법을 개발하여 데이터 분포 이동 조건 하에서 모델의 일반화 성능을 향상시키기 위해.
- 레이블이 부여된 데이터와 레이블이 미부여된 데이터 간의 클래스별 분포 간극을 줄이는 것이 성능 향상의 핵심 메커니즘임을 확인하기 위해.
- OOD 샘플을 더 효과적으로 활용함으로써 개방형 준지도 학습에서 최신 기술 수준 성능을 달성하기 위해.
제안 방법
- 데이터 증강을 활용한 일치성 훈련(DACT)을 적용하여, 변형에 대한 모델의 불변성을 유도함으로써 내재된(in-distribution) 및 OOD 샘플을 모두 활용한다.
- 레이블이 부여된 데이터와 레이블이 미부여된 데이터의 클래스별 특징 분포를 정렬하는 분포 간극 정규화를 도입한다.
- 명시적인 OOD 탐지나 필터링을 피하고, 강건성을 향상시키기 위해 분포 정렬에 집중한다.
- 표준 일치성 손실과 클래스별 분포 정렬 손실을 조합한 훈련 목표를 설정하여 혼합 데이터에서의 학습 안정성을 확보한다.
- 데이터 이동 설정 하에서 표준 벤치마크에서 평가하여 일반화 성능 향상을 입증한다.
- 기존의 SSL 프레임워크, 특히 의사 레이블링과 데이터 증강 기반의 프레임워크와의 호환성을 고려하여 설계된다.
실험 결과
연구 질문
- RQ1준지도 학습 조건에서 낮은 차원과 높은 차원 공간에서 분포 밖(OOD) 샘플이 딥 네URAL 네트워크 훈련에 어떤 영향을 미치는가?
- RQ2왜 OOD 샘플이 존재할 경우 일치성 훈련(DACT)은 성능을 향상시키지만, 의사 레이블링(PL)은 성능이 떨어지는가?
- RQ3데이터 이동 조건 하에서 레이블이 부여된 데이터와 레이블이 미부여된 데이터 간의 클래스별 분포 간극이 모델 일반화에 어떤 역할을 하는가?
- RQ4적절히 훈련 과정에 통합된다면 OOD 샘플이 유익할 수 있는가?
- RQ5레이블이 부여된 데이터와 레이블이 미부여된 데이터의 클래스별 분포를 정렬함으로써 어떻게 모델 성능을 향상시킬 수 있는가?
주요 결과
- OOD 샘플이 존재할 경우 일치성 훈련(DACT)은 성능을 향상시키지만, 의사 레이블링(PL)은 심각한 성능 저하를 겪는다.
- DACT의 성능 향상 정도는 레이블이 부여된 데이터와 레이블이 미부여된 데이터 간의 클래스별 분포 간극과 강하게 상관되어 있다.
- 분포 정렬을 통해 클래스별 분포 간극을 줄임으로써 일반화 성능 향상과 최신 기술 수준 성능을 달성할 수 있다.
- 특히 개방형 설정에서 OOD 탐지나 필터링에 의존하는 기존 방법들보다 본 방법이 뛰어난 성능을 보인다.
- OOD 샘플을 배제하는 대신 유의미하게 활용함으로써 데이터 분포 이동에 대한 모델의 강건성이 향상된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.