[논문 리뷰] Learning from Extrinsic and Intrinsic Supervisions for Domain Generalization
이 논문은 다중 작업 학습 프레임워크 내에서 외재적 지도 학습(모멘텀 거리 학습을 통한 이미지 간 관계)과 내재적 자기지도 학습(패치 순서 예측)을 동시에 활용하는 도메인 일반화 프레임워크인 EISNet을 제안한다. K-hard 음성 샘플링과 모멘텀 업데이트 메모리 백을 통합함으로써, EISNet은 훈련 시간을 크게 줄이며 VLCS 및 PACS 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성한다.
The generalization capability of neural networks across domains is crucial for real-world applications. We argue that a generalized object recognition system should well understand the relationships among different images and also the images themselves at the same time. To this end, we present a new domain generalization framework that learns how to generalize across domains simultaneously from extrinsic relationship supervision and intrinsic self-supervision for images from multi-source domains. To be specific, we formulate our framework with feature embedding using a multi-task learning paradigm. Besides conducting the common supervised recognition task, we seamlessly integrate a momentum metric learning task and a self-supervised auxiliary task to collectively utilize the extrinsic supervision and intrinsic supervision. Also, we develop an effective momentum metric learning scheme with K-hard negative mining to boost the network to capture image relationship for domain generalization. We demonstrate the effectiveness of our approach on two standard object recognition benchmarks VLCS and PACS, and show that our methods achieve state-of-the-art performance.
연구 동기 및 목표
- 도메인 이동으로 인해 새로운 도메인에서 테스트할 때 깊은 신경망의 일반화 능력이 떨어지는 문제를 해결하기 위해.
- 훈련 시 타겟 도메인 데이터에 접근할 필요 없이 모델의 강건성을 향상시키기 위해.
- 이미지 간 관계와 이미지 내 자기지도 학습을 결합하여 특징의 구분 가능성과 전이 가능성 향상시키기 위해.
- 다양한 도메인에 잘 스케일링되는 효율적이고 계산량이 적은 도메인 일반화 프레임워크 개발하기 위해.
제안 방법
- EISNet은 분류 학습, 모멘텀 거리 학습, 그리고 자기지도 학습 패치 순서 예측 작업을 결합한 다중 작업 학습 프레임워크를 사용한다.
- 모멘텀 업데이트 인코더는 훈련 안정성 향상과 특징 일관성 향상을 위해 특징 임bedding의 메모리 백을 유지한다.
- K-hard 음성 샘플링은 메모리 백에서 유의미한 하드 트리플릿을 선택하여 거리 학습의 트리플릿 손실을 최적화하는 데 사용된다.
- 자기지도 보조 작업은 이미지 패치의 상대적 공간 순서를 예측함으로써 모델이 구조적 및 맥락적 불변성을 학습하도록 유도한다.
- 모멘텀 업데이트 계수 δ는 메모리 백의 일관성에 영향을 주며, δ = 0.999일 때 최적의 성능을 보였다.
- 이 프레임워크는 AlexNet을 포함한 다양한 백본 네트워크에 쉽게 적용 가능하다.
실험 결과
연구 질문
- RQ1외재적 이미지 간 관계와 내재적 자기지도 학습을 결합하면 새로운 도메인에서의 일반화 능력을 향상시킬 수 있는가?
- RQ2K-hard 음성 샘플링을 통한 모멘텀 기반 거리 학습은 특징의 응집도와 일반화 능력에 어떤 영향을 미치는가?
- RQ3메모리 백 크기와 모멘텀 계수의 영향은 모델 성능과 훈련 안정성에 어떤가?
- RQ4이미지 내 자기지도 학습이 이미지 간 관계와 함께 특징의 구분 가능성 향상에 기여하는가?
- RQ5기존 도메인 일반화 접근법과 비교해 본다면, 제안된 방법은 효율성과 정확도 측면에서 어떤가?
주요 결과
- EISNet은 VLCS 및 PACS 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하며, 기존 도메인 일반화 방법을 초월한다.
- PACS Sketch 데이터셋에서 K-hard 음성 선택기 사용 시 70.25%의 정확도를 기록했으며, 반경 선택기 대비 2.70% 향상된 성능을 보였다.
- 최적의 음성 샘플 수 K는 256이며, K=512일 경우 계산 부담으로 인해 성능이 저하된다.
- SOTA MASF 대비 훈련 시간을 91% 이상 단축시켰으며, 단일 TITAN XP GPU에서 1.5시간으로 훈련이 가능했다.
- t-SNE 시각화 결과 EISNet이 클래스 간에 더 구분 가능하고 잘 분리된 특징 클러스터를 학습하는 것으로 확인되었다.
- 모멘텀 업데이트 계수 δ = 0.999일 때 최고의 성능를 기록했으며, 이는 메모리 백의 신속한 업데이트가 특징 일관성 향상에 기여함을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.