[논문 리뷰] Exploring Instance Relations for Unsupervised Feature Embedding
이 논문은 단순하면서도 효과적인 비지도 특징 임bedding 방법인 EIR를 제안한다. EIR는 인스턴스 내 다중 시각 간 관계와 인스턴스 간 보간 관계를 체계적으로 탐색한다. 증강된 샘플의 거리 분포를 정렬하고, 픽셀 공간에서의 보간 비율을 특징 공간으로 이전시킴으로써, EIR는 이미지 분류 및 검색 벤치마크에서 최신 기준 성능을 달성한다. kNN 평가 기준으로 CIFAR-10에서 89.2%의 top-1 정확도를 기록하였다.
Despite the great progress achieved in unsupervised feature embedding, existing contrastive learning methods typically pursue view-invariant representations through attracting positive sample pairs and repelling negative sample pairs in the embedding space, while neglecting to systematically explore instance relations. In this paper, we explore instance relations including intra-instance multi-view relation and inter-instance interpolation relation for unsupervised feature embedding. Specifically, we embed intra-instance multi-view relation by aligning the distribution of the distance between an instance's different augmented samples and negative samples. We explore inter-instance interpolation relation by transferring the ratio of information for image sample interpolation from pixel space to feature embedding space. The proposed approach, referred to as EIR, is simple-yet-effective and can be easily inserted into existing view-invariant contrastive learning based methods. Experiments conducted on public benchmarks for image classification and retrieval report state-of-the-art or comparable performance.
연구 동기 및 목표
- 기존의 대조 학습 방법이 인스턴스 식별에 크게 의존하고, 인스턴스 간 관계에 대한 체계적인 탐색을 간과하는 데에 기인한 한계를 해결하기 위해.
- 거리 분포 정렬을 통해 인스턴스 내 다중 시각 관계를 활용하여 비지도 특징 임베딩을 향상시키기 위해.
- 이미지 수준의 보간 비율(예: mixup, cutmix)을 특징 임베딩 공간으로 이전시켜 인스턴스 간 보간 관계를 활용하기 위해.
- 기존의 시각 불변 대조 학습 프레임워크와 호환되는 플러그인 방식의 방법을 개발하여, 더 향상된 분류 표현 학습을 가능하게 하기 위해.
제안 방법
- EIR는 KL 발산을 사용하여 동일 인스턴스의 두 증강된 시각 간의 거리 분포를, 훈련 세트에 포함된 모든 샘플에 대해 정렬함으로써 인스턴스 내 다중 시각 관계를 도입한다.
- 이 방법은 이미지 공간의 보간 비율(예: mixup, cutmix)에서 유래한 정보 비율을 특징 임베딩 공간으로 이전시켜 인스턴스 간 보간 관계를 모델링한다.
- 관계적 구조를 포착하기 위해 각 증강 샘플과 훈련 세트 내 모든 다른 샘플 간의 거리 분포를 계산한다.
- 아키텍처 변경 없이도 기존의 대조 학습 파ip라인에 쉽게 통합될 수 있도록 설계되었다.
- 손실 함수는 분포 정렬과 보간 일관성이라는 두 가지 관계 기반 유도적 편향을 통합 최적화 목표 내에 통합한다.
실험 결과
연구 질문
- RQ1인스턴스 내 다중 시각 관계를 어떻게 체계적으로 활용하여 비지도 특징 임베딩을 향상시킬 수 있는가?
- RQ2픽셀 공간에서의 인스턴스 간 보간 관계를 특징 공간으로 효과적으로 이전시킬 수 있는가?
- RQ3기존의 인스턴스 식별에 비해 인스턴스 내 및 인스턴스 간 관계를 모두 조합할 경우 성능 향상 정도는 어느 정도인가?
- RQ4관계 기반 유도적 편향에 기반한 단순하고 플러그인 방식의 방법이 최신 기준 비지도 방법을 능가하거나 동등하게 성능을 낼 수 있는가?
주요 결과
- EIR는 kNN 평가 프로토콜 기준으로 CIFAR-10에서 89.2%의 top-1 정확도를 기록하여 새로운 최신 기준 성능을 달성하였다.
- STL-10에서 EIR는 105K 미리 훈련된 경우 78.2%의 kNN 정확도를 기록하여 이전 최신 기준인 aISIF를 0.8% 초월하였다.
- ImageNet-100에서 EIR는 66.5%의 kNN 정확도를 기록하여 MoCo를 최소 2% 이상 초월하고, 다른 방법들보다도 큰 격차로 앞서며 성능을 냈다.
- 이미지 검색 성능에서는 CIFAR-10에서 97.1%의 R@8 정확도와 세부적인 Car-196 데이터셋에서 62.1%의 R@8 정확도를 기록하여 강력한 분류 능력을 입증하였다.
- qualitative한 t-SNE 시각화 결과, EIR는 긍정 쌍 간의 유인 효과와 부정 쌍 간의 분리 효과를 향상시켜 더 나은 클러스터 분리 구조를 만들어 냈다.
- EIR는 단지 2회의 훈련 라운드만으로도 5회 훈련된 다른 방법들을 능가하며, 더 빠른 수렴 속도와 높은 샘플 효율성을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.