[논문 리뷰] Weakly Supervised Learning with Side Information for Noisy Labeled Images
이 논문은 웹에서 수집한 대규모 노이즈가 심한 이미지에서 딥 컨volution 네트워크 훈련을 향상시키기 위해 이미지 측면 정보(예: 캡션, 태그)를 활용하는 약한 지도 학습 프레임워크인 SINet을 제안한다. 시각적 프로토타입과 노이즈 가중 모듈을 통합함으로써 SINet은 잘못 레이블이 붙은 이미지를 효과적으로 식별하고 가중치를 낮춰, WebVision, ImageNet, Clothing-1M 및 최신으로 공개된 250만 개 이상의 세분화된 제품 이미지를 포함하는 AliProducts 데이터셋에서 최신 기준 성능을 달성한다.
In many real-world datasets, like WebVision, the performance of DNN based classifier is often limited by the noisy labeled data. To tackle this problem, some image related side information, such as captions and tags, often reveal underlying relationships across images. In this paper, we present an efficient weakly supervised learning by using a Side Information Network (SINet), which aims to effectively carry out a large scale classification with severely noisy labels. The proposed SINet consists of a visual prototype module and a noise weighting module. The visual prototype module is designed to generate a compact representation for each category by introducing the side information. The noise weighting module aims to estimate the correctness of each noisy image and produce a confidence score for image ranking during the training procedure. The propsed SINet can largely alleviate the negative impact of noisy image labels, and is beneficial to train a high performance CNN based classifier. Besides, we released a fine-grained product dataset called AliProducts, which contains more than 2.5 million noisy web images crawled from the internet by using queries generated from 50,000 fine-grained semantic classes. Extensive experiments on several popular benchmarks (i.e. Webvision, ImageNet and Clothing-1M) and our proposed AliProducts achieve state-of-the-art performance. The SINet has won the first place in the classification task on WebVision Challenge 2019, and outperformed other competitors by a large margin.
연구 동기 및 목표
- 대규모 웹 이미지에서 심한 레이블 노이즈가 존재하는 상황에서 딥 컨volution 네트워크를 훈련하는 데 도전하는 것.
- 청결한 애너테이션을 요구하지 않고도 이미지 연관 측면 정보(예: 캡션, 태그)를 활용하여 모델의 강건성을 향상시키는 것.
- 실세계 데이터셋의 레이블 노이즈가 미치는 부정적 영향을 줄이기 위한 확장 가능한 약한 지도 학습 방법을 개발하는 것.
- 50,000개의 의미적 클래스와 계층적 카테고리 관계를 포함하는 대규모 세분화된 제품 데이터셋인 AliProducts를 공개하여 향후 연구를 위한 기반을 마련하는 것.
제안 방법
- SINet은 각 클래스별로 노이즈가 있는 이미지와 측면 정보를 융합하여 깨끗하고 대표적인 특징을 학습하는 시각적 프로토타입 모듈을 포함한다.
- 노이즈 가중 모듈은 깊이 특징을 시각적 프로토타입과 비교하여 각 이미지의 신뢰도 점수를 추정함으로써 이미지 순위 매기기와 선택적 훈련을 가능하게 한다.
- 프레임워크는 약한 지도 학습 목표를 사용하여 시각적 프로토타입과 노이즈 가중치를 동시에 최적화함으로써 청결한 레이블에 의존하지 않는다.
- 텍스트 기반 설명 및 계층적 클래스 관계와 같은 측면 정보를 활용하여 클래스 간 및 이미지 간 관계를 모델링하여 프로토타입 품질을 향상시킨다.
- 계층적 카테고리 데이터에서 클래스 관계 그래프를 구성하여 프로토타입 학습과 노이즈 추정을 안내한다.
- 교정된 신뢰도 기반 샘플에 대해 교차 엔트로피 손실을 사용하여 엔드 투 엔드로 학습함으로써 노이즈가 많은 데이터에서 일반화 성능을 향상시킨다.
실험 결과
연구 질문
- RQ1캡션과 태그와 같은 측면 정보가 노이즈가 많은 웹 이미지에서 딥 러닝 모델의 성능 향상에 효과적으로 활용될 수 있는가?
- RQ2청결한 감독 없이도 노이즈가 있는 이미지에서 각 클래스를 강건하게 대표할 수 있는 시각적 프로토타입을 어떻게 학습할 수 있는가?
- RQ3특징-프로토타입 정렬 기반의 노이즈 가중 메커니즘이 실제 노이즈가 많은 데이터셋에서 모델 정확도를 향상시킬 수 있는가?
- RQ4제안된 방법이 심한 레이블 노이즈가 존재하는 대규모 벤치마크에서 기존 최고 성능 기법들을 초월할 수 있는가?
- RQ5이 방법은 복잡한 카테고리 계층을 가진 세분화된 대규모 제품 인식 작업에 일반화될 수 있는가?
주요 결과
- SINet은 WebVision1.0에서 73.8%의 최상위 1 정확도를 기록했으며, ImageNet에서는 40%의 레이블 노이즈 조건에서도 기준 ResNet50 및 이전 방법들을 능가했다.
- Clothing1M에서 SINet는 5만 개의 청결한 이미지를 사용해 81.32%의 정확도를 달성했으며, CleanNet(79.9%), MetaCleaner(80.78%), DeepSelf(81.16%)를 모두 앞섰다.
- 250만 개 이상의 이미지와 5만 개의 세분화된 클래스를 포함하는 최신으로 공개된 AliProducts 데이터셋에서 SINet는 86.29%의 정확도를 기록했으며, 모든 기준 모델을 초월했다.
- SINet는 WebVision 챌린지 2019의 5000개 카테고리 분류 과제에서 1등을 차지하여 뛰어난 실세계 성능을 입증했다.
- 노이즈 가중 모듈은 이미지의 신뢰도에 따라 순위를 매겨 모델이 고품질 샘플에 집중하고 잘못 레이블이 붙은 데이터의 영향을 줄이는 데 효과적이었다.
- 측면 정보와 시각적 프로토타입의 통합은 특히 세분화된 분류 및 노이즈가 많은 환경에서 모델의 강건성을 크게 향상시켰다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.