Skip to main content
QUICK REVIEW

[논문 리뷰] Learning from Noisy Web Data with Category-level Supervision

Li Niu, Qingtao Tang|arXiv (Cornell University)|2018. 03. 10.
Domain Adaptation and Few-Shot Learning참고 문헌 35인용 수 5
한 줄 요약

이 논문은 웹에서 크롤링한 이미지의 레이블 노이즈를 완화하기 위해 범주 수준의 지도 정보—예를 들어 워드 벡터, 속성 또는 시각적 인코딩—를 사용하여 변동형 오토에인코더(VAE)와 분류 네트워크를 공동으로 훈련하는 WSCI라는 방법을 제안한다. 이 방법은 재구성 및 분류 성능을 햖을 수 있는 의미적 임베딩을 활용함으로써, 다양한 노이즈 수준에서 기존의 베이스라인을 능가하는 최신 기술 성능(SOTA)을 달성한다.

ABSTRACT

As tons of photos are being uploaded to public websites (e.g., Flickr, Bing, and Google) every day, learning from web data has become an increasingly popular research direction because of freely available web resources, which is also referred to as webly supervised learning. Nevertheless, the performance gap between webly supervised learning and traditional supervised learning is still very large, owning to the label noise of web data. To be exact, the labels of images crawled from public websites are very noisy and often inaccurate. Some existing works tend to facilitate learning from web data with the aid of extra information, such as augmenting or purifying web data by virtue of instance-level supervision, which is usually in demand of heavy manual annotation. Instead, we propose to tackle the label noise by leveraging more accessible category-level supervision. In particular, we build our method upon variational autoencoder (VAE), in which the classification network is attached on the hidden layer of VAE in a way that the classification network and VAE can jointly leverage the category-level hybrid semantic information. The effectiveness of our proposed method is clearly demonstrated by extensive experiments on three benchmark datasets.

연구 동기 및 목표

  • 웹 데이터의 노이즈 레이블로 인해 발생하는 웹리 서포티드 러닝과 전통적 서포티드 러닝 간의 지속적인 성능 격차를 해소하기 위해.
  • 비용이 많이 드는 인스턴스 수준의 지도 정보에 의존하는 것을 줄이고, 워드 벡터, 속성 또는 시각적 인코딩과 같은 더 접근하기 쉬운 범주 수준의 지도 정보를 활용하기 위해.
  • VAE와 분류 네트워크가 범주 수준의 지도 정보로부터 의미 정보를 공유함으로써 상호 보완적으로 강건성을 향상시키는 공동 학습 프레임워크를 개발하기 위해.
  • 다양한 데이터셋과 노이즈 수준에서 기존의 베이스라인에 비해 일관된 슈퍼리어리티를 입증하기 위해.

제안 방법

  • 모델은 잠재층에 분류 네트워크가 부착된 변동형 오토에인코더(VAE) 기반으로 구성되며, 공유 인코더와 VAE 아키텍처를 형성한다.
  • 분류 네트워크는 워드 벡터, 속성 또는 시각적 인코딩과 같은 범주 수준의 의미 정보를 사용하여 예측 점수를 생성함으로써, 잠재 변수에 의미적 의미를 부여한다.
  • VAE는 재구성 확률 밀도를 이상치 탐지 지표로 사용하며, 이 지표에 의해 이상치로 식별되지 않은 샘플에 대해 더 높은 손실 가중치를 할당한다.
  • 분류 네트워크는 VAE의 잠재 공간에 분류 정보를 주입함으로써 임베딩의 의미적 품질을 향상시키고 이상치 탐지 성능을 향상시킨다.
  • 각 범주 내의 시각적 특징을 평균화하여 새로운 시각적 인코딩을 제안하며, 이를 개선하여 강건성과 분류 능력을 향상시킨다.
  • VAE는 이상치 가중치를 통해 분류기의 강건성을 향상시키고, 분류기는 VAE의 의미적 표현을 강화함으로써 엔드 투 엔드로 공동 최적화되어 전체 모델이 향상된다.

실험 결과

연구 질문

  • RQ1범주 수준의 지도 정보는 노이즈가 많은 웹 데이터에서 훈련된 분류기의 강건성을 향상시킬 수 있는가?
  • RQ2VAE와 분류 네트워크 간의 공동 학습은 개별적으로 학습하는 것에 비해 성능 향상에 어떻게 기여하는가?
  • RQ3속성이 제공되지 않을 경우, 웹 이미지에서 유도된 시각적 인코딩의 사용이 성능 향상에 기여하는가?
  • RQ4노이즈 레이블 수준이 다양할 경우, 특히 노이즈가 정확히 제어되지 않을 경우 이 방법의 성능은 어떻게 되는가?
  • RQ5제안된 방법은 인스턴스 수준의 지도 정보나 수동 데이터 필터링에 의존하는 기존의 베이스라인을 능가할 수 있는가?

주요 결과

  • WSCI는 SUN, AwA2, CUB 세 가지 벤치마크 데이터셋에서 모두 최고의 성능을 기록하며, 인스턴스 수준의 지도 정보를 사용하는 모든 베이스라인을 능가한다.
  • SUN 데이터셋에서 가장 높은 품질의 검색 설정(s(1)) 하에서 WSCI는 42.26%의 정확도를 달성했으며, 가장 강력한 베이스라인(Xiao et al. [4])의 40.56%보다 높다.
  • 더 높은 노이즈 수준(s(201) 및 s(401))에서도 WSCI는 일관된 슈퍼리어리티를 유지하며, 각각 41.79% 및 41.47%의 정확도를 기록하여 모든 설정에서 베이스라인을 초월한다.
  • 제거 실험 결과, 시각적 인코딩을 제거한 WSCI w/o ve는 성능 저하를 보이며, 이는 시각적 인코딩이 범주 수준 표현을 향상시키는 데 유용함을 확인한다.
  • 속성이 제공되지 않을 경우 WSCI (w/o attr)도 여전히 모든 베이스라인을 능가하며, 무료로 자동으로 유도된 의미 정보만으로도 효과적임을 입증한다.
  • 정성적 분석을 통해 모델이 재구성 확률이 높은 상위 비이상치와 낮은 확률의 이상치를 성공적으로 식별함을 확인하였으며, 이는 이상치 탐지 능력의 타당성을 검증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.