Skip to main content
QUICK REVIEW

[논문 리뷰] Online Bag-of-Visual-Words Generation for Unsupervised Representation Learning

Spyros Gidaris, Andrei Bursuc|arXiv (Cornell University)|2020. 12. 21.
Multimodal Machine Learning Applications참고 문헌 16인용 수 10
한 줄 요약

이 논문은 온라인, 자기지도 학습 표현 학습 방법을 제안하며, 교정된 이미지에서 백오브비주얼워드(BoW) 표현을 재구성하도록 학습하는 학생 컨볼루션 네트워크를 설계하고, 동시에 교사 네트워크와 BoW 어휘를 실시간으로 공동 업데이트한다. 이 방법은 파스칼 객체 검출, 파스칼 분류, 플레이스205 분류와 같은 후행 작업에서 기존 최고 성능을 경신하며, 심지어 감독 학습 전훈보다도 뛰어난 성능을 달성한다.

ABSTRACT

Learning image representations without human supervision is an important and active research field. Several recent approaches have successfully leveraged the idea of making such a representation invariant under different types of perturbations, especially via contrastive-based instance discrimination training. Although effective visual representations should indeed exhibit such invariances, there are other important characteristics, such as encoding contextual reasoning skills, for which alternative reconstruction-based approaches might be better suited. With this in mind, we propose a teacher-student scheme to learn representations by training a convnet to reconstruct a bag-of-visual-words (BoW) representation of an image, given as input a perturbed version of that same image. Our strategy performs an online training of both the teacher network (whose role is to generate the BoW targets) and the student network (whose role is to learn representations), along with an online update of the visual-words vocabulary (used for the BoW targets). This idea effectively enables fully online BoW-guided unsupervised learning. Extensive experiments demonstrate the interest of our BoW-based strategy which surpasses previous state-of-the-art methods (including contrastive-based ones) in several applications. For instance, in downstream tasks such Pascal object detection, Pascal classification and Places205 classification, our method improves over all prior unsupervised approaches, thus establishing new state-of-the-art results that are also significantly better even than those of supervised pre-training. We provide the implementation code at this https URL.

연구 동기 및 목표

  • 대비 학습의 한계를 극복하고 변동성 외의 맥락적 추론을 포착할 수 있는 자기지도 표현 학습 방법을 개발한다.
  • 학생 네트워크와 BoW 어휘의 완전한 온라인 학습을 가능하게 하여 오프라인 사전 계산을 피한다.
  • 인스턴스 식별이 아닌 BoW 타겟을 통한 재구성 기반 지도 학습을 통해 시각적 표현 품질을 향상시킨다.
  • 인간 레이블이 없는 상태에서 후행 비전 작업에서 최고 성능을 달성한다.

제안 방법

  • 청결한 이미지에서 교사 네트워크가 BoW 표현을 생성하고, 이를 학생 네트워크의 타겟으로 활용한다.
  • 학생 네트워크를 동일한 이미지의 변형된 버전에서 BoW 표현을 재구성하도록 학습시키며, 재구성 손실을 사용한다.
  • 학습 도중 시각 어휘 어휘를 온라인으로 업데이트하여 데이터 분포에 동적으로 적응하도록 한다.
  • 학생 및 교사 네트워크를 온라인 학습 도중 반복적으로 업데이트하는 공동 학습 체계를 도입한다.
  • 입력 이미지에 데이터 증강을 적용하여 학생에 공급함으로써 강건성과 일반화 능력을 확보한다.
  • 실시간으로 BoW 어휘를 유지하고 업데이트하기 위해 미분 가능한 클러스터링 메커니즘을 사용한다.

실험 결과

연구 질문

  • RQ1비지도 설정에서 BoW 표현을 통한 재구성 기반 지도 학습이 대비 학습보다 더 나은 시각적 표현을 도출할 수 있는가?
  • RQ2BoW 어휘와 학생 네트워크의 온라인, 공동 학습이 오프라인 또는 정적 어휘 접근 방식보다 표현 품질을 향상시키는가?
  • RQ3BoW 유도 비지도 방법이 후행 비전 벤치마크에서 감독 학습 전훈을 초월할 수 있는가?
  • RQ4기존 최고 수준의 대비 및 자기지도 접근 방식과 비교해 본다면, 제안된 방법은 표준 이미지 분류 및 검출 작업에서 어떤 성능을 보이는가?

주요 결과

  • 제안된 방법은 비지도 설정에서 파스칼 VOC 객체 검출 벤치마크에서 새로운 최고 성능을 달성한다.
  • 파스칼 VOC 이미지 분류 벤치마크에서 이전의 모든 비지도 방법보다 뛰어난 성능을 기록하며 새로운 최고 기록을 수립한다.
  • 이전의 비지도 방법보다 플레이스205 스코너 분류 데이터셋에서 뛰어난 정확도를 확보한다.
  • 몇몇 후행 작업에서 감독 학습 전훈 성능을 초월하여 BoW 유도 재구성의 강력함을 입증한다.
  • 온라인 어휘 업데이트 메커니즘이 오프라인 클러스터링이나 고정 코드북이 필요 없이 안정적이고 효과적인 학습을 가능하게 한다.
  • 다양한 비전 작업에 걸쳐 뛰어난 일반화 능력을 보이며, BoW 기반 지도 학습이 풍부한 맥락적 및 구조적 정보를 포착함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.