Skip to main content
QUICK REVIEW

[논문 리뷰] Rectifying the Shortcut Learning of Background: Shared Object Concentration for Few-Shot Image Recognition.

Xu Luo, Longhui Wei|arXiv (Cornell University)|2021. 07. 16.
Domain Adaptation and Few-Shot Learning참고 문헌 32인용 수 4
한 줄 요약

이 논문은 이미지 배경에서 발생하는 단서 학습을 완화하기 위해 공통된 전경 객체를 이미지 간에 식별하고 집중하는 few-shot 학습 프레임워크인 COSOC을 제안한다. 사전학습 중에는 대비 특징 클러스터링과 융합 샘플링 전략을 사용하고, 추론 중에는 전경 인식 특징 매칭을 수행함으로써, 배경 편향을 억제함으로써 few-shot 이미지 인식 벤치마크에서 최고 성능을 달성한다.

ABSTRACT

Few-Shot image classification aims to utilize pretrained knowledge learned from a large-scale dataset to tackle a series of downstream classification tasks. Typically, each task involves only few training examples from brand-new categories. This requires the pretraining models to focus on well-generalizable knowledge, but ignore domain-specific information. In this paper, we observe that image background serves as a source of domain-specific knowledge, which is a shortcut for models to learn in the source dataset, but is harmful when adapting to brand-new classes. To prevent the model from learning this shortcut knowledge, we propose COSOC, a novel Few-Shot Learning framework, to automatically figure out foreground objects at both pretraining and evaluation stage. COSOC is a two-stage algorithm motivated by the observation that foreground objects from different images within the same class share more similar patterns than backgrounds. At the pretraining stage, for each class, we cluster contrastive-pretrained features of randomly cropped image patches, such that crops containing only foreground objects can be identified by a single cluster. We then force the pretraining model to focus on found foreground objects by a fusion sampling strategy; at the evaluation stage, among images in each training class of any few-shot task, we seek for shared contents and filter out background. The recognized foreground objects of each class are used to match foreground of testing images. Extensive experiments tailored to inductive FSL tasks on two benchmarks demonstrate the state-of-the-art performance of our method.

연구 동기 및 목표

  • 사전학습 중 이미지 배경에서 유사 상관관계를 학습하는 모델의 문제를 해결함으로써, 새로운 few-shot 클래스로의 일반화 능력을 향상시키는 것.
  • 동일한 클래스에 속하는 이미지 간에 공통적으로 존재하는 전경 객체를 식별하고 집중함으로써 도메인 특화된 배경 특징에 대한 의존도를 줄이는 것.
  • 사전학습 및 추론 모두에서 작동하는 이중 단계 프레임워크를 개발하여 배경 지배적인 이미지 패치를 탐지하고 제거하는 것.
  • 모델이 배경 조건에 의존하는 패tern 대신 잘 일반화 가능한 객체 중심 표현을 학습하도록 하여 few-shot 일반화 능력을 향상시키는 것.

제안 방법

  • 사전학습 중, 이미지 패치의 무작위 컷을 대비 사전학습된 백본을 사용해 임bedding하고, 그 특징을 클러스터링하여 전경 객체에 해당하는 주요 클러스터를 식별한다.
  • 식별된 전경 클러스터에서의 학습 샘플을 우선시하는 융합 샘플링 전략을 적용하여, 모델이 객체 중심 특징에 집중하도록 유도한다.
  • 추론 중에는 각 few-shot 지원 세트에 대해 특징 클러스터링을 사용하여 이미지 간의 공통된 내용을 탐지하고 전경 영역을 분리한다.
  • 지원 이미지의 전경 특징을 쿼리 이미지의 특징과 매칭하여 배경과 무관한 신호를 필터링한다.
  • 클러스터링 이전에 자기지도 대비 학습을 활용하여 분별성 있는 특징을 추출함으로써, 레이블이 없는 상태에서도 견고한 객체 탐지가 가능하다.
  • 모델이 바운딩 박스나 세그멘테이션 마스크가 필요로 하지 않는 약한 지도 학습 방식을 사용하므로, 확장성이 뛰어나고 실제 few-shot 작업에 적용 가능하다.

실험 결과

연구 질문

  • RQ1인간의 레이블 없이도 동일한 클래스의 이미지 간에 전경 객체 패턴을 신뢰성 있게 식별할 수 있는가?
  • RQ2사전학습 중 배경 특징을 억제하면 few-shot 일반화 성능이 향상되는가?
  • RQ3사전학습 시 클러스터링과 추론 시 전경 매칭을 수행하는 이중 단계 접근 방식이 기존의 few-shot 학습 방법보다 우월한가?
  • RQ4융합 샘플링 전략이 사전학습 중 모델이 전경 객체에 집중하도록 유도하는 데 얼마나 효과적인가?
  • RQ5공통 객체 집중이 배경 아티팩트에서 발생하는 단서 학습을 어느 정도 감소시키는가?

주요 결과

  • COSOC는 두 가지 표준 few-shot 이미지 인식 벤치마크에서 최고 성능을 기록하며, 기존 방법들을 능가한다.
  • 동일한 클래스의 이미지 간에 공통 전경 패턴을 식별하고 강조함으로써 모델이 배경 특징에 의존하는 정도를 크게 줄였다.
  • 사전학습 중 융합 샘플링 전략은 제로샷 일반화 및 미세조정 정확도 향상으로써 더 견고한 특징 학습을 이끌어내는 데 기여했다.
  • 추론 시 전경 클러스터링이 배경 노이즈를 효과적으로 필터링하여 쿼리 이미지의 매칭 정확도를 향상시켰다.
  • 추가적인 레이블이나 아키텍처 수정 없이도 다양한 few-shot 작업에 잘 일반화되는 것으로 확인되었다.
  • 제거 분석 결과, 전경 클러스터링을 통한 배경 억제가 모델 성능 향상의 핵심 요인임을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.