Skip to main content
QUICK REVIEW

[논문 리뷰] Image-Level or Object-Level? A Tale of Two Resampling Strategies for Long-Tailed Detection

Nadine Chang, Zhiding Yu|arXiv (Cornell University)|2021. 04. 12.
Domain Adaptation and Few-Shot Learning참고 문헌 28인용 수 5
한 줄 요약

이 논문은 장기적 희귀도 분포를 고려한 객체 검출을 위한 RIO를 제안한다. RIO는 반복 요소 샘플링(RFS)과 이전 모델 업데이트에서의 RoI 특징을 재사용하는 객체 중심 메모리 재생 기반의 통합 이미지 수준 및 객체 수준 리샘플링 전략을 결합한다. RIO는 LVIS v0.5 및 v1.0에서 최신 기준(SOTA) 성능을 달성하며, 기준 방법 대비 검출 시 희귀 카테고리 AP를 36.4% 향상시키고, 세분화 시 29.9% 향상시키면서도 전체 정확도를 유지한다.

ABSTRACT

Training on datasets with long-tailed distributions has been challenging for major recognition tasks such as classification and detection. To deal with this challenge, image resampling is typically introduced as a simple but effective approach. However, we observe that long-tailed detection differs from classification since multiple classes may be present in one image. As a result, image resampling alone is not enough to yield a sufficiently balanced distribution at the object level. We address object-level resampling by introducing an object-centric memory replay strategy based on dynamic, episodic memory banks. Our proposed strategy has two benefits: 1) convenient object-level resampling without significant extra computation, and 2) implicit feature-level augmentation from model updates. We show that image-level and object-level resamplings are both important, and thus unify them with a joint resampling strategy (RIO). Our method outperforms state-of-the-art long-tailed detection and segmentation methods on LVIS v0.5 across various backbones. Code is available at https://github.com/NVlabs/RIO.

연구 동기 및 목표

  • 한 장의 이미지에 여러 클래스가 포함되어 객체 수준의 분포가 불균형해지는 상황에서 이미지 수준 리샘플링의 한계를 해결한다.
  • 학습 중 추가 순방향/역방향 전파 없이도 효율적인 객체 수준 리샘플링 전략을 개발한다.
  • 모델 업데이트와 객체 제안서의 시간적 다양성을 통해 암묵적인 특징 수준 증강을 가능하게 한다.
  • 이미지 수준 및 객체 수준 리샘플링을 융합하여 상호보완적인 프레임워크를 구성함으로써 희귀 클래스 성능 향상을 도모한다. 이는 전체 정확도를 저하시키지 않는다.
  • LVIS와 같은 장기적 희귀도 분포 분류 및 인스턴스 세분화에 도전적인 벤치마크에서 최신 기준(SOTA) 성능을 달성한다.

제안 방법

  • 이전 순방향 전파에서의 RoI 특징과 바운딩 박스 좌표를 저장하고 재사용하는 객체 중심 메모리 재생 프레임워크를 도입한다.
  • 제한된 크기의 동적 클래스별 메모리 백을 유지하며, 매 학습 반복마다 새로운 특징을 삽입하고 오래된 특징을 제거한다.
  • 학습 중 메모리 백에서 추가적인 희귀 객체 제안서를 샘플링하여 객체 수준 분포를 균형 잡기 위해 추가 모델 추론 없이도 가능하게 한다.
  • 모델 업데이트와 데이터 증강을 활용해 암묵적인 특징 수준 증강을 제공함으로써 객체 표현의 다양성을 증가시킨다.
  • 이중 메모리 재생 전략을 반복 요소 샘플링(RFS)과 융합하여 이미지 수준 및 객체 수준 불균형을 동시에 해결하는 통합 리샘플링 전략(RIO)을 구성한다.
  • 30개 미만의 학습 샘플을 가진 클래스를 우선순위로 삼는 가중 샘플링 기법을 사용하여 메모리 재생의 이점을 극대화한다.

실험 결과

연구 질문

  • RQ1이미지에 다수의 클래스가 포함되어 있어 이미지 수준 리샘플링만으로는 부족한 상황에서 객체 수준 리샘플링이 장기적 희귀도 분포 분류 성능 향상에 기여할 수 있는가?
  • RQ2단순한 특징 반복 대비 객체 중심 메모리 재생이 모델 일반화 능력과 성능에 미치는 영향은 어떠한가?
  • RQ3희귀, 일반, 빈번 클래스 간 성능 균형을 고려할 때, 메모리 백에서 샘플링할 최적의 객체 제안서 수는 얼마인가?
  • RQ4이미지 수준 리샘플링과 객체 수준 리샘플링을 효과적으로 융합하여 장기적 희귀도 분류에서 상호보완적 성능 향상을 이룰 수 있는가?
  • RQ5모델 진화와 객체 제안서의 시간적 다양성을 통해 메모리 재생이 의미 있는 특징 수준 증강을 제공하는가?

주요 결과

  • LVIS v0.5 검출에서 RIO는 희귀 카테고리 AP를 기준 방법 대비 36.4% 상승시켜 뚜렷한 성능 향상을 보였다.
  • LVIS v1.0에서 RIO는 ResNeXt-101을 사용하여 검출 시 희귀 카테고리 AP를 14.8에서 18.6으로 18.6 향상시켰고, 인스턴스 세분화에서는 15.4에서 18.8로 18.8 향상되었다.
  • 메모리 백에서 샘플링할 최적의 객체 제안서 수는 20개로, 희귀 클래스 성능 향상과 일반/빈번 클래스의 안정성 간 균형을 잘 맞춘다.
  • 메모리 재생 없이 단순히 RoI 특징을 반복하면 성능 저하가 지속적으로 발생함을 확인하여, 메모리 재생이 시간적 다양성과 특징 다양성을 제공하는 중요성을 입증한다.
  • RIO는 희귀 클래스 검출 성능을 크게 향상시키면서도 전체 AP를 유지함으로써, 장기적 희귀도 인식에서 공정성과 정확도가 동시에 달성될 수 있음을 보여준다.
  • 이 방법은 ResNeXt-101와 같은 다양한 백본과 호환되며, 여러 벤치마크 및 설정에서 일관되게 성능 향상을 이룬다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.