Skip to main content
QUICK REVIEW

[논문 리뷰] Dense Relation Distillation with Context-aware Aggregation for Few-Shot Object Detection

Hanzhe Hu, Shuai Bai|arXiv (Cornell University)|2021. 03. 30.
Advanced Neural Network Applications참고 문헌 33인용 수 14
한 줄 요약

이 논문은 밀도 높은 관계 정규화(DRD)와 맥락 인지 특징 집합(CFA)을 통해 특징 학습을 향상시키는 새로운 소수 샘플 객체 검출 프레임워크인 DCNet을 제안한다. DRD는 쿼리 및 서포트 특징 간의 픽셀 단위 매칭을 통해 세밀한 세부 정보를 유지시켜 주며, CFA는 어텐션을 사용하여 다중 해상도 RoI 특징을 적응적으로 융합한다. 이 방법은 PASCAL VOC 및 MS COCO 벤치마크에서 최신 기술(SOTA) 성능을 달성한다.

ABSTRACT

Conventional deep learning based methods for object detection require a large amount of bounding box annotations for training, which is expensive to obtain such high quality annotated data. Few-shot object detection, which learns to adapt to novel classes with only a few annotated examples, is very challenging since the fine-grained feature of novel object can be easily overlooked with only a few data available. In this work, aiming to fully exploit features of annotated novel object and capture fine-grained features of query object, we propose Dense Relation Distillation with Context-aware Aggregation (DCNet) to tackle the few-shot detection problem. Built on the meta-learning based framework, Dense Relation Distillation module targets at fully exploiting support features, where support features and query feature are densely matched, covering all spatial locations in a feed-forward fashion. The abundant usage of the guidance information endows model the capability to handle common challenges such as appearance changes and occlusions. Moreover, to better capture scale-aware features, Context-aware Aggregation module adaptively harnesses features from different scales for a more comprehensive feature representation. Extensive experiments illustrate that our proposed approach achieves state-of-the-art results on PASCAL VOC and MS COCO datasets. Code will be made available at https://github.com/hzhupku/DCNet.

연구 동기 및 목표

  • 소수 샘플 객체 검출에서 레이블이 부족한 데이터로 인해 모델이 단지 몇 개의 예시에서 일반화하는 데 어려움을 겪는 문제를 해결하기 위해.
  • 기존 메타학습 방법에서 전역 풀링으로 인해 국소 맥락과 분류 특징이 손실되는 문제를 해결하기 위해.
  • 특징 추출기의 수정으로 인해 발생하는 척도 변동 문제로 인한 과적합을 완화하기 위해.
  • 서포트 세트 정보를 극대화하고 척도 인지 맥락적 신호를 포착하여 특징 표현을 향상시키기 위해.

제안 방법

  • 밀도 높은 관계 정규화(DRD) 모듈은 키 및 밸류 맵을 사용하여 쿼리 및 서포트 특징 간의 픽셀 단위 매칭을 수행하여 시각적 의미와 세부적인 외관 정보를 인코딩한다.
  • DRD는 전역 풀링을 대체하여 조밀한 특징 매칭을 수행함으로써, 저샷 조건에서 더 나은 일반화를 위해 세밀한 국소 특징을 활용할 수 있도록 한다.
  • 맥락 인지 특징 집합(CFA) 모듈은 세 가지 다른 RoI 풀링 해상도를 사용하여 다중 해상도 맥락 정보를 캡처한다.
  • 어텐션 메커니즘이 적용되어 다양한 해상도에서의 특징을 적응적으로 융합하며 기여도를 균형 있게 조정하고 다양한 크기의 객체에 대한 중요한 맥락을 유지한다.
  • 프레임워크는 메타학습 기반의 검출 백본에 기반하며, 클래스별 적응이 필요 없이 DRD 및 CFA를 플러그인 모듈로 통합한다.
  • 모델은 표준 검출 손실을 사용해 엔드 투 엔드로 훈련되며, 추론은 서포트 특징을 맥락으로 사용하는 단일 순방향 전파로 수행된다.

실험 결과

연구 질문

  • RQ1쿼리 및 서포트 특징 간의 조밀하고 픽셀 단위의 매칭이 국소적이고 분류 가능한 특징을 유지함으로써 소수 샘플 객체 검출 성능을 향상시킬 수 있는가?
  • RQ2적응형 어텐션을 사용한 다중 해상도 특징 융합이 저샷 환경에서 다양한 크기의 객체에 대해 검출의 강건성을 향상시키는가?
  • RQ3전역 풀링을 밀도 높은 관계 정규화로 대체할 경우, 특히 극도로 저샷 설정에서 성능 향상이 뚜렷하게 나타나는가?
  • RQ4맥락 인지 특징 집합이 과적합을 줄이고 기본 클래스 및 새로운 클래스에 대한 일반화 능력을 얼마나 향상시키는가?

주요 결과

  • 밀도 높은 관계 정규화(DRD) 모듈은 PASCAL VOC에서 모든 샷 설정에서 일관된 성능 향상을 기록하였으며, 특히 저샷 환경에서 가장 큰 향상이 관찰되었다.
  • 맥락 인지 특징 집합(CFA) 모듈은 척도 인지 맥락 정보를 유지함으로써 성능을 크게 향상시켰으며, 잡음 검출 및 누락 검출을 감소시켰다.
  • 세 가지 다른 RoI 풀링 해상도와 어텐션 기반 융합 메커니즘을 사용할 경우 최고의 성능을 기록하였으며, 단일 해상도 기반 베이스라인을 능가했다.
  • 제거 실험을 통해 DRD 및 CFA 모듈이 모두 필수적임을 확인하였으며, 두 모듈의 조합이 PASCAL VOC 및 MS COCO에서 최신 기술(SOTA) 성능을 달성했다.
  • MS COCO에서 DCNet은 10/30-shot 설정에서 대부분의 지표에서 최고 성능을 기록하였으며, 대규모이고 복잡한 데이터셋에서 강력한 일반화 능력을 입증하였다.
  • 시각화 결과는 DRD가 쿼리 특징 활성화를 향상시키고, 모든 클래스에 동시에 클래스에 종속되지 않는 관계 모델링을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.