Skip to main content
QUICK REVIEW

[논문 리뷰] Semantic Relation Reasoning for Shot-Stable Few-Shot Object Detection

Chenchen Zhu, Fang-Yi Chen|ArXiv.org|2021. 03. 02.
Domain Adaptation and Few-Shot Learning참고 문헌 47인용 수 22
한 줄 요약

이 논문은 학습 데이터 부족 상황에서 성능을 햖थ시키기 위해 학습된 단어 임베딩과 동적 관계 그래프를 사용하여 기본 클래스와 신규 클래스 간의 의미 관계를 명시적으로 모델링하는 소수 샘플 객체 검출 프레임워크인 SRR-FSD를 제안한다. 시각적 특징을 의미 공간으로 투영하고 주의 기반 관계 추론을 통해 보정함으로써 SRR-FSD는 특히 명시적 및 암시적 샘플 수가 모두 적은 상황에서 뚜렷하게 향상되고 안정적인 성능을 달성한다.

ABSTRACT

Few-shot object detection is an imperative and long-lasting problem due to the inherent long-tail distribution of real-world data. Its performance is largely affected by the data scarcity of novel classes. But the semantic relation between the novel classes and the base classes is constant regardless of the data availability. In this work, we investigate utilizing this semantic relation together with the visual information and introduce explicit relation reasoning into the learning of novel object detection. Specifically, we represent each class concept by a semantic embedding learned from a large corpus of text. The detector is trained to project the image representations of objects into this embedding space. We also identify the problems of trivially using the raw embeddings with a heuristic knowledge graph and propose to augment the embeddings with a dynamic relation graph. As a result, our few-shot detector, termed SRR-FSD, is robust and stable to the variation of shots of novel objects. Experiments show that SRR-FSD can achieve competitive results at higher shots, and more importantly, a significantly better performance given both lower explicit and implicit shots. The benchmark protocol with implicit shots removed from the pretrained classification dataset can serve as a more realistic setting for future research.

연구 동기 및 목표

  • 학습 데이터 부족 상황에서 소수 샘플 객체 검출기의 불안정성을 해결하고, 특히 명시적 및 암시적 샘플 수가 모두 제한된 경우에 초점을 맞춘다.
  • 기본 클래스와 신규 클래스 간의 일관된 의미 관계를 안정적인 인덕티브 바이어스로 활용하여 일반화 성능을 향상시킨다.
  • 기존 방법들이 시각적 특징에만 의존하고 샘플 수 변화에 민감한 점을 극복한다.
  • 시각적 검출과 텍스트 기반 의미 지식을 종합적으로 통합하고, 엔드 투 엔드로 학습 가능한 방식으로 개발한다.
  • 기존의 정적 또는 히ュ리스틱 지식 그래프보다 더 나은 클래스 간 관계를 모델링할 수 있는 동적 관계 그래프를 제안한다.

제안 방법

  • 대규모 텍스트 코퍼스에서 사전 학습된 단어 임베딩을 사용해 각 클래스를 표현함으로써, 제로샷 일반화를 위한 의미 공간을 구성한다.
  • 검출기를 훈련시켜 이미지 특징을 이 의미 공간으로 투영하도록 하여 시각적 표현을 해당 클래스 임베딩과 정렬한다.
  • 자기주의 주의(self-attention)를 사용해 클래스 임베딩 간의 상호 관계를 학습하는 동적 관계 그래프 모듈을 도입하여 고정된 히ュ리스틱 지식 그래프를 대체한다.
  • 관계 추론을 미분 가능한 연산으로 공식화한다: $\mathbf{W}_{e}^{\prime} = \delta(\mathbf{W}_{e}\mathbf{T}_{f}\mathbf{T}_{g}^{T}\mathbf{W}_{e}^{T})\mathbf{W}_{e}\mathbf{T}_{h}\mathbf{T}_{l} + \mathbf{W}_{e}$, 여기서 $\mathbf{W}_{e}$는 초기 단어 임베딩 행렬이다.
  • 증강된 임베딩 $\mathbf{W}_{e}^{\prime}$를 검출 헤드의 분류 가중치로 사용하여 관계 인식 기반의 분류를 가능하게 한다.
  • 백본을 고정하고 관계 추론 모듈과 투영 행렬만 미세조정하여, 소수 샘플 환경에서 과적합을 방지한다.

실험 결과

연구 질문

  • RQ1기본 클래스와 신규 클래스 간의 의미 관계가 데이터 부족 상황에서 소수 샘플 객체 검출의 안정적인 인덕티브 바이어스로 기능할 수 있는가?
  • RQ2학습된 의미 임베딩과 동적 관계 추론을 통합함으로써, 명시적 및 암시적 샘플 수의 변동에 대한 검출기의 강건성은 어떻게 향상되는가?
  • RQ3히ュ리스틱 지식 그래프를 데이터 기반의 학습 가능한 관계 그래프로 대체할 경우, 고정된 그래프보다 더 나은 소수 샘플 일반화 성능을 달성할 수 있는가?
  • RQ4시각-의미 정렬과 관계 추론을 종합적으로 엔드 투 엔드로 학습하는 것이 시각적 특징에만 의존하는 기존 방법보다 우월한가?
  • RQ5ImageNet 사전 훈련 데이터셋에서 신규 클래스 샘플을 제거하는 경우(즉, 암시적 샘플을 제거하는 경우), 검출기 성능에 어떤 영향을 미치며, 제안된 방법이 이를 완화할 수 있는가?

주요 결과

  • SRR-FSD는 1-shot VOC 벤치마크에서 mAP50가 46.1%를 기록하여, 저성능 기준 모델인 FSRW(31.5%)와 Meta R-CNN(35.8%)를 크게 앞서며 저성능 조건에서도 뛰어난 성능을 보였다.
  • 2-shot 설정에서는 SRR-FSD가 55.6%의 AP50를 달성하여, 매우 적은 레이블 예시가 있는 상황에서도 강력한 일반화 능력을 입증했다.
  • ImageNet에서 암시적 샘플을 제거한 rm-nov 설정에서도 SRR-FSD는 1-shot에서 41.5%의 mAP50를 유지하며, 기준 모델의 급격한 성능 저하를 보여주며 안정성의 우수성을 입증했다.
  • 5-shot에서는 65.4%의 AP50, 10-shot에서는 67.4%의 AP50를 기록하여, 모든 샘플 수 수준에서 경쟁적인 성능을 보였다.
  • 제거 실험(ablation study) 결과, 더 많은 파라미터를 미세조정해도 성능 향상이 없으며, 동적 관계 그래프가 강건성 확보에 필수적임을 확인했다. 정적 또는 히ュ리스틱 그래프보다 우수한 성능을 기록했다.
  • 자기주의 주의를 통해 구현된 동적 관계 그래프는 클래스 임베딩 간의 지식 전파를 효과적으로 가능하게 하여, 데이터가 적은 환경에서 분류 정확도를 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.