Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-Granularity Alignment Domain Adaptation for Object Detection

Wenzhang Zhou, Dawei Du|arXiv (Cornell University)|2022. 03. 31.
Domain Adaptation and Few-Shot Learning인용 수 9
한 줄 요약

이 논문은 객체 검출에서 비지도 도메인 적응을 위한 다중 균질성 정렬 프레임워크를 제안하며, 픽셀-, 인스턴스-, 카테고리 수준의 특징 정렬을 통합하여 도메인 불변 표현을 학습한다. 다중 해상도 특징 집약을 위한 옴니스케일 게이팅 퓨전 모듈과 인스턴스 구분 가능성 및 도메인 간 카테고리 일관성을 향상시키는 카테고리 수준의 판별기 도입으로, FCOS를 사용한 Cityscapes에서 FoggyCityscapes로의 적응에서 최고 성능(mAP 43.8%)을 달성한다.

ABSTRACT

Domain adaptive object detection is challenging due to distinctive data distribution between source domain and target domain. In this paper, we propose a unified multi-granularity alignment based object detection framework towards domain-invariant feature learning. To this end, we encode the dependencies across different granularity perspectives including pixel-, instance-, and category-levels simultaneously to align two domains. Based on pixel-level feature maps from the backbone network, we first develop the omni-scale gated fusion module to aggregate discriminative representations of instances by scale-aware convolutions, leading to robust multi-scale object detection. Meanwhile, the multi-granularity discriminators are proposed to identify which domain different granularities of samples(i.e., pixels, instances, and categories) come from. Notably, we leverage not only the instance discriminability in different categories but also the category consistency between two domains. Extensive experiments are carried out on multiple domain adaptation scenarios, demonstrating the effectiveness of our framework over state-of-the-art algorithms on top of anchor-free FCOS and anchor-based Faster RCNN detectors with different backbones.

연구 동기 및 목표

  • 원천 도메인과 타겟 도메인 간 분포 차이로 인한 도메인 이동 문제를 해결하기 위해.
  • 단일 수준 접근 방식을 넘어서 픽셀, 인스턴스, 카테고리 수준의 다중 균질성에서 특징 정렬을 향상시키기 위해.
  • 학습 가능한 게이팅 메커니즘을 사용한 다양한 해상도에서의 특징 융합을 통해 다중 해상도 객체 검출의 강건성을 향상시키기 위해.
  • 내부 카테고리의 구분 가능성과 도메인 간 카테고리 일관성을 동시에 모델링하여 더 나은 도메인 일반화를 달성하기 위해.
  • 최소한의 계산 비용으로 다양한 도메인 적응 벤치마크에서 최고 성능을 달성하기 위해.

제안 방법

  • 저해상도 및 고해상도 특징 맵에서 가장 적합한 컨볼루션을 조합하여 다중 해상도 특징 표현을 향상시키기 위해, 굵은 검출 가이던스를 기반으로 한 옴니스케일 게이팅 퓨전 모듈을 도입한다.
  • 픽셀, 인스턴스, 카테고리 수준에서 원천 및 타겟 도메인 샘플을 구분하기 위해 다중 균질성 판별기를 사용하며, 카테고리 수준의 판별기는 도메인 간 일관성을 강제한다.
  • 고신뢰도 검출을 위한 의사 레이블링을 사용하여 카테고리 수준의 판별기를 감독함으로써, 카테고리 일관성과 인스턴스 구분 가능성의 공동 학습을 가능하게 한다.
  • 백본 네트워크의 특징 맵을 활용하여 굵은 검출을 생성하고, 이를 바탕으로 각 인스턴스에 대한 최적의 컨볼루션 경로 선택을 유도한다.
  • 객체 검출기와 다중 균질성 도메인 판별기를 동시에 최적화하기 위한 통합 학습 목표를 설계하며, 적대적 방식으로 최적화한다.
  • VGG-16 및 ResNet-101 백본을 사용한 앵커 기반(Faster R-CNN) 및 앵커리스(FCOS) 검출기 모두에 이 프레임워크를 적용하여 광범위한 적용 가능성을 입증한다.

실험 결과

연구 질문

  • RQ1픽셀, 인스턴스, 카테고리 수준에서의 공동 정렬이 객체 검출의 도메인 일반화에 기여하는가?
  • RQ2학습 가능한 게이팅 메커니즘을 사용한 다중 해상도 특징 융합은 소형 및 대형 객체 검출 성능을 어떻게 향상시키는가?
  • RQ3원천 도메인과 타겟 도메인 간 카테고리 일관성 모델링이 도메인 적응에 얼마나 기여하는가?
  • RQ4각 균질성 수준(픽셀, 인스턴스, 카테고리)이 전체 도메인 적응 성능에 기여하는 비율은 어느 정도인가?
  • RQ5기존의 SOTA 도메인 적응 방법과 비교해 본다면, 제안된 방법은 정확도와 효율성 측면에서 어떻게 성능을 내는가?

주요 결과

  • 제안된 방법은 FCOS를 사용한 Cityscapes에서 FoggyCityscapes로의 도메인 적응 벤치마크에서 최고 성능인 mAP 43.8%를 달성하였으며, 두 번째로 우수한 성능을 보인 CFA보다 3.6%포인트 높은 성능을 기록하였다.
  • 카테고리 수준의 판별기를 제거할 경우, mAP가 43.6%에서 39.3%로 크게 하락하여, 성능 향상에 있어 그 핵심적인 역할을 한다는 점을 입증하였다.
  • 옴니스케일 게이팅 퓨전 모듈을 도입함으로써 기준 모델 대비 mAP가 4.3% 향상되어, 다중 해상도 특징 집약의 효과성을 입증하였다.
  • 기존의 판별기인 $D^{\text{cen}}$, $D^{\text{grp}}$, $D^{\text{cls}}$ 와 비교해 카테고리 수준의 판별기가 더 뛰어난 성능을 보였으며, 기준 모델 대비 5%의 성능 향상을 기록하였다.
  • 합리적인 계산 비용을 유지하였으며, Faster R-CNN 기준으로는 총 파라미터 수가 255M이고 추론 속도는 21.4 FPS로, SCL 및 SAPNet보다 정확도와 효율성 측면에서 모두 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.