[논문 리뷰] DA-DETR: Domain Adaptive Detection Transformer with Information Fusion
DA-DETR는 CNN과 Transformer 특징을 새로운 CNN-Transformer 블렌더(CTBlender)를 통해 융합함으로써 교차 도메인 특징 정렬과 지식 전달을 향상시키는 도메인 적응형 객체 검출 트랜스포머를 제안한다. 스플릿-머지 융합과 스케일 집합 융합을 통합함으로써 DA-DETR는 Cityscapes→Foggy Cityscapes에서 SOTA mAP 43.5를 달성하여 비지도 도메인 적응 벤치마크에서 기존 방법들을 능가한다.
The recent detection transformer (DETR) simplifies the object detection pipeline by removing hand-crafted designs and hyperparameters as employed in conventional two-stage object detectors. However, how to leverage the simple yet effective DETR architecture in domain adaptive object detection is largely neglected. Inspired by the unique DETR attention mechanisms, we design DA-DETR, a domain adaptive object detection transformer that introduces information fusion for effective transfer from a labeled source domain to an unlabeled target domain. DA-DETR introduces a novel CNN-Transformer Blender (CTBlender) that fuses the CNN features and Transformer features ingeniously for effective feature alignment and knowledge transfer across domains. Specifically, CTBlender employs the Transformer features to modulate the CNN features across multiple scales where the high-level semantic information and the low-level spatial information are fused for accurate object identification and localization. Extensive experiments show that DA-DETR achieves superior detection performance consistently across multiple widely adopted domain adaptation benchmarks.
연구 동기 및 목표
- 검출 트랜스포머의 간소화된 아키텍처에도 불구하고 도메인 적응이 효과적으로 이루어지지 않는 문제를 해결하기 위해.
- 상호보완적인 CNN(위치 정보)과 트랜스포머(의미 정보) 특징을 융합하여 비지도 도메인 적응을 향상시키기 위해.
- 추가적인 분류기 없이도 교차 도메인 특징 정렬을 향상시키는 통합된 특징 융합 메커니즘을 설계하기 위해.
- Cityscapes→Foggy Cityscapes, KITTI→Cityscapes, PASCAL VOC→Clipart1k를 포함한 다양한 도메인 이동 시나리오에 대한 일반화 능력을 입증하기 위해.
제안 방법
- 다중 스케일에서 CNN과 트랜스포머 특징을 융합하기 위한 CNN-Transformer 블렌더(CTBlender)를 도입한다.
- 스플릿-머지 융합(SMF)을 사용하여 CNN 특징을 K개의 그룹으로 나누고, 각 그룹을 해당하는 트랜스포머 특징으로 조절함으로써 채널별 및 공간별 정보 교환을 가능하게 한다.
- 스케일 집합 융합(SAF)을 적용하여 서로 다른 특징 스케일에서의 SMF 출력을 결합함으로써 다중 수준의 의미적 및 공간적 정보를 집계한다.
- 융합된 특징을 단일 도메인 구분자에 입력하여 엔드 투 엔드 비지도 도메인 적응을 수행한다.
- DETR의 자기주의 주의 메커니즘을 활용하여 CNN 특징을 조건부로 조절함으로써 도메인 간 특징 정렬을 향상시킨다.
- 교차 엔트로피 손실과 적대적 손실을 동시에 최적화하는 통합 학습 파이프라인을 채택한다.
![Figure 1 : The vanilla Deformable-DETR [ 81 ] trained with labeled source data cannot handle target data well due to cross-domain shift. The introduction of adversarial feature alignment in Deformable-DETR + Direct-align [ 19 ] improves the detection clearly. The proposed DA-DETR fuses CNN features](https://ar5iv.labs.arxiv.org/html/2103.17084/assets/x1.png)
실험 결과
연구 질문
- RQ1CNN과 트랜스포머 구성 요소 간의 특징 융합이 검출 트랜스포머에서 도메인 적응을 향상시킬 수 있는가?
- RQ2기존 융합 방법(예: 덧셈, 곱셈, 컨볼루션)과 비교할 때 스플릿-머지 융합은 교차 도메인 정렬에서 어떻게 성능을 냅니다?
- RQ3다양한 스케일 변동이 큰 도메인 이동에 대해 다중 스케일에서 특징을 융합하면 강건성이 향상되는가?
- RQ4개별 정렬 헤드가 필요 없이도 단일 도메인 구분자가 융합된 특징을 도메인 간에 효과적으로 정렬할 수 있는가?
- RQ5제안된 CTBlender는 표준 Cityscapes→Foggy Cityscapes 설정을 초월하여 다양한 도메인 적응 벤치마크에서 일반화 성능을 보일 수 있는가?
주요 결과
- Cityscapes→Foggy Cityscapes 벤치마크에서 DA-DETR는 mAP 43.5를 기록하여 이전 SOTA 방법(LS-DeconvNet)을 0.9점 초월한다.
- CTBlender의 스플릿-머지 융합은 효과적인 의미 그룹화를 가능하게 하며, 32개 그룹 각각에서 서로 다른 전경 영역에 대해 명확한 주의 패턴이 시각화되었다.
- CTBlender를 통한 CNN 및 트랜스포머 특징 융합은 오직 CNN 특징을 사용할 경우보다 4.7점, 오직 트랜스포머 특징을 사용할 경우보다 4.2점 향상된 mAP를 달성한다.
- CTBlender의 스케일 집합 융합은 KITTI→Cityscapes 및 PASCAL VOC→Comic2k와 같은 대규모 스케일 도메인 이동에 대해 성능 향상을 이룬다.
- PASCAL VOC→Watercolor2k 및 PASCAL VOC→Comic2k에서 DA-DETR는 모든 SOTA 방법을 능가하며, 다양한 도메인 이동에 대한 강력한 일반화 능력을 입증한다.
- 제거 실험 결과, CTBlender의 스플릿-머지 및 스케일 집합 융합 구성 요소가 필수적임을 확인하였으며, 이들을 제거할 경우 성능 저하가 심각하게 발생한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.