[논문 리뷰] Learning Domain-Aware Detection Head with Prompt Tuning
이 논문은 시각-언어 모델 백본과 학습 가능한 도메인 적응형 프롬프트를 사용하여 소스 및 타겟 도메인에 대한 동적 검출 헤드를 생성하는 새로운 도메인 적응형 객체 검출 프레임워크인 DA-Pro를 제안한다. 이중 제약 조건과 프롬프트 앙상블 전략을 통해 도메인 불변 및 도메인 특화 토큰을 동시에 최적화함으로써, DA-Pro는 RegionCLIP와 같은 강력한 베이스라인에 비해 교차 도메인 벤치마크에서 최신 기준(mAP) 성능을 1.9%–3.3% 향상시켰다.
Domain adaptive object detection (DAOD) aims to generalize detectors trained on an annotated source domain to an unlabelled target domain. However, existing methods focus on reducing the domain bias of the detection backbone by inferring a discriminative visual encoder, while ignoring the domain bias in the detection head. Inspired by the high generalization of vision-language models (VLMs), applying a VLM as the robust detection backbone following a domain-aware detection head is a reasonable way to learn the discriminative detector for each domain, rather than reducing the domain bias in traditional methods. To achieve the above issue, we thus propose a novel DAOD framework named Domain-Aware detection head with Prompt tuning (DA-Pro), which applies the learnable domain-adaptive prompt to generate the dynamic detection head for each domain. Formally, the domain-adaptive prompt consists of the domain-invariant tokens, domain-specific tokens, and the domain-related textual description along with the class label. Furthermore, two constraints between the source and target domains are applied to ensure that the domain-adaptive prompt can capture the domains-shared and domain-specific knowledge. A prompt ensemble strategy is also proposed to reduce the effect of prompt disturbance. Comprehensive experiments over multiple cross-domain adaptation tasks demonstrate that using the domain-adaptive prompt can produce an effectively domain-related detection head for boosting domain-adaptive object detection. Our code is available at https://github.com/Therock90421/DA-Pro.
연구 동기 및 목표
- 기존 방법이 검출 백본에서의 편향을 줄이는 것에만 집중하는 데 비해, 무시된 검출 헤드 내의 도메인 편향을 해결하기 위해.
- 시각-언어 모델(VLM)의 높은 일반화 능력을 활용하여 도메인 적응에 강력한 시각 인코더로 활용하기 위해.
- 도메인 불변 및 도메인 특화 토큰을 모두 사용하여 도메인 특화 검출 헤드를 동적으로 생성하는 학습 가능한 프롬프트 메커니즘을 설계하기 위해.
- 검출 헤드의 신뢰도와 정렬에 대한 이중 제약 조건을 통해 도메인 간 공통 및 고유 지식을 모두 포착하기 위해.
- EMA 기반 버퍼 업데이트를 사용한 역사적 프롬프트 앙상블 전략을 통해 학습 중 프롬프트 방해를 줄이기 위해.
제안 방법
- 프리트레인된 VLM을 백본으로 사용하여 도메인 일반화된 시각적 특징을 추출한다.
- 도메인 적응형 프롬프트는 학습 가능한 도메인 불변 토큰, 도메인 특화 토큰, 도메인 및 클래스에 대한 텍스트 기술로 구성된다.
- 두 가지 제약 조건이 적용된다: (1) 공통 지식을 유지하기 위해 소스 및 타겟 검출 헤드를 함께 최적화하고, (2) 도메인 특화 신뢰도 최대화를 통해 분류 성능을 향상시킨다.
- 프롬프트 앙상블 전략은 EMA를 통해 과거 프롬프트의 이동 평균을 유지하여 배치 수준의 데이터 변동에 대한 강건성을 향상시킨다.
- 검출 헤드는 VLM 내의 크로스 어텐션을 통해 프롬프트 토큰과 시각적 특징을 참조함으로써 동적으로 생성된다.
- 전체 학습 목표는 분류 손실, 도메인 신뢰도 손실, 엔트로피 정규화를 조합하여 최적화의 안정성을 확보한다.
실험 결과
연구 질문
- RQ1프롬프트 튜닝이 도메인 적응형 객체 검출에서 도메인 인식 검출 헤드를 효과적으로 학습하는 데 적용될 수 있는가?
- RQ2프롬프트 기반 검출 헤드에서 도메인 불변 및 도메인 특화 지식을 어떻게 함께 모델링할 수 있는가?
- RQ3소스 및 타겟 도메인 간 잘 일반화된 검출 헤드를 확보하기 위해 필요한 제약 조건은 무엇인가?
- RQ4프롬프트 앙상블 전략은 데이터 분포 변화 상황에서 강건성과 성능 향상에 기여하는가?
- RQ5프롬프트 길이가 DAOD에서 분류 성능와 과적합 사이의 트레이드오프에 어떤 영향을 미치는가?
주요 결과
- DA-Pro는 Cross-Weather, Cross-Fov, Sim-to-Real 세 가지 교차 도메인 벤치마크에서 최신 기준 성능을 달성했다.
- Cross-Weather 벤치마크에서 DA-Pro는 55.9% mAP를 기록하여 새로운 최고 기록을 수립했으며, RegionCLIP 대비 1.9%–3.3% 향상된 성능을 보였다.
- 제거 실험 결과, 도메인 특화 토큰과 이중 제약 조건을 추가함으로써 도메인 불변 토큰만 사용한 경우 대비 mAP가 0.4% 향상되었다.
- 프롬프트 앙상블 전략은 각각 AP, AP50, AP75에서 mAP를 0.7%, 0.4%, 1.5% 향상시켜 프롬프트 방해를 감소시켰다.
- 도메인 불변 및 도메인 특화 토큰에 대해 (8,8) 길이의 프롬프트가 최적의 성능을 내며, 더 긴 길이에서 관찰된 과적합을 피할 수 있었다.
- 시각화 결과, 도메인 적응형 프롬프트는 겹치거나 가려진 객체를 정확히 탐지하는 반면, 수작업으로 만든 프롬프트나 도메인 불변 프롬프트는 이를 놓치거나 잘못 분류하는 것으로 확인되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.