[논문 리뷰] Deeply Aligned Adaptation for Cross-domain Object Detection
이 논문은 Faster R-CNN을 사용한 교차 도메인 객체 검출을 위한 엔드 투 엔드 도메인 적응 방법인 딥리 어ล리드 어댑테이션(DAA)을 제안한다. 도메인 정합은 국소 패치 특징(저수준), 전반적 특징(고수준), 그리고 인스턴스 수준의 전경-배경 특징에서 다수의 수준에서 적용된다. 이 방법은 국소와 전반적 정합을 연결하기 위한 전이 모듈, 적대적 훈련을 향상시키기 위한 도메인 마스크 통합(DMI) 모듈, 객체 영역과 배경 영역 간의 잘못된 정합을 방지하기 위한 전경-배경 인식 정합 모듈을 도입한다. 이로 인해 Cityscapes에서 Foggy Cityscapes로의 벤치마크에서 최신 기술(SOTA) mAP 39.2%를 달성한다.
Cross-domain object detection has recently attracted more and more attention for real-world applications, since it helps build robust detectors adapting well to new environments. In this work, we propose an end-to-end solution based on Faster R-CNN, where ground-truth annotations are available for source images (e.g., cartoon) but not for target ones (e.g., watercolor) during training. Motivated by the observation that the transferabilities of different neural network layers differ from each other, we propose to apply a number of domain alignment strategies to different layers of Faster R-CNN, where the alignment strength is gradually reduced from low to higher layers. Moreover, after obtaining region proposals in our network, we develop a foreground-background aware alignment module to further reduce the domain mismatch by separately aligning features of the foreground and background regions from the source and target domains. Extensive experiments on benchmark datasets demonstrate the effectiveness of our proposed approach.
연구 동기 및 목표
- 라벨이 소스 도메인에서만 이용 가능한 교차 도메인 객체 검출에서 도메인 이동 문제를 해결하기 위해.
- Faster R-CNN의 다양한 네트워크 레이어에서 특징의 이동 가능성의 변화를 고려하여 특징 이동 가능성 향상을 위해.
- 도메인 적응 중 전경과 배경 영역 간의 잘못된 정합을 줄이기 위해 인스턴스 수준의 전경-배경 인식 정합을 도입하기 위해.
- 도메인 마스크 통합(DMI) 모듈을 통해 적대적 훈련을 향상시켜 더 나은 도메인 불변 특징 학습을 가능하게 하기 위해.
- 국소 패치 수준과 전반적 이미지 수준의 도메인 정합 간 격차를 해소하기 위해 새로운 전이 모듈을 도입하기 위해.
제안 방법
- 다중 수준 도메인 정합 전략을 적용한다: 초기 레이어에서 국소 패치 수준의 적대적 훈련, 후기 레이어에서 전반적 이미지 수준의 적대적 훈련, 그리고 이를 부드럽게 연결하는 전이 모듈.
- 도메인 마스크 통합(DMI) 모듈은 적대적 훈련 중 더 유용한 샘플에 더 높은 가중치를 할당하여 판별기 및 생성기 최적화를 향상시킨다.
- 전경-배경 인식 정합 모듈을 도입하여 영역 제안에서 유래한 특징을 별도로 정합함으로써, 한 도메인의 전경 객체가 다른 도메인의 배경 영역과 잘못 정합되는 것을 방지한다.
- 이 방법은 Faster R-CNN 프레임워크에 통합되어, 여러 단계에 도메인 적응 모듈을 삽입한 엔드 투 엔드 훈련을 가능하게 한다.
- 다양한 수준에서 적대적 훈련을 적용한다: 저수준 특징을 위한 패치 수준과 고수준 특징을 위한 전반적 수준이며, 전이 모듈이 정합 전략의 전환을 조율한다.
- 검출 및 도메인 적응 목표의 공동 최적화를 통해 엔드 투 엔드 방식으로 모델을 훈련시킨다.
실험 결과
연구 질문
- RQ1CNN의 다양한 수준에서 도메인 정합을 효과적으로 적용하여 특징 이동 가능성의 변화를 반영할 수 있는가?
- RQ2전경과 배경 영역의 정합을 분리함으로써 객체 검출에서 도메인 오정합을 줄일 수 있는가?
- RQ3도메인 마스크 통합 모듈이 더 정보가 많은 샘플에 집중함으로써 적대적 훈련을 향상시킬 수 있는가?
- RQ4국소와 전반적 정합 간의 전이 모듈이 특징 분포 정합을 향상시키는가?
- RQ5인스턴스 수준의 전경-배경 인식 정합이 교차 도메인 객체 검출에서 더 높은 mAP를 이끌어낼 수 있는가?
주요 결과
- 제안된 DAA 모델은 Cityscapes에서 Foggy Cityscapes로의 벤치마크에서 mAP 39.2%를 달성하여 기존 최신 기술(SOTA) 방법을 능가한다.
- 제거 실험 결과, 전이 모듈을 추가함으로써 mAP가 27.1%에서 37.0%로 향상되어 국소와 전반적 정합을 연결하는 데의 중요성을 확인한다.
- DMI 모듈을 모델에 추가함으로써 mAP가 33.9%에서 37.6%로 향상되어, 더 나은 적대적 수렴과 특징 일반화를 유도함을 나타낸다.
- 전경-배경 인식 정합 모듈을 추가함으로써 mAP가 37.6%에서 39.2%로 상승하여 객체 영역과 배경 영역 간의 오정합 감소에 효과적임을 입증한다.
- 전경과 배경을 구분하지 않을 경우 mAP가 36.9%로 하락하여 인스턴스 수준의 정합이 반드시 필요함을 검증한다.
- 도메인 확률의 빈도 히스토그램은 DMI가 0.5 근처에서 더 균형 잡힌 점수를 유도함을 보여주며, 더 나은 도메인 혼동과 불변 특징 학습을 의미한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.