Skip to main content
QUICK REVIEW

[논문 리뷰] Domain Adaptive YOLO for One-Stage Cross-Domain Detection

Shizhao Zhang, Hongya Tuo|arXiv (Cornell University)|2021. 06. 26.
Domain Adaptation and Few-Shot Learning참고 문헌 32인용 수 15
한 줄 요약

이 논문은 도메인 적응을 위한 새로운 프레임워크인 도메인 적응 YOLO(DA-YOLO)를 제안한다. 이는 도메인 간 분포 차이를 줄이기 위해 이미지 수준과 인스턴스 수준의 특징 정렬을 통합하는 한계 없는 단일 스테이지 객체 검출기이다. RIA(다양한 특징 맵 레이어에서 감소하는 가중치를 가진 세 개의 도메인 분류기)와 MSIA(세 가지 스케일 예측에 적용되는 세 개의 인스턴스 수준 도메인 분류기) 및 MLCR(이미지 수준 및 인스턴스 수준 도메인 분류기 간 일致성을 강화하는 다중 수준 공감 정규화)를 도입함으로써, DA-YOLO는 교차 도메인 검출 벤치마크에서 최신 기술(SOTA) 성능을 달성하며, 일부 설정에서 Faster R-CNN 기반 방법보다 최대 17.6% 높은 mAP 성능을 기록한다.

ABSTRACT

Domain shift is a major challenge for object detectors to generalize well to real world applications. Emerging techniques of domain adaptation for two-stage detectors help to tackle this problem. However, two-stage detectors are not the first choice for industrial applications due to its long time consumption. In this paper, a novel Domain Adaptive YOLO (DA-YOLO) is proposed to improve cross-domain performance for one-stage detectors. Image level features alignment is used to strictly match for local features like texture, and loosely match for global features like illumination. Multi-scale instance level features alignment is presented to reduce instance domain shift effectively , such as variations in object appearance and viewpoint. A consensus regularization to these domain classifiers is employed to help the network generate domain-invariant detections. We evaluate our proposed method on popular datasets like Cityscapes, KITTI, SIM10K and etc.. The results demonstrate significant improvement when tested under different cross-domain scenarios.

연구 동기 및 목표

  • 조명, 시점, 이미지 품질의 분포 변화로 인해 성능 저하를 겪는 단일 스테이지 객체 검출기에서 발생하는 도메인 간 분포 차이를 해결한다.
  • 주로 Faster R-CNN과 같은 이중 스테이지 검출기 전용으로 설계된 기존 도메인 적응 방법의 한계를 극복하며, 실시간 산업 응용에 부적합한 느린 속도 문제를 해결한다.
  • YOLOv3를 위한 통합된 도메인 적응 프레임워크를 개발하여, 영역 제안 없이도 효과적인 이미지 수준 및 인스턴스 수준의 특징 정렬을 가능하게 한다.
  • 자율 주행과 같은 실제 환경에서 테스트 데이터가 기후, 카메라 각도, 이미지 선명도 측면에서 훈련 데이터와 다를 수 있는 상황에서의 교차 도메인 일반화 성능을 향상시킨다.

제안 방법

  • 이미지 수준 도메인 분류기 세 개를 YOLOv3의 다양한 특징 맵 레이어에 적용하며, 가중치를 점점 감소시켜 국소적 특징(예: 텍스처)에 대해 더 엄격한 정렬과 전역적 특징(예: 조명)에 대해 덜 엄격한 정렬을 유도하는 회귀적 이미지 정렬(RIA)을 제안한다.
  • YOLOv3의 세 가지 스케일 예측에 각각 인스턴스 수준 도메인 분류기를 적용하여 다양한 수신장과 도메인 간 특징 정렬을 통해 인스턴스 수준의 도메인 간 차이를 줄이는 다중 스케일 인스턴스 정렬(MSIA)을 도입한다.
  • 이미지 수준 및 인스턴스 수준 도메인 분류기 간 일치성을 강제로 유도하여, 모든 수준에서 도메인 불변 특징을 학습하도록 하는 다중 수준 공감 정규화(MLCR)를 구현한다.
  • 기울기 반전 레이어(GRL)를 사용한 적대적 훈련을 통해 특징 추출기와 도메인 분류기를 동시에 최적화함으로써, 타겟 도메인 레이블 없이도 도메인 불변 특징을 생성할 수 있도록 한다.
  • 검출 손실, 이미지 및 인스턴스 수준의 도메인 분류 손실, 공감 정규화 손실을 포함하는 복합 손실을 사용하여 모델을 엔드 투 엔드로 훈련시킨다.
  • 다양한 백본 레이어의 특징 맵을 활용하여 다중 스케일 적응을 가능하게 하며, YOLOv3 특징 추출기의 다양한 단계에 도메인 분류기를 적용한다.

실험 결과

연구 질문

  • RQ1Faster R-CNN과 같은 이중 스테이지 검출기 전용으로 설계된 도메인 적응 기법이 YOLOv3와 같은 단일 스테이지 검출기로 효과적으로 이식될 수 있는가?
  • RQ2영역 제안망이 없는 단일 스테이지 검출기에서 이미지 수준 및 인스턴스 수준의 도메인 정렬을 어떻게 함께 최적화할 수 있는가?
  • RQ3이미지 수준 도메인 분류기의 가중치 전략이 국소적 특징과 전역적 특징 정렬에 미치는 영향은 어떠한가?
  • RQ4이미지 수준 및 인스턴스 수준 도메인 분류기 간의 공감 정규화가 단일 스테이지 검출기에서 도메인 불변 특징 학습에 기여하는가?
  • RQ5제안된 방법이 이중 스테이지 검출기 기반 최신 기술(SOTA) 방법보다 더 뛰어난 교차 도메인 검출 성능을 달성할 수 있는가?

주요 결과

  • KITTI에서 Cityscapes로의 이식 시, DA-YOLO는 기본 YOLOv3 대비 17.6% 높은 mAP 성능을 기록하며, 기존 Faster R-CNN 기반 도메인 적응 방법을 크게 능가한다.
  • Cityscapes에서 Foggy Cityscapes로의 벤치마크에서 DA-YOLO는 54.0% mAP 성능을 기록하여 이전 최신 기술 방법(51.8%)을 2.2% 포인트 초월하며 오라클 성능(57.8%)에 가까워졌다.
  • 제거 분석 결과, RIA, MSIA, MLCR 각각의 구성 요소가 성능 향상에 점진적으로 기여하며, 특히 Cityscapes에서 Foggy Cityscapes로의 이식 설정에서 MLCR가 1.2% mAP 향상 기여로 가장 큰 기여를 했다.
  • 가중치 감소 전략을 사용하는 RIA 모듈은 동일한 가중치를 사용하는 이미지 정렬 대비 1.5% mAP 향상을 기록하여 국소적 특징 정렬 우선 순위의 효과를 입증한다.
  • t-SNE 시각화 결과, DA-YOLO에서 추출한 전역적 특징은 소스 전용 기반 모델 대비 소스 및 타겟 도메인 간 더 잘 정렬되어 있음을 확인하여 도메인 정렬의 성공을 검증한다.
  • 정성적 결과에서 DA-YOLO는 기상 악화 조건에서 기준 모델이 놓친 차량까지도 성공적으로 검출하여 실제 교차 도메인 환경에서의 강건성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.