[논문 리뷰] Adapting Object Detectors with Conditional Domain Normalization
이 논문은 도메인별 특성(attribute)를 분리하고 도메인 임bedding 모듈을 통해 조건부 정규화를 적용하여 서로 다른 도메인의 특징을 정렬하는 새로운 방법인 조건부 도메인 정규화(Conditional Domain Normalization, CDN)를 제안한다. CDN은 2D 및 3D에서 실세계 대 실세계, 그리고 실세계 대 합성 데이터의 객체 검출 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하며, 검출기의 여러 특징 수준에서 도메인 간 차이를 크게 줄인다.
Real-world object detectors are often challenged by the domain gaps between different datasets. In this work, we present the Conditional Domain Normalization (CDN) to bridge the domain gap. CDN is designed to encode different domain inputs into a shared latent space, where the features from different domains carry the same domain attribute. To achieve this, we first disentangle the domain-specific attribute out of the semantic features from one domain via a domain embedding module, which learns a domain-vector to characterize the corresponding domain attribute information. Then this domain-vector is used to encode the features from another domain through a conditional normalization, resulting in different domains' features carrying the same domain attribute. We incorporate CDN into various convolution stages of an object detector to adaptively address the domain shifts of different level's representation. In contrast to existing adaptation works that conduct domain confusion learning on semantic features to remove domain-specific factors, CDN aligns different domain distributions by modulating the semantic features of one domain conditioned on the learned domain-vector of another domain. Extensive experiments show that CDN outperforms existing methods remarkably on both real-to-real and synthetic-to-real adaptation benchmarks, including 2D image detection and 3D point cloud detection.
연구 동기 및 목표
- 실세계 객체 검출에서 데이터 분포가 다를 경우 성능이著しく 떨어지는 문제를 해결하기 위해, 다양한 데이터 분포 간의 도메인 이동 문제를 다루는 것.
- 기존 도메인 적응 방법이 도메인 특성과 의미적 콘텐츠를 혼동하는 한계를 극복하기 위해, 도메인 혼동 학습 중 의미적 콘텐츠와 도메인 특성을 분리하는 것.
- 각 단계에서 도메인 이동을 다르게 모델링하여 저수준에서 고수준 특징에 이르기까지 다양한 표현 수준에서 객체 검출기의 도메인 적응을 가능하게 하는 것.
- 실세계 레이블링의 고비용을 줄이기 위해 합성 데이터에서 실세계 데이터로의 효과적인 적응을 가능하게 하는 것.
- 도메인 일반화 성능 평가를 위해 2D 객체 검출을 위한 대규모 합성-실세계 주행 벤치마크를 구축하는 것.
제안 방법
- 도메인 임베딩 모듈을 통해 의미적 특징에서 도메인에 특화된 특성을 분리하여 도메인별 특성과 의미적 특징을 분리한다.
- 학습된 도메인 벡터를 사용해 다른 도메인의 특징을 조건부 정규화하여, 도메인 특성을 효과적으로 전이함으로써 공통 잠재 공간에서 특징을 정렬한다.
- 검출기의 다중 컨볼루션 단계에 조건부 정규화를 적용하여 표현 수준에 따라 도메인 이동을 적응적으로 보정한다.
- 도메인 특성에 기반해 입력 이미지를 재구성하는 디코더 네트워크를 사용하여 도메인 임베딩의 영향을 시각화하고 해석할 수 있도록 한다.
- 재구성 과정에서 백본 네트워크의 가중치는 고정하고, 입력 이미지와 재구성된 이미지 간의 L2 재구성 손실을 최소화하도록 디코더를 학습한다.
- 공개 데이터셋을 활용하여 2D 객체 검출을 위한 대규모 합성-실세계 벤치마크를 구축한다.
실험 결과
연구 질문
- RQ1의미적 특징에서 도메인에 특화된 특성을 효과적으로 분리하여 이질적 도메인 간 특징 정렬이 가능한가?
- RQ2학습된 도메인 벡터를 조건부 정규화에 활용할 경우, 기존의 표준 도메인 혼동 방법에 비해 도메인 적응 성능이 향상되는가?
- RQ3CDN은 객체 검출기의 다양한 특징 표현 수준에서 도메인 이동을 적응적으로 다룰 수 있는가?
- RQ42D 및 3D 객체 검출에서 CDN은 합성 데이터에서 실세계 데이터로의 일반화 성능이 얼마나 우수한가?
- RQ5학습된 도메인 임베딩이 이미지 재구성 과정을 통해 의미 있는 도메인 특성을 캡처하는가?
주요 결과
- CDN은 실세계 대 실세계 적응 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하며, Cityscapes에서 Foggy Cityscapes로의 전이에서 기존 방법에 비해 상당한 mAP 향상을 보였다.
- 합성 대 실세계 적응에서 CDN은 2D 및 3D 검출 작업 모두에서 기존 방법을 능가하며, 합성 데이터에서 실세계 데이터로의 강력한 일반화 성능을 입증했다.
- 실세계 도메인 임베딩(예: BDD100K)을 사용해 특징을 인코딩한 후 재구성한 이미지는 더 현실적으로 출력되며, 이는 도메인 임베딩이 의미 있는 실세계 특성을 캡처하고 있음을 확인한다.
- 시각화 결과는 합성 도메인과 실세계 도메인의 특징이 공통 잠재 공간에서 시각적으로 구별되지 않음을 보여주며, 효과적인 도메인 정렬을 확인한다.
- 특징 맵에서 동일한 카테고리의 객체가 서로 다른 도메인 간에 유사한 활성화 패턴을 보이며 의미적 일致성을 유지함을 확인했다.
- KITTI의 3D 포인트 클라우드 검출에서 CDN은 PointRCNN를 사용해 중간 수준의 AP 19.0을 달성하여 3D 적응에서의 효과성을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.