[논문 리뷰] Towards Universal Object Detection by Domain Attention
이 논문은 사전 도메인 지식 없이 도메인 전용 하위 네트워크에 특징을 동적으로 라우팅할 수 있는 공유 백본과 학습 가능한 유니버설 스위즈-익사이트먼트(Se) 어댑터를 사용하는 도메인 주의형 유니버설 객체 검출기인 도메인-주의형 유니버설 객체 검출기를 제안한다. 이 방법은 11개의 다양한 데이터셋에서 최신 기술 수준의 성능을 달성하며, 단일 도메인 기반 모델보다도 미처 탐색되지 않은 도메인에서 슈퍼어리어를 기록한다. 파rameter 수는 단일 도메인 기반 모델의 1.3배 뿐이다.
Despite increasing efforts on universal representations for visual recognition, few have addressed object detection. In this paper, we develop an effective and efficient universal object detection system that is capable of working on various image domains, from human faces and traffic signs to medical CT images. Unlike multi-domain models, this universal model does not require prior knowledge of the domain of interest. This is achieved by the introduction of a new family of adaptation layers, based on the principles of squeeze and excitation, and a new domain-attention mechanism. In the proposed universal detector, all parameters and computations are shared across domains, and a single network processes all domains all the time. Experiments, on a newly established universal object detection benchmark of 11 diverse datasets, show that the proposed detector outperforms a bank of individual detectors, a multi-domain detector, and a baseline universal detector, with a 1.3x parameter increase over a single-domain baseline detector. The code and benchmark will be released at http://www.svcl.ucsd.edu/projects/universal-detection/.
연구 동기 및 목표
- 사전 도메인 지식 없이 다양한 이미지 도메인 간에서 일반화할 수 있는 유니버설 객체 검출 시스템의 부족을 해결한다.
- 추론 시 도메인 식별이 필요하고 도메인 수에 따라 선형적으로 파rameter가 증가하는 다중 도메인 검출기의 한계를 극복한다.
- 데이터 기반 주의 메커니즘을 통해 알려지지 않은 도메인에 적응할 수 있는 단일의 파rameter 효율적이고 항상 활성화된 검출기를 설계한다.
- 11개의 다양한 객체 검출 데이터셋으로 구성된 새로운 벤치마크인 UODB를 구축하여 유니버설 검출 성능을 평가한다.
- 다양한 도메인 간 공유 표현 학습이 자원이 부족하거나 도메인 이격이 있는 데이터셋에서 검출 성능을 크게 향상시킬 수 있음을 입증한다.
제안 방법
- 핵심 레이어에 삽입된 공유 백본과 유니버설 SE 어댑터의 은행을 갖춘 유니버설 객체 검출기를 제안하여 특징 조절을 가능하게 한다.
- SE 어댑터 출력에 대한 학습 가능한 주의 메커니즘을 통해 특정 도메인에 특징 반응을 할당하는 도메인 주의(DA) 모듈을 도입한다.
- 모든 11개의 데이터셋을 동시에 다중 작업 학습 목표로 사용하여 네트워크 전체를 엔드 투 엔드로 훈련시키며, DA 모듈이 감독 없이 도메인 전용 라우팅을 학습할 수 있도록 한다.
- 계산 오버헤드를 최소화하기 위해 스위즈-익사이트먼트 네트워크를 영감으로 삼은 경량이고 파rameter 효율적인 어댑터 설계를 사용한다.
- DA 모듈을 적용하여 활성화를 도메인 전용 하위 네트워크로 동적으로 라우팅함으로써, 동일한 네트워크가 추론 시 여러 도메인에 적응할 수 있도록 한다.
- 모든 데이터셋을 통합하여 훈련함으로써 지식 전이와 일반화 능력 향상을 가능하게 하며, 특히 자원이 부족한 도메인에서 유의미한 성능 향상을 이룬다.
실험 결과
연구 질문
- RQ1추론 시 도메인 식별이 필요 없이, 서로 다른 비중첩 이미지 도메인 간에서 잘 작동하는 단일 유니버설 객체 검출기를 훈련시킬 수 있는가?
- RQ2데이터 기반 도메인 주의 메커니즘이 비중요한 도메인 이격이 있는 여러 도메인에 적응할 수 있도록 공유 검출기를 효과적으로 조정하는 데 얼마나 효과적인가?
- RQ3여러 데이터셋 간 공유 표현 학습이 자원이 부족하거나 도메인 이격이 있는 데이터셋에서 검출 성능 향상에 얼마나 기여하는가?
- RQ4제안된 유니버설 검출기가 전용 단일 도메인 검출기와 도메인 전용 적응이 필요한 다중 도메인 검출기보다 우월한가?
- RQ5네트워크에 전략적으로 배치된 최소한의 유니버설 어댑터로, 전체 어댑터 은행과 비교해도 성능이 유사한 결과를 얻을 수 있는가?
주요 결과
- 제안된 도메인 주의형 유니버설 검출기는 UODB 벤치마크에서 개별 검출기 은행, 다중 도메인 검출기, 기초 유니버설 검출기보다 모두 뛰어난 성능을 보였다.
- COCO와 VOC 데이터셋에서, 11개의 데이터셋에 대해 훈련된 유니버설 검출기는 단일 도메인 기반 모델보다 mAP 4.5포인트 향상되었으며, 파rameter 수는 1.3배 뿐이었다.
- KITTI에서, 유니버설 검출기는 Moderate 설정에서 mAP 6.4포인트 향상되었으며, 해당 데이터셋에 특별히 최적화된 검출기와 동등한 성능을 기록했다.
- DeepLesion 및 교차 도메인 데이터셋(예: clipart, comic)과 같은 자원이 부족한 도메인에서는 유니버설 검출기가 최신 기술 수준의 방법보다 뚜렷이 뛰어나며, 공동 훈련을 통해 과적합을 완화했다.
- 첫 번째 및 중간 블록에만 6개의 유니버설 SE 어댑터를 갖춘 단순화된 모델은 파rameter 수를 줄였음에도 불구하고 가장 뛰어난 성능을 기록했으며, 단일 도메인 기반 모델보다 mAP 4.5포인트 높았다.
- 도메인 주의 메커니즘이 도메인 특성 특성을 잘 포착했음을 확인할 수 있었으며, VOC/COCO(유사)와 DOTA/DeepLesion(다른) 데이터셋 간의 주의 분포가 뚜렷하게 다름을 통해 도메인 전용 라우팅을 성공적으로 학습했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.