Skip to main content
QUICK REVIEW

[논문 리뷰] Zero-Annotation Object Detection with Web Knowledge Transfer

Qingyi Tao, Hao Yang|arXiv (Cornell University)|2017. 11. 16.
Domain Adaptation and Few-Shot Learning참고 문헌 28인용 수 4
한 줄 요약

이 논문은 인간에 의한 바운딩 박스 레이블이 전혀 필요 없이 웹 이미지에서의 지식을 타겟 데이터셋으로 전이하는 제로 애너테이션 객체 검출 프레임워크를 제안한다. 개체 수준의 적대적 도메인 적응 네트워크와 정상 주의를 도입하고, 의사 레이블 생성을 위한 동시 전이 메커니즘을 통해, VOC 2007과 VOC 2012에서 최신 기술 수준의 성능을 달성하며, 기준 강한 감독 검출 방법 대비 평균 3.7% 향상된 mAP를 기록한다.

ABSTRACT

Object detection is one of the major problems in computer vision, and has been extensively studied. Most of the existing detection works rely on labor-intensive supervision, such as ground truth bounding boxes of objects or at least image-level annotations. On the contrary, we propose an object detection method that does not require any form of human annotation on target tasks, by exploiting freely available web images. In order to facilitate effective knowledge transfer from web images, we introduce a multi-instance multi-label domain adaption learning framework with two key innovations. First of all, we propose an instance-level adversarial domain adaptation network with attention on foreground objects to transfer the object appearances from web domain to target domain. Second, to preserve the class-specific semantic structure of transferred object features, we propose a simultaneous transfer mechanism to transfer the supervision across domains through pseudo strong label generation. With our end-to-end framework that simultaneously learns a weakly supervised detector and transfers knowledge across domains, we achieved significant improvements over baseline methods on the benchmark datasets.

연구 동기 및 목표

  • 타겟 작업에서 인간에 의한 바운딩 박스 애너테이션을 전혀 필요로 하지 않는 객체 검출 방법을 개발하는 것.
  • 웹 이미지(간단하고 깔끔함)와 타겟 이미지(잡다한, 가림이 있음) 사이의 도메인 차이를 효과적인 지식 전이를 통해 해결하는 것.
  • 교차 도메인 특징 전이 과정에서 클래스별 의미적 구조를 유지하여 정확한 검출을 가능하게 하는 것.
  • 웹 이미지의 이미지 수준 레이블만을 사용하여 약한 감독 검출을 가능하게 하는 것.
  • 의사 레이블 개선과 함께 검출과 도메인 적응을 동시에 학습하는 것.

제안 방법

  • 약한 감독 검출(WSD), 개체 수준의 적대적 도메인 적응(DA), 동시 전이(ST) 스트림을 결합한 다중 스트림 엔드 투 엔드 프레임워크를 제안한다.
  • 도메인 분류기와 특징 생성기로 개체 제안 영역 수준에서 도메인 간 차이를 최소화하는 개체 수준의 적대적 DA 네트워크를 도입한다.
  • 특징 정렬 과정에서 배경 영역보다는 개체 제안 영역을 우선시하기 위해 DA 스트림에 정상 주의를 통합한다.
  • 웹에서 학습된 WSD 모델을 사용하여 타겟 도메인 샘플에 대한 의사 강력 레이블을 생성하는 동시 전이 스트림을 구현한다.
  • WSD와 ST 스트림 간 특징과 가중치를 공유하여 공동 학습을 가능하게 하고 분포 이탈을 방지한다.
  • t-SNE 시각화와 분석 실험을 통해 도메인 적응 및 주의 메커니즘의 효과를 검증한다.

실험 결과

연구 질문

  • RQ1타겟 데이터셋에서 인간에 의한 바운딩 박스 애너테이션 없이도 객체 검출을 효과적으로 수행할 수 있는가?
  • RQ2자유롭게 이용 가능한 웹 이미지에서의 지식을 도메인 차이가 있는 실제 세계의 타겟 데이터셋으로 효과적으로 전이할 수 있는가?
  • RQ3정상 주의를 갖춘 개체 수준의 도메인 적응이 객체 검출에서 도메인 간 차이를 줄이는 데 어떤 역할을 하는가?
  • RQ4동시 의사 레이블 전이가 제로 애너테이션 검출 과정에서 클래스 간 의미적 구조를 어떻게 유지하는가?
  • RQ5검출과 도메인 적응을 함께 학습하는 것이 별도의 사전 훈련 및 미세조정보다 더 효과적인가?

주요 결과

  • 제안된 방법은 VOC 2007 테스트 세트에서 mAP 24.6%를 달성하여 기준 WSD 전용 방법(23.5%)보다 뚜렷한 향상을 보였다.
  • 정상 주의 기반의 DA 스트림을 추가함으로써 기준 대비 mAP가 1.1% 향상되었으며, 이는 도메인 이탈을 줄이는 데 효과적임을 입증한다.
  • 분석 실험 결과, DA에서 정상 주의 메커니즘을 제거할 경우 성능이 23.3%로 떨어지며, 이는 DA를 전혀 적용하지 않은 경우(23.5%)보다도 열 劣한 성능을 보여, 제안 영역에 대한 무분별한 대응이 학습에 악영향을 준다는 것을 시사한다.
  • VOC 2012 데이터셋에서, 기준 대비 mAP가 VGG_M 기준 3.8%, VGG16 기준 3.7% 향상되어 다양한 데이터셋에 대한 일반화 능력을 확인하였다.
  • WSD와 ST 스트림의 동시 학습이 별도의 이중 단계 접근 방식(22.5% mAP)보다 우수한 성능을 보여, 공유된 특징 학습의 중요성을 입증한다.
  • t-SNE 시각화 결과, DA 및 ST 스트림이 함께 작용하여 교차 도메인 특징을 정렬하고 타겟 도메인 내 클래스 간 분리도를 향상시킴을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.