Skip to main content
QUICK REVIEW

[논문 리뷰] Cross-Domain Weakly-Supervised Object Detection through Progressive Domain Adaptation

Naoto Inoue, Ryosuke Furuta|arXiv (Cornell University)|2018. 03. 30.
Domain Adaptation and Few-Shot Learning인용 수 6
한 줄 요약

이 논문은 도메인 간 약한 지도 학습 객체 검출을 위한 이단계 점진적 도메인 적응 프레임워크를 제안한다. 도메인 전이(CycleGAN 기반 이미지 번역)와 가짜 레이블링을 활용하여 타겟 도메인의 이미지 수준 레이블에서 합성된 인스턴스 수준의 애너테이션을 생성한다. 이 방법은 세 가지 새로운 데이터셋(Clipart1k, Watercolor2k, Comic2k)에서 베이스라인 대비 5–20퍼센트 포인트의 mAP 향상을 달성하여, 다양한 시각적 도메인 간 강력한 일반화 성능을 보이며, 인간의 애너테이션에 대한 의존도를 최소화한다.

ABSTRACT

Can we detect common objects in a variety of image domains without instance-level annotations? In this paper, we present a framework for a novel task, cross-domain weakly supervised object detection, which addresses this question. For this paper, we have access to images with instance-level annotations in a source domain (e.g., natural image) and images with image-level annotations in a target domain (e.g., watercolor). In addition, the classes to be detected in the target domain are all or a subset of those in the source domain. Starting from a fully supervised object detector, which is pre-trained on the source domain, we propose a two-step progressive domain adaptation technique by fine-tuning the detector on two types of artificially and automatically generated samples. We test our methods on our newly collected datasets containing three image domains, and achieve an improvement of approximately 5 to 20 percentage points in terms of mean average precision (mAP) compared to the best-performing baselines.

연구 동기 및 목표

  • 타겟 이미지 도메인(예: 수채화, 만화)에서 인스턴스 수준의 애너테이션이 없이 객체를 검출하는 문제를 해결하기 위해.
  • 원천 도메인에서 풍부한 인스턴스 수준 애너테이션이 있는 상태에서, 이미지 수준의 레이블만 있는 타겟 도메인으로 효과적인 도메인 적응을 가능하게 하기 위해.
  • 새로운 도메인에서 비용이 많이 드는 인간이 애너테이션한 바운딩 박스에 의존도를 최소화하는 확장 가능하고 일반화 가능한 프레임워크를 개발하기 위해.
  • 평가를 위해 비자연적 이미지 도메인(예: 일러스트, 수채화, 만화 등)에서 완전히 애너테이션된 인스턴스를 포함하는 새로운 벤치마크 데이터셋을 구축하기 위해.

제안 방법

  • 원천 도메인의 인스턴스 수준 애너테이션을 가진 이미지에서 타겟 도메인의 이미지를 생성하기 위해 CycleGAN 기반 도메인 전이(DT)를 적용한다.
  • DT로 생성된 이미지에서 최적화된 검출기를 사용하여, 타겟 도메인의 이미지 수준 애너테이션을 가진 이미지에 대해 가짜 바운딩 박스를 생성한다.
  • 이미지 수준 레이블과 모델 예측을 조합하여 가짜 레이블링(PL)을 수행함으로써, 타겟 도메인에서 가짜 인스턴스 수준 애너테이션을 생성한다.
  • 이중 단계 점진적 도메인 적응을 구현한다: 먼저 DT로 생성된 데이터에서, 그 다음 PL로 생성된 데이터에서 각각 미세조정하여 검출 성능을 향상시킨다.
  • 외부 소스(예: BAM! 데이터셋)에서 유래한 추가적인 노이즈가 있는 이미지 수준 레이블을 활용하여 성능을 더욱 향상시킨다.
  • 표준 약한 지도 학습 목표 함수를 사용하여 검출기를 훈련하고, 도메인 적응을 통해 반복적인 개선을 수행한다.

실험 결과

연구 질문

  • RQ1원천 도메인에서 인스턴스 수준 애너테이션이 있는 도메인 전이가, 검출기 미세조정에 적합한 현실적인 타겟 도메인 이미지를 생성할 수 있는가?
  • RQ2이미지 수준 레이블과 모델 예측을 활용한 가짜 레이블링이, 타겟 도메인에서 신뢰할 수 있는 합성 인스턴스 수준 애너테이션을 효과적으로 생성할 수 있는가?
  • RQ3순차적 이중 단계 점진적 도메인 적응(DT 이후 PL)이 단일 단계 적응 또는 기존의 베이스라인 방법보다 도메인 간 약한 지도 학습 객체 검출에서 성능이 뛰어나게 되는가?
  • RQ4외부 소스에서 유래한 노이즈가 많은 대규모 이미지 수준 레이블이 인간의 수동 애너테이션 없이 검출 성능 향상에 얼마나 기여할 수 있는가?

주요 결과

  • 제안된 DT+PL 방법은 세 가지 데이터셋(Clipart1k, Watercolor2k, Comic2k) 전반에서 가장 우수한 베이스라인 대비 평균 정밀도(mAP) 향상이 약 5~20퍼센트 포인트에 이르렀다.
  • Watercolor2k 데이터셋에서, BAM!에서 유래한 노이즈가 있는 이미지 수준 레이블을 추가로 사용한 +extra 버전은 1,000개의 깨끗한 인스턴스 수준 애너테이션으로 훈련된 이상적인 경우보다도 뛰어난 성능을 보였으며, 대규모 노이즈가 있는 데이터의 가치를 입증했다.
  • 에러 분석 결과, DT는 특히 낮은 신뢰도 예측에서 검출 성능을 향상시켰고, PL은 더 높은 신뢰도 예측에서의 오분류 및 위치 오류를 크게 감소시켰다.
  • 정성적 결과는 CycleGAN이 스타일과 텍스처를 효과적으로 전이하면서도 의미적 구조를 유지함을 확인했으며, 이는 효과적인 도메인 적응을 가능하게 했다.
  • 이 프레임워크는 일러스트, 수채화, 만화 등 다양한 시각적 도메인에서 뛰어난 성능을 달성하여 자연 이미지 외의 도메인에서도 일반화 가능성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.