Skip to main content
QUICK REVIEW

[논문 리뷰] Beyond Generation: Harnessing Text to Image Models for Object Detection and Segmentation

Yunhao Ge, Jiashu Xu|arXiv (Cornell University)|2023. 09. 12.
Multimodal Machine Learning ApplicationsComputer Science인용 수 3
한 줄 요약

이 논문은 Stable Diffusion와 같은 텍스트-이미지 확산 모델을 사용하여 객체 검출 및 인스턴스 세그멘테이션을 위한 고품질, 완전히 애너테이션된 훈련 데이터를 생성하는 새로운 방법을 제안한다. 배경과의 상호작용을 고려한 맥락적 배경 합성과 전경 객체 생성을 분리하고, 도메인 간 격차를 메우기 위해 언어 수준의 간섭을 적용함으로써, 이 방법은 실제 데이터 훈련과 동등한 검출 성능를 달성하며, 실제 데이터와 조합할 경우 이를 초월한다.

ABSTRACT

We propose a new paradigm to automatically generate training data with accurate labels at scale using the text-to-image synthesis frameworks (e.g., DALL-E, Stable Diffusion, etc.). The proposed approach1 decouples training data generation into foreground object generation, and contextually coherent background generation. To generate foreground objects, we employ a straightforward textual template, incorporating the object class name as input prompts. This is fed into a text-to-image synthesis framework, producing various foreground images set against isolated backgrounds. A foreground-background segmentation algorithm is then used to generate foreground object masks. To generate context images, we begin by creating language descriptions of the context. This is achieved by applying an image captioning method to a small set of images representing the desired context. These textual descriptions are then transformed into a diverse array of context images via a text-to-image synthesis framework. Subsequently, we composite these with the foreground object masks produced in the initial step, utilizing a cut-and-paste method, to formulate the training data. We demonstrate the advantages of our approach on five object detection and segmentation datasets, including Pascal VOC and COCO. We found that detectors trained solely on synthetic data produced by our method achieve performance comparable to those trained on real data (Fig. 1). Moreover, a combination of real and synthetic data yields even much better results. Further analysis indicates that the synthetic data distribution complements the real data distribution effectively. Additionally, we emphasize the compositional nature of our data generation approach in out-of-distribution and zero-shot data generation scenarios. We open-source our code at https://github.com/gyhandy/Text2Image-for-Detection

연구 동기 및 목표

  • 객체 검출 및 세그멘테이션을 위한 인간 애너테이션 데이터셋의 높은 비용과 확장성의 한계를 해결하기 위해.
  • 최소한의 인간 간섭으로 제로샷 및 분포 외 데이터 생성을 가능하게 하기 위해.
  • 텍스트-이미지 모델의 구성적이고 의미적 이해 능력을 활용하여 정확한 바운딩 박스와 세그멘테이션 마스크를 갖춘 스케일러블하고 고해상도의 데이터 합성하기 위해.
  • 비용이 많이 드는 실제 세계 애너테이션에 의존도를 줄이면서도 모델 성능을 유지하거나 향상시키기 위해.
  • 이 파이프라인을 통해 생성된 합성 데이터가 실제 데이터와 효과적으로 보완되거나, 실제 데이터를 대체할 수 있음을 보여주기 위해.

제안 방법

  • 전경 객체 생성은 간단한 텍스트 템플릿(예: 'A [class]')을 텍스트-이미지 모델에 입력하여 텅 빈 배경 위에 고립된 객체 이미지를 생성함.
  • 생성된 객체 이미지에 사전 훈련된 인스턴스 세그멘테이션 모델을 적용하여 전경 마스크를 추출함.
  • 먼저 단일 도메인 내 이미지에서 다양한 기술적 묘사 문장을 생성하기 위해 이미지 캡션 모델을 사용함.
  • 이러한 문장을 텍스트-이미지 모델의 프롬프트로 사용하여 맥락적으로 일관된 다양한 배경 이미지를 생성함.
  • 전경 마스크를 컷 앤 페이스트 기법을 사용해 생성된 배경에 합성하여 정확한 인스턴스 수준 애너테이션이 포함된 완전한 현실적인 훈련 이미지를 형성함.
  • 도메인 이격을 줄이고 합성 데이터 분포를 실제 테스트 데이터 분포와 일치시키기 위해 언어 수준의 간섭(예: 'cartoon'을 'real'로 교체)을 적용함.

실험 결과

연구 질문

  • RQ1텍스트-이미지 모델을 효과적으로 객체 검출 및 인스턴스 세그멘테이션을 위한 완전히 애너테이션된 훈련 데이터 생성에 재사용할 수 있는가?
  • RQ2이 방법으로 생성된 합성 데이터가 표준 벤치마크에서 실제 데이터 훈련과 동등한 성능을 달성할 수 있는가?
  • RQ3최소한의 실제 데이터로 제로샷 및 분포 외 설정에서 이 방법의 효과는 어떠한가?
  • RQ4프롬프트에 대한 언어 수준의 수정이 합성 데이터 분포와 실제 테스트 데이터 분포 간의 일치도를 향상시키는 데 얼마나 효과적인가?
  • RQ5합성 데이터와 실제 데이터를 조합하면 각각을 별도로 사용할 때보다 성능 향상이 이루어지는가?

주요 결과

  • 제안된 방법으로 생성된 합성 데이터만으로 훈련된 검출기들이 COCO 및 Pascal VOC와 같은 전체 실제 데이터셋 훈련과 비교해 유사한 mAP 스코어를 달성한다.
  • 합성 데이터와 실제 데이터를 조합하면 COCO 데이터셋에서 실제 데이터 전용 훈련 대비 +22.5 mAP의 성능 향상을 달성한다.
  • 이 방법은 강력한 제로샷 일반화 성능를 보이며, 목표 클래스의 실제 이미지가 전혀 없더라도 클래스 이름만으로도 효과적인 성능를 달성한다.
  • 언어 수준의 간섭(예: 'cartoon'을 'real'로 교체하거나 'people'을 제거)은 분포 외 설정에서 최대 10.2 mAP까지 성능 향상을 이끌어낸다.
  • 파이프라인의 구성적 특성 덕분에 T2I 모델을 재훈련하지 않고도 효과적인 데이터 증강 및 도메인 적응이 가능하다.
  • 이 방법은 프라이버시를 보호하며 확장성이 뛰어나며, 최소한의 인간 참여가 필요하므로 자원이 제한된 또는 급격히 변화하는 비전 작업에 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.