[논문 리뷰] DALL-E for Detection: Language-driven Compositional Image Synthesis for Object Detection
이 논문은 객체 검출을 위한 고품질, 다양하고 정확하게 레이블링된 훈련 데이터를 생성하기 위해 DALL-E를 활용한 언어 기반, 구성적 이미지 합성 프레임워크를 제안한다. 텍스트 프롬프트와 이미지 캡션을 통해 배경 마스크 생성과 맥락 이미지 합성을 분리함으로써, 기존의 컷 앤 페이스트 기반 방법에 비해 mAP가 7.2% 향상되었으며, 이해할 수 있는 언어 간섭을 통해 제로샷 및 분포 외 일반화를 가능하게 한다.
We propose a new paradigm to automatically generate training data with accurate labels at scale using the text-toimage synthesis frameworks (e.g., DALL-E, Stable Diffusion, etc.). The proposed approach decouples training data generation into foreground object mask generation and background (context) image generation. For foreground object mask generation, we use a simple textual template with object class name as input to DALL-E to generate a diverse set of foreground images. A foreground-background segmentation algorithm is then used to generate foreground object masks. Next, in order to generate context images, first a language description of the context is generated by applying an image captioning method on a small set of images representing the context. These language descriptions are then used to generate diverse sets of context images using the DALL-E framework. These are then composited with object masks generated in the first step to provide an augmented training set for a classifier. We demonstrate the advantages of our approach on four object detection datasets including on Pascal VOC and COCO object detection tasks. Furthermore, we also highlight the compositional nature of our data generation approach on out-of-distribution and zero-shot data generation scenarios.
연구 동기 및 목표
- 객체 검출을 위한 인간 레이블링 데이터셋의 높은 비용과 확장성 한계를 해결하기 위해.
- 자동화되고 스케일이 가능하며 프라이버시를 보장하는 다양한 고품질 훈련 이미지와 정확한 바운딩 박스 레이블링을 생성하기 위해.
- DALL-E와 같은 텍스트-이미지 모델의 구성적이고 설명 가능한 성질을 활용하여 분포 외 및 제로샷 시나리오에서의 강력한 데이터 합성 가능성을 확보하기 위해.
- 언어를 구성적 인터페이스로 사용함으로써 인간 레이블링과 3차원 모델링에 대한 의존도를 줄이기 위해.
제안 방법
- DALL-E를 통해 다양한 전경 객체 이미지를 생성하기 위해 단순한 텍스트 프롬프트(예: '순수한 배경 위의 고양이')를 사용한다.
- 배경-전경 분할 알고리즘을 적용하여 DALL-E가 생성한 이미지에서 정확한 객체 마스크를 추출한다.
- 실제 또는 합성된 맥락 이미지의 소량에 대해 이미지 캡션을 적용하여 맥락 기술서를 생성한다.
- 생성된 언어 기술서를 프롬프트로 사용하여 DALL-E에서 다양한 맥락적으로 일관된 배경 이미지를 합성한다.
- 전경 마스크를 합성된 배경 이미지에 컷 앤 페이스트 전략을 사용하여 증강된 훈련 데이터로 조합한다.
- 캡션을 수정함으로써 언어 기반 간섭을 가능하게 한다(예: '사람'과 같은 혼란을 유발하는 요소 제거), 맥락의 관련성과 모델의 일반화 능력을 향상시킨다.
실험 결과
연구 질문
- RQ1DALL-E와 같은 텍스트-이미지 모델을 사용하여 인간 참여를 최소화하면서도 스케일이 가능하고 고품질이며 정확하게 레이블링된 객체 검출 훈련 데이터를 생성할 수 있는가?
- RQ2실제 세계 맥락 이미지 사용과 비교했을 때, 언어 기반 맥락 이미지 생성 방식은 검출 성능에서 어떤가?
- RQ3언어의 구성적 성질이 합성 데이터 생성에서 제로샷 및 분포 외 일반화 능력을 얼마나 향상시킬 수 있는가?
- RQ4언어 기반 캡션 편집은 최종 검출 작업을 위한 생성된 맥락 이미지의 품질과 관련성에 어떤 영향을 미칠 수 있는가?
주요 결과
- 실제 맥락 이미지(UW-kitchen)를 기준으로 사용했을 때, 제안된 방법은 Object Cut-and-Paste 기반 방법에 비해 mAP가 7.2% 향상되었다.
- 언어 기반 DALL-E가 생성한 맥락 이미지를 사용할 경우, 공개 데이터셋의 실제 세계 맥락 이미지 사용보다 더 높은 성능을 기록하여 합성 맥락의 우수성을 입증했다.
- 언어 기반 캡션 편집은 예를 들어 만화나 스케치 이미지를 맥락 기술서로 사용할 경우 분포 외 시나리오에서 검출 정확도를 최대 10.2%포인트 향상시켰다.
- 이 방법은 효과적인 제로샷 및 구성적 데이터 생성을 가능하게 하였으며, 실제 주방, 만화 주방, 사람 있는 장면 등 다양한 테스트 환경에서 성능 향상을 관찰할 수 있었다.
- 3차원 모델이나 수동 레이블링 없이도 고품질 이미지 생성과 정확한 레이블링을 유지함으로써, 확장 가능하고 프라이버시를 보장하는 데이터 합성 기반을 제공했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.