[논문 리뷰] X-Paste: Revisiting Scalable Copy-Paste for Instance Segmentation using CLIP and StableDiffusion
X-Paste는 CLIP을 활용한 제로샷 카테고리 필터링과 StableDiffusion를 활용한 텍스트 기반 이미지 생성을 통해 인스턴스 세분화를 위한 확장 가능한 데이터 증강 프레임워크를 제안한다. 이는 네 단계로 구성된 파이프라인(객체 확보, 마스크 생성, 필터링, 조합)을 통해 구현되며, Swin-L 백본을 사용할 경우 LVIS에서 +2.6 박스 AP와 +2.1 마스크 AP 향상을 기록하고 COCO에서는 +1.6 박스 AP와 +1.1 마스크 AP 향상을 달성하여 아키텍처 변경 없이도 장꼬리 카테고리에서 성능을 크게 향상시킨다.
Copy-Paste is a simple and effective data augmentation strategy for instance segmentation. By randomly pasting object instances onto new background images, it creates new training data for free and significantly boosts the segmentation performance, especially for rare object categories. Although diverse, high-quality object instances used in Copy-Paste result in more performance gain, previous works utilize object instances either from human-annotated instance segmentation datasets or rendered from 3D object models, and both approaches are too expensive to scale up to obtain good diversity. In this paper, we revisit Copy-Paste at scale with the power of newly emerged zero-shot recognition models (e.g., CLIP) and text2image models (e.g., StableDiffusion). We demonstrate for the first time that using a text2image model to generate images or zero-shot recognition model to filter noisily crawled images for different object categories is a feasible way to make Copy-Paste truly scalable. To make such success happen, we design a data acquisition and processing framework, dubbed ``X-Paste", upon which a systematic study is conducted. On the LVIS dataset, X-Paste provides impressive improvements over the strong baseline CenterNet2 with Swin-L as the backbone. Specifically, it archives +2.6 box AP and +2.1 mask AP gains on all classes and even more significant gains with +6.8 box AP, +6.5 mask AP on long-tail classes. Our code and models are available at https://github.com/yoctta/XPaste.
연구 동기 및 목표
- 기존 Copy-Paste 증강 기법이 인간 레이블링 또는 3D 렌더링된 객체 인스턴스에 의존하는 데 기인한 확장성 한계를 해결하기 위해.
- 제로샷 인식(CLIP)과 텍스트 기반 이미지 생성(StableDiffusion)을 활용해 개방형 어휘, 확장 가능한 데이터 증강을 가능하게 하기 위해.
- 학습을 위해 자동으로 객체 인스턴스를 확보하고, 마스크를 생성하며, 필터링하고, 조합하는 체계적인 프레임워크를 설계하기 위해.
- 모델 아키텍처를 수정하지 않고도 인스턴스 세분화 성능, 특히 장꼬리 객체 카테고리에서의 성능 향상을 도모하기 위해.
제안 방법
- 객체 인스턴스 확보는 StableDiffusion를 사용해 텍스트 프롬프트를 활용해 무제한 카테고리에 걸쳐 다양한 객체 중심 이미지를 생성한다.
- 인스턴스 마스크 생성은 카테고리에 관계없이 객체 중심의 특성과 단순함을 살린 사전 학습된 시각적 중심성 모델을 적용해 생성된 이미지나 웹 크롤링된 이미지에서 객체를 분할한다.
- 인스턴스 필터링은 예측 마스크와 클래스 프롬프트 간의 유사도를 CLIP을 통해 계산하고, 낮은 유사도 또는 잘못 분류된 인스턴스를 제거한다.
- 배경 조합은 필터링된 마스크가 있는 인스턴스를 다양한 배경 이미지에 붙여넣으며, 현실감을 유지하고 오버랩 아티팩트를 방지하는 전략을 사용한다.
- 이 프레임워크는 기존 인스턴스 세분화 모델(예: CenterNet2)과 호환되는 플러그인 방식의 증강 방법으로 통합된다.
- 텍스트 기반 이미지 생성과 웹 크롤링된 이미지에 대한 CLIP 기반 필터링을 조합한 하이브리드 데이터 확보 전략을 통해 다양성과 품질을 극대화한다.
실험 결과
연구 질문
- RQ1StableDiffusion와 같은 텍스트 기반 이미지 생성 디퓨전 모델이 인스턴스 세분화의 확장 가능한 데이터 증강을 위해 충분히 다양한 실재감 있는 객체 인스턴스를 생성할 수 있는가?
- RQ2ViLD, PromptDet, DetPro와 같은 최신 오픈 범위 감지 모델보다 정확도와 데이터 효율성 면에서 뛰어나며, LVIS에서 35.7 박스 AP와 31.8 마스크 AP를 기록한다.
- RQ3실제로 인간 레이블링이나 3D 렌더링된 데이터가 아닌 합성 및 필터링된 실사 이미지를 사용할 경우 Copy-Paste 증강의 성능가 어떻게 확장되는가?
- RQ4모델 아키텍처를 수정하지 않고 X-Paste가 장꼬리 객체 카테고리에서 인스턴스 세분화 성능을 얼마나 향상시킬 수 있는가?
- RQ5정확도와 데이터 효율성 측면에서 최신 오픈 범위 감지 방법과 비교해 X-Paste는 어떠한가?
주요 결과
- LVIS 데이터셋에서 X-Paste는 Swin-L 백본을 사용한 강력한 기준 모델인 CenterNet2 대비 +2.6 박스 AP와 +2.1 마스크 AP 향상을 기록했으며, 특히 장꼬리 클래스에서는 +6.8 박스 AP와 +6.5 마스크 AP 향상으로 더욱 두드러진 성능 향상을 보였다.
- COCO에서 X-Paste는 Swin-L 백본을 사용할 경우 기준 모델 대비 +1.6 박스 AP와 +1.1 마스크 AP 향상을 기록하여 다양한 데이터셋과 아키텍처에서 일관된 성능 향상을 입증했다.
- ViLD, PromptDet, DetPro와 같은 최신 오픈 범위 감지 모델보다 뛰어난 성능을 기록했으며, LVIS에서 35.7 박스 AP와 31.8 마스크 AP를 달성했다.
- 표준 Copy-Paste와 X-Paste를 병합하면 추가적인 성능 향상이 이루어지며, Swin-L을 사용할 경우 COCO에서 +1.6 박스 AP와 +1.1 마스크 AP 향상을 기록해 상호 보완적인 이점을 보였다.
- 높은 인스턴스 밀도와 장꼬리 분포를 가진 COCO에서도 효과적이며, 다양한 데이터 환경에서의 강건성을 입증했다.
- 제거 분석 결과, 텍스트 기반 이미지 생성과 CLIP 기반 필터링 모두 성능 향상에 기여하며, 두 요소의 조합이 가장 우수한 성능을 낸다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.