[논문 리뷰] MosaicFusion: Diffusion Models as Data Augmenters for Large Vocabulary Instance Segmentation
MosaicFusion는 사전 훈련된 텍스트-이미지 확산 모델을 활용하여 훈련 없이, 레이블 감독 없이도 대규모 어휘의 인스턴스 세그멘테이션을 위한 고품질 합성 이미지와 인스턴스 마스크를 생성하는 방법을 제안한다. 단일 확산 과정 동안 이미지 캔버스를 영역으로 나누고 각 영역을 서로 다른 텍스트 프롬프트로 조건화함으로써, 계층과 시간 단계를 걸친 통합된 상호주의 맵을 활용하여 임계치 설정과 에지 인식 보정을 통해 정밀한 인스턴스 마스크를 생성한다. 이는 LVIS 벤치마크에서 희귀 및 신규 카테고리에서 성능을 크게 향상시킨다.
We present MosaicFusion, a simple yet effective diffusion-based data augmentation approach for large vocabulary instance segmentation. Our method is training-free and does not rely on any label supervision. Two key designs enable us to employ an off-the-shelf text-to-image diffusion model as a useful dataset generator for object instances and mask annotations. First, we divide an image canvas into several regions and perform a single round of diffusion process to generate multiple instances simultaneously, conditioning on different text prompts. Second, we obtain corresponding instance masks by aggregating cross-attention maps associated with object prompts across layers and diffusion time steps, followed by simple thresholding and edge-aware refinement processing. Without bells and whistles, our MosaicFusion can produce a significant amount of synthetic labeled data for both rare and novel categories. Experimental results on the challenging LVIS long-tailed and open-vocabulary benchmarks demonstrate that MosaicFusion can significantly improve the performance of existing instance segmentation models, especially for rare and novel categories. Code: https://github.com/Jiahao000/MosaicFusion.
연구 동기 및 목표
- 희귀 및 신규 카테고리에 대해 데이터 부족 문제를 해결한다.
- 훈련 또는 레이블 감독이 필요한 기존 데이터 증강 방법의 한계를 극복한다.
- 사전 훈련된 텍스트-이미지 확산 모델을 활용해 동시에 다양한 고품질 이미지와 해당 인스턴스 마스크를 생성한다.
- 백본 아키텍처를 수정하지 않고도 훈련 없이 데이터 증강을 가능하게 한다.
- 장꼬리 및 오픈 어휘 인스턴스 세그멘테이션 벤치마크에서 모델의 일반화 능력과 성능을 향상시킨다.
제안 방법
- 단일 이미지에 다수의 객체를 동시에 생성할 수 있도록 이미지 캔버스를 다수의 영역으로 나눈다.
- 모든 영역을 거쳐 하나의 확산 과정을 실행하며, 각 영역을 서로 다른 텍스트 프롬프트로 조건화하여 다양한 사실적인 객체 인스턴스를 생성한다.
- 모든 트랜스포머 계층과 확산 시간 단계에서 각 객체의 텍스트 프롬프트에 해당하는 상호주의 맵을 추출한다.
- 계층과 시간 단계를 평균하여 이러한 맵을 통합함으로써 고품질이고 공간적으로 일관된 마스크 제안을 생성한다.
- 통합된 상호주의 맵에 임계치 설정 및 에지 인식 보정(예: 이중 솔버)을 적용하여 정밀한 인스턴스 마스크를 생성한다.
- 생성된 이미지-마스크 쌍을 합성 훈련 데이터로 사용하여 기존 인스턴스 세그멘테이션 모델을 미세조정하거나 사전학습한다.
실험 결과
연구 질문
- RQ1사전 훈련된 텍스트-이미지 확산 모델을 사용해 추가 훈련이나 감독 없이 다양한 다중 객체 이미지와 정확한 인스턴스 마스크를 생성할 수 있는가?
- RQ2계층과 시간 단계를 걸친 상호주의 맵의 통합이 고품질 마스크 예측을 위해 얼마나 효과적인가?
- RQ3MosaicFusion를 통해 생성된 합성 데이터가 장꼬리 및 오픈 어휘 환경에서 희귀 및 신규 카테고리의 인스턴스 세그멘테이션 성능을 얼마나 향상시킬 수 있는가?
- RQ4이 방법은 다양한 백본 아키텍처와 인스턴스 세그멘테이션 모델에 일반화되는가?
- RQ5이미지당 생성된 객체 수가 합성 데이터셋의 품질과 활용도에 어떤 영향을 미치는가?
주요 결과
- MosaicFusion는 Mask R-CNN, Box-Supervised CenterNet2, F-VLM 등 다양한 베이스라인 모델에서 희귀 카테고리(AP_r)와 신규 카테고리(AP_novel)의 마스크 AP를 크게 향상시켰다.
- 모델의 미세조정이나 추가 감독 없이도 LVIS 장꼬리 및 오픈 어휘 벤치마크에서 강력한 성능 향상을 달성했다.
- 계층과 시간 단계를 걸친 상호주의 맵의 통합은 개별 맵을 사용하는 것보다 더 높은 품질의 마스크 예측을 가능하게 하며, 특히 최종 확산 단계와 고해상도 계층에서 가장 우수한 성능을 보였다.
- MosaicFusion가 생성한 합성 데이터셋은 저자원 카테고리에 특히 뛰어난 성능 향상을 이끌어내어, 데이터가 부족한 상황에서의 효과성을 입증했다.
- 이 방법은 다양한 후행 인스턴스 세그멘테이션 모델과 호환되며, 백본 아키텍처에 관계없이 일관된 성능 향상을 보였다.
- 도메인 갭이 존재하더라도 합성 이미지와 마스크는 충분히 현실적이며 다양하여 효과적인 훈련 데이터로 기능하며, 장꼬리 일반화에서 기존의 Copy-Paste와 같은 전통적 증강 기법을 능가했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.