[논문 리뷰] Dataset Diffusion: Diffusion-based Synthetic Dataset Generation for Pixel-Level Semantic Segmentation
이 논문은 Stable Diffusion의 텍스트-이미지 생성 및 어텐션 메커니즘을 활용하여 고품질의 픽셀 수준 세분화 데이터셋을 합성하는 새로운 프레임워크인 Dataset Diffusion을 제안한다. 클래스 프롬프트 추가, 클래스 프롬프트 크로스-어텐션, 그리고 자기-어텐션 지수화를 도입함으로써, 텍스트 프롬프트에서 정밀한 세분화 마스크를 생성한다. 이는 PASCAL VOC에서 64.8 mIoU, COCO에서 34.2 mIoU를 기록하며, 이전 작업인 DiffuMask를 능가한다.
Preparing training data for deep vision models is a labor-intensive task. To address this, generative models have emerged as an effective solution for generating synthetic data. While current generative models produce image-level category labels, we propose a novel method for generating pixel-level semantic segmentation labels using the text-to-image generative model Stable Diffusion (SD). By utilizing the text prompts, cross-attention, and self-attention of SD, we introduce three new techniques: class-prompt appending, class-prompt cross-attention, and self-attention exponentiation. These techniques enable us to generate segmentation maps corresponding to synthetic images. These maps serve as pseudo-labels for training semantic segmenters, eliminating the need for labor-intensive pixel-wise annotation. To account for the imperfections in our pseudo-labels, we incorporate uncertainty regions into the segmentation, allowing us to disregard loss from those regions. We conduct evaluations on two datasets, PASCAL VOC and MSCOCO, and our approach significantly outperforms concurrent work. Our benchmarks and code will be released at https://github.com/VinAIResearch/Dataset-Diffusion
연구 동기 및 목표
- 세분화 데이터셋의 픽셀 수준 수동 주석 처리에 드는 높은 비용과 노동 강도 문제를 해결하기 위해.
- 텍스트-이미지 확산 모델을 활용해 다수의 객체를 포함한 현실적이고 다양한 시나리오를 생성하기 위해.
- 인간 주석 마스크에 의존하지 않고 정확한 의사 레이블 세분화 지도를 생성하기 위해.
- 어텐션 기반 정련 및 불확실성 인식 훈련을 통해 세분화 품질을 향상시키기 위해.
- 합성 데이터셋 생성을 평가하기 위한 표준화된 벤치마크(synth-VOC 및 synth-COCO)를 구축하기 위해.
제안 방법
- 다양한 객체 클래스를 포함한 이미지를 생성하도록 확산 모델을 유도하기 위해 클래스 프롬프트 추가 기법을 도입한다.
- 장면 내 개별 객체에 대한 어텐션 국소화를 향상시키기 위해 클래스 프롬프트 크로스-어텐션을 활용한다.
- 어텐션 맵을 정교화하고 세분화 마스크 품질을 향상시키기 위해 자기-어텐션 지수화를 적용한다.
- 다중 특징 스케일에서 크로스-어텐션 및 자기-어텐션 맵을 통합하여 전반적인 구조와 국소적 세부 사항의 균형을 맞춘다.
- 어 attention 맵에서 이진 세분화 마스크를 생성하기 위해 가속 가능한 임계값 설정 메커니즘을 사용하며, 초모수 τ, α, 및 β를 포함한다.
- 불확실성 인식 손실과 테스트 시 증강을 활용한 자기 훈련을 적용하여 합성 데이터에 대한 일반화 성능을 향상시킨다.

실험 결과
연구 질문
- RQ1Stable Diffusion와 같은 텍스트-이미지 확산 모델이 복잡한 다중 객체 시나리오에 대해 픽셀 수준 세분화 레이블을 효과적으로 생성하는 데 적합한가?
- RQ2크로스-어텐션 및 자기-어텐션 메커니즘이 생성된 세분화 마스크 품질에 어떤 기여를 하는가?
- RQ3특징 스케일 통합 및 마스크 정교화 기법과 같은 아키텍처 구성 요소가 세분화 성능에 미치는 영향은 무엇인가?
- RQ4Dataset Diffusion로 생성된 합성 데이터셋으로 훈련된 모델이 실제 벤치마크에 얼마나 잘 일반화되는가?
- RQ5불확실성 인식 훈련이 확산 모델에서 유도된 불완전한 의사 레이블을 사용할 때 견고성을 어떻게 향상시키는가?
주요 결과
- Dataset Diffusion는 PASCAL VOC 벤치마크에서 평균 교차율(mIoU) 64.8을 기록하며, 크로스-어텐션만을 사용할 경우 44.8 mIoU를 기록한 DiffuMask를 크게 능가한다.
- COCO 벤치마크에서 합성 데이터셋으로 훈련된 DeepLabV3 모델은 34.2 mIoU를 기록하며, 완전히 감독된 실세계 데이터로 훈련된 모델의 성능에 근접한다.
- 자기-어텐션 정교화만으로도 mIoU가 44.8에서 61.0으로 상승하여, 정확도 향상에 있어 그 핵심적인 역할을 한다는 것을 입증한다.
- 불확실성 인식 손실, 자기 훈련, 테스트 시 증강의 조합이 mIoU를 64.3까지 끌어올려 각 구성 요소가 점진적인 성능 향상을 이룬다는 것을 보여준다.
- 마스크 생성에 최적의 초모수는 τ=4, α=0.5, β=0.6이며, τ가 4를 초과하면 어텐션 맵의 과도한 매끄러움으로 인해 성능이 급격히 저하된다.
- 어텐션 맵 통합에 16 및 32 스케일을 사용할 경우 최고의 성능를 기록하며, 단지 스케일 8 또는 64만을 사용할 경우 세부 정보 손실 또는 미세 무늬에 대한 과도한 강조로 인해 성능이 저하된다.
![Figure 2: Three stages of Dataset Diffusion . In the first stage, the target classes are provided, and text prompts are generated using language models such as ChatGPT [ 48 ] . Real captions (for COCO) or image-based captions (for VOC) can also be used for prompt generation to ensure standard evalua](https://ar5iv.labs.arxiv.org/html/2309.14303/assets/x2.png)
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.