Skip to main content
QUICK REVIEW

[논문 리뷰] Expanding Small-Scale Datasets with Guided Imagination

Yifan Zhang, Daquan Zhou|arXiv (Cornell University)|2022. 11. 25.
Generative Adversarial Networks and Image Synthesis인용 수 11
한 줄 요약

이 논문은 Stable Diffusion와 DALL-E2와 같은 사전 훈련된 생성 모델을 사용하여 사진처럼 생긴, 클래스에 일관되며 다양한 이미지를 생성함으로써 소규모 데이터셋을 확장하는 가이드드 인식 프레임워크(GIF)를 제안한다. 클래스 유지 정보 강화와 샘플 다양성 증진을 통해 잠재 특징를 최적화함으로써, GIF는 여섯 개인 자연 이미지 데이터셋 평균 36.9% 향상 및 세 개인 의료 이미지 데이터셋 평균 13.5% 향상된 정확도를 달성하여 가이드되지 않은 생성 방식보다 성능을 높인다.

ABSTRACT

The power of DNNs relies heavily on the quantity and quality of training data. However, collecting and annotating data on a large scale is often expensive and time-consuming. To address this issue, we explore a new task, termed dataset expansion, aimed at expanding a ready-to-use small dataset by automatically creating new labeled samples. To this end, we present a Guided Imagination Framework (GIF) that leverages cutting-edge generative models like DALL-E2 and Stable Diffusion (SD) to "imagine" and create informative new data from the input seed data. Specifically, GIF conducts data imagination by optimizing the latent features of the seed data in the semantically meaningful space of the prior model, resulting in the creation of photo-realistic images with new content. To guide the imagination towards creating informative samples for model training, we introduce two key criteria, i.e., class-maintained information boosting and sample diversity promotion. These criteria are verified to be essential for effective dataset expansion: GIF-SD obtains 13.5% higher model accuracy on natural image datasets than unguided expansion with SD. With these essential criteria, GIF successfully expands small datasets in various scenarios, boosting model accuracy by 36.9% on average over six natural image datasets and by 13.5% on average over three medical datasets. The source code is available at https://github.com/Vanint/DatasetExpansion.

연구 동기 및 목표

  • 대규모 레이블링이 비용과 시간이 많이 들기 때문에, 소규모 데이터셋에서의 데이터 부족 문제를 해결한다.
  • 기존 데이터 증강 기법의 한계를 극복한다. 이는 새로운 콘텐츠를 도입하지 않고 표면적인 변형만 적용하기 때문이다.
  • 정보성 있고 현실적이며 다양한 합성 샘플을 생성함으로써 모델 일반화 능력을 향상시키기 위해 강력한 사전 훈련된 생성 모델을 활용한다.
  • 생성된 샘플이 원래 클래스와 의미적으로 일관되면서도 콘텐츠 다양성이 풍부하도록 보장하여 훈련에 최대한의 이점을 얻는다.
  • 다양한 도메인, 특히 의료 영상에 적용 가능한 확장성 있고 안전하며 제어 가능한 프레임워크를 개발한다.

제안 방법

  • 시드 이미지를 잠재 공간에 인코딩하기 위해 사전 훈련된 생성 모델(예: Stable Diffusion, DALL-E2, MAE)을 사전 모델로 사용한다.
  • 시드 이미지의 잠재 특징를 의미 있는 공간에서 최적화하여 새로운 사진처럼 생긴, 새로운 콘텐츠를 가진 이미지를 생성한다.
  • 두 가지 핵심 기준을 적용한다: 의미적 클래스 정체성을 유지하는 데 중점을 둔 정보 강화와 콘텐츠 다양성을 보장하는 샘플 다양성 증진.
  • 잠재 특징를 대상 데이터셋의 레이블 공간에 매핑하기 위해 CLIP을 활용하여 합성 샘플의 정확한 레이블링을 보장한다.
  • Google Cloud Vision API를 사용해 안전성 검사를 통합하여 합성 이미지가 성인, 폭력적이거나 부적절한 콘텐츠를 포함하지 않도록 보장한다.
  • 확장된 데이터셋으로 딥 네트워크를 훈련하고 표준 벤치마크에서 성능을 평가하여 효과성을 검증한다.

실험 결과

연구 질문

  • RQ1생성 모델이 원래 클래스와 의미적으로 일관되며 콘텐츠 다양성이 풍부한 합성 데이터를 효과적으로 유도할 수 있는가?
  • RQ2클래스 유지 정보 강화와 샘플 다양성 증진이 하류 훈련을 위한 생성 데이터의 품질과 유용성에 어떻게 기여하는가?
  • RQ3가이드된 상상이 소규모 데이터셋에서 모델 정확도 향상에 있어 가이드되지 않은 생성 또는 전통적 데이터 증강 방식보다 얼마나 뛰어나게 작용하는가?
  • RQ4제안된 프레임워크는 자연 이미지와 의료 영상과 같이 다양한 도메인에 대해 일관된 성능 향상을 보이며 일반화 가능한가?
  • RQ5생성된 합성 데이터의 안전 프로파일은 어떠한가? 실세계 응용에 신뢰성 있게 사용될 수 있는가?

주요 결과

  • GIF-SD는 가이드되지 않은 Stable Diffusion 생성 방식 대비 자연 이미지 데이터셋에서 평균 13.5% 높은 모델 정확도를 기록하여 가이드된 상상의 효과성을 입증한다.
  • 여섯 개인 자연 이미지 데이터셋 평균으로 GIF는 36.9% 높은 정확도 향상을 달성하여 기준 데이터 증강 및 가이드되지 않은 생성 방식을 크게 앞서간다.
  • 세 개인 의료 영상 데이터셋에서 프레임워크는 평균 13.5%의 정확도 향상을 기록하여 전문 도메인으로의 강력한 일반화 능력을 보여준다.
  • Google Cloud Vision API를 통한 안전성 검사 결과, 생성된 이미지의 96%가 성인 콘텐츠로 분류될 가능성이 '매우 낮음'이며, 80% 이상이 허위 또는 노골적인 콘텐츠로 분류될 가능성이 '매우 낮음'으로 확인되어 높은 안전성과 배포 가능성 확보됨.
  • 시각화 결과 GIF가 의미적으로 일관되지만 콘텐츠 다양성이 풍부한 이미지를 생성하는 것으로 확인되었다. 예를 들어 고양이의 새로운 자세나 베개의 다양한 질감 등으로 정보 확장을 효과적으로 구현하였다.
  • CLIP를 활용한 제로샷 레이블 매핑을 통해 합성 샘플이 정확하게 분류되고 대상 데이터셋의 의미론과 정렬됨을 보장한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.