[논문 리뷰] Cap2Aug: Caption guided Image to Image data Augmentation
Cap2Aug는 이미지 캡션을 텍스트 프롬프트로 사용하여 안정된 확산 모델을 통해 의미적으로 다양한 실재감 있는 훈련 샘플을 생성하는 새로운 이미지-이미지 데이터 증강 방법을 제안한다. 도메인 갭을 줄이기 위해 최대 평균 차이(MMD) 손실을 사용하는 이미지 생성과 결합함으로써, 특히 낮은 데이터 환경에서 소수의 샘플 학습 및 장꼬리 분류에서 최신 기술 수준의 성능을 달성한다.
Visual recognition in a low-data regime is challenging and often prone to overfitting. To mitigate this issue, several data augmentation strategies have been proposed. However, standard transformations, e.g., rotation, cropping, and flipping provide limited semantic variations. To this end, we propose Cap2Aug, an image-to-image diffusion model-based data augmentation strategy using image captions as text prompts. We generate captions from the limited training images and using these captions edit the training images using an image-to-image stable diffusion model to generate semantically meaningful augmentations. This strategy generates augmented versions of images similar to the training images yet provides semantic diversity across the samples. We show that the variations within the class can be captured by the captions and then translated to generate diverse samples using the image-to-image diffusion model guided by the captions. However, naive learning on synthetic images is not adequate due to the domain gap between real and synthetic images. Thus, we employ a maximum mean discrepancy (MMD) loss to align the synthetic images to the real images for minimizing the domain gap. We evaluate our method on few-shot and long-tail classification tasks and obtain performance improvements over state-of-the-art, especially in the low-data regimes.
연구 동기 및 목표
- 표준 기하 변환을 넘어서 의미적으로 유의미한 데이터 증강을 생성함으로써 저데이터 환경에서의 과적합 문제를 해결한다.
- 사전 훈련된 시각-언어 모델과 확산 모델을 활용하여 자연어 설명을 기반으로 다양한 실재감 있는 이미지 변형을 생성한다.
- 최대 평균 차이(MMD) 손실을 사용하여 실재 이미지와 합성 이미지의 특징 분포를 정렬함으로써 두 이미지 간의 도메인 갭을 줄인다.
- 의미적으로 풍부한 캡션 유도 이미지 생성을 통해 소수의 샘플 학습 및 장꼬리 분류 성능을 향상시킨다.
- 표준 벤치마크에서 방법을 검증하고, 특히 미세한 인식 작업에서의 실패 케이스를 분석한다.
제안 방법
- 의미적 특징을 포착하기 위해 사전 훈련된 이미지 캡션 모델을 사용해 훈련 이미지에 대한 캡션을 생성한다.
- 원본 이미지와 그 캡션을 텍스트 프롬프트로 조건화하여 이미지-이미지 안정된 확산 모델을 사용해 증강된 이미지를 생성한다.
- 한 이미지의 캡션을 다른 이미지에 적용함으로써 캡션 간 상호 교환을 가능하게 하여 클래스 간 의미적 다양성을 증가시킨다.
- 다중 커널 최대 평균 차이(MMD) 손실을 적용하여 합성 이미지의 특징 분포를 실재 이미지의 특징 분포와 정렬함으로써 도메인 갭을 최소화한다.
- 실재 및 증강된 데이터를 통합한 데이터셋으로 분류기의 미세조정을 수행하여 일반화 성능을 향상시킨다.
- 캡션 생성, 이미지-이미지 생성, MMD 손실 구성 요소의 기여도를 검증하기 위해 분석 실험을 실시한다.
실험 결과
연구 질문
- RQ1표준 기하 증강에 비해 캡션 유도 이미지-이미지 생성이 더 의미적으로 다양한 실재감 있는 데이터 증강을 생성할 수 있는가?
- RQ2MMD 기반 도메인 정렬은 실재 이미지와 합성 이미지 간의 성능 격차를 얼마나 효과적으로 줄이는가?
- RQ3Cap2Aug는 최신 기술 수준의 방법들에 비해 소수의 샘플 학습 및 장꼬리 분류 정확도를 향상시키는가?
- RQ4어떤 상황에서 이 방법이 실패하는가, 특히 미세한 인식 작업에서의 경우는?
- RQ5한 이미지의 캡션을 다른 이미지에 적용하는 교차 캡션 생성이 모델의 일반화 성능을 크게 향상시키는가?
주요 결과
- Cap2Aug는 11개의 소수의 샘플 학습 벤치마크에서 최신 기술 수준의 성능을 달성하였으며, 5-way 5-shot 설정에서 평균 정확도가 92.80%로 이전 방법들을 능가한다.
- 장꼬리 분류를 위한 ImageNet-LT 벤치마크에서 Cap2Aug는 기존 최신 기술 수준의 방법들을 초월하여 장꼬리 데이터 환경에서의 효과성을 입증한다.
- MMD 기반 도메인 정렬은 도메인 갭을 크게 줄이며, 실재 및 합성 이미지를 통합할 때 일반화 성능을 향상시킨다.
- 분석 실험을 통해 캡션 유도 이미지 생성과 MMD 손실이 성능 향상에 필수적인 구성 요소임을 확인한다.
- 실패 케이스는 FGVC-Aircraft 및 Food101과 같은 미세한 인식 작업에서 발생하며, 이는 캡션이 중요한 시각적 차이를 포착하지 못해 오해의 소지가 있는 증강을 유도하기 때문이다.
- 이 방법은 이미지 다양성이 부족한 1-shot 학습에서는 효과적이지 않기 때문에, 2-shot부터 평가된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.