Skip to main content
QUICK REVIEW

[논문 리뷰] Negative Data Augmentation

Abhishek Sinha, Kumar Ayush|arXiv (Cornell University)|2021. 02. 09.
Generative Adversarial Networks and Image Synthesis참고 문헌 35인용 수 8
한 줄 요약

이 논문은 분포 외 샘플(out-of-distribution, OOD)을 분포 내 데이터에 구조적 변환(jigsaw, cutout 등)을 적용하여 생성하는 Negative Data Augmentation(NDA) 방법을 소개한다. 이러한 OOD 샘플을 약한 지도 신호로 사용함으로써 NDA는 GAN 학습과 대비적 자기지도 학습 표현 학습을 향상시키며, 이미지 생성, 이상 탐지, 분류 및 동작 인식과 같은 후행 비전 작업에서 최신 기술 성능을 달성한다.

ABSTRACT

Data augmentation is often used to enlarge datasets with synthetic samples generated in accordance with the underlying data distribution. To enable a wider range of augmentations, we explore negative data augmentation strategies (NDA)that intentionally create out-of-distribution samples. We show that such negative out-of-distribution samples provide information on the support of the data distribution, and can be leveraged for generative modeling and representation learning. We introduce a new GAN training objective where we use NDA as an additional source of synthetic data for the discriminator. We prove that under suitable conditions, optimizing the resulting objective still recovers the true data distribution but can directly bias the generator towards avoiding samples that lack the desired structure. Empirically, models trained with our method achieve improved conditional/unconditional image generation along with improved anomaly detection capabilities. Further, we incorporate the same negative data augmentation strategy in a contrastive learning framework for self-supervised representation learning on images and videos, achieving improved performance on downstream image classification, object detection, and action recognition tasks. These results suggest that prior knowledge on what does not constitute valid data is an effective form of weak supervision across a range of unsupervised learning tasks.

연구 동기 및 목표

  • 무 supervisory 신호가 존재하는 비지도 학습에서, 데이터가 되어서는 안 될 만한 사전 지식을 활용하여 효과적인 인도크티브 바이어스의 부족을 해결하고자 한다.
  • 데이터 분포의 경계를 모델이 인지할 수 있도록, 지원이 disjoint한 분포를 생성하는 새로운 데이터 증강 전략을 체계화하고자 한다.
  • 약한 지도 신호로 부정 샘플을 통합함으로써 생성 모델링과 자기지도 표현 학습을 향상시키고자 한다.
  • 이론적 및 실증적으로 NDA가 다양한 비전 작업에서 모델의 일반화 능력과 성능 향상을 이끌어내는지 검증하고자 한다.

제안 방법

  • 구조적 일관성을 파괴하는 변환(jigsaw, cutout 등)을 사용하여 진정한 데이터 분포 $p_{\text{data}}$ 와 지지가 disjoint한 부정 데이터 분포 $\overline{p}$ 를 정의한다.
  • GAN 학습에서 NDA 샘플을 추가적인 가짜 데이터로 통합하여, 구분자(discriminator)가 진짜 데이터와 표준 증강 데이터뿐 아니라 NDA로 생성된 OOD 샘플도 구분하도록 한다.
  • 생성자(generator)가 NDA 출력과 유사한 샘플을 생성하는 것을 방지하도록 유도하는 수정된 GAN 목표함수를 제안함으로써 생성 품질을 향상시킨다.
  • MoCo-v2 및 DPC와 같은 모델에서 분포 내 샘플과 NDA 샘플 간의 표현 이질성(representation disjointness)을 강제함으로써 NDA를 대비적 자기지도 학습에 적용한다.
  • 표준 데이터 증강 기법(mixup, cutout 등)을 NDA 전략으로 활용하며, 이미지 또는 영상 프레임 전체에 일관되게 적용하여 OOD 샘플을 생성한다.
  • 이론적 분석을 통해 타당한 NDA 가정 하에 무한한 데이터 근처에서 수정된 GAN 목표함수 최적화가 여전히 진짜 데이터 분포를 회복할 수 있음을 보였다.

실험 결과

연구 질문

  • RQ1구조적 변환을 통해 생성된 분포 외 샘플이 비지도 학습의 효과적인 인도크티브 바이어스로 기능할 수 있는가?
  • RQ2부정 데이터 증강을 통합함으로써 GAN과 같은 생성 모델의 무조건적 및 조건부 이미지 생성 품질이 향상되는가?
  • RQ3NDA는 이미지 및 영상의 자기지도 표현 학습을 향상시켜 후행 작업에서 성능 향상을 이끌어낼 수 있는가?
  • RQ4성능 및 일반화 능력 측면에서 NDA는 표준 데이터 증강 및 다른 대비 학습 목표함수와 비교해 어떻게 성능을 내는가?
  • RQ5다양한 학습 목표에 적합한 가장 효과적인 데이터 변환 유형은 무엇인가?

주요 결과

  • NDA로 훈련된 모델은 이미지 생성, 이미지 번역, 이상 탐지에서 최신 기술 성능을 달성하며, NDA 없이 훈련된 기준 모델보다 성능 향상을 보였다.
  • CIFAR-10에서 NDA는 Inception Score를 91.20에서 91.66으로, FID를 12.85에서 12.51로 개선했으며, 더 나은 샘플 품질과 다양성을 의미한다.
  • 대비적 자기지도 학습(MoCo-v2)에서, jigsaw 및 cutout 증강을 사용한 NDA는 ImageNet-100의 top-1 정확도를 69.41%에서 70.01%로 향상시켰다.
  • Pascal VOC에서의 객체 검출 작업에서, mixup NDA를 적용한 MoCo는 AP를 38.47에서 38.72로, AP50를 65.99에서 66.23으로, AP75를 38.81에서 39.16으로 개선했다.
  • DPC를 사용한 영상 표현 학습에서, jigsaw 및 cutmix를 사용한 NDA는 UCF101의 top-1 정확도를 61.35%에서 64.54%로, HMDB51의 정확도를 45.31%에서 48.43%로 향상시켰다.
  • NDA는 추가적인 계산 부담 없이 여러 벤치마크에서 성능 향상을 보였으며, 이는 효율성과 광범위한 적용 가능성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.