Skip to main content
QUICK REVIEW

[논문 리뷰] PatchUp: A Regularization Technique for Convolutional Neural Networks

Mojtaba Faramarzi, Mohammadreza Amini|arXiv (Cornell University)|2020. 06. 14.
Adversarial Robustness in Machine Learning참고 문헌 13인용 수 17
한 줄 요약

PatchUp는 컨volution 네트워크의 블록 수준 정규화 기법으로, 히든 레이어에서 두 개의 랜덤 트레이닝 샘플에서 연속된 특징 맵 블록을 혼합함으로써 일반화 능력과 강건성을 향상시킨다. 이는 Mixup와 CutMix에서 관찰되는 매니폴드 침입 문제를 감소시키며, CIFAR-10, CIFAR-100, SVHN에서 최신 기술 수준의 성능을 달성한다. 이는 아핀 변환과 적대적 공격에 대한 강건성도 향상시킨다.

ABSTRACT

Large capacity deep learning models are often prone to a high generalization gap when trained with a limited amount of labeled training data. A recent class of methods to address this problem uses various ways to construct a new training sample by mixing a pair (or more) of training samples. We propose PatchUp, a hidden state block-level regularization technique for Convolutional Neural Networks (CNNs), that is applied on selected contiguous blocks of feature maps from a random pair of samples. Our approach improves the robustness of CNN models against the manifold intrusion problem that may occur in other state-of-the-art mixing approaches like Mixup and CutMix. Moreover, since we are mixing the contiguous block of features in the hidden space, which has more dimensions than the input space, we obtain more diverse samples for training towards different dimensions. Our experiments on CIFAR-10, CIFAR-100, and SVHN datasets with PreactResnet18, PreactResnet34, and WideResnet-28-10 models show that PatchUp improves upon, or equals, the performance of current state-of-the-art regularizers for CNNs. We also show that PatchUp can provide better generalization to affine transformations of samples and is more robust against adversarial attacks.

연구 동기 및 목표

  • 제한된 레이블 데이터로 훈련된 딥 컨volution 네트워크에서의 높은 일반화 갭을 해결하기 위해.
  • Mixup와 CutMix와 같은 기존의 데이터 혼합 방법에서 내재된 매니폴드 침입 문제를 완화하기 위해.
  • 아핀 변환과 적대적 공격에 대한 모델의 강건성을 향상시키기 위해.
  • 입력 공간이 아닌 고차원 히든 특징 공간에서의 혼합이 가지는 이점을 탐색하기 위해.
  • 블록 수준의 특징 혼합을 통해 다양성과 일반화 능력을 향상시키는 정규화 기법을 개발하기 위해.

제안 방법

  • PatchUp는 두 개의 랜덤 트레이닝 샘플을 선택하고, 히든 레이어에서 각각에서 연속된 특징 맵 블록을 무작위로 샘플링한다.
  • 두 샘플에서 선택된 특징 맵 블록을 요소별 평균화하여 새로운 혼합 샘플을 생성한다.
  • 혼합은 입력 픽셀이 아닌 고차원 히든 표현에서 작동하는 특징 맵 수준에서 수행된다.
  • 이 기법은 훈련 중에 적용되며, 아키텍처 변경이나 표준 훈련 외에 추가 하이퍼파rameter가 필요하지 않다.
  • 혼합된 블록 내에서 공간 일관성을 유지함으로써, 패치 기반 혼합 접근 방식에서 흔히 발생하는 아티팩트를 방지한다.
  • 히든 레이어의 richer 표현 능력을 활용하여 더 다양하고 의미 있는 훈련 샘플을 생성한다.

실험 결과

연구 질문

  • RQ1히든 공간에서 특징 맵을 블록 수준으로 혼합하는 것이 입력 공간 혼합 방법에 비해 CNN의 일반화 능력을 향상시키는가?
  • RQ2매니폴드 침입 문제 측면에서 PatchUp은 Mixup와 CutMix에 비해 어떻게 비교되는가?
  • RQ3고차원 특징 공간에서의 혼합이 분포 이탈과 아핀 변환 상황에서 더 나은 일반화를 이끌어내는가?
  • RQ4기본 정규화 기법에 비해 PatchUp이 적대적 공격에 대해 얼마나 더 강건한가?
  • RQ5아키텍처 수정 없이도 PatchUp이 여러 벤치마크 데이터셋에서 최신 기술 수준의 성능을 달성할 수 있는가?

주요 결과

  • PatchUp는 CIFAR-10, CIFAR-100, SVHN 데이터셋에서 최신 기술 수준의 정규화 기법과 동등하거나 그 이상의 성능을 달성한다.
  • 아핀 변환에 대한 일반화 능력이 향상되어 기하학적 편향에 더 강건한 성능을 보인다.
  • 표준 훈련 및 기본 데이터 증강 방법에 비해 PatchUp은 적대적 공격에 대해 더 강건한 것으로 나타났다.
  • 제한된 레이블 데이터가 있는 상황에서 Mixup와 CutMix보다 PatchUp으로 훈련된 모델가 더 나은 일반화 능력을 보였다.
  • 히든 레이어에서 연속된 블록 혼합을 사용함으로써 매니폴드 침입 문제를 감소시켜 더 안정적이고 의미 있는 데이터 보간을 가능하게 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.