Skip to main content
QUICK REVIEW

[논문 리뷰] Shape-Texture Debiased Neural Network Training

Yingwei Li, Qihang Yu|arXiv (Cornell University)|2020. 10. 12.
Adversarial Robustness in Machine Learning참고 문헌 48인용 수 5
한 줄 요약

이 논문은 형태-텍스처 상충 쌍을 포함한 이미지를 사용하여 훈련 데이터를 증강하고, 두 쌍의 지도를 동시에 제공함으로써 CNN의 일반화 능력과 강인성을 향상시키는 형태-텍스처 탈편향 신경망 훈련 방법을 제안한다. 이 방법은 ResNet-152 기반으로 ImageNet(+1.2% top-1 정확도), ImageNet-A(+5.2%), ImageNet-C(+8.3%), Stylized-ImageNet(+11.1%), FGSM 적대적 공격 방어(+14.4%)에서 최신 기준 성능을 달성하며, Mixup 및 CutMix와도 호환된다.

ABSTRACT

Shape and texture are two prominent and complementary cues for recognizing objects. Nonetheless, Convolutional Neural Networks are often biased towards either texture or shape, depending on the training dataset. Our ablation shows that such bias degenerates model performance. Motivated by this observation, we develop a simple algorithm for shape-texture debiased learning. To prevent models from exclusively attending on a single cue in representation learning, we augment training data with images with conflicting shape and texture information (eg, an image of chimpanzee shape but with lemon texture) and, most importantly, provide the corresponding supervisions from shape and texture simultaneously. Experiments show that our method successfully improves model performance on several image recognition benchmarks and adversarial robustness. For example, by training on ImageNet, it helps ResNet-152 achieve substantial improvements on ImageNet (+1.2%), ImageNet-A (+5.2%), ImageNet-C (+8.3%) and Stylized-ImageNet (+11.1%), and on defending against FGSM adversarial attacker on ImageNet (+14.4%). Our method also claims to be compatible with other advanced data augmentation strategies, eg, Mixup, and CutMix. The code is available here: https://github.com/LiYingwei/ShapeTextureDebiasedTraining.

연구 동기 및 목표

  • 대부분의 CNN 모델이 표현 학습 과정에서 형태나 텍스처 중 하나에 편향을 지니는 현상이 발생함에 따라 표준 및 강인성 기준 평가 성능이 저하되는 문제를 해결하기 위해.
  • 형상과 텍스처 표현을 융합함으로써 일반화 능력과 적대적 강인성을 향상시킬 수 있는지 탐구하기 위해.
  • 형상-텍스처 상관관계를 명시적으로 깨뜨리면서도 이중 지도 신호를 유지하는 데이터 증강 전략을 개발하기 위해.
  • 기존의 고급 데이터 증강 기법들(예: Mixup, CutMix)과의 호환성을 입증하기 위해.
  • 이미지 분류 외에도 세분화와 같은 밀도 예측 작업으로의 확장 가능성을 보여주기 위해.

제안 방법

  • 두 개의 무작위로 선택된 이미지 간에 스타일 전이를 적용하여 형상-텍스처 상충 이미지를 생성하며, AdaIN를 사용해 한 이미지의 텍스처를 다른 이미지의 형상에 전이한다.
  • 각 형상-텍스처 상충 이미지에 대해 두 원본 이미지의 진짜 레이블을 조합하여 소프트 레이블을 구성함으로써 형상과 텍스처 양쪽에서의 지도를 보장한다.
  • 형상과 텍스처 양측의 지도를 통합한 복합 손실 함수를 사용해 모델을 훈련함으로써 단일 지도에 대한 과도한 의존을 방지한다.
  • 스타일 전이 과정에서 물체 경계를 유지하기 위해 스타일화 계수(α=0.2)와 형상-텍스처 계수(γ=0.95)를 사용한다.
  • 이를 이미지 분류 및 세분화 작업에 적용하며, 세분화 작업에 맞는 데이터 생성 및 레이블 조합 방식을 적절히 조정한다.
  • CutMix 및 Mixup와 같은 기존의 데이터 증강 기법과 통합하여, 상호 보완적인 성능 향상을 입증한다.

실험 결과

연구 질문

  • RQ1형상과 텍스처가 상충하는 이미지로 CNN을 훈련시키면 표준 및 손상된 이미지 기준 평가 성능에서 일반화 능력 향상이 이루어지는가?
  • RQ2훈련 과정에서 형상과 텍스처 양측에 동시에 지도를 제공하는 것이 모델이 특정 쌍에 대한 편향을 줄이는 데 효과적인가?
  • RQ3제안된 방법은 기존의 순수 훈련 및 다른 데이터 증강 기법 대비 적대적 공격에 대한 강인성에서 어떻게 성능을 발휘하는가?
  • RQ4탈편향 프레임워크는 이미지 분류 외에도 세분화와 같은 밀도 예측 작업으로 확장 가능한가?
  • RQ5제안된 방법은 CutMix 및 Mixup와 같은 기존 고급 데이터 증강 기법과 호환되며, 상호 보완적인 성능 향상을 이끌 수 있는가?

주요 결과

  • 제안된 방법으로 훈련된 ResNet-152는 ImageNet에서 79.8%의 top-1 정확도를 기록하여 기준 모델 대비 +1.2%의 절대적 향상을 달성한다.
  • 탈편향 모델은 ImageNet-A에서 +5.2%, ImageNet-C에서 +8.3%, Stylized-ImageNet에서 +11.1%의 강인성 향상을 기록하여 기준 모델 대비 우수한 성능을 보인다.
  • 적대적 강인성 측면에서, FGSM 공격에 대한 정상 이미지 정확도에서 ImageNet에서 +14.4% 향상되었다.
  • CutMix와 조합했을 경우, CutMix-ResNeXt-101의 ImageNet top-1 정확도는 81.2%로 상승하여 기준 모델 대비 +0.7% 향상되었다.
  • 세분화 작업에서는 DeepLabv3-ResNet-101의 mIOU가 77.6%로 향상되어 기준 모델 대비 1.1% 향상되었고, 2배 훈련 스케줄 기준 모델 대비 0.9% 향상되었다.
  • 더 긴 훈련 스케줄과 비교해도 성능 향상이 유지됨에 따라, 이는 능력 증가가 아닌 더 나은 표현 학습에 기인함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.