Skip to main content
QUICK REVIEW

[논문 리뷰] Pyramid Adversarial Training Improves ViT Performance

Charles Herrmann, Kyle Sargent|arXiv (Cornell University)|2021. 11. 30.
Adversarial Robustness in Machine Learning참고 문헌 55인용 수 4
한 줄 요약

이 논문은 비전 트랜스포머(ViT) 성능을 향상시키기 위해 훈련 중에 다중 척도, 구조화된 적대적 편향을 적용하는 새로운 데이터 증강 방법인 피라미드 적대적 훈련(PyramidAT)을 소개한다. ViT-B/16에 대해 ImageNet 정상 정확도에서 1.82%의 절대적 향상을 이룩했으며, 추가 데이터 없이 7개의 ImageNet 강건성 벤치마크에서 새로운 최고 성능(SoTA)을 달성했다. 이는 일치하는 드롭아웃과 확률적 깊이 정규화를 사용한 결과이다.

ABSTRACT

Aggressive data augmentation is a key component of the strong generalization capabilities of Vision Transformer (ViT). One such data augmentation technique is adversarial training (AT); however, many prior works have shown that this often results in poor clean accuracy. In this work, we present pyramid adversarial training (PyramidAT), a simple and effective technique to improve ViT's overall performance. We pair it with a "matched" Dropout and stochastic depth regularization, which adopts the same Dropout and stochastic depth configuration for the clean and adversarial samples. Similar to the improvements on CNNs by AdvProp (not directly applicable to ViT), our pyramid adversarial training breaks the trade-off between in-distribution accuracy and out-of-distribution robustness for ViT and related architectures. It leads to 1.82% absolute improvement on ImageNet clean accuracy for the ViT-B model when trained only on ImageNet-1K data, while simultaneously boosting performance on 7 ImageNet robustness metrics, by absolute numbers ranging from 1.76% to 15.68%. We set a new state-of-the-art for ImageNet-C (41.42 mCE), ImageNet-R (53.92%), and ImageNet-Sketch (41.04%) without extra data, using only the ViT-B/16 backbone and our pyramid adversarial training. Our code is publicly available at pyramidat.github.io.

연구 동기 및 목표

  • 비전 트랜스포머(ViT)에서 내분포 일반화와 외분포 강건성 사이의 상충 관계를 해결하기 위해.
  • 추가 데이터에 의존하지 않고 ViT의 정상 ImageNet 및 여러 강건성 벤치마크 성능을 향상시키기 위해.
  • ViT의 아키텍처와 인덕티브 바이어스에 맞춰진 더 효과적인 적대적 훈련 방법을 설계하기 위해.
  • 일치하는 드롭아웃과 확률적 깊이 정규화와 같은 정규화 기법이 ViT에 대한 적대적 훈련 성능에 미치는 영향을 조사하기 위해.
  • 표준 사전 훈련과 함께 PyramidAT만을 사용하여 ViT-B/16의 ImageNet-C, ImageNet-R, ImageNet-Sketch에서 새로운 최고 성능을 확립하기 위해.

제안 방법

  • 다중 척도 공간에서 적대적 편향을 생성하는 피라미드 적대적 훈련(PyramidAT)을 제안하며, 이는 구조화된 큰 편향과 유연한 작은 편향을 통해 데이터 증강을 모방한다.
  • 큰 일관성 있는 편향을 이미지 영역에 적용하면서도, 강건성을 위해 세밀한 픽셀 수준의 편향 허용을 위한 다중 척도 피라미드 공격을 사용한다.
  • 같은 드롭아웃 마스크를 미니배치 내의 정상 샘플과 적대적 샘플에 모두 적용하여 훈련을 안정화시키는 '일치하는' 드롭아웃을 도입한다.
  • 일치하는 설정을 갖춘 확률적 깊이를 활용하여, 훈련 중에 레이어를 무작위로 제거함으로써 일반화 및 강건성을 향상시킨다.
  • 정상 및 적대적 전방향 전파 간에 동일한 최적화 하이퍼파rameter(예: 학습률, 가중치 감쇠)를 적용하여 훈련 일관성을 유지한다.
  • ViT-B/16에 대한 아키텍처 수정 없이, 표준 ImageNet-1K 및 선택적 ImageNet-21K 데이터를 사용하여 모델을 훈련시킨다.

실험 결과

연구 질문

  • RQ1적대적 훈련이 비전 트랜스포머에서 정상 정확도와 강건성을 동시에 향상시켜 전형적인 정확도-강건성 상충 관계를 깨는가?
  • RQ2표준 픽셀 수준의 적대적 공격에 비해 다중 척도, 구조화된 적대적 편향은 ViT의 일반화 성능 향상에 어떻게 기여하는가?
  • RQ3일치하는 드롭아웃과 확률적 깊이 정규화는 ViT 모델의 적대적 훈련 성능에 어떤 영향을 미치는가?
  • RQ4PyramidAT는 ViT-B/16 이외의 다양한 데이터셋과 모델 아키텍처로 일반화되는가?
  • RQ5추가 데이터 없이 PyramidAT가 외분포 벤치마크에서 최고 성능을 달성할 수 있는가?

주요 결과

  • PyramidAT는 ImageNet-1K 데이터만으로 훈련된 ViT-B/16에 대해 ImageNet 정상 정확도에서 1.82%의 절대적 향상을 달성한다.
  • 이 방법은 추가 데이터 없이 ImageNet-C에서 41.42 mCE를 기록하여 이전 방법을 초월하며 새로운 SoTA를 수립한다.
  • ImageNet-R에서 53.92%의 정확도와 ImageNet-Sketch에서 41.04%의 정확도를 기록했으며, 양자 모두 ViT-B/16에 대해 새로운 SoTA 결과이다.
  • 7개의 ImageNet 강건성 벤치마크에서의 강건성 향상은 1.76%에서 15.68%까지 절대적 향상이다.
  • AdaBelief 옵timizer의 사용은 ImageNet-R에서 PixelAT 성능을 최대 1.72% 향상시켰지만, PyramidAT에 대해서는 이점이 다소 뚜렷하지 않다.
  • 절단 실험 결과, 일치하는 드롭아웃과 확률적 깊이 정규화가 PyramidAT의 성능 향상에 핵심 요소임을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.