Skip to main content
QUICK REVIEW

[논문 리뷰] A Comprehensive Study on Robustness of Image Classification Models: Benchmarking and Rethinking

Chang Liu, Yinpeng Dong|arXiv (Cornell University)|2023. 02. 28.
Adversarial Robustness in Machine Learning인용 수 6
한 줄 요약

이 논문은 다양한 적대적 공격과 분포 이탈(OOD) 변화 상황에서 ImageNet에서 55개의 딥러닝 모델(CNN 및 트랜스포머 포함)을 평가하는 종합적인 강건성 벤치마크인 ARES-Bench를 소개한다. 이는 적대적 강건성과 자연적 강건성 사이의 상충 관계를 드러내며, 특히 트랜스포머에서 적대적 훈련이 적대적 강건성을 향상시킴을 보여주고, 사전 훈련이 자연적 강건성을 크게 향상시켜 최적의 훈련 레시피를 통해 최신 기술 수준의 적대적 성능을 달성함을 보여준다.

ABSTRACT

The robustness of deep neural networks is usually lacking under adversarial examples, common corruptions, and distribution shifts, which becomes an important research problem in the development of deep learning. Although new deep learning methods and robustness improvement techniques have been constantly proposed, the robustness evaluations of existing methods are often inadequate due to their rapid development, diverse noise patterns, and simple evaluation metrics. Without thorough robustness evaluations, it is hard to understand the advances in the field and identify the effective methods. In this paper, we establish a comprehensive robustness benchmark called extbf{ARES-Bench} on the image classification task. In our benchmark, we evaluate the robustness of 55 typical deep learning models on ImageNet with diverse architectures (e.g., CNNs, Transformers) and learning algorithms (e.g., normal supervised training, pre-training, adversarial training) under numerous adversarial attacks and out-of-distribution (OOD) datasets. Using robustness curves as the major evaluation criteria, we conduct large-scale experiments and draw several important findings, including: 1) there is an inherent trade-off between adversarial and natural robustness for the same model architecture; 2) adversarial training effectively improves adversarial robustness, especially when performed on Transformer architectures; 3) pre-training significantly improves natural robustness based on more training data or self-supervised learning. Based on ARES-Bench, we further analyze the training tricks in large-scale adversarial training on ImageNet. By designing the training settings accordingly, we achieve the new state-of-the-art adversarial robustness. We have made the benchmarking results and code platform publicly available.

연구 동기 및 목표

  • 딥러닝 분야에서 적대적 예제, 자연적 손상, 분포 이탈을 포함한 종합적이고 최신 기술 기반의 다면적 강건성 평가의 부족을 해결하기 위해.
  • 기존의 점별 지표에 의존하는 벤치마크의 한계를 밝혀내며, 전체 강건성 스펙트럼을 포괄하지 못하는 문제를 밝히기 위해.
  • 다양한 아키텍처와 훈련 패러다임에서 다양한 강건성 유형(적대적, 자연적, OOD 강건성) 간의 상호작용을 탐구하기 위해.
  • 공정하고 재현 가능하며 철저한 모델 강건성 평가를 가능하게 하는 표준화된 대규모 벤치마크(ARES-Bench)와 훈련 레시피 제공하기 위해.

제안 방법

  • 저자들은 ImageNet에서 다양한 아키텍처(CNN, 트랜스포머)와 훈련 방법(일반, 사전 훈련, 자기지도 학습, 적대적 훈련)을 갖춘 55개의 모델을 평가하는 대규모 벤치마크인 ARES-Bench를 구축한다.
  • 다중 변형 수준과 OOD 데이터셋 간의 포괄적 비교를 가능하게 하기 위해 주로 강건성 곡선을 평가 지표로 사용한다.
  • 벤치마크는 AutoAttack 적대적 공격과 ImageNet-R, Stylized-ImageNet, ImageNet-Sketch 등 10개의 OOD 데이터셋에서 모델을 평가한다.
  • 적대적 훈련의 초모수에 대한 분석 실험을 수행하여 과적합을 완화하는 데 기여하는 핵심 훈련 기법(예: 데이터 증강, 가중치 평균화, 정규화)을 규명한다.
  • 주파수 분석을 적용하여 적대적으로 훈련된 모델의 주파수 편향을 분석하고, 저주파 특징 학습이 강건성 향상과 관련이 있음을 규명한다.
  • 재현 가능성을 확보하고 향후 연구를 가능하게 하기 위해 벤치마크 결과와 코드를 공개한다.

실험 결과

연구 질문

  • RQ1동일한 모델 아키텍처에서 적대적 강건성과 자연적 강건성 사이에 본질적인 상충 관계가 존재하는가?
  • RQ2특히 적대적 훈련과 사전 훈련과 같은 다양한 훈련 패러다임이 여러 강건성 유형에 미치는 영향은 어떠한가?
  • RQ3최근의 아키텍처 설계(예: ConvNeXt)가 트랜스포머보다 강건성에서 뛰어나며, 자기주의(self-attention)가 핵심 요인인가?
  • RQ4최적화된 훈련 레시피는 과도한 계산 비용 없이 ImageNet에서 적대적 강건성을 크게 향상시킬 수 있는가?
  • RQ5모델 표현에서의 주파수 편향은 특히 적대적으로 훈련된 모델에서 강건성과 어떻게 관련이 있는가?

주요 결과

  • 적대적 강건성과 자연적 강건성 사이에 상당한 상충 관계가 존재한다: 적대적 훈련은 적대적 공격에 대한 강건성을 향상시키지만, 특히 OOD 일반화에서 자연 분포 이탈 상황에서 성능 저하를 초래하는 경향이 있다.
  • 적대적 훈련은 적대적 강건성을 크게 향상시키며, 특히 트랜스포머 아키텍처에 적용했을 경우 표준 CNN보다 더 높은 강건성을 달성한다.
  • 대규모 데이터셋(예: ImageNet-21K)에서의 사전 훈련 또는 자기지도 학습을 통해 자연적 강건성이 크게 향상되며, 과적합과 유사한 신호를 줄이는 데 기여한다.
  • 최근의 CNN인 ConvNeXt는 트랜스포머 수준의 강건성을 달성하며, 더 큰 커널과 감소된 정규화 레이어와 같은 아키텍처 혁신이 자기주의보다 강건성 향상에 더 중요한 요소임을 시사한다.
  • 분석 실험을 통해 과적합을 완화하는 데 기여하는 핵심 훈련 기법(데이터 증강, 가중치 평균화, 정규화)을 규명하였으며, 이는 최신 기술 수준의 적대적 강건성을 달성하는 데 기여한다.
  • 적대적으로 훈련된 모델은 낮은 주파수 편향을 보이며, 더 많은 형태 기반 특징을 학습하여 고주파 텍스처 손실이 큰 OOD 데이터셋(예: ImageNet-R, Stylized-ImageNet)에서 강건성이 향상됨을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.