Skip to main content
QUICK REVIEW

[논문 리뷰] How explainable are adversarially-robust CNNs?

Mehdi Nourelahi, Lars Kotthoff|arXiv (Cornell University)|2022. 05. 25.
Adversarial Robustness in Machine Learning인용 수 6
한 줄 요약

이 연구는 다섯 가지 아키텍처와 세 가지 학습 방법을 통해 12개의 ImageNet 학습된 CNN에서 시험 정확도, 분포 외(OOD) 내성성, 해석 가능성 간 상호작용에 대한 최초의 대규모 평가를 수행한다. 연구 결과, 적대적 공격에 강건한 CNN은 기울기 기반 할당 방법(예: GradCAM)에서 상당히 더 높은 해석 가능성도 보이며, AdvProp 모델은 높은 정확도를 보이지만 해석 가능성에서 강건한 모델을 능가하지 못함을 확인했다. 또한 GradCAM과 RISE는 모든 메트릭과 모델에서 일관되게 상위 성능을 기록함을 확인했다.

ABSTRACT

Three important criteria of existing convolutional neural networks (CNNs) are (1) test-set accuracy; (2) out-of-distribution accuracy; and (3) explainability. While these criteria have been studied independently, their relationship is unknown. For example, do CNNs that have a stronger out-of-distribution performance have also stronger explainability? Furthermore, most prior feature-importance studies only evaluate methods on 2-3 common vanilla ImageNet-trained CNNs, leaving it unknown how these methods generalize to CNNs of other architectures and training algorithms. Here, we perform the first, large-scale evaluation of the relations of the three criteria using 9 feature-importance methods and 12 ImageNet-trained CNNs that are of 3 training algorithms and 5 CNN architectures. We find several important insights and recommendations for ML practitioners. First, adversarially robust CNNs have a higher explainability score on gradient-based attribution methods (but not CAM-based or perturbation-based methods). Second, AdvProp models, despite being highly accurate more than both vanilla and robust models alone, are not superior in explainability. Third, among 9 feature attribution methods tested, GradCAM and RISE are consistently the best methods. Fourth, Insertion and Deletion are biased towards vanilla and robust models respectively, due to their strong correlation with the confidence score distributions of a CNN. Fifth, we did not find a single CNN to be the best in all three criteria, which interestingly suggests that CNNs are harder to interpret as they become more accurate.

연구 동기 및 목표

  • 시험 세트 정확도, 분포 외(OOD) 정확도, 해석 가능성 간의 관계를 조사하기 위해.
  • 아홉 가지 최신 기능 할당 방법이 다양한 CNN 아키텍처와 학습 알고리즘 간에 얼마나 잘 일반화되는지 평가하기 위해.
  • 적대적 공격에 강건한 모델이 표준(바닐라) 모델보다 더 높은 해석 가능성성을 보이는지, 그리고 AdvProp로 학습된 모델이 해석 가능성성을 향상시키는지 평가하기 위해.
  • 삽입(Insertion)과 삭제(Deletion)와 같은 일반적인 평가 메트릭에서의 편향, 특히 점수 기반 메트릭(삽입/삭제)이 모델 신뢰도 점수와의 상관관계로 인해 발생하는 편향을 평가하기 위해.
  • 실무자들이 강건하고 정확하며 해석 가능한 CNN과 할당 방법을 선택하는 데 도움이 되는 실질적인 권고 사항을 제공하기 위해.

제안 방법

  • 기울기 기반 할당 방법 9종—GradCAM, RISE, GradCAM++, SmoothGrad, Integrated Gradients, CAM, Grad-CAM, SmoothGrad, Integrated Gradients—을 12개의 ImageNet 학습된 CNN에 적용하여 평가함.
  • 다섯 가지 CNN 아키텍처(ResNet, DenseNet, EfficientNet, MobileNet, Wide ResNet)와 세 가지 학습 알고리즘—바닐라, 적대적 공격에 강건한(PGD-1), AdvProp(PGD-1에 데이터 혼합 적용)—을 사용함.
  • 할당 지ap의 품질을 평가하기 위해 네 가지 평가 메트릭—포인팅 게임(PG), 약한 감독된 국소화(WSL), 삽입, 삭제—을 적용함.
  • 정확한 비교를 위해 각 할당 방법과 모델에 대해 근사적인 그리드 서치를 통해 하이퍼파rameter 튜닝을 수행함.
  • 할당 점수와 모델 신뢰도 분포 간의 상관관계를 분석함. 특히 점수 기반 메트릭(삽입/삭제)에 대해 분석함.
  • 통계적 분석을 통해 아키텍처와 학습 방법에 따라 해석 가능성 성능를 비교하고 결과를 시각화함.

실험 결과

연구 질문

  • RQ1적대적 공격에 강건한 CNN은 다양한 할당 방법에서 바닐라 모델보다 더 높은 해석 가능성성을 보이는가?
  • RQ2시험 정확도와 OOD 정확도가 뛰어난 AdvProp 모델은 바닐라 모델과 강건한 모델에 비해 해석 가능성에서 어떻게 비교되는가?
  • RQ3다양한 아키텍처와 학습 방법 간에 항상 최상의 성능을 보이는 기능 할당 방법은 무엇인가?
  • RQ4삽입과 삭제 메트릭이 모델의 신뢰도 점수와의 상관관계로 인해 특정 모델 유형에 대해 얼마나 편향되어 있는가?
  • RQ5시험 정확도, OOD 정확도, 해석 가능성 모두에서 최고 성능을 내는 단일 CNN 아키텍처나 모델이 존재하는가?

주요 결과

  • 기울기 기반 할당 방법을 사용할 경우, 적대적 공격에 강건한 CNN은 바닐라 모델보다 상당히 더 높은 해석 가능성 점수를 기록함. 특히 GradCAM과 RISE에서 두드러진 성능 향상을 보임.
  • 시험 세트 정확도와 OOD 정확도가 매우 높은 AdvProp 모델도, 네 가지 평가 메트릭 전반에서 강건한 모델보다 뛰어난 해석 가능성성을 보이지 않음.
  • GradCAM과 RISE는 모든 12개 모델과 네 가지 평가 메트릭 전반에서 항상 상위 3개 이내에 포함되어 있어, 가장 신뢰할 수 있는 선택으로 간주됨.
  • 삽입과 삭제 메트릭은 강한 편향을 보임: 삽입은 더 높은 신뢰도 점수로 인해 바닐라 모델을 선호하고, 삭제는 더 보수적인 예측을 내는 강건한 모델을 선호함.
  • 시험 정확도, OOD 정확도, 해석 가능성 모두에서 최고 성능을 내는 단일 CNN 모델은 존재하지 않음. 이는 성능과 해석 가능성 간의 근본적인 상충 관계를 시사함.
  • ResNet-50는 모든 메트릭 평균에서 최고 성능을 기록함. 비록 DenseNet-161이 시험 세트 정확도에서 가장 높은 점수를 기록했지만, 이는 높은 정확도가 반드시 더 높은 해석 가능성성을 의미하지는 않음을 시사함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.