Skip to main content
QUICK REVIEW

[논문 리뷰] CIFS: Improving Adversarial Robustness of CNNs via Channel-wise Importance-based Feature Selection

Hanshu Yan, Jingfeng Zhang|arXiv (Cornell University)|2021. 02. 10.
Adversarial Robustness in Machine Learning참고 문헌 52인용 수 11
한 줄 요약

CIFS는 적대적 훈련 중에 부정적으로 관련된(NR) 채널을 억제하고 양적으로 관련된(PR) 채널과 활성화를 일치시킴으로써 CNN의 적대적 내성성을 향상시키는 채널별 중요도 기반 특징 선택 메커니즘을 제안한다. 상위-k 예측 기울기에서 동적 중요도 마스크를 생성함으로써, CIFS는 PGD-20 공격 하에서 CIFAR10에서 기준 적대적 훈련 대비 최대 6%포인트의 정확도 향상을 이룩하며, 표준 적대적 훈련을 능가한다.

ABSTRACT

We investigate the adversarial robustness of CNNs from the perspective of channel-wise activations. By comparing extit{non-robust} (normally trained) and extit{robustified} (adversarially trained) models, we observe that adversarial training (AT) robustifies CNNs by aligning the channel-wise activations of adversarial data with those of their natural counterparts. However, the channels that are extit{negatively-relevant} (NR) to predictions are still over-activated when processing adversarial data. Besides, we also observe that AT does not result in similar robustness for all classes. For the robust classes, channels with larger activation magnitudes are usually more extit{positively-relevant} (PR) to predictions, but this alignment does not hold for the non-robust classes. Given these observations, we hypothesize that suppressing NR channels and aligning PR ones with their relevances further enhances the robustness of CNNs under AT. To examine this hypothesis, we introduce a novel mechanism, i.e., \underline{C}hannel-wise \underline{I}mportance-based \underline{F}eature \underline{S}election (CIFS). The CIFS manipulates channels' activations of certain layers by generating non-negative multipliers to these channels based on their relevances to predictions. Extensive experiments on benchmark datasets including CIFAR10 and SVHN clearly verify the hypothesis and CIFS's effectiveness of robustifying CNNs. \url{https://github.com/HanshuYAN/CIFS}

연구 동기 및 목표

  • 적대적 훈련을 거친 모델가 특정 클래스에서 여전히 실패하는 이유를 규명하는 것.
  • 특히 NR 및 PR 채널을 포함한 채널별 활성화의 역할이 적대적 취약성에 미치는 영향을 규명하는 것.
  • 비특정 채널(NR)을 선택적으로 억제하고 예측 관련성에 따라 PR 채널 활성화를 일치시킴으로써 내성을 향상시키는 메커니즘을 개발하는 것.
  • 표준 적대적 훈련이 성능을 발휘하지 못하는 경우에도 자연 정확도를 희생시키지 않고 적대적 내성을 향상시키는 것.

제안 방법

  • CIFS는 상위-k 예측 로지트에 대한 관련성을 기반으로 채널별 활성화를 조절하는 학습 가능한 중요도 마스크를 도입한다.
  • 특정 레이어에서 원시 예측을 생성하기 위해 프로브 네트워크를 사용하며, 이는 최종 분류기의 대체 역할을 한다.
  • 상위-k 로지트에 대한 기울기와 채널 활성화 간의 관계를 통해 중요도 점수를 계산함으로써 채널의 예측 신뢰도에 대한 관련성을 캡처한다.
  • 중요도 마스크는 전방 전파 중에 NR 채널을 억제하고 PR 채널을 강화하기 위해 곱셈 요소로 적용된다.
  • 이 방법은 표준 교차 엔트로피 손실을 사용하여 기초 네트워크와 함께 함께 훈련되는 적대적 훈련에 통합된다.
  • 특히 상위-2 또는 상위-3 예측에서 피드백을 활용함으로써 중요도 추정의 신뢰성을 향상시키고, 중요한 채널의 잘못된 식별을 줄인다.

실험 결과

연구 질문

  • RQ1적대적 훈련 중에 부정적으로 관련된(NR) 채널을 억제하면 내성이 향상되는가?
  • RQ2채널 활성화를 그 예측 관련성과 일치시키면, 특히 비내성 클래스에 대해 내성이 향상되는가?
  • RQ3상위-1 대신 상위-k 예측 피드백을 사용하면 채널 중요도 추정의 신뢰성이 어떻게 향상되는가?
  • RQ4CIFS는 적대적 데이터에 대한 과적합을 줄이면서 자연 정확도를 유지하거나 향상시키는가?

주요 결과

  • CIFS는 상위-2 피드백을 사용할 경우, 표준 적대적 훈련 대비 PGD-20 공격 하에서 CIFAR10에서 정확도를 6%포인트 향상시킨다.
  • 상위-2 피드백 하에서 CIFS/Final의 방어율은 CIFS/CIFS보다 6%포인트 높으며, 이는 CIFS가 최종 분류 이전에 적대적 입력을 효과적으로 정제함을 시사한다.
  • 중요도 평가에 상위-1 로지트를 사용할 경우, 중요한 채널를 잘못 식별할 가능성이 50% 이상이지만, 상위-2 또는 상위-3 피드백을 사용하면 관련 채널 식별 정확도가 크게 향상된다.
  • CIFS는 내성 향상과 함께 높은 자연 정확도(83.49% CIFAR10 상위-1)를 유지하며, 자연 정확도와 내성 정확도 사이의 유리한 트레이드오프를 보여준다.
  • 절단 실험 결과 상위-k 예측 피드백이 효과적인 채널 선택에 필수적임을 확인하였으며, 상위-2 및 상위-3가 상위-1보다 뛰어난 성능을 낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.