Skip to main content
QUICK REVIEW

[논문 리뷰] Exploiting the Relationship Between Kendall's Rank Correlation and Cosine Similarity for Attribution Protection

Fan Wang, Adams Wai‐Kin Kong|arXiv (Cornell University)|2022. 05. 15.
Adversarial Robustness in Machine Learning인용 수 5
한 줄 요약

이 논문은 자연 입력과 변형된 입력 간의 할당값 간 코사인 유사도를 최대화하여 할당값의 안정성을 향상시키는 통합 기울기 정규화자(IGR)를 제안한다. 이는 코사인 유사도와 켄달의 순서상관계수 간 이론적 양의 상관관계를 활용한 것으로, 할당값의 안정성 향상에 기여한다. 실험 결과 IGR는 다양한 모델과 데이터셋에서 할당값 및 적대적 공격에 대한 안정성을 모두 향상시키며, 기존 최고 수준의 방법들을 능가한다.

ABSTRACT

Model attributions are important in deep neural networks as they aid practitioners in understanding the models, but recent studies reveal that attributions can be easily perturbed by adding imperceptible noise to the input. The non-differentiable Kendall's rank correlation is a key performance index for attribution protection. In this paper, we first show that the expected Kendall's rank correlation is positively correlated to cosine similarity and then indicate that the direction of attribution is the key to attribution robustness. Based on these findings, we explore the vector space of attribution to explain the shortcomings of attribution defense methods using $\ell_p$ norm and propose integrated gradient regularizer (IGR), which maximizes the cosine similarity between natural and perturbed attributions. Our analysis further exposes that IGR encourages neurons with the same activation states for natural samples and the corresponding perturbed samples, which is shown to induce robustness to gradient-based attribution methods. Our experiments on different models and datasets confirm our analysis on attribution protection and demonstrate a decent improvement in adversarial robustness.

연구 동기 및 목표

  • 미세한 입력 변형에 의해 영향을 받는 모델 할당값의 취약성을 해결하기 위해.
  • Kendall의 순서상관계수는 비가환적이지만 할당값의 안정성에 핵심적인 역할을 하므로, ℓp-노름 정규화자가 이를 유지하지 못하는 한계를 극복하기 위해.
  • 할당값 방어를 향상시키기 위해 코사인 유사도와 Kendall의 순서상관계수 간 기하학적 연결 고리를 구축하기 위해.
  • 자연 입력과 변형된 입력 간 일관된 신경망 활성화 패턴을 유도하는 가환성 정규화자를 개발하기 위해.
  • 제안된 IGR 정규화자가 딥 네ural 네트워크에서 할당값 및 적대적 안정성 향상에 기여하는지 경험적으로 검증하기 위해.

제안 방법

  • 이론적 분석을 통해 특정 가정 하에 Kendall의 순서상관계수와 코사인 유사도 간에 양의 상관관계가 있음을 증명하며, 할당값 안정성에 대한 가환성 대체 측정 기준을 제공한다.
  • 자연 입력과 변형된 입력의 할당값 벡터 간 코사인 유사도를 최대화함으로써 학습 중에 통합 기울기 정규화자(IGR)를 제안한다.
  • IGR는 적대적 훈련 프레임워크에 통합되어 할당값 안정성과 기존의 적대적 안정성 최적화를 동시에 수행한다.
  • 이 방법은 자연 입력과 변형된 입력에 대해 동일한 활성화 상태(부호)를 유지하도록 신경망을 유도함으로써 안정성을 향상시킨다.
  • 역전파 동안 통합 기울기를 사용하여 할당값 벡터를 계산하고, 이 정규화자를 기반으로 기울기 흐름이 할당 메커니즘을 통해 유지를 보장한다.
  • 실험은 여러 데이터셋(MNIST, Fashion-MNIST, CIFAR-10)과 모델을 대상으로 수행되며, 기준 및 최신 방식의 방어 방법과 비교한다.

실험 결과

연구 질문

  • RQ1Kendall의 순서상관계수에 대한 신뢰할 수 있는 가환성 대체 측정 기준이 존재하는가? 그리고 코사인 유사도가 그러한 대체 측정 기준으로 기능하는가?
  • RQ2입력 변형이 작더라도 ℓp-노름 기반 정규화자가 할당값 안정성을 유지하지 못하는 이유는 무엇인가?
  • RQ3벡터 간 각도에 기반한 기하학적 시각화가 할당 방법의 안정성을 설명할 수 있는가?
  • RQ4할당값 간 코사인 유사도 최적화가 자연 입력과 변형된 입력 간 일관된 신경망 활성화 패턴을 유도하는가?
  • RQ5제안된 IGR 정규화자가 동시에 할당값 안정성과 적대적 안정성을 향상시킬 수 있는가?

주요 결과

  • IGR는 할당값 안정성을 크게 향상시키며, PGD20 공격 하에서 CIFAR-10에서 TRADES+IGR가 0.945의 최고 Kendall 순서상관계수 기록을 달성했다.
  • IGR 모델의 활성화 일관성은 기준보다 항상 높았으며, MART+IGR는 Fashion-MNIST에서 기준의 0.67 대비 0.69를 기록했다.
  • IGR는 모든 데이터셋에서 적대적 안정성을 향상시켰다: AT+IGR는 MNIST에서 기준의 99.39%에서 99.45%로 FGSM 정확도가 상승했다.
  • CIFAR-10에서 MART+IGR는 PGD20 정확도 79.93%를 달성하여 MART 기준(77.91%) 대비 2.02% 향상되었다.
  • 9개 평가 중 7개에서 자연 정확도가 유지되거나 향상되어 일반화 능력 저하 없이 성능을 확보했다.
  • 이론적 및 경험적 결과는 IGR가 자연 입력과 변형된 입력 모두에서 동일한 부호로 신경망을 활성화하도록 유도함을 확인하며, 제안된 기하학적 해석을 뒷받침한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.