Skip to main content
QUICK REVIEW

[논문 리뷰] Uncovering the Connections Between Adversarial Transferability and Knowledge Transferability

Kaizhao Liang, Jacky Zhang|arXiv (Cornell University)|2020. 06. 25.
Adversarial Robustness in Machine Learning인용 수 4
한 줄 요약

이 논문은 딥러닝에서 적대적 전이 가능성과 지식 전이 가능성 사이의 상호 이원적 이론적 및 실험적 연결을 수립한다. 적대적 전이 가능성의 정도를 측정하기 위해 기울기 유사도와 헤시안 기하학을 기반으로 한 새로운 지표를 제안하며, 높은 적대적 전이 가능성은 높은 지식 전이 가능성과 상관이 있으며, 그 반대도 마찬가지임을 입증한다. 이미지 및 NLP 벤치마크에서 광범위한 실험을 통해 강한 양의 상관관계를 확인하였다.

ABSTRACT

Knowledge transferability, or transfer learning, has been widely adopted to allow a pre-trained model in the source domain to be effectively adapted to downstream tasks in the target domain. It is thus important to explore and understand the factors affecting knowledge transferability. In this paper, as the first work, we analyze and demonstrate the connections between knowledge transferability and another important phenomenon--adversarial transferability, \\emph{i.e.}, adversarial examples generated against one model can be transferred to attack other models. Our theoretical studies show that adversarial transferability indicates knowledge transferability and vice versa. Moreover, based on the theoretical insights, we propose two practical adversarial transferability metrics to characterize this process, serving as bidirectional indicators between adversarial and knowledge transferability. We conduct extensive experiments for different scenarios on diverse datasets, showing a positive correlation between adversarial transferability and knowledge transferability. Our findings will shed light on future research about effective knowledge transfer learning and adversarial transferability analyses.

연구 동기 및 목표

  • 딥 네ural 웹워크에서 적대적 전이 가능성과 지식 전이 가능성 간의 기본적 관계를 조사하는 것.
  • 모든 잠재적 변형 벡터를 고려하여 적대적 전이 가능성의 공식 정의를 내리고, 이와 지식 전이 가능성 간의 이론적 연결 고리를 수립하는 것.
  • 지식 전이 가능성에 대한 상호 이원적 지표로 기능하는 실용적인 적대적 전이 가능성 지표를 개발하는 것.
  • 다양한 데이터셋과 모델 아키텍처에서의 제어된 실험을 통해 이론적 통찰을 경험적으로 검증하는 것.
  • 공유된 모델 유사성 특성에 기반한 전이 학습 및 적대적 강건성 향상을 위한 새로운 통찰을 제공하는 것.

제안 방법

  • 논문은 적대적 변형 벡터의 전체 집합을 고려하여 적대적 전이 가능성의 공식 정의를 내림으로써 엄밀한 이론적 분석을 가능하게 한다.
  • 헤시안 기반의 내적 공간을 통해 적대적 손실의 헤시안에 의해 정의된 내적 공간을 통해, 높은 적대적 전이 가능성은 높은 지식 전이 가능성으로 이어진다는 이론적 연결을 유도한다.
  • 기울기 코사인 유사도와 헤시안 기반 거리에 기반한 두 가지 실용적인 적대적 전이 가능성 지표를 제안하며, 실무에서 전이 가능성의 정도를 측정하는 데 사용된다.
  • 방법론은 소스 모델을 타겟 모델의 기울기 유사도를 정규화하는 손실 함수로 훈련시켜, 적대적 전이 가능성의 제어된 조작을 가능하게 한다.
  • 지식 전이 가능성은 소스 모델의 최종 레이어를 다운스트림 작업에 대해 미세조정하여 평가하며, 적대적 전이 가능성은 타겟 모델에서 생성된 적대적 예제로 소스 모델을 공격하여 측정된다.
  • 실험은 ℓ∞ 변형 예산 ε=0.1과 50회의 반복을 사용한 PGD 공격를 사용하며, 전이 손실과 적대적 지표 간의 상관관계는 피어슨 상관계수를 통해 평가된다.

실험 결과

연구 질문

  • RQ1적대적 전이 가능성과 지식 전이 가능성 간에 기본적인 이론적 연결 고리가 존재하는가?
  • RQ2적대적 전이 가능성은 지식 전이 가능성의 신뢰할 수 있는 지표가 될 수 있는가?
  • RQ3지식 전이 가능성은 상호 이원적으로 적대적 전이 가능성 예측에 사용될 수 있는가?
  • RQ4기울기 유사도와 헤시안 기하학은 두 형태의 전이 가능성과 어떻게 관련이 있는가?
  • RQ5적대적 전이 가능성 지표는 다운스트림 지식 전이 성능을 어느 정도 예측할 수 있는가?

주요 결과

  • 여러 데이터셋과 모델 아키텍처에서 적대적 전이 가능성과 지식 전이 가능성 간에 강한 양의 상관관계가 관찰되었다.
  • 기울기 정규화를 통해 적대적 전이 가능성을 감소시켰을 때(ρ ∈ {0.0, 0.5, 1.0, 2.0, 5.0}), 지식 전이 가능성도 감소하였으며, 정확도는 73.91%에서 71.62%로 떨어졌다.
  • 표본별 지식 전이 손실과 적대적 전이 가능성 지표 α₁ 간의 피어슨 상관계수는 음의 상관이며 유의미하여, 이론적 예측을 확인하였다.
  • NLP 실험에서는 지식 전이 신뢰도와 적대적 전이 가능성 지표 α₁ 간에 양의 상관관계(피어슨 점수)가 발견되어, 높은 지식 전이 가능성은 높은 적대적 전이 가능성으로 이어진다는 것을 시사한다.
  • 제안된 적대적 전이 가능성 지표, 특히 α₁과 α₂는 이미지 및 텍스트 작업 전반에서 지식 전이 가능성 예측에 일관되고 신뢰할 수 있는 성능을 보였다.
  • 이론적 분석을 통해 높은 적대적 전이 가능성은 헤시안 기반 내적 공간을 통해 높은 지식 전이 가능성으로 이어지고, 그 반대도 마찬가지로 성립함을 확인하여 상호 이원적 관계를 수립하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.