Skip to main content
QUICK REVIEW

[논문 리뷰] Improving the Robustness of Deep Neural Networks via Adversarial Training with Triplet Loss

Pengcheng Li, Jinfeng Yi|arXiv (Cornell University)|2019. 05. 28.
Adversarial Robustness in Machine Learning참고 문헌 21인용 수 11
한 줄 요약

이 논문은 삼중손실을 적대적 훈련에 통합하여 딥 네ural 네트워크의 강건성을 향상시키는 새로운 방어 방법인 Adversarial Training with Triplet Loss (AT²L)를 제안한다. 적대적 예제를 삼중손실의 앵커로 사용함으로써 AT²L은 결정 경계를 매끄럽게 하고, FGSM, DeepFool, C&W 공격에 대해 강력한 강건성을 확보하면서도 높은 정확도를 유지한다. 강력한 공격 조건에서도 오류율이 최소 4.6%까지 낮아진다.

ABSTRACT

Recent studies have highlighted that deep neural networks (DNNs) are vulnerable to adversarial examples. In this paper, we improve the robustness of DNNs by utilizing techniques of Distance Metric Learning. Specifically, we incorporate Triplet Loss, one of the most popular Distance Metric Learning methods, into the framework of adversarial training. Our proposed algorithm, Adversarial Training with Triplet Loss (AT$^2$L), substitutes the adversarial example against the current model for the anchor of triplet loss to effectively smooth the classification boundary. Furthermore, we propose an ensemble version of AT$^2$L, which aggregates different attack methods and model structures for better defense effects. Our empirical studies verify that the proposed approach can significantly improve the robustness of DNNs without sacrificing accuracy. Finally, we demonstrate that our specially designed triplet loss can also be used as a regularization term to enhance other defense methods.

연구 동기 및 목표

  • 자율주행 및 생체인식과 같은 실생활 응용 분야에 위협이 되는 딥 네ural 네트워크의 적대적 예제에 대한 취약성을 해결하기 위해.
  • 거리 메트릭 학습을 통해 결정 경계를 정교화시켜 표준 적대적 훈련을 초월한 적대적 강건성을 향상시키기 위해.
  • 삼중손실이 기존 방어 방법의 정규화 항으로 기능할 수 있는지 탐색하기 위해.
  • 앙상블 기반 공격 통합이 방어 일반화 능력 향상에 기여하는지 평가하기 위해.

제안 방법

  • 삼중손실을 적대적 훈련에 통합하기 위해 삼중손실의 앵커로 적대적 예제를 사용함으로써, 동일 클래스 내의 밀집도를 증가시키고, 서로 다른 클래스 간의 분리를 강화한다.
  • 삼중손실의 공식을 수정하여 적대적 예제를 앵커로 사용함으로써, 잘못 분류된 예제가 올바른 클래스 임bedding에서 멀어지도록 보장한다.
  • FGSM, DeepFool, C&W 공격 유형과 다양한 모델 아키텍처를 조합한 앙상블 버전의 AT²L을 제안하여 강건성을 향상시킨다.
  • 기존 방어 프레임워크(예: Defense-GAN)에 제안된 삼중손실을 정규화 항으로 적용하여 강건성을 향상시킨다.
  • 교차 엔트로피와 삼중손실을 조합한 손실 함수를 사용한다: L_total = L_cross_entropy + λ₁·L_triplet + λ₂·L_reg, 여기서 α=2.0, λ₁=0.3, λ₂=1.0.
  • 이중 단계 훈련 과정을 적용한다: 먼저 표준 손실을 사용한 적대적 훈련을 수행한 후, 삼중 정규화를 사용한 미세조정을 수행한다.

실험 결과

연구 질문

  • RQ1삼중손실을 적대적 훈련에 통합할 경우, 적대적 강건성이 향상되는가?
  • RQ2삼중손실에서 적대적 예제를 앵커로 사용하면 결정 경계가 더 매끄럽고 일반화 능력이 향상되는가?
  • RQ3제안된 삼중손실이 다른 방어 방법에 효과적인 정규화 항으로 기능할 수 있는가?
  • RQ4앙상블 기반 공격 통합은 방어 모델의 강건성에 어떤 영향을 미치는가?
  • RQ5강력한 공격 조건에서도 높은 자연 정확도를 유지하면서 강건성이 향상되는가?

주요 결과

  • 기본 공격 시나리오에서, AT²L은 C&W 공격 조건에서 Inception-ResNet-v2의 상위-1 오류율을 원본 모델의 100%에서 4.6%로 감소시켰다.
  • 앙성 패턴 공격 시나리오에서, AT²L은 C&W 공격 조건에서 Inception-v3의 오류율을 9.0%로 낮췄으며, 원본 모델의 99.1% 오류율에 비해 뚜렷한 우월성을 보였다.
  • AT²L의 앙성 버전은 FGSM 조건에서 Ens-adv-Inception-ResNet-v2의 오류율을 원본 모델의 13.8%에서 8.9%로 낮췄다.
  • Defense-GAN에 삼중손실을 정규화 항으로 적용했을 때, C&W 공격의 오류율은 모델 A에서 96.5%에서 1.4%로 감소하여 강력한 전이성(transferability)을 입증했다.
  • 무작위화 레이어를 AT²L과 조합하면 강건성이 더욱 향상되었으며, 앙성 공격 조건에서 Inception-v3의 C&W 오류율은 7.4%로 낮아졌다.
  • 모든 설정에서 높은 자연 정확도를 유지하면서도 강건성이 뚜렷하게 향상되었으며, 정확도 하락 폭은 최소한이었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.