[논문 리뷰] TRS: Transferability Reduced Ensemble via Encouraging Gradient Diversity and Model Smoothness
이 논문은 기본 모델에서 기울기 수직성과 모델의 매끄러움을 동시에 촉진함으로써 적대적 전이성(transferability)을 감소시키는 새로운 앙상블 학습 방법인 TRS를 제안한다. 이론적으로, 기울기 유사도와 모델의 매끄러움이 적대적 전이성의 핵심 요소임을 입증하며, 실험적으로는 여러 백색상자 및_BLK 백색상자 공격 하에서 MNIST, CIFAR-10, CIFAR-100에서 기존 앙상블보다 유의미한 성능 향상을 보이며 최첨단 수준의 강건성을 달성한다.
Adversarial Transferability is an intriguing property - adversarial perturbation crafted against one model is also effective against another model, while these models are from different model families or training processes. To better protect ML systems against adversarial attacks, several questions are raised: what are the sufficient conditions for adversarial transferability and how to bound it? Is there a way to reduce the adversarial transferability in order to improve the robustness of an ensemble ML model? To answer these questions, in this work we first theoretically analyze and outline sufficient conditions for adversarial transferability between models; then propose a practical algorithm to reduce the transferability between base models within an ensemble to improve its robustness. Our theoretical analysis shows that only promoting the orthogonality between gradients of base models is not enough to ensure low transferability; in the meantime, the model smoothness is an important factor to control the transferability. We also provide the lower and upper bounds of adversarial transferability under certain conditions. Inspired by our theoretical analysis, we propose an effective Transferability Reduced Smooth(TRS) ensemble training strategy to train a robust ensemble with low transferability by enforcing both gradient orthogonality and model smoothness between base models. We conduct extensive experiments on TRS and compare with 6 state-of-the-art ensemble baselines against 8 whitebox attacks on different datasets, demonstrating that the proposed TRS outperforms all baselines significantly.
연구 동기 및 목표
- 딥 뉴럴 네트워크 간의 적대적 전이성에 대한 충분조건을 이론적으로 분석하는 것.
- 전이성을 감소시켜 강건성을 향상시키는 앙상블 모델에서 실용적인 학습 전략을 개발하는 것.
- 기울기 수직성과 모델의 매끄러움이 전이성을 제어하는 데 미치는 상호작용을 조사하는 것.
- 기울기 다양성과 매끄러움을 동시에 강제함으로써 더 강건한 앙상블이 도출됨을 경험적으로 검증하는 것.
- 특정 기하학적 및 최적화 조건 하에서 적대적 전이성의 경계를 제공하는 것.
제안 방법
- 기본 모델 간 손실 기울기 간余弦 유사도를 최소화하는 학습 목표를 제안하여 기울기 다양성을 장려한다.
- 적대적 편향을 기반으로 한 모델의 매끄러움 정규화 항을 도입하여 局부 선형성과 강건성을 강제한다.
- 매끄러움 손실의 내부 최대화를 위해 투영된 기울기 하강(PGD)을 사용하여 악성 기울기 방향을 근사한다.
- 기울기 수직성과 매끄러움 항을 통합한 손실 함수를 구성하여 앙상블 학습 중 동시 최적화를 수행한다.
- 기본 모델들이 동일한 데이터를 공유하고 상호 보완적인 정규화를 적용하는 방식으로, 다중 교사 distillation 유사 전략을 활용한다.
- TRS 학습 절차를 MNIST, CIFAR-10, CIFAR-100에서 표준 아키텍처(예: ResNet-20)에 적용한다.
실험 결과
연구 질문
- RQ1딥 뉴럴 네트워크 간에 낮은 적대적 전이성을 보장하는 충분조건는 무엇인가?
- RQ2기울기 수직성만으로도 낮은 전이성을 확보할 수 있는가, 아니면 모델의 매끄러움 또한 필수적인가?
- RQ3기울기 유사도와 모델의 매끄러움이 적대적 전이성의 상한 및 하한에 어떻게 공동으로 영향을 미치는가?
- RQ4기울기 다양성과 모델의 매끄러움을 동시에 강제하는 학습 전략이 앙상블 모델의 전이성을 유의미하게 감소시킬 수 있는가?
- RQ5제안된 TRS 방법이 다양한 백색상자 및 블랙박스 공격 하에서 최첨단 앙상블 기준보다 더 뛰어난 강건성을 달성하는가?
주요 결과
- TRS는 ILA, DI2-FGSM, IRA 공격에 대해 MNIST, CIFAR-10, CIFAR-100에서 최첨단 수준의 강건 정확도를 달성하며, DVERGE, GAL, ADP 등의 기준보다 모두 뛰어나다.
- ε=0.3일 때 MNIST에서 TRS는 ILA에 대해 91.2%의 강건 정확도, DI2-FGSM에 대해 93.7%, IRA에 대해 84.4%를 기록하며, DVERGE의 89.5%, 91.6%, 82.0%를 각각 초월한다.
- ε=0.05일 때 CIFAR-10에서 TRS는 ILA에 대해 46.2%의 강건 정확도, DI2-FGSM에 대해 50.0%, IRA에 대해 45.1%를 기록하며, DVERGE의 35.9%, 38.3%, 32.4%를 크게 앞서간다.
- CIFAR-100에서는 CW 공격(C=0.01) 하에서 TRS가 45.7%의 강건 정확도를 기록했고, DVERGE의 44.8%를 초월했으며, C=0.1일 때는 26.9%의 정확도를 기록해 DVERGE의 20.3%를 뛰어넘었다.
- 절단 실험 결과, PGD 단계 수(T)를 늘일수록 강건성이 향상되며, MNIST에서 T=6이 비용 대비 성능의 좋은 균형을 이룬다.
- TRS의 기울기 수직성과 매끄러움 성분 모두가 강건성에 기여하며, 절단 실험에서 둘 중 하나의 항목을 제거할 경우 성능 저하가 발생함을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.