[논문 리뷰] Reinforcing Adversarial Robustness using Model Confidence Induced by Adversarial Training
이 논문은 모델의 신뢰도와 근접 이웃 검색을 조합하여 저신뢰도의 적대적 예측을 수정함으로써 적대적 방어성능을 향상시키는 HCNN 프레임워크를 제안한다. 적대적으로 훈련된 모델이 자연스럽게 정확한 예측과 잘못된 예측를 구분하는 데 사용할 수 있는 신뢰도를 유도함을 보여주며, 이는 Carlini-Wagner 공격과 같은 강력한 공격에 대해서도 효과적인 방어를 가능하게 한다. 이를 위해 근접 이웃 검색과 결합된다.
In this paper we study leveraging confidence information induced by adversarial training to reinforce adversarial robustness of a given adversarially trained model. A natural measure of confidence is $\|F({\bf x})\|_\infty$ (i.e. how confident $F$ is about its prediction?). We start by analyzing an adversarial training formulation proposed by Madry et al.. We demonstrate that, under a variety of instantiations, an only somewhat good solution to their objective induces confidence to be a discriminator, which can distinguish between right and wrong model predictions in a neighborhood of a point sampled from the underlying distribution. Based on this, we propose Highly Confident Near Neighbor (${ t HCNN}$), a framework that combines confidence information and nearest neighbor search, to reinforce adversarial robustness of a base model. We give algorithms in this framework and perform a detailed empirical study. We report encouraging experimental results that support our analysis, and also discuss problems we observed with existing adversarial training.
연구 동기 및 목표
- 적대적으로 훈련된 모델에서의 신뢰도가 자연 데이터 포인트의 이웃에서 정확한 예측과 잘못된 예측를 신뢰할 만하게 구분할 수 있는가를 조사하는 것.
- 기존의 적대적 훈련에도 불구하고 강력한 적대적 공격에 대한 방어성의 격차를 해결하는 것.
- 입력 공간 내 국소 검색과 함께 신뢰도를 조합하여 방어성을 향상시키는 방법을 제안하는 것.
- 자연 데이터 포인트의 이웃에서 신뢰도가 예측 정확성의 강력한 지표임을 경험적으로 검증하는 것.
제안 방법
- 프레임워크는 예측의 정확성과 잘못됨을 구분하기 위해 모델 출력의 무한노름 \|F(\mathbf{x})\|_{\infty}을 신뢰도 측정치로 사용한다.
- \xi-높은 신뢰도 근접 이웃(HCNN_{\xi}) 방법을 도입하여, \mathbf{x}를 중심으로 하는 \xi-공 안에서 신뢰도를 최대화하면서 \mathbf{x}에 가까운 점 \mathbf{z}를 탐색한다.
- 최적화 목적함수는 \operatorname*{arg\,max}_{\mathbf{z} \in N(\mathbf{x},\xi)} (\|F(\mathbf{z})\|_{\infty} - \lambda|\mathbf{z} - \mathbf{x}|)이며, 신뢰도와 근접성 간의 균형을 맞춘다.
- 이 방법은 적대적 예시에 대해 국소 검색을 통해 고신뢰도 영역으로 다시 매핑함으로써 적용된다.
- 기본 모델로 Madry 등이 훈련한 강건한 ResNet 모델을 재사용하고, 종단간 방어를 위해 HCNN를 적용한다.
- 이 방법은 적대적 공격 정보를 악용하려는 PGD 및 CW 공격의 수정된 버전에 대해 평가된다.
실험 결과
연구 질문
- RQ1자연 데이터 포인트의 이웃에서 적대적으로 훈련된 모델의 신뢰도가 정확한 예측과 잘못된 예측를 신뢰할 만하게 구분할 수 있는가?
- RQ2신뢰도를 활용하여 기본 모델을 초월해 적대적 방어성을 향상시킬 수 있는가?
- RQ3저신뢰도를 가진 적대적 예측을 수정하기 위해 신뢰도와 근접 이웃 검색을 조합하는 것이 얼마나 효과적인가?
- RQ4공격 반경이 커질 경우 기존의 적대적 훈련 공식의 한계는 무엇인가?
- RQ5저신뢰도 영역을 공격하는 적응형 공격에 대해서도 신뢰도 기반 방어가 효과를 유지할 수 있는가?
주요 결과
- 작은 공격 반경(예: \eta = \xi = 0.010)에서는 HCNN_{\xi}가 원래 잘못된 레이블을 가진 94개의 적대적 예측을 올바르게 분류했고, 신뢰도가 감소한 예측 중 오류가 27개 뿐이었다.
- \eta = \xi = 0.015일 때는 HCNN_{\xi}가 114개의 레이블 변경된 적대적 예측을 정확히 예측했으며, 신뢰도가 감소한 예측 중 오류는 20개 뿐이었다.
- \eta = \xi = 0.010일 때 99.44%의 경우와 \eta = \xi = 0.015일 때 98.94%의 경우에서, 오염된 점의 두 번째까지의 최고 신뢰도 예측에 정확한 레이블이 포함되었다.
- \ell_{\infty} 공 안에 무작위 노이즈가 포함되면서, 더 큰 반경(예: 0.03)에서는 신뢰도가 구분 기능으로서의 효과를 상실한다.
- 이 연구는 Madry 등의 공식의 두 가지 핵심 한계를 규명했다: 큰 공 안에서의 열악한 기울기 탐색과 노이즈에 대한 과도한 정규화로, 제한된 크기의 신뢰 영역이 필요함을 시사한다.
- 결과적으로, 국소 검색과 함께 사용될 경우 신뢰도가 강력한 방어 신호로 기능함을 보여주며, 생성적 다양체 기반 방어의 대안으로 유용한 분류 기반 접근을 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.