[논문 리뷰] Learnable Boundary Guided Adversarial Training
이 논문은 자연적인 정확도를 유지하면서 모델의 강건성을 향상시키기 위해 강건 모델의 로짓을 잘 훈련된 정제 모델의 로짓과 일치시키는 방식으로, 새로운 적대적 훈련 방법인 Learnable Boundary Guided Adversarial Training (LBGAT)을 제안한다. 이 방법은 추가 데이터 없이 Auto-Attack 기준으로 CIFAR-100에서 최고 수준의 강건성을 달성하며, 자연 정확도와 강건 정확도 양측 모두에서 이전 방법들을 능가한다.
Previous adversarial training raises model robustness under the compromise of accuracy on natural data. In this paper, we reduce natural accuracy degradation. We use the model logits from one clean model to guide learning of another one robust model, taking into consideration that logits from the well trained clean model embed the most discriminative features of natural data, {\it e.g.}, generalizable classifier boundary. Our solution is to constrain logits from the robust model that takes adversarial examples as input and makes it similar to those from the clean model fed with corresponding natural data. It lets the robust model inherit the classifier boundary of the clean model. Moreover, we observe such boundary guidance can not only preserve high natural accuracy but also benefit model robustness, which gives new insights and facilitates progress for the adversarial community. Finally, extensive experiments on CIFAR-10, CIFAR-100, and Tiny ImageNet testify to the effectiveness of our method. We achieve new state-of-the-art robustness on CIFAR-100 without additional real or synthetic data with auto-attack benchmark \footnote{\url{https://github.com/fra31/auto-attack}}. Our code is available at \url{https://github.com/dvlab-research/LBGAT}.
연구 동기 및 목표
- 적대적 훈련에서 강건성과 자연 정확도 사이의 상충 관계를 해결하기 위해.
- 적대적 공격에 대한 강건성을 향상시키면서도 높은 자연 분류 정확도를 유지하기 위해.
- 정제 모델의 분류기 경계 지도가 자연 정확도와 강건성을 향상시키는 데 기여할 수 있는지 탐색하기 위해.
- 정제 모델과 강건 모델의 공동 훈련 중에 동적으로 조정 가능한 학습 가능한 동적 경계 지도 메커니즘을 개발하기 위해.
- CIFAR-10, CIFAR-100, Tiny ImageNet를 포함한 다양한 데이터셋에서의 효과성을 입증하기 위해.
제안 방법
- 적대적 훈련 중에 자연적으로 훈련된 정제 모델의 로짓을 강건 모델의 지도로 사용한다.
- 강건 모델에서의 적대적 예제의 로짓이 정제 모델에서의 해당 자연 입력의 로짓과 유사하도록 제약을 둔다.
- 두 모델의 출력 분포를 일치시키는 디스틸레이션 유사 손실을 통해 경계 지도를 구현한다.
- 정제 모델과 강건 모델을 공동으로 훈련함으로써 LBGAT로 일반화하며, 분류기 경계의 동적 조정을 가능하게 한다.
- TRADES 및 ALP와 같은 최첨단 방어 프레임워크와 통합하여 성능을 향상시킨다.
- 훈련 과정은 PGD 기반의 적대적 예제와 경계 지도를 포함한 교차 엔트로피 손실을 사용한다.

실험 결과
연구 질문
- RQ1정제 모델의 분류기 경계 지식이 적대적 훈련에서 자연 정확도와 강건성을 향상시키는 데 기여할 수 있는가?
- RQ2자연적으로 훈련된 모델의 경계 지도가 자연 정확도 유지 외에도 강건성을 향상시키는가?
- RQ3학습 가능한, 공동 훈련된 경계 지도 메커니즘이 사전 훈련된 정제 모델에서의 정적 지도보다 우수한 성능을 낼 수 있는가?
- RQ4LBGAT는 화이트박스 및_BLK박스 공격 설정을 포함한 다양한 공격 환경에서 어떻게 성능을 발휘하는가?
- RQ5LBGAT는 추가적인 실재 또는 합성 훈련 데이터 없이도 최고 수준의 강건성을 달성할 수 있는가?
주요 결과
- CIFAR-100에서 LBGAT+TRADES (α=0)는 20-반복 PGD 기준으로 47.80%의 자연 정확도와 14.31%의 강건 정확도를 기록하여, 베이스라인인 TRADES (α=6)보다 자연 정확도에서 9.29% 높다.
- Tiny ImageNet에서 LBGAT+TRADES (α=6)는 자연 정확도 39.26%, 강건 정확도 16.42%를 기록하여, 최고의 베이스라인보다 자연 정확도에서 0.75% 높고 강건 정확도에서 2.94% 높다.
- CIFAR-100에서 LBGAT+TRADES (α=0)는 TRADES (α=6) 대비 자연 정확도를 13.53% 향상시키며, 동등한 수준의 강건성을 유지한다.
- 블랙박스 공격 조건에서, 자연적으로 훈련된 소스 모델에서 전이된 LBGAT 모델은 TRADES (α=6)보다 12.83% 더 강건하다.
- 실재 또는 합성 데이터를 추가로 사용하지 않고도, Auto-Attack 벤치마크 기준으로 CIFAR-100에서 최고 수준의 강건성을 달성한다.
- 의외이지만 중요한 발견으로, 정제 모델의 경계 지도가 강건성 향상에도 기여함을 확인하여, 이 방법이 이중적인 이점을 제공한다는 점을 시사한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.