[논문 리뷰] On the Power of Abstention and Data-Driven Decision Making for Adversarial Robustness
이 논문은 비리프시츠 신경망에서 공격을 저차원 부분공간으로 제한함으로써 기각을 활용하는 새로운 적대적 로버스트니 프레임워크를 제안한다. 이 프레임워크는 이러한 공격 하에서 기각 기반 분류기가 비기각 기반 분류기보다 증명 가능하게 더 강건하다는 것을 증명하며, 이론적 보장을 갖는 데이터 기반 방법을 제안하여 지도 및 자기지도 대비 학습 설정 모두에서 높은 강건한 정확도를 달성한다.
We formally define a feature-space attack where the adversary can perturb datapoints by arbitrary amounts but in restricted directions. By restricting the attack to a small random subspace, our model provides a clean abstraction for non-Lipschitz networks which map small input movements to large feature movements. We prove that classifiers with the ability to abstain are provably more powerful than those that cannot in this setting. Specifically, we show that no matter how well-behaved the natural data is, any classifier that cannot abstain will be defeated by such an adversary. However, by allowing abstention, we give a parameterized algorithm with provably good performance against such an adversary when classes are reasonably well-separated in feature space and the dimension of the feature space is high. We further use a data-driven method to set our algorithm parameters to optimize over the accuracy vs. abstention trade-off with strong theoretical guarantees. Our theory has direct applications to the technique of contrastive learning, where we empirically demonstrate the ability of our algorithms to obtain high robust accuracy with only small amounts of abstention in both supervised and self-supervised settings. Our results provide a first formal abstention-based gap, and a first provable optimization for the induced trade-off in an adversarial defense setting.
연구 동기 및 목표
- 낮은 랜덤 부분공간으로 제한된 특징 공간 적대적 공격 모델을 정식화하여 비리프시츠 네트워크의 분석을 가능하게 한다.
- 데이터 분포와 관계없이, 기각 기능이 없는 분류기가 이러한 공격 하에서 증명 가능하게 취약하다는 것을 입증한다.
- 고차원 특징 공간에서 클래스가 잘 분리되어 있을 경우, 증명 가능하게 양호한 성능을 달성하는 매개변수 기반 기각 분류기를 설계한다.
- 정확도-기각 트레이드오프를 강력한 이론적 보장과 함께 데이터 기반으로 최적화하는 방법을 개발한다.
- 지도 및 자기지도 대비 학습 설정 모두에서 접근을 실증적으로 검증한다.
제안 방법
- 낮은 차원의 랜덤 부분공간 내에서 입력을 변형하는 특징 공간 공격을 정식화하여 비리프시츠 행동의 분석을 가능하게 한다.
- 특징 공간 기하학과 클래스 간 분리도를 활용하여 강건성을 향상시키는 매개변수 기반 기각 분류기를 도입한다.
- 기각이 비기각 모델이 실패하는 상황에서 증명 가능하게 강건성을 확보할 수 있음을 보여주는 이론적 보장을 유도한다.
- 정확도와 기각 비율 간 트레이드오프를 최적화하는 데이터 기반 파rameter 조정 방법을 제안한다.
- 대비 학습에 프레임워크를 적용하여 최소한의 기각으로 높은 강건한 정확도를 달성함을 보여준다.
- 높은 차원의 특징 공간과 클래스 간 분리도를 핵심 가정으로 삼아 이론적 성능 한계를 보장한다.
실험 결과
연구 질문
- RQ1비리프시츠 네트워크를 가진 적대적 환경에서 기각이 비기각 기반 분류기보다 증명 가능하게 강건성 이점을 제공할 수 있는가?
- RQ2적대적 변형을 저차원 부분공간으로 제한할 경우 분류기의 강건성에 어떤 영향을 미치는가?
- RQ3이러한 적대적 환경에서 정확도와 기각 비율 간 최적의 트레이드오프는 무엇이며, 이를 어떻게 데이터 기반으로 최적화할 수 있는가?
- RQ4제안된 프레임워크는 최소한의 기각으로 자기지도 대비 학습에서 높은 강건한 정확도를 달성할 수 있는가?
- RQ5정의된 공격 모델 하에서 기각 기반 분류기가 비기각 기반 분류기를 능가하도록 보장하는 이론적 조건은 무엇인가?
주요 결과
- 어떤 비기각 기반 분류기라도 데이터 분포나 네트워크 아키텍처와 관계없이 정의된 부분공간 공격에 대해 증명 가능하게 취약하다.
- 클래스가 고차원 특징 공간에서 잘 분리되어 있을 경우 기각 기반 분류기는 증명 가능하게 양호한 성능을 달성한다.
- 데이터 기반 파arameter 조정 방법은 정확도-기각 트레이드오프에 대해 강력한 이론적 보장을 보장한다.
- 실증 결과는 지도 및 자기지도 대비 학습 설정 모두에서 소량의 기각으로도 높은 강건한 정확도를 달성함을 보여준다.
- 이 프레임워크는 공식적인 기각 기반 강건성 격차를 처음으로 설정했으며, 적대적 방어에서 정확도-기각 트레이드오프에 대한 증명 가능한 최적화를 처음으로 제안한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.