[논문 리뷰] Revisiting Adversarial Risk
이 논문은 진짜 레이블이 변경되지 않는 범위로 적대적 편향을 재정의하여 표준 정확도와 적대적 정확도 사이의 상충 관계를 해결한다. 진짜 레이블이 변경되지 않는 편향만을 처벌하는 정의로 수정함으로써, 저자들은 강건하고 높은 정확도를 가진 분류기의 존재를 증명하며, 이전의 본질적 상충 관계가 존재한다는 주장에 도전한다.
Recent works on adversarial perturbations show that there is an inherent trade-off between standard test accuracy and adversarial accuracy. Specifically, they show that no classifier can simultaneously be robust to adversarial perturbations and achieve high standard test accuracy. However, this is contrary to the standard notion that on tasks such as image classification, humans are robust classifiers with low error rate. In this work, we show that the main reason behind this confusion is the inexact definition of adversarial perturbation that is used in the literature. To fix this issue, we propose a slight, yet important modification to the existing definition of adversarial perturbation. Based on the modified definition, we show that there is no trade-off between adversarial and standard accuracies; there exist classifiers that are robust and achieve high standard accuracy. We further study several properties of this new definition of adversarial risk and its relation to the existing definition.
연구 동기 및 목표
- 딥 러닝 모델이 적대적 공격에 취약한 데 반해 인간이 이미지 분류에서 강건한 데 대한 모순을 해결하기 위해.
- 입력의 이웃 영역에서 진짜 레이블이 일정하게 유지된다고 가정하는 기존의 적대적 위험 정의에 내재된 결함을 규명하기 위해.
- 진짜 레이블을 변경하는 편향을 제외한 적대적 편향의 개선된 정의를 제안하기 위해.
- 새로운 정의 하에서 표준 정확도와 적대적 정확도 사이에 본질적 상충 관계가 존재하지 않음을 보여주기 위해.
- 분류기가 높은 표준 정확도와 동시에 적대적 편향에 대한 강건성을 동시에 달성할 수 있음을 보여주기 위해.
제안 방법
- 진짜 레이블이 편향된 점에서 변경되지 않는 모든 편향을 포함하지 않는 적대적 편향의 수정된 정의를 제안한다.
- 진짜 레이블을 유지하면서 분류기의 출력에만 영향을 주는 편향을 기반으로 적대적 위험을 정의한다.
- 마진 기반 분석을 통해 새로운 정의 하에서 높은 표준 정확도가 강건성을 차단하지 않음을 보여준다.
- 0-1 분류 오차와 가중치 벡터의 쌍대 노름에 비례하는 하한을 구하여 적대적 위험의 하한을 유도한다.
- 적대적 훈련에 대해 프로젝션 기반 경사 하강법(PGD)을 사용하고, 새로운 위험 정의 하에서 모델을 평가한다.
- 표준 정확도와 적대적 정확도 사이의 균형에 영향을 주는 하이퍼파rameter λ의 역할을 분석하여, λ=1이 항상 최적이 아니라는 것을 보여준다.
실험 결과
연구 질문
- RQ1표준 정확도와 적대적 정확도 사이의 인식된 상충 관계는 적대적 편향 정의가 잘못되어서 비롯되는가?
- RQ2개선된 적대적 위험 정의 하에서 분류기가 높은 표준 정확도와 높은 적대적 강건성을 동시에 달성할 수 있는가?
- RQ3레이블를 변경하는 편향을 제외함으로써 적대적 위험의 이론적 및 실험적 행동에 어떤 영향을 미치는가?
- RQ4적대적 훈련 목표 함수에서 하이퍼파rameter λ의 선택은 표준 성능과 적대적 성능 간의 균형에 어떤 영향을 미치는가?
- RQ5새로운 적대적 위험 정의 하에서 강건성의 형식적 검증이 의미 있는가?
주요 결과
- 이전의 표준 정확도와 적대적 정확도 사이의 상충 관계 주장의 핵심 문제는 레이블 변경을 포함하는 정의가 정확하지 않기 때문이다.
- 개선된 정의 하에서 본질적 상충 관계가 존재하지 않으며, 분류기는 높은 표준 정확도와 강건성을 동시에 달성할 수 있다.
- 새로운 정의 하에서의 적대적 위험은 0-1 분류 오차와 가중치 벡터의 쌍대 노름에 비례하는 항으로 하한이 존재한다.
- 실험 결과, λ=1이 아닌 경우의 적대적 훈련이 λ=1일 때보다 더 나은 병렬 성능을 낼 수 있음을 보여주며, λ=1이 항상 최적이 아님을 시사한다.
- 수정된 정의는 인간의 인식과 더 잘 부합한다. 왜냐하면 인간이 적대적라고 보지 않는 레이블 변경 편향을 제외하기 때문이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.