[논문 리뷰] Improved Network Robustness with Adversary Critic
이 논문은 타겟 클래스의 자연 이미지와 구분이 가지 않는 방식으로 적대적 예제를 훈련시켜 강건한 분류기를 만드는 새로운 GAN 기반 방어 기법을 제안한다. 적대적 공격를 생성기로 간주하고 진짜 이미지와 적대적 이미지를 구분하는 비평가를 사용함으로써, 표준 적대적 훈련을 초월하는 강건성을 확보하며, 인간 평가를 통해 적대적 예제가 빛의 흐림을 유발함을 확인하였다.
Ideally, what confuses neural network should be confusing to humans. However, recent experiments have shown that small, imperceptible perturbations can change the network prediction. To address this gap in perception, we propose a novel approach for learning robust classifier. Our main idea is: adversarial examples for the robust classifier should be indistinguishable from the regular data of the adversarial target. We formulate a problem of learning robust classifier in the framework of Generative Adversarial Networks (GAN), where the adversarial attack on classifier acts as a generator, and the critic network learns to distinguish between regular and adversarial images. The classifier cost is augmented with the objective that its adversarial examples should confuse the adversary critic. To improve the stability of the adversarial mapping, we introduce adversarial cycle-consistency constraint which ensures that the adversarial mapping of the adversarial examples is close to the original. In the experiments, we show the effectiveness of our defense. Our method surpasses in terms of robustness networks trained with adversarial training. Additionally, we verify in the experiments with human annotators on MTurk that adversarial examples are indeed visually confusing. Codes for the project are available at https://github.com/aam-at/adversary_critic.
연구 동기 및 목표
- 신경망이 미세한 변형에 취약한 것과 인간의 인지 간 격차를 해결하기 위해, 적대적 예제가 시각적으로 혼란스럽게 만들어져야 한다는 것.
- 적대적 예제가 의미 없는 변형이 아니라 의미 있는 의미적 내용을 지닌 시각적으로 타당한 예제가 되도록 방어 기법을 개발하는 것.
- 적대적 예제의 현실성에 평가하는 비평가 네트워크를 통합함으로써 표준 적대적 훈련을 초월하는 강건성을 향상시키는 것.
- 적대적 예제가 분류기를 속이기만 하는 것이 아니라 인간 관찰자에게도 자연스럽게 보이도록 보장하는 것.
- 적대적 매핑 과정의 안정성을 높이기 위해 사이클 일致성 제약 조건을 도입하는 것.
제안 방법
- 적대적 분류기 훈련을 GAN 프레임워크로 재구성하여, 적대적 공격를 생성기로 간주하고 비평가 네트워크가 진짜 이미지와 적대적 이미지를 구분하도록 한다.
- 현재 분류기 가중치에 따라 매개변수화되는 완전히 미분 가능한 타겟 지향 적대적 공격을 도입하여, 적대적 예제를 생성한다.
- 분류기의 손실에 비평가 손실을 추가로 통합하여, 적대적 예제가 비평가를 속이도록 하여 시각적 타당성을 강제한다.
- 적대적 사이클 일치 제약 조건을 적용하여, 적대적 예제의 적대적 매핑이 원래 입력에 가까워지도록 하여 안정성을 향상시킨다.
- 백프로파게이션을 통해 분류기와 비평가를 동시에 훈련시켜 양쪽 요소를 종합적으로 최적화한다.
- 신규한 공격 전략을 도입하여, 분류기 매개변수에 암묵적으로 의존하고, 시각적으로 현실적이며 타겟 클래스와 의미적으로 일치하는 적대적 예제를 생성하도록 최적화한다.
실험 결과
연구 질문
- RQ1적대적 예제를 타겟 클래스의 자연 이미지와 시각적으로 구분이 가지 않도록 만들 수 있는가, 이를 통해 인간 수준의 혼란을 유도할 수 있는가?
- RQ2적대적 예제를 탐지하는 비평가를 훈련시키는 GAN 기반 방어 프레임워크는 표준 적대적 훈련보다 더 강력한 강건성을 확보할 수 있는가?
- RQ3제안된 방법으로 생성된 적대적 예제는 인간이 본다면 진짜 레이블을 얼마나 변화시키는가?
- RQ4사이클 일치성의 포함이 적대적 예제의 안정성과 품질에 어떤 영향을 미치는가?
- RQ5제안된 방법은 높은 정확도를 유지하면서도 더 높은 강건성을 확보하고 의미 있는 적대적 예제를 생성할 수 있는가?
주요 결과
- 완전히 연결된 네트워크를 사용한 MNIST 데이터셋에서, 제안된 방법은 제안된 공격 하에 강건도 점수 0.590을 기록하였으며, [7] (0.286) 및 [19] (0.470)과 같은 표준 적대적 훈련 방법을 뛰어넘었다.
- LeNet-5 아키텍처에서, 이 방법은 강건도 점수 0.590을 기록하였으며, [7] (0.286), [16] (0.330), [19] (0.470)을 크게 앞서며 성능을 냈다.
- 아마존 메카니컬 터크에서의 인간 평가 결과, 제안된 방어 기법이 생성한 적대적 예제 중 87.99%가 인간 평가자에 의해 타겟 클래스로 정확히 식별되었으며, [19]의 경우 60.47%, [7]의 경우 19.02%에 그쳤다.
- 인간 연구 결과, 적대적 예제 중 9.86%가 원래 클래스로 잘못 분류되었으며, 이는 대부분의 적대적 예제가 시각적으로 설득력 있고 의미적으로 타당하다는 것을 시사한다.
- LeNet-5를 사용한 정상 MNIST 이미지에 대한 테스트 오차는 0.93%를 기록하여, 정상 데이터에 대한 강력한 일반화 능력을 입증하였다.
- 적대적 사이클 일치 제약 조건은 적대적 매핑의 안정성을 향상시켜, 적대적 예제가 원래 입력의 분포에 가까이 유지되도록 보장하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.