Skip to main content
QUICK REVIEW

[논문 리뷰] Optimal Transport Classifier: Defending Against Adversarial Attacks by Regularized Deep Embedding

Li Yao, Martin Renqiang Min|arXiv (Cornell University)|2018. 11. 19.
Adversarial Robustness in Machine Learning참고 문헌 25인용 수 6
한 줄 요약

이 논문은 최적 운반 이론을 기반으로 한 최적 운반 분류기(OT-Classifier)를 제안한다. 이는 정규화된 딥 인코더를 사용해 고차원 이미지를 저차원 잠복 공간으로 투영함으로써 화이트박스 적대적 공격에 대비하는 새로운 엔드 투 엔드 딥 러닝 프레임워크이다. 진짜 레이블 분포와 모델의 출력 분포 간의 최적 운반 비용을 최소화함으로써, 중요한 특징을 유지하면서 적대적 편향을 감소시키며, 강력한 적대적 공격 하에서 MNIST, CIFAR10, STL10, 그리고 Tiny ImageNet에서 최고의 강건성을 달성한다.

ABSTRACT

Recent studies have demonstrated the vulnerability of deep convolutional neural networks against adversarial examples. Inspired by the observation that the intrinsic dimension of image data is much smaller than its pixel space dimension and the vulnerability of neural networks grows with the input dimension, we propose to embed high-dimensional input images into a low-dimensional space to perform classification. However, arbitrarily projecting the input images to a low-dimensional space without regularization will not improve the robustness of deep neural networks. Leveraging optimal transport theory, we propose a new framework, Optimal Transport Classifier (OT-Classifier), and derive an objective that minimizes the discrepancy between the distribution of the true label and the distribution of the OT-Classifier output. Experimental results on several benchmark datasets show that, our proposed framework achieves state-of-the-art performance against strong adversarial attack methods.

연구 동기 및 목표

  • 딥 네트워크가 적대적 예제에 취약한 점을 해결하기 위해, 특히 전체 모델에 접근이 가능한 화이트박스 공격 환경에서의 취약성을 다루기 위해.
  • 고차원 이미지 입력을 저차원 잠복 공간으로 투영함으로써 모델의 강건성 저하를 줄이기 위해, 여기서 적대적 편향이 감소하도록 하기 위해.
  • 저차원 임베딩이 분류에 가장 관련 있는 특징만 유지하여 분류 정보 손실을 방지하기 위해.
  • 최적 운반 이론을 활용해 진짜 레이블과 모델 출력 간의 분포 불일치를 최소화하는 방어 메커니즘을 체계화하기 위해.
  • 다양한 벤치마크 데이터셋에서 강력한 적대적 공격에 대해 기존 방어 방법을 뛰어넘는 강건성을 확보하기 위해.

제안 방법

  • 프레임워크는 입력 이미지를 저차원 잠복 공간으로 매핑하는 딥 인코더를 사용하고, 이후 분류기 헤드를 통해 최종 예측을 수행한다.
  • 잠복 공간에 디스criminator를 도입하여, 인코더의 출력 분포가 사전 분포(표준 정규분포)와 일치하도록 유도한다. 이는 GAN 유사한 적대적 메커니즘을 사용한다.
  • 진짜 클래스 분포와 OT-Classifier의 출력 분포 간의 최적 운반 비용을 최소화함으로써, 투영 과정 중 특징 유지 보장을 보장한다.
  • 목표 함수는 분류를 위한 교차 엔트로피 손실과 최적 운반 이론에서 유도된 분포 정규화 항을 조합한다.
  • 인코더와 디스criminator는 엔드 투 엔드 방식으로 공동으로 훈련되며, 디스criminator는 잠복 공간을 잘 구조화된 저차원 다양체로 형상화하는 정규화 역할을 한다.
  • 프레임워크는 적대적 훈련을 통해 적대적 예시로 훈련되어, 화이트박스 공격 시나리오에서 더욱 강건성을 향상시킨다.

실험 결과

연구 질문

  • RQ1딥 네트워크의 입력 차원을 줄임으로써 화이트박스 적대적 공격에 대한 강건성이 향상될 수 있는가?
  • RQ2어떻게 임베딩 과정을 정규화하여, 적대적 노이즈를 억제하면서도 가장 분류에 유의미한 특징만 유지할 수 있는가?
  • RQ3최적 운반 이론을 효과적으로 활용하여 진짜 레이블과 모델 출력 간의 분포 불일치를 최소화할 수 있는가?
  • RQ4대부분의 표준 벤치마크에서 표현 학습과 분포 정규화를 통합한 종단 간 아키텍처가 기존 방어 방법을 뛰어넘을 수 있는가?
  • RQ5강력한 적대적 공격 하에서 OT-Classifier는 뛰어난 강건성을 확보하면서도 정상 이미지 정확도를 얼마나 유지하는가?

주요 결과

  • OT-Classifier는 강력한 화이트박스 적대적 공격 하에서 MNIST, CIFAR10, STL10, 그리고 Tiny ImageNet에서 최고의 강건 정확도를 달성한다.
  • 이 방법은 입력을 저차원 공간으로 투영함으로써 적대적 편향의 영향을 크게 줄이며, 여기서 이러한 편향이 감쇠됨을 보여준다.
  • 최적 운반 기반 정규화를 사용함으로써, 잠복 공간이 분류에 가장 관련 있는 특징만 유지하여 정보 손실를 최소화한다.
  • 특히 적대적 훈련을 병행할 경우, 다른 최고 수준의 방어 방법보다 뛰어난 성능을 보인다.
  • 실험 결과는 이미지 데이터의 내재 차원이 픽셀 공간의 차원보다 훨씬 낮다는 것을 입증하며, 이는 본 방법의 핵심 가정을 뒷받침한다.
  • GAN 유사 디스criminator는 효과적으로 잠복 공간을 정규화하여 표준 정규분포 사전을 따르도록 유도하며, 이는 강건성 향상에 기여한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.