Skip to main content
QUICK REVIEW

[논문 리뷰] Understanding the Intrinsic Robustness of Image Distributions using Conditional Generative Models

Xiao Zhang, Jinghui Chen|arXiv (Cornell University)|2020. 02. 29.
Adversarial Robustness in Machine Learning인용 수 7
한 줄 요약

이 논문은 조건부 생성 모델을 사용하여 자연 이미지 분포의 내재적 내성에 대한 이론적 한계를 설정하며, $\varepsilon$-구 $\hat{\mu}_2$ 변형 하에서 최신의 강건한 분류기들이 여전히 이러한 이론적 한계에 크게 못 미친다는 것을 보여줍니다. 이는 데이터 만능에 속하는 적대적 예제를 탐색하기 위한 방법을 제안하고, MNIST와 ImageNet에서 현재의 모델 성능과 이론적 내성 한계 사이에 큰 격차가 있음을 실험적으로 입증합니다.

ABSTRACT

Starting with Gilmer et al. (2018), several works have demonstrated the inevitability of adversarial examples based on different assumptions about the underlying input probability space. It remains unclear, however, whether these results apply to natural image distributions. In this work, we assume the underlying data distribution is captured by some conditional generative model, and prove intrinsic robustness bounds for a general class of classifiers, which solves an open problem in Fawzi et al. (2018). Building upon the state-of-the-art conditional generative models, we study the intrinsic robustness of two common image benchmarks under $\\ell_2$ perturbations, and show the existence of a large gap between the robustness limits implied by our theory and the adversarial robustness achieved by current state-of-the-art robust models. Code for all our experiments is available at https://github.com/xiaozhanguva/Intrinsic-Rob.

연구 동기 및 목표

  • 자연 이미지 분포에 대한 내재적 내성 한계에 관해 Fawzi 등(2018)이 제기한 열린 문제를 다루기 위해.
  • 이론적 내성 한계와 최신의 적대적으로 훈련된 모델의 성능 사이의 격차를 메우기 위해.
  • 데이터 만능에 위치한 내재적 적대적 예제를 탐색하기 위한 방법을 개발하기 위해.
  • 최신의 조건부 생성 모델을 사용하여 MNIST와 ImageNet에서 내재적 내성의 경험적 평가를 수행하기 위해.
  • 내재적 적대적 위험과 내재적 내성 사이의 관계를 규명하기 위해.

제안 방법

  • 이론적 분석을 통해 데이터 분포가 조건부 생성 모델에 의해 포괄된다고 가정할 때 내재적 내성에 대한 기본적인 한계를 증명합니다.
  • 이 방법은 잠재 변수 $\bm{z}$ 를 이미지 $\bm{x}$ 로 매핑하는 생성자 $g$ 를 통해 데이터 분포를 모델링하기 위해 $g_*(\nu)$ 를 사용합니다.
  • 변형 제약 조건 $\Delta(\bm{x}, \bm{x}') \leq \epsilon$ 을 만족하면서 $\|G(\bm{z}, y) - \bm{x}\|_2$ 를 최소화하는 방식으로 내재적 적대적 예제를 탐색하기 위한 최적화 프레임워크를 제안합니다.
  • 정규화 파rameter $\lambda$ 에 대해 이분 탐색을 수행하여 변형 크기와 적대적 성공률 사이의 균형을 조절합니다.
  • 초기화로는 재구성 오차를 최소화하는 잠재 코드 $\bm{z}_{\text{init}}$ 또는 테스트 이미지를 생성한 데 사용된 진짜 $\bm{z}^*$ 를 사용합니다.
  • 실험에서는 $\ell_2$ 기반의 강건성 목표에 따라 훈련된 LP-Certify, Adv-Train 및 TRADES 모델을 사용합니다.

실험 결과

연구 질문

  • RQ1조건부 생성 모델을 가정할 때, 자연 이미지 분포에 대한 $\ell_2$ 변형 하에서 내재적 내성의 이론적 상한은 무엇입니까?
  • RQ2최신의 적대적으로 훈련된 모델이 달성한 내성과 이론적 내성 한계 사이에는 어떤 비교가 이루어지나요?
  • RQ3잠재 공간 최적화 프레임워크를 사용하여 내재적 적대적 예제를 효과적으로 탐색할 수 있나요?
  • RQ4내재적 적대적 위험과 내재적 내성 사이의 관계는 무엇입니까?
  • RQ5현재의 강건한 모델들이 데이터 분포가 암시하는 이론적 내성 한계에 얼마나 못 미치는가요?

주요 결과

  • MNIST에 대해 이론적 내재적 내성 한계는 $\ell_2$ 변형 하에서 약 1.85이며, 최고의 강건한 모델은 단지 1.35에 그칩니다.
  • ImageNet10에 대해 내재적 내성 한계는 약 2.15이지만, 최고의 강건한 모델은 단지 1.55에 그치며, 이는 상당한 성능 격차가 있음을 시사합니다.
  • 제안된 최적화 방법은 데이터 만능에 위치한 내재적 적대적 예제를 성공적으로 탐색하여 그 효과성을 입증합니다.
  • 내재적 적대적 위험은 내재적 내성과 공식적으로 연결되어 있으며, 이론적 한계는 달성 가능한 내성의 경계로 작용합니다.
  • 경험적 결과는 심지어 가장 강력한 인증된 모델과 적대적으로 훈련된 모델들 역시 데이터 분포가 암시하는 이론적 내성 한계에 못 미친다는 것을 보여줍니다.
  • 이론과 실천 사이의 격차는 MNIST와 ImageNet10 모두에서 지속되며, 현재의 강건한 훈련 접근법에 근본적인 한계가 있음을 시사합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.