Skip to main content
QUICK REVIEW

[논문 리뷰] SegPGD: An Effective and Efficient Adversarial Attack for Evaluating and Boosting Segmentation Robustness

Jindong Gu, Hengshuang Zhao|arXiv (Cornell University)|2022. 07. 25.
Adversarial Robustness in Machine Learning인용 수 5
한 줄 요약

이 논문은 표준 PGD보다 효과성과 효율성을 향상시킨 정신적 분할을 위한 새로운 적대적 공격 방법인 SegPGD를 제안한다. 분할 전용 기울기 역동성과 동적 가중치 스케줄을 활용함으로써 SegPGD는 더 적은 반복 횟수로도 뛰어난 적대적 예제 품질을 달성하여 강력한 내성 평가와 PASCAL VOC 및 Cityscapes 데이터셋에서 분할 모델에 대한 최신 기술 수준의 적대적 훈련 성능을 실현한다.

ABSTRACT

Deep neural network-based image classifications are vulnerable to adversarial perturbations. The image classifications can be easily fooled by adding artificial small and imperceptible perturbations to input images. As one of the most effective defense strategies, adversarial training was proposed to address the vulnerability of classification models, where the adversarial examples are created and injected into training data during training. The attack and defense of classification models have been intensively studied in past years. Semantic segmentation, as an extension of classifications, has also received great attention recently. Recent work shows a large number of attack iterations are required to create effective adversarial examples to fool segmentation models. The observation makes both robustness evaluation and adversarial training on segmentation models challenging. In this work, we propose an effective and efficient segmentation attack method, dubbed SegPGD. Besides, we provide a convergence analysis to show the proposed SegPGD can create more effective adversarial examples than PGD under the same number of attack iterations. Furthermore, we propose to apply our SegPGD as the underlying attack method for segmentation adversarial training. Since SegPGD can create more effective adversarial examples, the adversarial training with our SegPGD can boost the robustness of segmentation models. Our proposals are also verified with experiments on popular Segmentation model architectures and standard segmentation datasets.

연구 동기 및 목표

  • 분류 모델보다 훨씬 더 많은 공격 반복 횟수가 필요한 정신적 분할 모델을 위한 효과적인 적대적 예제를 생성하는 데 도전하는 것.
  • 강력한 적대적 예제를 생성하기 위해 필요한 반복 횟수를 줄임으로써 적대적 내성 평가의 효율성과 효과성을 향상시키는 것.
  • 더 강력한 공격 방법을 사용해 더 높은 품질의 적대적 예제를 생성함으로써 정신적 분할 모델의 적대적 훈련을 향상시키는 것.
  • SegPGD가 향상된 적대적 훈련을 통해 정신적 분할 모델에서 최신 기술 수준의 내성을 달성할 수 있음을 보여주는 것.

제안 방법

  • SegPGD는 품질 분류 목표에 더 잘 부합하도록 PGD 최적화 과정을 수정한 분할 전용 공격 전략을 도입한다.
  • 공격 중에 다양한 클래스 간 손실을 적절히 균형 잡는 동적 가중치 스케줄(가중치-다이나믹-선형)을 적용하여 기울기 신호 품질을 향상시킨다.
  • SegFGSM을 통해 단단한 공격으로 일반화함으로써 빠르면서도 효과적인 적대적 예제 생성을 가능하게 한다.
  • 이론적 수렴 분석을 통해 동일한 반복 횟수 내에서 표준 PGD보다 SegPGD가 더 빠르게 수렴하고 더 나은 해에 도달함을 입증한다.
  • SegPGD는 적대적 훈련(SegPGD-AT)에 통합되며, 훈련 중에 적대적 예제가 생성되어 모델의 내성을 향상시킨다.
  • 백색 상자 및_BLK 박스 공격 설정 하에서 여러 아키텍처(PSPNet, DeepLabV3)와 데이터셋(PASCAL VOC, Cityscapes)을 대상으로 평가된다.

실험 결과

연구 질문

  • RQ1분할 전용 공격 방법은 효과성과 효율성 측면에서 표준 PGD를 초월할 수 있는가?
  • RQ2SegPGD의 동적 가중치 스케줄은 균일하거나 고정된 가중치 스케줄과 비교해 수렴성과 공격 품질을 어떻게 향상시키는가?
  • RQ3SegPGD를 적대적 훈련에 활용할 경우 정신적 분할 모델의 내성은 어느 정도 향상되는가?
  • RQ4강력한 공격에 대한 내성 측면에서 SegPGD-AT는 DDCAT와 같은 기존의 적대적 훈련 방법과 비교해 어떻게 다른가?
  • RQ5SegPGD의 향상된 공격 능력은 전이 기반 블랙박스 공격에 대한 일반화 성능 향상으로 이어지는가?

주요 결과

  • SegPGD는 100회의 PGD 반복 내에서 적대적으로 훈련된 PSPNet의 mIoU를 거의 0으로 낮춰, 약한 공격으로 훈련된 모델의 취약성을 입증한다.
  • SegPGD-AT를 통한 적대적 훈련은 PGD-AT와 DDCAT를 크게 능가하는 최신 기술 수준의 내성을 달성했으며, PGD100 기준 VOC에서 18.24 mIoU 대비 10.98 mIoU를 기록했다.
  • Cityscapes에서 SegPGD-AT는 PGD-AT의 mIoU 3.95에서 PGD100 기준 13.04로 향상되어 뚜렷한 내성 향상을 보였다.
  • SegPGD-AT로 훈련된 모델은 전이 기반 블랙박스 공격에 대해 PGD나 DDCAT로 훈련된 모델보다 뛰어난 성능을 보였다.
  • 수렴 분석 결과, 동일한 반복 횟수 내에서 SegPGD는 PGD보다 더 나은 적대적 예제를 더 빨리 도달함을 확인했다.
  • SegPGD의 동적 선형 가중치 스케줄은 더 효과적인 기울기 갱신을 이끌어내어 기준 방법 대비 더 강력한 공격 성능을 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.