Skip to main content
QUICK REVIEW

[논문 리뷰] AdvDrop: Adversarial Attack to DNNs by Dropping Information

Ranjie Duan, Yuefeng Chen|arXiv (Cornell University)|2021. 08. 20.
Adversarial Robustness in Machine Learning참고 문헌 48인용 수 11
한 줄 요약

이 논문은 고주파 성분을 주파수 도메인에서 제거함으로써 눈에 띄지 않는 이미지 세부 정보를 제거함으로써 노이즈를 추가하는 대신 악성 예측 예제를 생성하는 새로운 적대적 공격 AdvDrop을 제안한다. 이 방법은 ImageNet에서 97.20%의 공격 성공률를 기록하며, 노이즈 제거 기반 방어 기법에 대해 강력한 저항성을 보이며 현재 DNN의 강인성 평가에 치명적인 취약점을 드러낸다.

ABSTRACT

Human can easily recognize visual objects with lost information: even losing most details with only contour reserved, e.g. cartoon. However, in terms of visual perception of Deep Neural Networks (DNNs), the ability for recognizing abstract objects (visual objects with lost information) is still a challenge. In this work, we investigate this issue from an adversarial viewpoint: will the performance of DNNs decrease even for the images only losing a little information? Towards this end, we propose a novel adversarial attack, named extit{AdvDrop}, which crafts adversarial examples by dropping existing information of images. Previously, most adversarial attacks add extra disturbing information on clean images explicitly. Opposite to previous works, our proposed work explores the adversarial robustness of DNN models in a novel perspective by dropping imperceptible details to craft adversarial examples. We demonstrate the effectiveness of extit{AdvDrop} by extensive experiments, and show that this new type of adversarial examples is more difficult to be defended by current defense systems.

연구 동기 및 목표

  • 눈에 띄지 않는 이미지 세부 정보를 제거하는 것이 DNN을 속이는 데 효과적인 악성 예측 예제를 생성할 수 있는지 조사하는 것.
  • 노이즈 추가가 아니라 정보 손실의 관점에서 적대적 강인성을 탐구하는 것.
  • 특히 노이즈 제거 기반 방어 기법을 포함한 기존 방어 기법에 대해 AdvDrop의 효과성을 평가하는 것.
  • 모델의 주의 분포와 제거된 이미지 특징 간의 관계를 분석하는 것.
  • 공간 도메인 방법(예: 색상 깊이 감소)과 비교해 주파수 도메인 정보 제거가 왜 더 효과적이고 자연스러운지 보여주는 것.

제안 방법

  • AdvDrop는 이산余弦변환(DCT)을 사용해 입력 이미지를 공간 도메인에서 주파수 도메인으로 변환한다.
  • 인간의 시각적 감지에 덜 민감한 고주파 성분을 선택적으로 감소시키기 위해 미분 가능 양자화를 적용한다.
  • 이 공격은 이미지의 구조를 유지하면서 미세한 질감과 세부 정보를 제거하는 유연한 양자화 전략을 사용한다.
  • 청정 이미지와의 시각적 유사성을 유지하면서 DNN 분류를 교란시키는 방식으로 악성 예측 예제를 생성한다.
  • 제거된 주파수 성분의 양과 위치를 조절하여 대상 공격 및 비대상 공격을 수행한다.
  • 주파수 대역 제거(저주파, 중주파, 고주파)와 양자화 방법에 대한 분석을 통해 방법의 성능을 평가한다.

실험 결과

연구 질문

  • RQ1주파수 도메인에서 눈에 띄지 않는 이미지 세부 정보를 제거하면 DNN을 속이는 효과적인 악성 예측 예제를 생성할 수 있는가?
  • RQ2기존의 노이즈 추가 공격과 비교해 AdvDrop는 효과성과 강인성 면에서 어떻게 다른가?
  • RQ3왜 주파수 도메인 정보 제거가 색상 깊이 감소와 같은 공간 도메인 방법보다 더 효과적인가?
  • RQ4AdvDrop는 DNN의 주의 맵과 얼마나 겹치거나 이를 악용하는가?
  • RQ5특히 노이즈 제거 기반 방어 기법은 AdvDrop가 생성한 악성 예측 예제에 대해 얼마나 효과적인가?

주요 결과

  • AdvDrop는 ImageNet에서 97.20%의 공격 성공률를 기록하며, 표준 반올림(5.00%) 및 미분 가능 양자화(65.20%) 방법보다 뚜렷이 뛰어나다.
  • 이 방법은 노이즈 제거 기반 방어 기법에 매우 강력한 저항성을 보이며, PGD로 생성된 악성 예측 예제는 노이즈 제거로 완화되지만 AdvDrop 예제는 여전히 효과가 유지된다.
  • 저주파 성분을 제거할 경우 정확도가 가장 크게 감소(30.00%)하여 DNN 인식에서 저주파 성분이 지배적인 역할을 함을 시사하며, 고주파 성분 제거는 덜 해로우나 여전히 효과적이다.
  • 시각적 분석 결과, AdvDrop는 주로 고주파 질감 세부 정보를 제거하며, 특히 질감이 뚜렷한 영역에서 모델의 주의 영역과 겹치는 경향이 있다.
  • 주파수 도메인 정보 제거는 공간 도메인 방법(예: 색상 깊이 감소)보다 더 효과적이며, 더 자연스러운 보기에 가까운 악성 예측 이미지를 생성한다.
  • 분석 결과, 미분 가능 양자화가 높은 성능을 내기 위해 필수적임을 확인하였으며, 이는 공격 성공률를 극대화하는 데 기여하는 비균일한 정보 제거를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.