Skip to main content
QUICK REVIEW

[논문 리뷰] Unrestricted Adversarial Attacks on ImageNet Competition

Yuefeng Chen, Xiaofeng Mao|arXiv (Cornell University)|2021. 10. 17.
Adversarial Robustness in Machine Learning참고 문헌 36인용 수 6
한 줄 요약

이 논문은 ImageNet에 대한 제한 없는 적대적 공격에 대한 경쟁을 제시하며, 공격자가 인간의 시각 인지에 영향을 주지 않으면서도 큰, 눈에 띄는 교란을 생성하여 딥러닝 모델을 오도한다. 우승한 방법인 R-DTI-FGSM은 입력 다각도성과 이동 불변 변환을 통한 기울기 정련을 사용하여 95.48%의 공격 성공률를 기록했으며, 주관적 평가에서 4위(10000점 중 9081.6점)를 기록했다.

ABSTRACT

Many works have investigated the adversarial attacks or defenses under the settings where a bounded and imperceptible perturbation can be added to the input. However in the real-world, the attacker does not need to comply with this restriction. In fact, more threats to the deep model come from unrestricted adversarial examples, that is, the attacker makes large and visible modifications on the image, which causes the model classifying mistakenly, but does not affect the normal observation in human perspective. Unrestricted adversarial attack is a popular and practical direction but has not been studied thoroughly. We organize this competition with the purpose of exploring more effective unrestricted adversarial attack algorithm, so as to accelerate the academical research on the model robustness under stronger unbounded attacks. The competition is held on the TianChi platform (\url{https://tianchi.aliyun.com/competition/entrance/531853/introduction}) as one of the series of AI Security Challengers Program.

연구 동기 및 목표

  • 큰, 눈에 띄는 교란을 생성하면서도 의미적 의미와 시각적 품질을 유지하는 실용적이고 제한 없는 적대적 공격 방법을 탐색하고 발전시키기.
  • 실제 위협을 모방하는 강력하고 무제한의 적대적 공격에 대한 딥러닝 모델의 강건성을 평가하기.
  • 구조화된 경쟁을 통해 다양한 공격 알고리즘을 수집하고 분석함으로써 적대적 강건성의 기준을 설정하기.
  • 다양한 방어 모델 간의 전이성과 일반화를 테스트함으로써 적대적 공격 설계의 혁신을 촉진하기.
  • 공격 성능을 성공률 외에도 인간의 시각적 품질과 의미 일관성에 대한 평가로 함께 평가하기.

제안 방법

  • 입력 다각도성과 이동 불변 변환을 조합한 기울기 정련 방법인 R-DTI-FGSM을 제안하여 적대적 예제의 전이성을 향상시킨다.
  • 확률 p = 0.7로 설정된 확률적 변환 함수 T(x, p)를 사용하여 각 반복마다 무작위 자르기, 뒤집기, 돌기 변환을 적용한다.
  • n=9개의 변환된 기울기를 평균 내기 위해 5×5 사전 정의된 커널 W를 사용하여 기울기를 정련함으로써 노이즈를 감소시키고 전이성을 향상시킨다.
  • 단계 크기 α = 1/255, 최대 교란 ε = 32/255로 설정된 서명 기반 FGSM 업데이트 규칙을 40회 반복 적용한다.
  • 공격의 전이성과 강건성을 향상시키기 위해 앙상블 모델(ResNet50, DenseNet161, Inception-v4 등)을 활용한다.
  • 최종 단계에서 인간 평가 단계를 도입하여 의미 일관성과 시각적 품질을 기준으로 예제를 평가한다.

실험 결과

연구 질문

  • RQ1작은 교란 제약에서 자유로운 공격에서 의미 일관성과 시각적 현실감을 유지하면서도 공격의 효과성을 어떻게 높일 수 있는가?
  • RQ2기울기 정련과 입력 다각도성 기법이 제한 없는 적대적 예제의 전이성에 얼마나 기여하는가?
  • RQ3시각적 품질과 의미 일관성에 대한 인간 평가가 제한 없는 적대적 공격 평가에 신뢰할 수 있는 지표가 될 수 있는가?
  • RQ4다양한 변환 전략(예: 회전, 무작위 크기)이 적대적 예제의 강건성과 일반화에 어떤 영향을 미치는가?
  • RQ5ImageNet에서의 제한 없는 적대적 공격에서 공격 성공률와 시각적 품질 사이의 상충 관계는 어떠한가?

주요 결과

  • R-DTI-FGSM 방법은 최종 테스트 세트에서 95.48%의 공격 성공률를 기록하여 참가 팀 중 두 번째로 높은 성과를 기록했다.
  • 동일한 방법은 최종 주관적 평가에서 4위를 차지하여 인간 평가 기준으로 10,000점 중 9081.6점을 기록했다.
  • 5위 팀은 100회의 반복을 수행한 회전 증강 MI-FGSM 방법을 사용하여 78.38%의 공격 성공률와 9026.2점의 주관적 점수를 기록했다.
  • 기울기 정련은 입력 다각도성에 의해 유도된 무작위이자 도움이 되지 않는 기울기의 영향을 크게 감소시켜 전이성을 향상시켰다.
  • 경쟁는 다섯 개의 강력한 공격 알고리즘을 성공적으로 식별하여 고품질의 제한 없는 적대적 예제 제작의 가능성을 입증했다.
  • 인간 평가 결과, 공격 성공률가 높더라도 시각적 품질과 의미 일관성이 현실적인 적대적 예제에 있어 핵심 요소임을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.