Skip to main content
QUICK REVIEW

[논문 리뷰] Distorting Neural Representations to Generate Highly Transferable Adversarial Examples.

Muzammal Naseer, Salman Khan|arXiv (Cornell University)|2018. 11. 22.
Adversarial Robustness in Machine Learning인용 수 7
한 줄 요약

이 논문은 작업별 손실 함수에 최적화하는 대신 깊이 있는 신경망 특징을 왜곡하는 새로운 방법을 제안하여 매우 높은 이식성(transferability)을 갖는 적대적 예제를 생성한다. 특징 공간에서의 변형을 최대화함으로써, 다양한 아키텍처와 작업(분류, 객체 검출, 세그멘테이션 포함) 간에 강력한 이식성을 달성한다.

ABSTRACT

neural networks (DNN) can be easily fooled by adding human imperceptible perturbations to the images. These perturbed images are known as the `adversarial examples' that pose a serious threat to security and safety critical systems. A litmus test for the strength of adversarial examples is their transferability across different DNN models in a black box setting (i.i. when target model's architecture and parameters are not known to attacker). Current attack algorithms that seek to enhance adversarial transferability work on the decision level i.e. generate perturbations that alter the network decisions. This leads to two key limitations: (a) An attack is dependent on the task-specific loss function (e.g. softmax cross-entropy for object recognition) and therefore does not generalize beyond its original task. (b) The adversarial examples are specific to the network architecture and demonstrate poor transferability to other network architectures. We propose a novel approach to create adversarial examples that can broadly fool different networks on multiple tasks. Our approach is based on the following intuition: Deep features are highly generalizable and show excellent performance across different tasks, therefore an ideal attack must create maximum distortions in the feature space to realize highly transferable examples. Specifically, for an input image, we calculate perturbations that push its feature representations furthest away from the original image features. We report extensive experiments to show how adversarial examples generalize across multiple networks across classification, object detection and segmentation tasks.

연구 동기 및 목표

  • 작업별 손실 함수에 의존하는 기존 적대적 공격의 제한된 이식성 문제를 해결하기 위해.
  • 특정 네트워크 아키텍처와 손실 함수에 의존하는 적대적 예제의 문제를 해결하기 위해.
  • 다양한 딥러닝 모델과 작업 간에 일반화되는 유니버설 공격 전략을 개발하기 위해.
  • 결정 경계가 아닌 특징 공간의 왜곡에 초점을 맞춤으로써 적대적 이식성을 향상시키기 위해.

제안 방법

  • 이 방법은 원본 이미지의 특징 표현과 변형된 이미지의 특징 간의 거리를 특징 공간에서 최대화하는 변형을 계산한다.
  • 분류 손실 최적화를 하지 않고, 네트워크의 내부 특징 활성화를 직접 조작한다.
  • 특징 공간 최적화 목표를 사용하여 변형이 표현 공간에서 최대한의 왜곡을 유도하도록 보장한다.
  • 종단 간(end-to-end)으로 적용되어 아키텍처 및 작업 변동에 대해 강건한 적대적 예제를 생성한다.
  • 이 방법은 이미지 분류, 객체 검출, 세그멘테이션 등 다양한 모델과 작업에서 평가된다.
  • 대상 모델의 아키텍처나 파라미터에 의존하지 않아 효과적인 블랙박스 공격를 가능하게 한다.

실험 결과

연구 질문

  • RQ1특징 공간의 왜곡에 초점을 맞춤으로써 다양한 딥 뉴럴 네트워크 아키텍처 간에 적대적 예제의 이식성을 높일 수 있는가?
  • RQ2결정 수준의 손실 함수 최적화보다 특징 공간의 변형을 최적화하는 것이 더 높은 이식성을 이끌어내는가?
  • RQ3동일한 하나의 적대적 예제가 분류, 검출, 세그멘테이션과 같은 다른 작업에 대해 학습된 모델을 얼마나 잘 속일 수 있는가?
  • RQ4기존 공격 방법과 비교할 때, 제안된 방법은 모델과 작업 간 이식성 측면에서 어떻게 다른가?

주요 결과

  • 제안된 방법은 기존 공격 방법에 비해 다양한 딥 뉴럴 네트워크 아키텍처 간에 훨씬 높은 이식성을 달성한다.
  • 특징 공간 왜곡을 사용해 생성된 적대적 예제는 미리 알 수 없는 아키텍처의 모델을 더 잘 속인다.
  • 이 방법은 이미지 분류, 객체 검출, 세그멘테이션 등 여러 작업에서 강력한 이식성을 보여준다.
  • 대상 모델의 아키텍처와 파라미터가 알려지지 않은 블랙박스 환경에서도 공격가 효과적이다.
  • 이 방법은 원래 작업을 초월해 잘 일반화됨을 보여주며, 특징 공간의 왜곡이 더 보편적인 적대적 취약성의 원천임을 시사한다.
  • 이 방법은 다양한 벤치마크 모델과 데이터셋에서 높은 성공률를 기록하여 광범위한 적용 가능성을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.