[논문 리뷰] DAmageNet: A Universal Adversarial Dataset
DAmageNet는 이미지넷 이미지에서 최소한의 편향(평균 RMS 편차 3.8)으로 유도된 96,020개의 매우 이식 가능한 적대적 샘플을 포함한 최초의 통합 적대적 데이터셋이다. 이 샘플들은 어떤 모델 쿼리 없이도 다양한 사전 훈련된 모델에서 최대 90%의 오분류율을 달성하여, 쿼리 없이 블랙박스 공격을 가능하게 하고 딥 네URAL 네트워크의 강건성 평가 및 향상에 기준이 되는 데이터셋이다.
It is now well known that deep neural networks (DNNs) are vulnerable to adversarial attack. Adversarial samples are similar to the clean ones, but are able to cheat the attacked DNN to produce incorrect predictions in high confidence. But most of the existing adversarial attacks have high success rate only when the information of the attacked DNN is well-known or could be estimated by massive queries. A promising way is to generate adversarial samples with high transferability. By this way, we generate 96020 transferable adversarial samples from original ones in ImageNet. The average difference, measured by root means squared deviation, is only around 3.8 on average. However, the adversarial samples are misclassified by various models with an error rate up to 90\%. Since the images are generated independently with the attacked DNNs, this is essentially zero-query adversarial attack. We call the dataset \emph{DAmageNet}, which is the first universal adversarial dataset that beats many models trained in ImageNet. By finding the drawbacks, DAmageNet could serve as a benchmark to study and improve robustness of DNNs. DAmageNet could be downloaded in http://www.pami.sjtu.edu.cn/Show/56/122.
연구 동기 및 목표
- 딥 네URAL 네트워크(DNNs)의 적대적 공격에 대한 취약성을 해결하기 위해 쿼리가 없는 통합 공격 기준을 마련하기 위해.
- 이미지넷에서 훈련된 다양한 DNN 아키텍처 간에 높은 이식성을 가지는 적대적 샘플을 생성하기 위해.
- 대상 모델의 접근 또는 쿼리 없이도 강건성 평가 및 향상이 가능하도록 데이터셋을 제공하기 위해.
- 기울기 추정 또는 모델 쿼리 접근 없이도 고성능의 블랙박스 공격이 가능함을 보여주기 위해.
제안 방법
- 대상 DNN의 아키텍처나 파라미터에 접근하지 않아도 되는 이식성 기반 접근 방식을 사용하여 적대적 샘플을 생성한다.
- 이 방법은 여러 DNN에 걸쳐 일반화되는 편향을 생성하기 위해 사전 모델을 활용한다.
- 편향은 L2 노름(평균 RMS 편차 ≈ 3.8)을 사용하여 원본 이미지넷 이미지와의 시각적 유사성을 유지한다.
- 공격은 쿼리 없이 수행되며, 샘플 생성 과정에서 대상 모델에 대한 쿼리가 전혀 사용되지 않으며, 오직 사전 모델의 이식성에 의존한다.
- 1,000개의 이미지넷 클래스에서 샘플을 생성하였으며, 각 클래스당 약 100개의 적대적 예제를 포함하여 총 96,020개의 샘플을 구성한다.
- 클래스별 폴더와 인덱스 기반 파일명을 사용하여 원본 이미지넷 이미지로의 직접 매핑을 가능하게 한다.
실험 결과
연구 질문
- RQ1대상 모델에 대한 쿼리 없이도 다양한 DNN 간에 높은 이식성을 가지는 적대적 샘플을 생성할 수 있는가?
- RQ2통합 적대적 편향 전략을 사용할 때 쿼리가 없는 블랙박스 환경에서 달성 가능한 최대 공격 성공률는 얼마인가?
- RQ3여러 모델에서 높은 공격 성공률를 유지하면서도 편향의 크기는 어느 정도까지 작게 유지할 수 있는가?
- RQ4단일 세트의 적대적 샘플이 여러 최신 이미지넷 모델의 강건성 취약점을 효과적으로 드러낼 수 있는가?
- RQ5적대적 예제의 이식성은 얼마나 모델에 종속되지 않는 통합 공격을 가능하게 하는가?
주요 결과
- DAmageNet은 총 96,020개의 적대적 샘플을 포함하며, 각 샘플의 평균 L2 편향(RMS 편차)은 3.8로, 원본 이미지넷 이미지와 시각적으로 구분하기 어려운 수준이다.
- 적대적 샘플은 VGG19, NASNetLarge, InceptionV4, Xception, DenseNet121 등의 여러 모델에서 최대 100%의 top-1 오류율을 기록하였다.
- ResNet152와 DenseNet169는 각각 81.8%와 94.3%의 오류율을 보이며 강력한 다중 모델 간 이식성을 입증하였다.
- ResNet50에서는 92.5%의 공격 성공률를, InceptionV3에서는 96.7%의 성공률를 기록하여 다양한 아키텍처 간 높은 일반화 능력을 입증하였다.
- 샘플 생성 과정에서 대상 모델에 대한 정보나 쿼리가 전혀 사용되지 않았기 때문에, DAmageNet은 쿼리 없이 블랙박스 공격을 가능하게 한다.
- DAmageNet은 이식 가능하고 쿼리 없는 적대적 예제를 사용하여 다중 모델 간 강건성 평가를 체계적으로 수행하는 최초의 통합 적대적 데이터셋이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.