Skip to main content
QUICK REVIEW

[논문 리뷰] There is Limited Correlation between Coverage and Robustness for Deep Neural Networks

Yizhen Dong, Peixin Zhang|arXiv (Cornell University)|2019. 11. 14.
Adversarial Robustness in Machine Learning참고 문헌 41인용 수 20
한 줄 요약

이 논문은 25개의 지표를 사용하여 100개의 모델을 대상으로 심층 신경망(DNN) 테스트 커버리지와 강건성 간의 관계를 실증적으로 평가한다. 커버리지 기준과 강건성 간의 상관관계가 제한적이며, 높은 커버리지가 더 강건한 모델을 이끌 것이라는 가정을 도전하며, 향후 DNN 테스트 연구를 위한 공개 벤치마크를 제공한다.

ABSTRACT

Deep neural networks (DNN) are increasingly applied in safety-critical systems, e.g., for face recognition, autonomous car control and malware detection. It is also shown that DNNs are subject to attacks such as adversarial perturbation and thus must be properly tested. Many coverage criteria for DNN since have been proposed, inspired by the success of code coverage criteria for software programs. The expectation is that if a DNN is a well tested (and retrained) according to such coverage criteria, it is more likely to be robust. In this work, we conduct an empirical study to evaluate the relationship between coverage, robustness and attack/defense metrics for DNN. Our study is the largest to date and systematically done based on 100 DNN models and 25 metrics. One of our findings is that there is limited correlation between coverage and robustness, i.e., improving coverage does not help improve the robustness. Our dataset and implementation have been made available to serve as a benchmark for future studies on testing DNN.

연구 동기 및 목표

  • 안전 핵심 응용 분야에서 기존 DNN 테스트 커버리지 기준이 모델의 강건성과 상관관계가 있는지 조사하기.
  • 테스트 데이터로 재학습한 후 커버리지 향상과 강건성 향상 간의 관계 평가하기.
  • 더 나은 테스트 가이던스를 위해 강건성 또는 강건성 향상과 강하게 상관관계가 있는 지표 식별하기.
  • 실세계 모델과 대비 샘플을 사용하여 종합적이고 재현 가능한 DNN 테스트 연구를 위한 벤치마크 구축하기.

제안 방법

  • 다양한 아키텍처를 사용하여 MNIST 및 CIFAR-10 데이터셋에서 100개의 최신 DNN 모델을 훈련시킴.
  • 세 가지 최신 공격 기법(FGSM, JSMA, C&W)을 사용하여 대비 샘플을 생성하여 다양한 훈련 세트를 구성함.
  • 10개 이상의 커버리지 기준(예: 뉴런 커버리지, DeepGauge, MC/DC, 서프라이즈 적합성)을 구현하고 평가함.
  • CLEVER 점수와 다양한 공격 하에서의 대비 공격 성공률을 사용하여 강건성 측정.
  • 25개의 지표 간의 관계 평가를 위해 상관관계 분석(Pearson 및 Spearman)을 적용함.
  • 모든 모델, 대비 샘플, 코드를 향후 DNN 테스트 연구를 위한 공개 벤치마크로 배포함.

실험 결과

연구 질문

  • RQ1테스트 커버리지 기준과 DNN의 강건성 간에 상관관계가 있는가?
  • RQ2다양한 커버리지 기준 간에 상관관계가 있는가?
  • RQ3재학습 후 커버리지 기준 향상과 강건성 향상 간에 상관관계가 있는가?
  • RQ4DNN 강건성 또는 재학습 후 강건성 향상과 강하게 상관관계가 있는 지표가 있는가?

주요 결과

  • 뉴런 커버리지, DeepGauge 등 커버리지 기준과 DNN 강건성 간에 제한적이거나 유의미한 상관관계가 없으며, 커버리지 기반 테스트의 기본 가정을 도전함.
  • 대비 샘플로 재학습하여 커버리지 향상을 가져오더라도 CLEVER 점수와 대비 공격 성공률로 측정한 강건성 향상은 일관되게 이루어지지 않음.
  • MC/DC 및 서프라이즈 적합성과 같은 고급 기준을 사용하더라도 커버리지와 강건성 간의 상관관계는 여전히 약함.
  • CLEVER 점수와 같은 강건성 지표는 커버리지 지표보다 대비 공격 성공률과 더 강한 상관관계를 보임.
  • 대비 샘플로 재학습한 후 강건성 향상 여부를 커버리지 기준으로 신뢰성 있게 예측할 수 없음.
  • 본 연구는 향후 DNN 테스트 방법 평가를 위한 100개의 DNN 모델, 대비 샘플, 지표 구현 코드를 공개하는 벤치마크를 제공함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.